LESSON 01 / 04
Cara Kerja LLM: Token, Konteks, Sampling
18 menit bacaLLM & API Fundamentals
Tiga mekanisme yang wajib dipahami
Token
Model tidak membaca huruf; ia membaca token (≈ ¾ kata untuk bahasa Indonesia, lebih boros untuk teks campur kode). Implikasi:
- Batas konteks dihitung per token.
- Biaya dihitung per token input dan output.
- Menghitung huruf itu sulit bagi model — minta ia memakai tools untuk itu.
Jendela konteks
Context window adalah memori kerja model. Semua — system prompt, riwayat chat, dokumen RAG, output parsial — berbagi kuota yang sama. Strategi penting:
- Rangkum riwayat saat percakapan memanjang.
- Prioritaskan instruksi krusial di awal (primacy) dan akhir (recency).
- Hitung anggaran token per komponen sebelum memanggil API.
Sampling
Parameter yang mengatur pemilihan token berikutnya:
| Parameter | Efek |
|---|---|
| temperature | 0 = deterministik-ish, 1+ = kreatif/liar |
| top_p | batasi kandidat ke persentil probabilitas teratas |
| max_tokens | cap keras panjang output |
Untuk pipeline produksi yang butuh konsistensi: temperature rendah + output terstruktur. Untuk ideasi: temperature tinggi.
Insight praktis: kelainan output ("tiba-tiba malas menjawab", "terpotong") hampir selalu bisa dijelaskan oleh trio token–konteks–sampling ini.