LESSON 03 / 04
Manajemen Konteks & Biaya
15 menit bacaLLM & API Fundamentals
Biaya itu desain, bukan takdir
Aplikasi LLM yang tidak dikelola membakar uang dengan cara yang bisa diprediksi: konteks menumpuk, riwayat penuh dikirim ulang, dan output bertele-tele.
Teknik pengendalian konteks
- Ringkas percakapan — saat melewati ambang (mis. 20 pesan), ganti riwayat lama dengan ringkasannya.
- Cache system prompt — sebagian provider memberi diskon untuk prefix yang identik di banyak request.
- Seleksi RAG — ambil top-k paling relevan saja; jangan menembakkan seluruh dokumen.
Teknik pengendalian output
max_tokenswajar (output panjang = biaya + latensi).- Instruksi "ringkas" eksplisit di system prompt.
- Format terstruktur mengurangi basa-basi pembuka/penutup.
Model routing sederhana
const model = task === "klasifikasi" ? "small-cheap" : "large-smart";
Klasifikasi dan ekstraksi jarang butuh model terbesar. Menyimpan 50–80% biaya lewat routing itu normal di production.
Dashboard biaya minimum
Lacak per endpoint: token masuk, token keluar, error rate, p95 latensi. Tanpa angka ini, optimasi apa pun cuma feeling.