LESSON 04 / 04
Evaluasi Output: Kapan Model Layak Percaya?
16 menit bacaLLM & API Fundamentals
Tanpa eval, kamu menebak
Setiap perubahan prompt/model/parameter adalah perubahan perilaku. Eval set adalah satu-satunya cara tahu apakah kamu memperbaiki atau merusak.
Anatomi eval set
[
{
"input": "Ringkas artikel ini: ...",
"rubrik": ["maksimal 3 kalimat", "tanpa informasi baru", "bahasa Indonesia"]
}
]
Tiga komponen: input nyata, kriteria keberhasilan, dan cara menilai (manusia, model-as-judge, atau assertion programatik).
Tiga tingkat evaluasi
- Assertion programatik — format JSON valid? field lengkap? panjang sesuai? Murah dan deterministik.
- Model-as-judge — model lain menilai kualitas dengan rubrik. Skalabel, perlu kalibrasi.
- Human review — sampel acak, terutama untuk kasus gagal. Mahal tapi emas.
Praktik terbaik
- Mulai dari 30–50 kasus nyata dari log produksi, bukan kasus imajiner.
- Jalankan eval di CI: prompt/parameter berubah → eval jalan → regression terdeteksi sebelum rilis.
- Simpan kasus gagal sebagai kasus uji tetap. Kegagalan lama yang kambuh adalah regresi paling umum.