LESSON 03 / 03
Mengevaluasi Model dengan Jujur
15 menit bacaEksperimen & Dataset
Angka tanpa konteks adalah manipulasi
"Akurasi 95%" bisa berarti mahakarya atau sampah — tergantung baseline dan distribusi kelas.
Pilih metrik sesuai asimetri biaya
- Deteksi fraud (1:1000) — akurasi 99.9% dicapai dengan menebak "bukan fraud" terus. Butuh precision/recall/F1 per kelas, atau PR-AUC.
- Ranking (search/rekomendasi) — NDCG/MRR, bukan akurasi.
- Generatif — eval otomatis (BLEU dsb.) untuk sanity, penilaian manusia untuk kebenaran.
Variance itu nyata
Satu run dengan satu seed bukan hasil — itu undian. Laporan serius:
Metrik = mean ± std pada k run (seed berbeda)
Signifikansi: uji statistik sederhana (paired t-test / bootstrap)
Selisih 0.5 poin antar model tanpa uji signifikansi = kemungkinan besar noise.
Perangkat penipuan diri yang populer
- Cherry-picking seed — lapor best-of-20 tanpa menyebutnya.
- Test set yang intip-intip (lihat lesson sebelumnya).
- Membandingkan tidak adil — metode barumu di-tuning total, baseline jalan default.
- Metrik berganti tengah jalan — saat gagal di akurasi, pindah ke metrik yang lebih ramah.
Kebiasaan penutup yang membedakan peneliti
Laporkan juga kasus gagal — di mana model-mu kalah, kapan prediksinya buruk. Analisis kegagalan memberi pembaca (dan dirimu) informasi lebih besar daripada selisih 0.3 poin leaderboard.