LESSON 02 / 03
Mencari & Menyiapkan Dataset
14 menit bacaEksperimen & Dataset
Data dulu, model belakangan
Sumber dataset
- Kaggle / HuggingFace Datasets — titik awal default; periksa lisensi & kartu data.
- Data pemerintah terbuka (data.go.id) — kaya data lokal Indonesia.
- Scraping — legal ≠ boleh: hormati robots.txt, ToS, dan rate limit. Simpan bukti asal-usul data.
- Buat sendiri — anotasi kecil yang berkualitas sering mengalahkan data besar yang kotor.
Kebiasaan pembersihan yang menyelamatkan
- Audit duplikat & near-duplicate — duplikat train/test adalah leakage klasik.
- Distribusi label — imbalance ekstrem? Rencanakan strateginya (weighting, resampling) sebelum menyesali hasil nanti.
- Inspeksi manual sampel acak — 50 sampel dibaca manusia menemukan masalah yang tak terlihat di statistik.
- Dokumentasikan keputusan pembersihan — baris apa yang dibuang dan kenapa. Ini bagian dari integritas riset.
Lisensi itu serius
Dataset "tersedia di internet" belum berarti bisa dipakai untuk apa pun. Periksa: komersial atau riset saja? Redistribusi diizinkan? Data pribadi ter-anonymize? Melanggar di sini bisa membatalkan seluruh proyekmu di kemudian hari.
Data card singkat (simpan di repo)
Sumber : [url, tanggal akses]
Lisensi : [jenis]
Ukuran : N baris, distribusi label
Pembersihan : [keputusan + alasan]
Batas : [bias yang diketahui, keterbatasan cakupan]