LESSON 01 / 04
Garak: Scanner Kerentanan LLM
16 menit bacaLab Red Team: Garak, PyRIT, Promptfoo
Antivirus-nya model AI
Garak (dari NVIDIA, open-source) adalah vulnerability scanner untuk LLM — analoginya seperti menjalankan nmap atau OWASP ZAP, tapi sasarannya model bahasa. Satu perintah, ia melesatkan pustaka probe (paket-paket serangan uji) ke modelmu dan melaporkan apa yang tembus.
Cara kerjanya: probe statis
Karakter Garak: pustaka probe yang dikurasi dan statis — pola serangan terdokumentasi (jailbreak klasik, pancingan data, prompt injection, pemicu halusinasi) dijalankan sistematis, hasilnya diskor per kategori. Pendekatan ini membuatnya:
- Cepat & konsisten — hasil bisa dibandingkan antar run dan antar model.
- Transparan — tiap probe bisa kamu baca dan pahami.
- Fokus kelemahan level model — bukan hanya celah lapisan aplikasi.
Rotasi penggunaan yang wajar
# pola dasar: scan endpoint model dengan semua probe ringan
garak --model_type openai.OpenAICompatible \
--model_name kandidat-modelmu \
--probe_type lite
Laporan Garak memberi hit rate per probe — peta panas kelemahan. Tidak ada model yang bersih; yang kamu cari adalah kelemahan yang relevan dengan risiko produkmu.
Posisi Garak dalam kerja red team
Garak adalah pemetaan awal: murah, cepat, cocok dijalankan tiap kali ganti model/prompt sistem. Temuan yang serius lalu ditindaklanjuti dengan pengujian dinamis (lesson PyRIT berikutnya) dan perbaikan guardrails.
Scanner tidak membuatmu aman — tapi membuatmu tahu di mana harus takut.