LESSON 02 / 04
PyRIT: Red Teaming dengan Attacker Otonom
16 menit bacaLab Red Team: Garak, PyRIT, Promptfoo
Dari kamus serangan ke penyerang yang berpikir
Kalau Garak memakai daftar serangan tetap, PyRIT (Python Risk Identification Toolkit, dari Microsoft) menempuh jalan sebaliknya: ia memakai LLM lain sebagai attacker — men-generate serangan secara dinamis, menilai hasilnya, lalu memperbaiki serangan berikutnya berdasarkan tanggapan korban.
Anatomi loop PyRIT
- Attacker LLM menyusun prompt serangan (bisa dua arah — multi-turn, seperti sosial engineering sungguhan).
- Prompt dikirim ke target (model/aplikasi yang dites).
- Evaluator menilai: apakah target bocor? melanggar policy? mengeksekusi instruksi berbahaya?
- Hasil evaluasi kembali ke attacker — iterasi berikutnya lebih tajam.
Peran attacker dan evaluator bisa kamu pilih sendiri (model berbeda atau konverter kustom) — inilah yang membuat PyRIT disebut framework red-teaming paling dapat dikustomisasi: skenario serangan sektormu bisa Anda kodifikasikan.
Kapan PyRIT, kapan Garak
| Situasi | Pilihan | |---|---| | Screening cepat saat memilih model | Garak | | Menguji prompt sistem / produk spesifik secara mendalam | PyRIT | | Butuh bukti eksploitabilitas (PoC) untuk laporan | PyRIT | | CI/CD: regresi keamanan tiap rilis | Garak (+ Promptfoo untuk eval) |
Etika yang tidak bisa dinegosiasikan
Alat ini hanya untuk aset yang kamu miliki atau berizin menguji. Red teaming tanpa izin bukan riset — itu pelanggaran. Simpan semua log, dokumentasikan temuan, laporkan melalui jalur disclosure yang benar.
Keamanan bukan produk yang dibeli sekali. Ia latihan yang diulang — dan alat ini barbells-nya.