Red Teaming dalam konteks AI adalah praktik menguji keamanan model AI secara sistematis dan proaktif dengan cara mensimulasikan berbagai upaya serangan atau manipulasi—mencoba membuat model menghasilkan output berbahaya, bias, atau melanggar kebijakan—dengan tujuan menemukan dan memperbaiki celah keamanan sebelum model dirilis secara luas atau dieksploitasi pihak yang berniat jahat.
Istilah "red team" berasal dari dunia militer dan keamanan siber, merujuk pada tim yang secara sengaja berperan sebagai "musuh" untuk menguji ketahanan suatu sistem. Dalam konteks AI, tim red teaming—yang dapat terdiri dari peneliti keamanan internal, kontraktor eksternal, atau bahkan sistem AI lain yang dirancang khusus untuk menguji model target—secara sistematis mencoba berbagai teknik seperti jailbreak, prompt injection, atau skenario penyalahgunaan kreatif lainnya.
Proses red teaming biasanya mencakup pengujian terhadap berbagai kategori risiko, seperti kemungkinan model menghasilkan instruksi berbahaya (misalnya terkait senjata atau zat berbahaya), bias diskriminatif terhadap kelompok tertentu, kebocoran informasi pribadi, kerentanan terhadap manipulasi yang membuat model melanggar kebijakan penggunaannya sendiri, hingga potensi penyalahgunaan dalam skenario keamanan siber dan disinformasi.
Hasil temuan dari proses red teaming kemudian digunakan untuk memperbaiki model, baik melalui penyesuaian data pelatihan, penambahan lapisan guardrails, atau penyesuaian kebijakan penggunaan sebelum model dirilis ke publik. Laboratorium AI besar seperti OpenAI, Anthropic, dan Google DeepMind secara rutin menerbitkan laporan keamanan (system card atau model card) yang mendokumentasikan hasil proses red teaming sebagai bagian dari komitmen transparansi mereka.
Red teaming menjadi praktik yang semakin diwajibkan secara regulasi di berbagai yurisdiksi, termasuk sebagai bagian dari kewajiban penilaian risiko dalam kerangka regulasi seperti EU AI Act, khususnya untuk model AI berisiko tinggi atau model frontier dengan kemampuan yang sangat canggih.
