Jailbreak dalam konteks AI merujuk pada upaya mengelabui atau memanipulasi model AI agar mengabaikan aturan keamanan, kebijakan penggunaan, atau batasan perilaku yang telah ditetapkan oleh pengembangnya—biasanya untuk memaksa model menghasilkan konten yang seharusnya ditolak, seperti instruksi berbahaya, konten ilegal, atau informasi yang melanggar kebijakan penggunaan.
Teknik jailbreak sangat beragam dan terus berkembang seiring model AI menjadi lebih canggih dalam mendeteksi dan menolak upaya manipulasi. Beberapa teknik umum termasuk role-play (meminta model berperan sebagai karakter fiktif yang "tidak memiliki batasan"), penyamaran konteks (membingkai permintaan berbahaya sebagai skenario akademis atau fiksi), atau pemecahan instruksi (memecah permintaan berbahaya menjadi beberapa bagian yang masing-masing terlihat tidak berbahaya secara terpisah).
Berbeda dengan prompt injection yang biasanya menargetkan aplikasi yang dibangun di atas model AI (misalnya menyisipkan instruksi tersembunyi dalam dokumen yang diproses AI), jailbreak umumnya menargetkan model AI itu sendiri secara langsung melalui percakapan biasa, berusaha membuat model "melupakan" atau mengabaikan pelatihan keamanannya.
Laboratorium AI besar seperti OpenAI, Anthropic, dan Google secara rutin melakukan red teaming—pengujian keamanan sistematis dengan mencoba berbagai teknik jailbreak—untuk menemukan dan menutup celah keamanan sebelum model dirilis ke publik. Meski demikian, perlombaan antara teknik jailbreak baru dan pertahanan model terus berlanjut tanpa henti, mirip dengan perlombaan antara peretas dan sistem keamanan siber pada umumnya.
Memahami risiko jailbreak penting bagi developer yang membangun aplikasi berbasis AI, karena aplikasi yang tidak memiliki lapisan keamanan tambahan di luar model itu sendiri berisiko dieksploitasi pengguna jahat untuk menghasilkan konten yang dapat merugikan reputasi atau bahkan menimbulkan tanggung jawab hukum bagi pengembang aplikasi tersebut.
