Guardrails adalah mekanisme keamanan tambahan yang dipasang di sekitar model AI—baik sebelum input diproses maupun sebelum output ditampilkan ke pengguna—dengan tujuan membatasi, memfilter, atau mengoreksi perilaku model agar tetap sesuai dengan kebijakan, batasan etika, dan tujuan aplikasi yang ditetapkan oleh developer.
Berbeda dengan pelatihan keamanan yang tertanam langsung dalam model itu sendiri (seperti melalui RLHF), guardrails biasanya diimplementasikan sebagai lapisan perangkat lunak terpisah yang berjalan di luar model, memungkinkan developer aplikasi menerapkan aturan tambahan yang spesifik untuk kasus penggunaan mereka tanpa perlu melatih ulang model.
Guardrails dapat diterapkan pada dua sisi: input guardrails memeriksa dan memfilter permintaan pengguna sebelum diteruskan ke model, misalnya mendeteksi upaya jailbreak atau permintaan yang jelas melanggar kebijakan; sementara output guardrails memeriksa jawaban yang dihasilkan model sebelum ditampilkan ke pengguna, misalnya memastikan tidak ada informasi sensitif yang bocor, memverifikasi format output sesuai skema yang diharapkan, atau menyaring konten yang berpotensi berbahaya.
Contoh penerapan guardrails dalam praktik termasuk sistem yang menolak memproses permintaan yang mengandung informasi identitas pribadi (PII) tanpa izin, filter yang mencegah chatbot layanan pelanggan memberikan saran hukum atau medis yang berada di luar cakupan wewenangnya, atau validasi otomatis yang memastikan agen AI tidak mengeksekusi tindakan finansial di atas batas nominal tertentu tanpa persetujuan tambahan.
Guardrails menjadi komponen penting dalam arsitektur aplikasi AI tingkat produksi, karena model AI sendiri—betapa pun canggihnya—tidak dapat sepenuhnya diandalkan untuk selalu berperilaku sesuai harapan dalam setiap skenario, terutama menghadapi input yang dirancang secara khusus untuk mengeksploitasi celah dalam perilaku model.
