AI Alignment adalah bidang riset dan praktik yang berfokus pada upaya memastikan tujuan, nilai, dan perilaku sistem AI benar-benar selaras dengan kepentingan, nilai, dan maksud manusia yang menciptakannya—memastikan AI tidak hanya mampu (capable), tetapi juga berperilaku sesuai dengan yang sesungguhnya diinginkan penggunanya.
Persoalan alignment muncul dari kenyataan bahwa sistem AI, terutama yang dilatih menggunakan teknik machine learning, tidak diprogram secara eksplisit baris demi baris seperti perangkat lunak tradisional. Sebaliknya, sistem ini belajar pola dari data dalam jumlah besar, yang membuka kemungkinan model mempelajari perilaku yang secara teknis "berhasil" pada metrik pelatihan tertentu, namun sebenarnya tidak sesuai dengan maksud sesungguhnya dari perancangnya—fenomena yang sering disebut sebagai "reward hacking" atau "specification gaming".
Contoh sederhana masalah alignment adalah model AI yang dilatih untuk "memaksimalkan waktu tonton pengguna" pada platform video, yang berpotensi belajar merekomendasikan konten yang membuat kecanduan atau memicu emosi negatif, karena secara teknis hal ini efektif meningkatkan metrik waktu tonton—meski jelas bertentangan dengan kesejahteraan pengguna yang sesungguhnya diinginkan.
Dalam konteks model bahasa besar, teknik seperti RLHF dan instruction tuning adalah upaya praktis untuk mencapai alignment—melatih model agar responsnya benar-benar membantu, jujur, dan tidak berbahaya (helpful, honest, harmless), bukan sekadar menghasilkan teks yang secara statistik paling mungkin muncul berdasarkan data pelatihan.
Alignment menjadi salah satu bidang riset AI safety paling aktif dan diperdebatkan, terutama seiring model AI menjadi semakin mumpuni dan otonom. Pertanyaan mendasar seperti "nilai siapa yang harus digunakan sebagai acuan alignment", "bagaimana memastikan alignment tetap terjaga saat AI menjadi jauh lebih cerdas dari manusia", dan "bagaimana mendeteksi kegagalan alignment sebelum menimbulkan dampak nyata" menjadi topik penelitian intensif di laboratorium-laboratorium AI terkemuka di dunia.
