Long-Horizon Task adalah istilah untuk tugas yang membutuhkan rangkaian langkah panjang dan saling terkait dari waktu ke waktu untuk dapat diselesaikan dengan benar, berbeda dari tugas sekali jalan (single-turn) seperti menjawab satu pertanyaan atau menerjemahkan satu kalimat.
Contoh tugas berjenjang panjang meliputi menyelesaikan proyek pengembangan perangkat lunak dari awal hingga rilis, melakukan riset mendalam yang membutuhkan puluhan pencarian dan sintesis informasi, atau mengelola alur kerja bisnis yang melibatkan banyak sistem dan menunggu respons dari pihak lain di sela-sela prosesnya. Tugas semacam ini menuntut agent untuk mempertahankan konteks, tujuan, dan konsistensi keputusan sepanjang keseluruhan proses, yang bisa berlangsung dari beberapa menit hingga berjam-jam bahkan berhari-hari.
Kemampuan menangani tugas berjenjang panjang telah menjadi salah satu metrik utama untuk mengukur kemajuan kemampuan AI agent dari waktu ke waktu. Beberapa lembaga riset AI menggunakan metrik seperti "durasi tugas yang dapat diselesaikan dengan tingkat keberhasilan tertentu" untuk melacak seberapa jauh model-model terbaru mampu menangani horizon waktu yang lebih panjang dibanding model-model sebelumnya, dengan tren yang menunjukkan peningkatan signifikan dari tahun ke tahun.
Tantangan utama dalam tugas berjenjang panjang meliputi menjaga koherensi tujuan agar agent tidak "menyimpang" di tengah proses, mengelola context window yang terbatas ketika riwayat interaksi menjadi sangat panjang, serta menangani kegagalan parsial—jika satu langkah di tengah gagal, agent perlu mampu memulihkan diri (self-correction) tanpa harus mengulang keseluruhan proses dari awal. Kemampuan ini erat kaitannya dengan task decomposition yang baik serta mekanisme agent memory yang andal.
