Latency dalam konteks AI merujuk pada jeda waktu yang dibutuhkan antara saat pengguna atau sistem mengirim permintaan ke model AI hingga respons pertama atau lengkap diterima kembali. Latensi menjadi salah satu metrik performa paling penting yang memengaruhi pengalaman pengguna, terutama untuk aplikasi yang membutuhkan interaksi secara real-time.
Dalam konteks Large Language Model, latensi biasanya diukur dalam beberapa metrik spesifik: Time to First Token (TTFT), yaitu waktu yang dibutuhkan sejak permintaan dikirim hingga token (bagian kata) pertama dari jawaban mulai muncul, dan token per detik, yaitu kecepatan model menghasilkan token-token berikutnya secara berkelanjutan setelah token pertama muncul.
Latensi dipengaruhi oleh berbagai faktor, termasuk ukuran model (model yang lebih besar umumnya membutuhkan waktu komputasi lebih lama per token), jarak fisik antara pengguna dan server yang memproses permintaan, beban server saat itu (jumlah permintaan yang sedang diproses secara bersamaan), serta kompleksitas permintaan itu sendiri—misalnya, reasoning model yang melakukan "berpikir" mendalam sebelum menjawab secara alami memiliki latensi lebih tinggi dibanding model konvensional.
Latensi menjadi pertimbangan krusial dalam desain aplikasi AI. Untuk aplikasi seperti chatbot layanan pelanggan atau asisten suara real-time, latensi tinggi dapat membuat pengalaman terasa lambat dan mengganggu alur percakapan alami. Sebaliknya, untuk tugas yang tidak membutuhkan respons instan, seperti pemrosesan dokumen secara batch di latar belakang, latensi yang lebih tinggi umumnya dapat diterima demi keuntungan lain seperti biaya yang lebih rendah atau kualitas jawaban yang lebih baik dari reasoning model.
Trade-off antara latensi, biaya, dan kualitas output menjadi salah satu keputusan arsitektural mendasar yang harus dipertimbangkan developer saat memilih model AI dan strategi deployment yang tepat untuk kasus penggunaan spesifik mereka—mendorong munculnya varian model "flash" atau "turbo" yang dioptimalkan khusus untuk latensi rendah dengan sedikit trade-off pada kemampuan penalaran mendalam.
