Test-time compute (juga disebut inference-time scaling) adalah pendekatan meningkatkan kualitas jawaban model AI dengan mengalokasikan lebih banyak komputasi saat model sedang menjawab pertanyaan, bukan saat proses pelatihan awal. Ini berbeda dengan cara tradisional meningkatkan kemampuan AI, yaitu memperbesar jumlah parameter atau data pre-training.
Dalam praktiknya, model dengan test-time compute tinggi "berpikir lebih lama" sebelum memberi jawaban akhir — menjelajahi beberapa jalur penalaran, mengecek ulang langkah-langkahnya, atau mencoba beberapa pendekatan berbeda — mirip proses chain-of-thought yang diperluas. Pendekatan ini dipopulerkan lewat seri model reasoning model seperti OpenAI o1 dan penerusnya, yang secara eksplisit dioptimalkan untuk "berpikir" lebih lama pada soal matematika, logika, dan coding yang rumit.
Trade-off utamanya adalah biaya dan latensi: makin banyak komputasi yang dipakai saat inferensi, makin lama dan makin mahal setiap jawaban yang dihasilkan. Karena itu, penyedia model biasanya menawarkan beberapa tingkat "effort" atau "thinking budget" yang bisa diatur pengguna, sehingga tugas sederhana tetap cepat dan murah, sementara tugas yang benar-benar sulit bisa memakai lebih banyak waktu berpikir.
