Kamus AI

Perplexity

Metrik evaluasi dalam NLP yang mengukur seberapa baik model bahasa memprediksi sebuah urutan kata—semakin rendah perplexity, semakin baik model.

Perplexity adalah metrik evaluasi yang digunakan dalam pemrosesan bahasa alami untuk mengukur seberapa baik model bahasa dalam memprediksi sebuah urutan kata. Secara intuitif, perplexity mengukur "tingkat kejutan" model—semakin rendah perplexity, semakin baik model dalam memprediksi kata berikutnya.

Secara matematis, perplexity adalah eksponensial dari cross-entropy rata-rata. Untuk model bahasa, perplexity dapat diartikan sebagai rata-rata jumlah pilihan yang dipertimbangkan model pada setiap langkah. Misalnya, perplexity 10 berarti model rata-rata "bingung" antara 10 kemungkinan kata berikutnya; perplexity 2 berarti model sangat yakin dan hanya mempertimbangkan sekitar 2 kemungkinan.

Perplexity yang lebih rendah menunjukkan model yang lebih baik dalam memahami dan memprediksi bahasa. Model bahasa manusia memiliki perplexity yang sangat rendah karena kita sangat baik dalam memprediksi kata berikutnya dalam konteks. Model AI terbaik saat ini telah mencapai perplexity yang mendekati manusia pada beberapa tugas.

Perplexity banyak digunakan untuk membandingkan model bahasa yang berbeda. Namun, perplexity bukanlah metrik yang sempurna—perplexity yang rendah tidak selalu berarti model lebih berguna atau lebih akurat dalam aplikasi dunia nyata. Model dengan perplexity rendah mungkin masih menghasilkan halusinasi atau output yang tidak koheren.

Perplexity juga digunakan dalam evaluasi model selama pelatihan—peneliti memantau perplexity pada data validasi untuk melihat apakah model masih belajar atau mulai overfit. Penurunan perplexity yang terus-menerus menunjukkan bahwa model masih meningkatkan pemahaman bahasanya.

Jelajahi Kamus AI