Kamus AI

Tokenization

Proses memecah teks menjadi unit-unit kecil yang disebut token, langkah pertama yang dilakukan model bahasa sebelum dapat memproses dan memahami suatu teks.

Tokenization atau tokenisasi adalah proses memecah teks mentah menjadi unit-unit lebih kecil yang disebut token, merupakan langkah pertama dan mendasar yang dilakukan model bahasa sebelum dapat memproses dan memahami suatu teks. Model AI tidak dapat langsung memproses teks dalam bentuk karakter atau kata sebagaimana manusia membacanya—teks harus terlebih dahulu diubah menjadi unit-unit numerik yang dapat diolah secara matematis.

Token tidak selalu sama dengan satu kata utuh. Bergantung pada algoritma tokenisasi yang digunakan, satu token bisa berupa satu kata lengkap, sebagian dari kata (subword), satu karakter tunggal, atau bahkan tanda baca. Misalnya, kata "ketidakpastian" mungkin dipecah menjadi beberapa token seperti "ke", "tidak", "pasti", "an", tergantung pada kosakata (vocabulary) yang telah dipelajari tokenizer selama pelatihannya.

Pendekatan tokenisasi berbasis subword ini, dengan algoritma populer seperti Byte-Pair Encoding (BPE), dipilih karena memberikan keseimbangan optimal: cukup fleksibel untuk menangani kata-kata baru atau jarang muncul (dengan memecahnya menjadi subword yang sudah dikenal), namun tetap efisien dibanding tokenisasi per karakter yang akan menghasilkan urutan token sangat panjang untuk teks yang sama.

Proses tokenisasi memiliki implikasi praktis penting bagi pengguna model AI. Jumlah token dari suatu teks—bukan jumlah karakter atau kata—yang menjadi dasar perhitungan biaya penggunaan API model AI serta batas context window yang tersedia. Bahasa dengan struktur kata yang berbeda dari bahasa Inggris, termasuk Bahasa Indonesia, terkadang menghasilkan jumlah token yang lebih banyak untuk teks dengan panjang serupa, karena tokenizer sering dilatih dengan proporsi data bahasa Inggris yang jauh lebih dominan.

Setelah tokenisasi, setiap token kemudian diubah lebih lanjut menjadi representasi vektor melalui proses embedding, yang menjadi bentuk data numerik sesungguhnya yang diproses oleh lapisan-lapisan internal model bahasa selama menghasilkan jawaban.

Jelajahi Kamus AI