Langsung ke konten

Arsip

Tokenisasi

3 artikel
Kecerdasan Buatan 23 Sep 2026 5 min read

Repetition Penalty Mengubah Logit untuk ID Token yang Sudah Muncul

Repetition penalty dapat bekerja sebelum sampling dengan mengubah logit milik ID token yang sudah terdapat dalam riwayat token tertentu. Operasi ini tidak harus membandingkan kata, frasa, atau string hasil render. Unit yang diperiksa dapat berupa ID integer dari tokenizer, sehingga makna mekanismenya lebih sempit daripada kesan yang diberikan oleh namanya. Perbedaan tersebut terlihat saat decoder menghasilkan token subword. Dua string yang tampak serupa dapat tersusun dari urutan token berbeda, sedangkan satu token yang dipakai di dalam kata berbeda tetap dapat ditandai sebagai token yang sudah muncul.

Kecerdasan Buatan 08 Sep 2026 10 min read

Hindari Kegagalan Batas Tokenisasi pada Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefiks, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berakhir tepat di posisi itu. Detail ini dapat menjadi penting ketika prompt berakhir pada posisi karakter yang, jika prompt dan kelanjutannya ditokenisasi bersama, biasanya berada di dalam token yang lebih besar. Masalah batas tokenisasi (tokenization boundary problem), yang juga disebut masalah token parsial (partial token problem), dapat membuat kelanjutan yang sebenarnya natural menjadi sangat kecil kemungkinannya.

Kecerdasan Buatan 08 Sep 2026 8 min read

Hindari Kegagalan Batas Tokenisasi dalam Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefix, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berhenti tepat pada posisi itu. Detail ini dapat berpengaruh ketika prompt berakhir pada posisi karakter yang, jika prompt dan continuation ditokenisasi bersama, seharusnya berada di dalam token yang lebih besar. Masalah batas tokenisasi, yang juga disebut partial token problem, dapat membuat continuation yang sebenarnya natural menjadi sangat tidak mungkin.