Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi t: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token x_(t+1). Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut.

Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.

Satu posisi memiliki beberapa target prediksi

Untuk urutan x_1, ..., x_T, training kausal konvensional dapat meminimalkan loss next-token seperti:

L_next = - sum_t log p(x_(t+1) | x_<=t)

Dengan n head token masa depan, objektif dapat menggabungkan loss dari beberapa offset:

L_mtp = - sum_t sum_(k=1)^n log p_k(x_(t+k) | x_<=t)

Di sini, p_k adalah distribusi yang dihasilkan head untuk offset k. Posisi yang mendekati akhir urutan memiliki lebih sedikit target masa depan yang valid, sehingga target yang tidak tersedia perlu dimask atau dikeluarkan sesuai implementasi.

Poin strukturalnya terletak pada state trunk untuk posisi t yang dipakai bersama. Objektif tambahan meminta representasi tersebut mendukung beberapa prediksi masa depan, sedangkan setiap head menyediakan jalur output untuk offset tertentu.

Head paralel tidak menghapus dependensi antartoken

Memprediksi x_(t+2) dari prefix x_<=t tidak sama dengan memprediksinya setelah x_(t+1) dimasukkan ke konteks autoregresif. Head token masa depan kedua bekerja dari representasi prefix yang tersedia pada t; head tersebut tidak otomatis menerima hasil prediksi pertama sebagai konteks tambahan.

Perbedaan ini membatasi jaminan dari head paralel. Beberapa distribusi kandidat dapat dihasilkan untuk sejumlah offset, tetapi token-token itu tidak otomatis menjadi pengganti yang valid untuk sampling autoregresif berurutan.

Setiap token yang dihasilkan mengubah konteks untuk token sesudahnya. Jika kandidat awal berbeda dari token yang dipilih proses decoding target, distribusi kandidat berikutnya mungkin tidak lagi sesuai dengan konteks yang benar-benar terbentuk. Skema inference yang memakai beberapa kandidat sekaligus memerlukan mekanisme penerimaan, verifikasi, atau penanganan dependensi yang sesuai.

Trunk dan head memiliki biaya yang berbeda

Trunk bersama menjalankan komputasi representasi urutan yang mahal satu kali untuk posisi tersebut. Prediction head tambahan menambah parameter dan komputasi output, tetapi tidak menggandakan seluruh stack transformer.

Biaya tepatnya bergantung pada desain head. Sebuah head dapat hanya memakai transformasi kecil sebelum proyeksi vocabulary, atau dapat memiliki layer tambahan. Proyeksi vocabulary sendiri dapat bernilai besar pada vocabulary yang luas, sehingga penambahan head tetap memiliki biaya komputasi.

Riset Gloeckle dan kolaborator pada 2024 mengevaluasi beberapa head token masa depan di atas trunk bersama dan melaporkan peningkatan kualitas model pada konfigurasi eksperimen mereka. Hasil tersebut melekat pada konfigurasi, data, pilihan optimisasi, dan suite evaluasi yang dilaporkan; hasil itu bukan jaminan arsitektural untuk setiap model atau workload.

Loss offset masa depan mengubah tekanan pada representasi

Objektif next-token memberi tekanan pada representasi agar mendukung token berikutnya. Prediksi multi-token memperluas tekanan itu ke horizon masa depan yang pendek. State trunk perlu berguna bagi token berikutnya sekaligus beberapa token setelahnya.

Hal ini tidak berarti setiap hidden state menyimpan urutan masa depan yang deterministik. Setiap head menghasilkan distribusi probabilitas, dan ketidakpastian dapat meningkat pada offset yang lebih jauh. Satu prefix dapat memiliki banyak kelanjutan yang konsisten, terutama saat horizon prediksi bertambah.

Objektif ini juga berbeda dari sekadar memberi bobot lebih besar pada loss next-token biasa. Head tambahan memakai target pada offset yang berbeda. Gradien dari setiap head bertemu pada trunk bersama, sehingga proses optimisasi menggabungkan sinyal dari beberapa posisi masa depan.

Bobot loss merupakan bagian dari definisi objektif

Ekspresi ringkas di atas memberi bobot yang sama pada setiap offset, tetapi implementasi dapat memakai koefisien:

L = sum_(k=1)^n lambda_k * L_k

Nilai lambda_k menentukan seberapa kuat setiap offset masa depan berkontribusi pada update. Koefisien yang sama hanyalah salah satu pilihan, bukan sifat yang diwajibkan arsitektur.

Masking juga berpengaruh. Padding, packed sequence, batas dokumen, dan segmen training yang dipotong dapat membuat target masa depan nominal menjadi tidak valid. Implementasi yang benar harus mencegah head mengoptimalkan token yang bukan bagian dari kelanjutan yang diizinkan untuk posisi training tersebut.

Detail ini memisahkan mekanisme umum dari implementasi tertentu. Ide arsitekturalnya adalah trunk bersama dengan beberapa objektif token masa depan; kedalaman head, parameter sharing, pembobotan, masking, dan layout proyeksi tetap menjadi pilihan implementasi.

Akselerasi inference memerlukan desain decoding terpisah

Head multi-token menyediakan sumber kandidat token masa depan yang dapat dipakai untuk generasi spekulatif. Produksi kandidat saja tidak menetapkan speedup yang pasti. Sistem serving tetap perlu menentukan cara kandidat diajukan, diperiksa, diterima, dan digabungkan dengan semantik decoding model target.

Throughput yang tercapai bergantung pada panjang penerimaan kandidat, biaya verifikasi, bentuk batch, utilisasi hardware, traffic memori, biaya proyeksi vocabulary, dan implementasi runtime serving. Konfigurasi yang mengurangi jumlah langkah model target secara berurutan masih dapat kehilangan sebagian keuntungan akibat komputasi head tambahan atau verifikasi yang tidak efisien.

Batas ini penting: prediksi multi-token mengubah supervisi dan distribusi kandidat yang tersedia. Mengubah kandidat tersebut menjadi lebih sedikit langkah decoding berurutan merupakan keputusan sistem inference di lapisan berikutnya.

Objektif memperluas supervisi tanpa menggandakan model

Prediksi multi-token menempatkan beberapa loss token masa depan pada representasi yang dihasilkan satu trunk kausal. Desain ini mempertahankan backbone mahal sebagai komponen bersama sambil menyediakan sinyal prediktif khusus untuk beberapa offset selama training.

Efek arsitekturalnya spesifik: setiap posisi training yang memenuhi syarat menyumbang supervisi untuk lebih dari satu token masa depan. Perubahan kualitas model dan speedup serving tetap merupakan hasil empiris yang dipengaruhi desain head, konfigurasi optimisasi, data, algoritma decoding, dan runtime.