Langsung ke konten

Arsip

Decoding

12 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Secara Paralel

Generasi autoregresif biasanya menetapkan satu token sebelum langkah model target berikutnya dapat dievaluasi. Speculative decoding mengubah pola eksekusi tersebut. Distribusi proposal yang lebih murah menghasilkan blok kandidat pendek, sementara model target mengevaluasi posisi-posisi kandidat itu bersama-sama. Aturan penerimaan kemudian menentukan seberapa banyak bagian blok yang dapat menjadi output. Mekanisme ini bukan batching biasa. Token di dalam proposal tetap dihasilkan secara autoregresif, dan model target tetap menentukan distribusi output yang dituju ketika algoritma speculative sampling eksak digunakan. Perubahan yang berguna terletak pada verifikasi: satu pass yang mahal dapat mencakup beberapa posisi output jika cukup banyak proposal diterima.

Kecerdasan Buatan 24 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Sequence yang Terpilih

Beam search dapat memilih sequence pendek walaupun continuation yang lebih panjang berisi token-token yang secara lokal masuk akal. Efek ini berasal dari aturan skornya: log-probability token biasanya diakumulasi sepanjang sequence, dan setiap token tambahan menyumbangkan satu nilai non-positif lagi. Normalisasi panjang mengubah tekanan ranking tersebut, tetapi tidak mengubah probabilitas model yang menghasilkan token. Pemisahan itu penting pada sistem generasi. Skor decoding adalah objektif saat inferensi untuk membandingkan hipotesis. Skor tersebut tidak otomatis menjadi probabilitas terkalibrasi untuk output yang sudah selesai, dan mengubahnya dapat mengganti sequence terpilih tanpa mengubah parameter model.

Kecerdasan Buatan 24 Sep 2026 5 min read

Contrastive Search Memberi Penalti pada Repetisi Hidden State Saat Decoding

Generasi autoregresif menghasilkan distribusi token berikutnya, tetapi decoder tetap harus menentukan kandidat yang akan ditambahkan. Contrastive search mengubah keputusan tersebut dengan menggabungkan probabilitas model dan penalti untuk kandidat yang menghasilkan hidden state terlalu mirip dengan hidden state yang sudah ada pada prefix. Mekanisme ini bekerja saat inference. Parameter model dan distribusi next-token tidak diubah. Perubahan terjadi pada ranking yang dipakai untuk memilih token dari sekumpulan kandidat terbatas. Pemilihan kandidat dimulai dari probabilitas model Pada langkah decoding t, model menghasilkan distribusi kondisional

Kecerdasan Buatan 23 Sep 2026 4 min read

Temperature Scaling Mengubah Sampling Tanpa Mengubah Urutan Logit

Temperature sering tersedia sebagai satu parameter generasi, tetapi efeknya lebih sempit daripada kendali umum atas kualitas output. Untuk sebuah vektor logit finite yang tetap, temperature positif mengubah skala selisih sebelum softmax. Probabilitas hasilnya berubah tanpa mengubah relasi logit mana yang lebih besar. Perbedaan ini relevan ketika serving layer menggabungkan temperature dengan greedy selection, top-k filtering, top-p filtering, penalty, atau penanganan khusus untuk temperature nol. Nilai numerik yang sama dapat berada dalam pipeline decoding yang berbeda meski operasi scaling dasarnya sederhana.

Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Kecerdasan Buatan 23 Sep 2026 5 min read

Speculative Decoding Memverifikasi Token Draft Sebelum Diterima

Generasi autoregresif biasanya maju satu token setiap iterasi: model menghitung distribusi token berikutnya, aturan decoding memilih token, lalu token tersebut masuk ke konteks untuk forward berikutnya. Speculative decoding mengubah jadwal eksekusi ini. Proses draft yang lebih murah mengusulkan beberapa token ke depan, sementara model target tetap menentukan usulan mana yang boleh masuk ke sequence hasil. Pemisahan peran itu merupakan batas utamanya. Token draft adalah prediksi terhadap keputusan model target di posisi mendatang, bukan distribusi pengganti yang dapat langsung ditambahkan. Implementasi serving harus memverifikasinya memakai skor model target dan menerapkan aturan penerimaan dari algoritma speculative yang digunakan.

Kecerdasan Buatan 23 Sep 2026 5 min read

Repetition Penalty Mengubah Logit untuk ID Token yang Sudah Muncul

Repetition penalty dapat bekerja sebelum sampling dengan mengubah logit milik ID token yang sudah terdapat dalam riwayat token tertentu. Operasi ini tidak harus membandingkan kata, frasa, atau string hasil render. Unit yang diperiksa dapat berupa ID integer dari tokenizer, sehingga makna mekanismenya lebih sempit daripada kesan yang diberikan oleh namanya. Perbedaan tersebut terlihat saat decoder menghasilkan token subword. Dua string yang tampak serupa dapat tersusun dari urutan token berbeda, sedangkan satu token yang dipakai di dalam kata berbeda tetap dapat ditandai sebagai token yang sudah muncul.

Kecerdasan Buatan 23 Sep 2026 5 min read

Penalti Repetisi Mengubah Skor Token Berdasarkan Output Sebelumnya

Penalti repetisi mengubah distribusi next-token tanpa mengubah parameter model atau komputasi hidden state. Model tetap menghasilkan logit dari konteks saat ini, tetapi decoder mengubah skor tertentu berdasarkan token yang sudah muncul. Sampling kemudian bekerja pada skor hasil perubahan tersebut, bukan langsung pada output model. Pemisahan ini relevan saat mereproduksi perilaku generation. Dua sistem dapat menjalankan bobot model dan token ID yang identik tetapi menghasilkan continuation berbeda karena rumus penalti, cakupan riwayat token, atau posisi aturan itu dalam pipeline decoding tidak sama.

Kecerdasan Buatan 23 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Peringkat Sequence

Beam search memberi peringkat pada sequence parsial memakai skor yang terakumulasi sepanjang proses decoding. Jika skor tersebut berupa jumlah log-probability token, setiap token tambahan biasanya menyumbang nilai non-positif. Kandidat yang lebih panjang mendapat lebih banyak kesempatan untuk menurunkan skor mentahnya, bahkan ketika continuation-nya tetap masuk akal secara lokal. Sifat ini bukan cacat pada teori probabilitas. Efek tersebut muncul karena sequence lengkap dengan jumlah faktor kondisional berbeda sedang dibandingkan. Persoalannya menjadi relevan pada implementasi ketika decoder diharapkan menghasilkan completion yang berguna, bukan sekadar mengurutkan sequence berdasarkan probabilitas model tanpa penyesuaian.

Kecerdasan Buatan 23 Sep 2026 4 min read

Logit Bias Mengubah Odds Token Sebelum Sampling

Bias pada level token umumnya diterapkan pada skor model sebelum probabilitas dinormalisasi. Posisi operasi ini menentukan efeknya. Penambahan konstanta pada logit satu token mengubah odds token tersebut relatif terhadap semua token yang tidak menerima konstanta yang sama, tanpa mengubah parameter model maupun hidden state saat itu. Mekanismenya sederhana, tetapi dampak operasionalnya bergantung pada pipeline decoding yang mengikutinya. Bias aditif bekerja pada selisih skor Untuk vocabulary dengan logit (z_1, \ldots, z_V), softmax memberikan probabilitas token (i) sebesar

Kecerdasan Buatan 23 Sep 2026 6 min read

Bias Logit Aditif Mengubah Odds Token Sebelum Sampling

Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya. Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.

Kecerdasan Buatan 22 Sep 2026 5 min read

Top-p Sampling Membentuk Ulang Set Kandidat pada Setiap Token

Top-p sampling tidak mempertahankan shortlist token yang tetap sepanjang generation. Pada setiap langkah decoding, model menghasilkan vektor logit baru, vektor itu menjadi distribusi probabilitas, lalu sampler membentuk set kandidat baru dengan massa probabilitas kumulatif yang mencapai threshold terkonfigurasi. Konsekuensinya mudah terlewat pada kode serving: nilai top_p yang sama dapat memasukkan dua token pada satu langkah dan puluhan token pada langkah lain. Parameter ini mengendalikan massa probabilitas, bukan jumlah kandidat. Cutoff mengikuti distribusi saat ini Untuk vocabulary dengan probabilitas token p_1, p_2, ..., p_V, urutkan token dari probabilitas tertinggi ke terendah: