Langsung ke konten

Arsip

Sampling

5 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Target

Generasi autoregresif biasanya menjalankan model target sekali untuk setiap token yang dikeluarkan. Speculative decoding mengubah pola eksekusi itu: model draft yang lebih murah mengusulkan beberapa token, kemudian model target mengevaluasi blok proposal tersebut dalam satu verification pass. Peluang pengurangan latensi berasal dari pekerjaan model target untuk beberapa posisi sekaligus, bukan dari menganggap keluaran draft sebagai hasil final. Token draft hanya berstatus proposal Misalkan model target mendefinisikan distribusi p dan model draft mendefinisikan distribusi q pada suatu posisi. Model draft mengambil kandidat token dari q. Tahap verifikasi kemudian menentukan apakah kandidat tersebut dapat dipertahankan sebagai sampel yang konsisten dengan p.

Kecerdasan Buatan 24 Sep 2026 6 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Sampling Target

Decoding autoregresif biasanya menetapkan satu token setelah setiap evaluasi model target. Menghasilkan K token membentuk rantai dependensi serial: token t+1 belum dapat di-sampling sebelum token t ditetapkan dan menjadi bagian dari prefix. Speculative decoding mengubah jumlah progres yang dapat diperoleh dari satu pemanggilan model target tanpa menghapus dependensi kausal tersebut. Model draft yang lebih murah terlebih dahulu mengusulkan beberapa token lanjutan. Model target kemudian mengevaluasi posisi kandidat itu bersama-sama. Token dengan probabilitas draft yang kompatibel terhadap distribusi target dapat diterima, sedangkan posisi pertama yang ditolak dikoreksi memakai distribusi residual. Sampel akhir tetap mengikuti distribusi model target ketika prosedur acceptance dan koreksi diterapkan sesuai formulasi algoritmanya.

Kecerdasan Buatan 23 Sep 2026 4 min read

Temperature Scaling Mengubah Sampling Tanpa Mengubah Urutan Logit

Temperature sering tersedia sebagai satu parameter generasi, tetapi efeknya lebih sempit daripada kendali umum atas kualitas output. Untuk sebuah vektor logit finite yang tetap, temperature positif mengubah skala selisih sebelum softmax. Probabilitas hasilnya berubah tanpa mengubah relasi logit mana yang lebih besar. Perbedaan ini relevan ketika serving layer menggabungkan temperature dengan greedy selection, top-k filtering, top-p filtering, penalty, atau penanganan khusus untuk temperature nol. Nilai numerik yang sama dapat berada dalam pipeline decoding yang berbeda meski operasi scaling dasarnya sederhana.

Kecerdasan Buatan 23 Sep 2026 4 min read

Speculative Sampling Mempertahankan Distribusi Target lewat Koreksi Rejection

Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection. Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target. Acceptance bergantung pada rasio probabilitas Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).

Kecerdasan Buatan 09 Sep 2026 9 min read

Sampling LLM: Temperature, Top-K, dan Top-P

Language model biasanya tidak menghasilkan satu next token yang tak terelakkan. Berdasarkan prefix, model memberi skor pada banyak token yang mungkin. Algoritma decoding kemudian menentukan cara mengubah skor tersebut menjadi output berikutnya. Tahap terakhir ini penting. Sampling yang terlalu bebas dapat membuat model bergeser ke continuation yang tidak mungkin. Sampling yang terlalu dibatasi dapat membuat output repetitif atau kehilangan variasi yang berguna. Parameter seperti temperature, top-k, dan top-p mengontrol bagian berbeda dari trade-off ini, sehingga memperlakukannya sebagai satu “creativity setting” akan menghasilkan perilaku yang membingungkan.