Langsung ke konten

Arsip

Speculative Decoding

4 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Target

Generasi autoregresif biasanya menjalankan model target sekali untuk setiap token yang dikeluarkan. Speculative decoding mengubah pola eksekusi itu: model draft yang lebih murah mengusulkan beberapa token, kemudian model target mengevaluasi blok proposal tersebut dalam satu verification pass. Peluang pengurangan latensi berasal dari pekerjaan model target untuk beberapa posisi sekaligus, bukan dari menganggap keluaran draft sebagai hasil final. Token draft hanya berstatus proposal Misalkan model target mendefinisikan distribusi p dan model draft mendefinisikan distribusi q pada suatu posisi. Model draft mengambil kandidat token dari q. Tahap verifikasi kemudian menentukan apakah kandidat tersebut dapat dipertahankan sebagai sampel yang konsisten dengan p.

Kecerdasan Buatan 24 Sep 2026 6 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Sampling Target

Decoding autoregresif biasanya menetapkan satu token setelah setiap evaluasi model target. Menghasilkan K token membentuk rantai dependensi serial: token t+1 belum dapat di-sampling sebelum token t ditetapkan dan menjadi bagian dari prefix. Speculative decoding mengubah jumlah progres yang dapat diperoleh dari satu pemanggilan model target tanpa menghapus dependensi kausal tersebut. Model draft yang lebih murah terlebih dahulu mengusulkan beberapa token lanjutan. Model target kemudian mengevaluasi posisi kandidat itu bersama-sama. Token dengan probabilitas draft yang kompatibel terhadap distribusi target dapat diterima, sedangkan posisi pertama yang ditolak dikoreksi memakai distribusi residual. Sampel akhir tetap mengikuti distribusi model target ketika prosedur acceptance dan koreksi diterapkan sesuai formulasi algoritmanya.

Kecerdasan Buatan 23 Sep 2026 4 min read

Speculative Sampling Mempertahankan Distribusi Target lewat Koreksi Rejection

Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection. Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target. Acceptance bergantung pada rasio probabilitas Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).

Kecerdasan Buatan 22 Sep 2026 6 min read

Speculative Decoding Menghubungkan Kecepatan Draft dengan Tingkat Penerimaan

Generasi autoregresif biasanya maju satu token yang diterima pada satu waktu. Setiap token baru memperpanjang prefix, sehingga evaluasi target model berikutnya bergantung pada token yang dipilih pada posisi sebelumnya. Speculative decoding mengubah jadwal eksekusi: proses draft yang lebih murah mengusulkan beberapa token ke depan, lalu target model mengevaluasi posisi tersebut bersama-sama dan menentukan seberapa panjang proposal yang dapat dipertahankan. Susunan ini dapat mengurangi jumlah pemanggilan target model yang bersifat serial untuk setiap token output. Verifikasi tetap memiliki biaya, dan blok draft yang lebih panjang tidak otomatis lebih baik. Titik operasi yang berguna bergantung pada kecepatan pembuatan proposal, seberapa sering proposal lolos verifikasi target, dan biaya yang ditanggung serving stack untuk pekerjaan yang akhirnya ditolak.