Langsung ke konten

Arsip

Inferensi LLM

5 artikel
Kecerdasan Buatan 24 Sep 2026 6 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Sampling Target

Decoding autoregresif biasanya menetapkan satu token setelah setiap evaluasi model target. Menghasilkan K token membentuk rantai dependensi serial: token t+1 belum dapat di-sampling sebelum token t ditetapkan dan menjadi bagian dari prefix. Speculative decoding mengubah jumlah progres yang dapat diperoleh dari satu pemanggilan model target tanpa menghapus dependensi kausal tersebut. Model draft yang lebih murah terlebih dahulu mengusulkan beberapa token lanjutan. Model target kemudian mengevaluasi posisi kandidat itu bersama-sama. Token dengan probabilitas draft yang kompatibel terhadap distribusi target dapat diterima, sedangkan posisi pertama yang ditolak dikoreksi memakai distribusi residual. Sampel akhir tetap mengikuti distribusi model target ketika prosedur acceptance dan koreksi diterapkan sesuai formulasi algoritmanya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi

Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention. Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.

Kecerdasan Buatan 24 Sep 2026 5 min read

Grouped-Query Attention Membagi Head Key-Value di Antara Grup Query

Multi-head attention tidak mengharuskan setiap head query memiliki head key dan head value yang berbeda. Grouped-query attention, atau GQA, membagi head query ke dalam beberapa grup dan memberikan satu head key-value untuk setiap grup. Proyeksi query tetap terpisah, tetapi beberapa head query membaca key dan value hasil proyeksi yang sama. Perbedaan ini mengubah bentuk parameter dan state yang disimpan di cache tanpa menyatukan head query menjadi satu komputasi attention. Setiap head query tetap menghasilkan skor attention sendiri karena vektor query-nya berbeda.

Kecerdasan Buatan 24 Sep 2026 5 min read

Continuous Batching Mengganti Kelompok Request Statis dengan Scheduling per Iterasi

Generasi autoregresif tidak menyelesaikan setiap request pada iterasi yang sama. Satu sequence dapat menghasilkan stop token setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah berikutnya. Batch statis mengikat request tersebut sampai batas batch tercapai. Continuous batching memutus ikatan itu dengan mengizinkan himpunan aktif berubah di antara iterasi model. Perubahan utamanya berada pada granularitas scheduling. Request tidak lagi menjadi unit scheduling yang tidak dapat dipecah selama seluruh proses generasi. Sistem serving dapat membentuk batch eksekusi untuk satu iterasi, memperbarui state request setelah iterasi tersebut, mengeluarkan sequence yang selesai, lalu memasukkan pekerjaan antrean sebelum langkah eksekusi berikutnya.

Kecerdasan Buatan 17 Sep 2026 6 min read

Mempertahankan Attention Sink dalam KV Cache Terbatas

KV cache terbatas tampak cocok dengan aturan eviction sederhana: setelah cache penuh, buang pasangan key-value tertua dan pertahankan token terbaru. Pada sebagian transformer decoder-only, aturan ini dapat menurunkan kualitas generasi secara tajam setelah urutan melewati jendela yang dipertahankan. Kegagalan tersebut tidak hanya berasal dari hilangnya konten semantik lama. Token awal dapat menerima attention besar meski teksnya hanya membawa sedikit informasi yang berguna untuk prediksi saat ini. Perilaku ini umum disebut attention sink. Dampaknya penting bagi desain inferensi streaming karena kebijakan cache yang mempertahankan prefix awal kecil ditambah sliding window terbaru dapat berperilaku sangat berbeda dari sliding window murni dengan batas memori yang serupa.