Langsung ke konten

Arsip

LLM Inference

7 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Target

Generasi autoregresif biasanya menjalankan model target sekali untuk setiap token yang dikeluarkan. Speculative decoding mengubah pola eksekusi itu: model draft yang lebih murah mengusulkan beberapa token, kemudian model target mengevaluasi blok proposal tersebut dalam satu verification pass. Peluang pengurangan latensi berasal dari pekerjaan model target untuk beberapa posisi sekaligus, bukan dari menganggap keluaran draft sebagai hasil final. Token draft hanya berstatus proposal Misalkan model target mendefinisikan distribusi p dan model draft mendefinisikan distribusi q pada suatu posisi. Model draft mengambil kandidat token dari q. Tahap verifikasi kemudian menentukan apakah kandidat tersebut dapat dipertahankan sebagai sampel yang konsisten dengan p.

Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama

Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru. Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.

Kecerdasan Buatan 24 Sep 2026 5 min read

PagedAttention Memisahkan Urutan KV Logis dari Blok Cache Fisik

Serving autoregresif menyimpan state key-value yang terus bertambah untuk setiap sequence aktif. Jika seluruh state itu harus berada pada satu area fisik kontigu yang disiapkan untuk sebuah request, alokasi ikut terikat pada panjang sequence yang belum pasti. Reservasi terlalu besar membuang kapasitas, sedangkan memperbesar atau memindahkan area yang terus tumbuh menambah persoalan manajemen memori. PagedAttention mengubah batas alokasi tersebut. Sequence direpresentasikan sebagai blok KV logis, sementara blok fisiknya dapat berada di lokasi cache pool yang tidak bersebelahan.

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.