Langsung ke konten

Arsip

KV Cache

21 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama

Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru. Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix Caching Menggunakan Ulang State KV untuk Prefix Token Identik

Serving autoregresif sering menerima request yang dimulai dengan urutan token panjang yang sama. System prompt, tool schema, header dokumen tetap, atau konteks berulang lain dapat membuat model menghitung state attention untuk prefix yang sama berkali-kali. Prefix caching menargetkan pekerjaan prefill yang berulang itu dengan mempertahankan state key-value yang kompatibel dan menghubungkan request berikutnya ke state tersebut. Batas penggunaan ulang adalah state token yang identik, bukan kemiripan semantik. Dua prompt yang menyampaikan maksud serupa tetapi menghasilkan token berbeda tidak memiliki entry prefix cache yang dapat dipertukarkan.

Kecerdasan Buatan 24 Sep 2026 5 min read

PagedAttention Memisahkan Urutan KV Logis dari Blok Cache Fisik

Serving autoregresif menyimpan state key-value yang terus bertambah untuk setiap sequence aktif. Jika seluruh state itu harus berada pada satu area fisik kontigu yang disiapkan untuk sebuah request, alokasi ikut terikat pada panjang sequence yang belum pasti. Reservasi terlalu besar membuang kapasitas, sedangkan memperbesar atau memindahkan area yang terus tumbuh menambah persoalan manajemen memori. PagedAttention mengubah batas alokasi tersebut. Sequence direpresentasikan sebagai blok KV logis, sementara blok fisiknya dapat berada di lokasi cache pool yang tidak bersebelahan.

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi

Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention. Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.

Kecerdasan Buatan 24 Sep 2026 6 min read

Grouped-Query Attention Mengecilkan KV Cache dengan Berbagi Head Key-Value

Grouped-query attention mengubah jumlah key dan value head yang harus disimpan selama decoding autoregresif. Setiap query head tidak lagi selalu memiliki pasangan key-value sendiri. Beberapa query head memakai key-value head yang sama. Sisi query tetap dapat memiliki banyak head, sedangkan state KV persisten menggunakan lebih sedikit proyeksi independen. Perubahan ini berada pada arsitektur attention, bukan codec kompresi cache. Cache menjadi lebih kecil karena model memang menghasilkan lebih sedikit key dan value head yang berbeda untuk setiap token.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Eviction Cache untuk Streaming

KV cache dengan kapasitas tetap dapat mencegah memori inferensi terus bertambah pada aliran token yang panjang. Namun, membuang semua token lama secara ketat berdasarkan urutan kedatangan dapat mengganggu attention lebih besar daripada sekadar hilangnya isi token tersebut. Pada sebagian transformer autoregresif, posisi awal menerima bobot attention yang berarti walaupun semantik tokennya tidak berkaitan langsung dengan prediksi saat ini. Posisi seperti ini disebut attention sink. Konsekuensi pada serving cukup spesifik: sliding cache yang mempertahankan prefix awal kecil bersama token terbaru dapat berperilaku berbeda dari cache berukuran sama yang hanya berisi token paling baru. Mekanisme ini berkaitan dengan state attention dan pengelolaan posisi, bukan pemulihan teks lama yang sudah dibuang.

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.

Kecerdasan Buatan 23 Sep 2026 5 min read

Reuse Prefix KV Cache Bergantung pada Identitas Konteks yang Tepat

Prefix cache dapat menghilangkan komputasi prefill yang berulang tanpa mengubah output model, tetapi hanya jika key dan value yang tersimpan mewakili konteks prefix yang sama dengan state yang seharusnya dihasilkan request baru. Kecocokan teks yang terlihat belum cukup. Jalur serving pada akhirnya bekerja dengan token ID, posisi, parameter model, dan state attention yang bergantung pada implementasi. Batas ini membuat prefix caching berbeda dari cache teks biasa. Cache teks menyimpan hasil yang terkait dengan sebuah input. KV prefix cache menyimpan state perantara yang validitasnya bergantung pada komputasi yang membentuknya.

Kecerdasan Buatan 23 Sep 2026 5 min read

PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu

KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU. Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.

Kecerdasan Buatan 23 Sep 2026 5 min read

KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses

Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.

Kecerdasan Buatan 23 Sep 2026 4 min read

KV Cache RoPE Mempertahankan Posisi Token saat Decoding Inkremental

Pada decoder dengan rotary position embeddings, key yang masuk ke KV cache sudah membawa rotasi sesuai posisi tokennya. Decoding inkremental dapat memakai key tersebut secara langsung. Memberikan rotasi posisi token saat ini sekali lagi ke key lama justru mengubah geometri attention. Akibatnya, state posisi merupakan bagian dari kontrak cache meskipun API cache tampak hanya menyimpan tensor. Rotasi terjadi sebelum key dipakai oleh attention Untuk satu pasangan komponen dua dimensi, RoPE menerapkan rotasi yang bergantung pada posisi. Jika (R_m) menyatakan rotasi pada posisi (m), query dan key menjadi

Kecerdasan Buatan 23 Sep 2026 4 min read

Attention Sink Membuat Eviksi KV Naif Tidak Stabil

KV cache berukuran tetap tampak cocok dengan kebijakan sederhana: simpan entry terbaru dan buang yang paling lama. Pada sebagian decoder transformer, kebijakan ini justru menghapus posisi yang masih menerima porsi attention besar dari query berikutnya. Posisi awal tersebut bertindak sebagai attention sink, sehingga penghapusannya dapat mengubah distribusi attention jauh melampaui arti semantik token itu sendiri. Efek ini relevan pada inference ketika sistem serving memangkas key dan value yang sudah tersimpan. Ini bukan klaim bahwa token pertama selalu memiliki arti semantik khusus, ataupun bahwa setiap transformer menunjukkan pola yang sama.

Kecerdasan Buatan 22 Sep 2026 6 min read

Reuse Prefix KV Cache Bergantung pada Riwayat Token yang Identik

Satu entri KV cache bukan representasi yang dapat dipakai ulang untuk sembarang teks yang tampak mirip. Pada transformer autoregresif, key dan value yang tersimpan adalah state perantara yang dihasilkan untuk prefix token tertentu dalam konteks eksekusi tertentu. Reuse valid hanya jika request baru mencapai batas state yang sama. Batas itu lebih ketat daripada kecocokan karakter yang terlihat. Tokenisasi, urutan token, penanganan posisi, identitas model, state adapter, serta input lain yang memengaruhi hidden state dapat menentukan apakah prefix dalam cache masih mewakili komputasi yang dibutuhkan request baru.

Kecerdasan Buatan 19 Sep 2026 6 min read

Prefix Caching Memakai Ulang State KV Hanya pada Prefix Prompt yang Identik

Serving transformer autoregresif sering memproses prefix prompt yang sama pada banyak request: system message, header dokumen panjang, atau tool schema tetap dapat muncul sebelum teks khusus pengguna. Prefix caching menyimpan state key-value yang dihasilkan prefix bersama tersebut sehingga request berikutnya dapat melanjutkan komputasi dari batas cache tanpa menghitung ulang seluruh prefix. Batas yang berguna lebih sempit daripada sekadar “prompt yang mirip.” Reuse bergantung pada urutan token yang identik dan state model yang memengaruhi aktivasi tersimpan. Perubahan satu karakter dapat mempertahankan sebagian besar token, menggeser tokenisasi di sekitar perubahan, atau mengubah semua token setelah batas format tertentu. Cache hanya dapat memakai ulang bagian yang input efektifnya tetap identik.

Kecerdasan Buatan 17 Sep 2026 6 min read

Mempertahankan Attention Sink dalam KV Cache Terbatas

KV cache terbatas tampak cocok dengan aturan eviction sederhana: setelah cache penuh, buang pasangan key-value tertua dan pertahankan token terbaru. Pada sebagian transformer decoder-only, aturan ini dapat menurunkan kualitas generasi secara tajam setelah urutan melewati jendela yang dipertahankan. Kegagalan tersebut tidak hanya berasal dari hilangnya konten semantik lama. Token awal dapat menerima attention besar meski teksnya hanya membawa sedikit informasi yang berguna untuk prediksi saat ini. Perilaku ini umum disebut attention sink. Dampaknya penting bagi desain inferensi streaming karena kebijakan cache yang mempertahankan prefix awal kecil ditambah sliding window terbaru dapat berperilaku sangat berbeda dari sliding window murni dengan batas memori yang serupa.

Kecerdasan Buatan 13 Sep 2026 6 min read

Gunakan Ulang State Prefix Bersama pada Inferensi LLM

Inferensi LLM autoregresif sering memproses token awal yang sama pada banyak request. System prompt tetap, schema tool, atau prefix dokumen dapat berisi ribuan token sebelum teks khusus request dimulai. Menghitung state attention untuk prefix identik pada setiap request berarti mengulang pekerjaan prefill yang sebelumnya sudah menghasilkan key dan value cache yang sama dalam kondisi eksekusi yang kompatibel. Prefix caching menyimpan state attention yang dapat digunakan ulang untuk prefix token bersama. Mekanisme ini mengurangi komputasi prefill saat terjadi cache hit, tetapi tidak membuat prompt yang sekadar mirip dapat saling dipertukarkan. Unit yang dapat digunakan ulang terikat pada state input model yang tepat, bukan kemiripan semantik.