Langsung ke konten

Arsip

Kuantisasi

8 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi

Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention. Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.

Kecerdasan Buatan 24 Sep 2026 5 min read

Activation Outlier Mendistorsi Skala Kuantisasi Low-Bit

Sebuah tensor dapat direpresentasikan dengan baik dalam floating point tetapi sulit dipetakan ke rentang integer yang kecil. Masalah ini terasa ketika sebagian besar nilai aktivasi berada dalam interval sempit, sementara sedikit nilai memiliki magnitudo jauh lebih besar. Skala kuantisasi bersama harus mencakup nilai ekstrem tersebut, sehingga nilai biasa hanya mendapat sebagian kecil level representasi yang tersedia. Itulah dampak praktis activation outlier pada inference low-bit. Masalahnya bukan sekadar sebuah outlier memiliki nilai numerik besar. Lokasi, persistensi, dan hubungannya dengan sumbu tempat skala digunakan bersama menentukan apakah outlier tersebut benar-benar merusak representasi hasil kuantisasi.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi

Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi. Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Mendominasi Skala Kuantisasi Per-Tensor

Quantizer per-tensor memetakan setiap nilai dalam tensor aktivasi melalui satu skala bersama. Keterikatan ini menjadi relevan saat sebagian besar aktivasi berada dalam interval sempit, tetapi beberapa nilai memiliki magnitudo jauh lebih besar. Nilai besar tersebut dapat menentukan skala, sedangkan area pusat yang padat direpresentasikan dengan jarak antarnilai yang lebih kasar daripada kebutuhan rentangnya sendiri. Ini bukan berarti setiap aktivasi besar merupakan error atau aman untuk dihapus. Outlier dapat membawa state model yang berguna. Persoalannya bersifat numerik: satu skala harus mencakup nilai dengan magnitudo yang sangat berbeda.

Kecerdasan Buatan 15 Sep 2026 6 min read

Kuantisasi KV Cache dengan Error Budget yang Eksplisit

Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator. Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kuantisasi KV Cache dengan Error Budget Key dan Value Terpisah

Inference transformer autoregressive menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke posisi terdahulu tanpa menghitung ulang seluruh prefix. KV cache tersebut bertambah bersama sequence length, jumlah layer, batch size, dan jumlah key-value head yang disimpan. Pada context panjang, jejak memorinya dapat langsung membatasi jumlah request konkuren atau context length yang dapat digunakan. Kuantisasi KV cache mengurangi byte per elemen yang disimpan. Namun, aproksimasi yang dihasilkan tidak setara dengan menguantisasi struktur data pasif. Cached key ikut dalam perhitungan attention score, sedangkan cached value dicampur berdasarkan attention weight yang dihasilkan. Error pada kedua tensor itu karena itu memasuki operasi attention pada titik yang berbeda.