Langsung ke konten

Arsip

Artificial Intelligence

52 artikel
Kecerdasan Buatan 23 Sep 2026 4 min read

Attention Sink Membuat Eviksi KV Naif Tidak Stabil

KV cache berukuran tetap tampak cocok dengan kebijakan sederhana: simpan entry terbaru dan buang yang paling lama. Pada sebagian decoder transformer, kebijakan ini justru menghapus posisi yang masih menerima porsi attention besar dari query berikutnya. Posisi awal tersebut bertindak sebagai attention sink, sehingga penghapusannya dapat mengubah distribusi attention jauh melampaui arti semantik token itu sendiri. Efek ini relevan pada inference ketika sistem serving memangkas key dan value yang sudah tersimpan. Ini bukan klaim bahwa token pertama selalu memiliki arti semantik khusus, ataupun bahwa setiap transformer menunjukkan pola yang sama.

Kecerdasan Buatan 17 Sep 2026 5 min read

Membatasi Update Gradien dengan Global Norm Clipping

Satu langkah optimisasi dapat menghasilkan gradien dengan besar gabungan yang jauh melebihi langkah-langkah di sekitarnya. Jika gradien itu langsung diberikan kepada optimizer, update parameter yang dihasilkan dapat memindahkan model ke wilayah space parameter yang sangat berbeda. Global norm clipping membatasi besar gradien sebelum optimizer memakainya. Mekanismenya sederhana, tetapi perilakunya mudah disalahartikan. Mekanisme ini tidak membatasi setiap elemen gradien secara terpisah dan tidak menjamin norm update parameter yang tetap untuk optimizer adaptif. Mekanisme ini menskalakan ulang seluruh vektor gradien ketika norm yang dipilih melewati ambang.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kuantisasi Embedding Tanpa Menyamarkan Error Retrieval

Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan. Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kecerdasan Buatan 15 Sep 2026 6 min read

Kuantisasi KV Cache dengan Error Budget yang Eksplisit

Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator. Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.