Attention Sink Membuat Eviksi KV Naif Tidak Stabil
KV cache berukuran tetap tampak cocok dengan kebijakan sederhana: simpan entry terbaru dan buang yang paling lama. Pada sebagian decoder transformer, kebijakan ini justru menghapus posisi yang masih menerima porsi attention besar dari query berikutnya. Posisi awal tersebut bertindak sebagai attention sink, sehingga penghapusannya dapat mengubah distribusi attention jauh melampaui arti semantik token itu sendiri. Efek ini relevan pada inference ketika sistem serving memangkas key dan value yang sudah tersimpan. Ini bukan klaim bahwa token pertama selalu memiliki arti semantik khusus, ataupun bahwa setiap transformer menunjukkan pola yang sama.