KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses
Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.