Kecerdasan Buatan
24 Sep 2026
5 min read
Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal
Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.