Langsung ke konten

Arsip

Attention

29 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal

Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sequence Packing Memerlukan Attention Mask yang Sadar Batas

Sequence packing mengurangi padding dengan menempatkan beberapa contoh berpanjang variabel ke dalam satu buffer token. Layout penyimpanannya dapat terlihat seperti satu sequence panjang, tetapi setiap contoh tetap independen secara semantik. Causal mask standar tidak menjaga independensi tersebut dengan sendirinya. Pada Transformer decoder-only, causal masking mencegah attention menuju posisi masa depan. Mekanisme ini biasanya tidak mencegah attention menuju posisi sebelumnya yang berasal dari contoh lain dalam buffer yang sama. Jika batas diabaikan, token pada contoh berikutnya dapat mengakses key dan value dari contoh sebelumnya. Model akhirnya menerima konteks yang semestinya dipisahkan oleh data pipeline.

Kecerdasan Buatan 24 Sep 2026 4 min read

Rotary Position Embedding Mengubah Indeks Absolut Menjadi Fase Relatif pada Attention

Self-attention dapat membandingkan isi token tanpa memberi urutan pada posisi token. Rotary Position Embedding (RoPE) memasukkan posisi ke dalam perbandingan itu dengan merotasi pasangan koordinat pada query dan key. Setiap token menerima rotasi berdasarkan indeks absolut, tetapi inner product query-key mereduksi kedua sudut absolut tersebut menjadi selisih sudut. Pembatalan secara aljabar ini merupakan mekanisme utama RoPE. Tidak ada vektor posisi yang harus ditambahkan ke hidden state. Posisi mengubah orientasi komponen query dan key sebelum dot product dihitung.

Kecerdasan Buatan 24 Sep 2026 4 min read

RoPE Mengodekan Offset Relatif melalui Fase Query-Key yang Diputar

Rotary Position Embedding (RoPE) menerapkan rotasi berbasis posisi pada koordinat query dan key sebelum dot product attention dihitung. Skor yang dihasilkan membawa posisi relatif melalui selisih fase kedua rotasi tersebut, bukan melalui vektor posisi aditif yang ditempelkan pada representasi token. Perbedaan ini bersifat struktural. RoPE memakai indeks absolut untuk menentukan setiap rotasi, tetapi inner product antara query dan key dapat ditulis sebagai fungsi offset di antara kedua posisi. Pasangan koordinat membawa frekuensi sudut yang berbeda RoPE membagi query atau key berdimensi genap menjadi pasangan koordinat dua dimensi. Untuk satu pasangan, posisi m menerapkan rotasi

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.

Kecerdasan Buatan 24 Sep 2026 5 min read

Grouped-Query Attention Membagi Head Key-Value di Antara Grup Query

Multi-head attention tidak mengharuskan setiap head query memiliki head key dan head value yang berbeda. Grouped-query attention, atau GQA, membagi head query ke dalam beberapa grup dan memberikan satu head key-value untuk setiap grup. Proyeksi query tetap terpisah, tetapi beberapa head query membaca key dan value hasil proyeksi yang sama. Perbedaan ini mengubah bentuk parameter dan state yang disimpan di cache tanpa menyatukan head query menjadi satu komputasi attention. Setiap head query tetap menghasilkan skor attention sendiri karena vektor query-nya berbeda.

Kecerdasan Buatan 24 Sep 2026 5 min read

FlashAttention Menghitung Softmax Eksak per Tile Tanpa Menyimpan Matriks Skor Penuh

Scaled dot-product attention standar membentuk matriks skor dengan dua sumbu panjang yang sama-sama mengikuti posisi sequence. Untuk satu attention head, S = QK^T / sqrt(d) P = softmax(S) O = PV definisi matematisnya ringkas, tetapi implementasi GPU langsung dapat menulis intermediate besar S dan P ke high-bandwidth memory lalu membacanya kembali. FlashAttention mengubah aliran data tersebut. Query, key, dan value diproses dalam blok di memori on-chip, sementara state softmax per baris dibawa dari satu tile ke tile berikutnya agar seluruh tile skor tetap dapat digabungkan secara eksak.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Eviction Cache untuk Streaming

KV cache dengan kapasitas tetap dapat mencegah memori inferensi terus bertambah pada aliran token yang panjang. Namun, membuang semua token lama secara ketat berdasarkan urutan kedatangan dapat mengganggu attention lebih besar daripada sekadar hilangnya isi token tersebut. Pada sebagian transformer autoregresif, posisi awal menerima bobot attention yang berarti walaupun semantik tokennya tidak berkaitan langsung dengan prediksi saat ini. Posisi seperti ini disebut attention sink. Konsekuensi pada serving cukup spesifik: sliding cache yang mempertahankan prefix awal kecil bersama token terbaru dapat berperilaku berbeda dari cache berukuran sama yang hanya berisi token paling baru. Mekanisme ini berkaitan dengan state attention dan pengelolaan posisi, bukan pemulihan teks lama yang sudah dibuang.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Penalti Jarak Langsung ke Logit Attention

Attention with Linear Biases (ALiBi) mengubah skor causal attention sebelum softmax dengan menambahkan penalti yang membesar seiring jarak antartoken. Posisi masuk melalui jalur skor, bukan melalui vektor posisi yang ditambahkan ke representasi setiap token. Untuk query pada posisi i yang mengakses key pada posisi j, satu head dapat ditulis secara skematis sebagai: score(i, j) = q_i · k_j / sqrt(d_k) - m_h * (i - j) untuk posisi kausal j <= i. Slope positif m_h bersifat spesifik untuk attention head h. Causal mask tetap mencegah akses ke posisi masa depan; komponen linear hanya mengubah preferensi relatif di antara posisi yang masih terlihat.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Bias Proporsional Jarak pada Skor Attention

ALiBi mengubah skor attention sebelum softmax, bukan menambahkan vektor posisi ke representasi token. Pada transformer kausal, key yang berada semakin jauh di belakang query menerima offset negatif yang semakin besar. Offset tersebut linear terhadap jarak token dan memakai slope yang terkait dengan attention head. Bentuk sederhana untuk skor head h dapat ditulis sebagai: score_h(i, j) = q_i k_j^T / sqrt(d) - m_h * (i - j) untuk pasangan kausal yang diizinkan dengan j <= i dan slope positif m_h. Causal mask tetap menentukan posisi masa depan yang tidak dapat diakses. ALiBi mengubah skor relatif di antara posisi yang masih diizinkan.

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 4 min read

Grouped-Query Attention Membagi Head Key-Value ke Beberapa Head Query

Grouped-query attention mengubah satu bagian spesifik dari multi-head attention: beberapa head query menggunakan head key dan value yang sama. Proyeksi query tetap terpisah, sehingga head-head query tersebut dapat menghasilkan bobot attention yang berbeda, tetapi semuanya membaca key dan value dari representasi hasil proyeksi yang dipakai bersama. Perbedaan ini relevan saat inferensi. Cache pada decoder menyimpan key dan value dari posisi sebelumnya, bukan query. Mengurangi jumlah head key-value karena itu dapat mengurangi penyimpanan KV cache tanpa harus mengurangi jumlah head query dengan faktor yang sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Grouped-Query Attention Berbagi KV Head di Antara Grup Query

Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Entropi Attention Mengukur Konsentrasi, Bukan Kepentingan Kausal

Sebuah attention head dapat menempatkan sebagian besar massa probabilitas pada satu posisi tanpa memberikan bukti kuat bahwa posisi tersebut mengendalikan output akhir model. Entropi bobot attention mengukur konsentrasi, bukan pengaruh kausal. Pemisahan ini relevan saat attention map dipakai sebagai diagnostik. Entropi dapat menunjukkan apakah sebuah head menyebarkan massa secara luas atau memusatkannya pada sedikit posisi untuk query tertentu. Nilai itu sendiri tidak menetapkan bahwa token dengan bobot tertinggi membawa fitur yang menentukan prediksi downstream.

Kecerdasan Buatan 23 Sep 2026 4 min read

Attention Sink Membuat Eviksi KV Naif Tidak Stabil

KV cache berukuran tetap tampak cocok dengan kebijakan sederhana: simpan entry terbaru dan buang yang paling lama. Pada sebagian decoder transformer, kebijakan ini justru menghapus posisi yang masih menerima porsi attention besar dari query berikutnya. Posisi awal tersebut bertindak sebagai attention sink, sehingga penghapusannya dapat mengubah distribusi attention jauh melampaui arti semantik token itu sendiri. Efek ini relevan pada inference ketika sistem serving memangkas key dan value yang sudah tersimpan. Ini bukan klaim bahwa token pertama selalu memiliki arti semantik khusus, ataupun bahwa setiap transformer menunjukkan pola yang sama.

Kecerdasan Buatan 22 Sep 2026 6 min read

Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention

Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.