Langsung ke konten

Arsip

Transformer

52 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Tanh Logit Soft Capping Membatasi Skor Ekstrem Sebelum Softmax

Softmax dapat menerima logit dengan magnitudo hingga berapa pun selama nilainya finite, tetapi selisih skor yang besar membuat keluarannya semakin terkonsentrasi. Tanh logit soft capping menyisipkan transformasi nonlinear terbatas sebelum softmax sehingga logit hasil transformasi tidak melewati magnitudo yang ditentukan. Untuk cap positif c, bentuk yang umum adalah: softcap(z; c) = c * tanh(z / c) Operasi ini bukan hard clipping pada ambang tertentu. Di sekitar nol perilakunya hampir linear, lalu magnitudo yang lebih besar dikompresi secara bertahap saat mendekati -c atau c.

Kecerdasan Buatan 24 Sep 2026 5 min read

SwiGLU Mengendalikan Kanal Feed-Forward Transformer dengan Proyeksi Kedua

SwiGLU membagi input feed-forward transformer ke dua jalur proyeksi, menerapkan SiLU pada satu jalur, lalu mengalikan kedua hasil secara elemen per elemen. Proyeksi kedua bukan statistik tambahan: nilainya langsung mengendalikan jalur yang sudah diaktivasi sebelum proyeksi output. Untuk hidden state x, bentuk struktural yang umum adalah: g = SiLU(x W_gate) u = x W_up h = g * u y = h W_down Bias, orientasi proyeksi, lebar intermediate, dan nama parameter dapat berbeda antar arsitektur. Batas yang mendefinisikan operasi ini adalah perkalian elemen per elemen antara cabang proyeksi nonlinear dan cabang proyeksi lainnya.

Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Secara Paralel

Generasi autoregresif biasanya menetapkan satu token sebelum langkah model target berikutnya dapat dievaluasi. Speculative decoding mengubah pola eksekusi tersebut. Distribusi proposal yang lebih murah menghasilkan blok kandidat pendek, sementara model target mengevaluasi posisi-posisi kandidat itu bersama-sama. Aturan penerimaan kemudian menentukan seberapa banyak bagian blok yang dapat menjadi output. Mekanisme ini bukan batching biasa. Token di dalam proposal tetap dihasilkan secara autoregresif, dan model target tetap menentukan distribusi output yang dituju ketika algoritma speculative sampling eksak digunakan. Perubahan yang berguna terletak pada verifikasi: satu pass yang mahal dapat mencakup beberapa posisi output jika cukup banyak proposal diterima.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal

Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sequence Packing Memerlukan Attention Mask yang Sadar Batas

Sequence packing mengurangi padding dengan menempatkan beberapa contoh berpanjang variabel ke dalam satu buffer token. Layout penyimpanannya dapat terlihat seperti satu sequence panjang, tetapi setiap contoh tetap independen secara semantik. Causal mask standar tidak menjaga independensi tersebut dengan sendirinya. Pada Transformer decoder-only, causal masking mencegah attention menuju posisi masa depan. Mekanisme ini biasanya tidak mencegah attention menuju posisi sebelumnya yang berasal dari contoh lain dalam buffer yang sama. Jika batas diabaikan, token pada contoh berikutnya dapat mengakses key dan value dari contoh sebelumnya. Model akhirnya menerima konteks yang semestinya dipisahkan oleh data pipeline.

Kecerdasan Buatan 24 Sep 2026 4 min read

RoPE Mengodekan Offset Relatif melalui Fase Query-Key yang Diputar

Rotary Position Embedding (RoPE) menerapkan rotasi berbasis posisi pada koordinat query dan key sebelum dot product attention dihitung. Skor yang dihasilkan membawa posisi relatif melalui selisih fase kedua rotasi tersebut, bukan melalui vektor posisi aditif yang ditempelkan pada representasi token. Perbedaan ini bersifat struktural. RoPE memakai indeks absolut untuk menentukan setiap rotasi, tetapi inner product antara query dan key dapat ditulis sebagai fungsi offset di antara kedua posisi. Pasangan koordinat membawa frekuensi sudut yang berbeda RoPE membagi query atau key berdimensi genap menjadi pasangan koordinat dua dimensi. Untuk satu pasangan, posisi m menerapkan rotasi

Kecerdasan Buatan 24 Sep 2026 4 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menormalisasi vektor hidden state tanpa mengurangi mean koordinatnya. Satu perbedaan ini memisahkannya dari LayerNorm pada antarmuka matematis: RMSNorm mengendalikan skala melalui statistik root mean square, sedangkan offset yang sama pada seluruh koordinat tetap menjadi bagian dari representasi yang ditransformasikan. Untuk vektor x dengan lebar D, salah satu bentuk umum RMSNorm adalah: rms(x) = sqrt(mean(x_i^2) + eps) y_i = g_i * x_i / rms(x) Di sini g_i adalah skala per koordinat yang dapat dilatih dan eps adalah nilai positif kecil yang ditentukan implementasi model. Parameterisasi dan detail numerik yang tepat merupakan bagian dari kontrak checkpoint dan runtime.

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix Caching Menggunakan Ulang State KV untuk Prefix Token Identik

Serving autoregresif sering menerima request yang dimulai dengan urutan token panjang yang sama. System prompt, tool schema, header dokumen tetap, atau konteks berulang lain dapat membuat model menghitung state attention untuk prefix yang sama berkali-kali. Prefix caching menargetkan pekerjaan prefill yang berulang itu dengan mempertahankan state key-value yang kompatibel dan menghubungkan request berikutnya ke state tersebut. Batas penggunaan ulang adalah state token yang identik, bukan kemiripan semantik. Dua prompt yang menyampaikan maksud serupa tetapi menghasilkan token berbeda tidak memiliki entry prefix cache yang dapat dipertukarkan.

Kecerdasan Buatan 24 Sep 2026 6 min read

Kuantisasi KV Cache Menukar Presisi dengan Memori Serving

Decoding autoregresif menyimpan key dan value attention dari token sebelumnya agar setiap token baru dapat memakai kembali proyeksi yang sudah dihitung. KV cache tersebut membesar mengikuti panjang sequence, jumlah layer, batch size, serta jumlah dan lebar head key/value yang disimpan. Menurunkan presisi numeriknya dapat mengurangi byte yang ditempati tensor cache, tetapi nilai yang dipakai oleh operasi attention berikutnya juga ikut berubah. Karena itu, kuantisasi KV cache berbeda dari kompresi data yang hanya disimpan lalu dipulihkan tanpa kehilangan informasi. Cache terkuantisasi tetap berada pada jalur inferensi. Setiap query berikutnya dapat berinteraksi dengan key dan value hasil aproksimasi, sehingga persoalannya bukan sekadar berapa byte yang berkurang, tetapi juga di bagian mana error kuantisasi masuk ke attention dan bagaimana implementasi serving membatasinya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert MoE Membatasi Routing Token

Layer Mixture-of-Experts yang sparse dapat memiliki banyak jaringan expert sambil hanya mengaktifkan sebagian kecil untuk setiap token. Conditional computation ini bergantung pada router, tetapi skor router saja tidak menentukan graph yang benar-benar dieksekusi. Pada implementasi dengan batch expert terbatas, setiap expert juga memiliki jumlah slot token yang terbatas. Kondisi ini menambahkan batas kedua setelah pemilihan expert: sebuah token dapat memilih expert yang sudah tidak memiliki kapasitas. Penanganan overflow tersebut merupakan keputusan implementasi dan arsitektur yang berdampak langsung pada training dan serving.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow

Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert. Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.

Kecerdasan Buatan 24 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Indeks Sebelum Rotasi

Rotary position embeddings menerapkan rotasi yang bergantung pada posisi ke komponen query dan key sebelum dot product dihitung. Jika model dilatih dengan posisi sampai panjang acuan tertentu, memasukkan indeks yang jauh lebih besar langsung ke aturan rotasi yang sama dapat membawa attention ke rentang sudut yang tidak tercakup oleh rentang posisi saat training. Interpolasi posisi mengubah koordinat yang diberikan kepada RoPE. Untuk faktor ekstensi s > 1, bentuk sederhananya memetakan

Kecerdasan Buatan 24 Sep 2026 6 min read

Grouped-Query Attention Mengecilkan KV Cache dengan Berbagi Head Key-Value

Grouped-query attention mengubah jumlah key dan value head yang harus disimpan selama decoding autoregresif. Setiap query head tidak lagi selalu memiliki pasangan key-value sendiri. Beberapa query head memakai key-value head yang sama. Sisi query tetap dapat memiliki banyak head, sedangkan state KV persisten menggunakan lebih sedikit proyeksi independen. Perubahan ini berada pada arsitektur attention, bukan codec kompresi cache. Cache menjadi lebih kecil karena model memang menghasilkan lebih sedikit key dan value head yang berbeda untuk setiap token.

Kecerdasan Buatan 24 Sep 2026 5 min read

Grouped-Query Attention Membagi Head Key-Value di Antara Grup Query

Multi-head attention tidak mengharuskan setiap head query memiliki head key dan head value yang berbeda. Grouped-query attention, atau GQA, membagi head query ke dalam beberapa grup dan memberikan satu head key-value untuk setiap grup. Proyeksi query tetap terpisah, tetapi beberapa head query membaca key dan value hasil proyeksi yang sama. Perbedaan ini mengubah bentuk parameter dan state yang disimpan di cache tanpa menyatukan head query menjadi satu komputasi attention. Setiap head query tetap menghasilkan skor attention sendiri karena vektor query-nya berbeda.

Kecerdasan Buatan 24 Sep 2026 5 min read

Contrastive Search Memberi Penalti pada Repetisi Hidden State Saat Decoding

Generasi autoregresif menghasilkan distribusi token berikutnya, tetapi decoder tetap harus menentukan kandidat yang akan ditambahkan. Contrastive search mengubah keputusan tersebut dengan menggabungkan probabilitas model dan penalti untuk kandidat yang menghasilkan hidden state terlalu mirip dengan hidden state yang sudah ada pada prefix. Mekanisme ini bekerja saat inference. Parameter model dan distribusi next-token tidak diubah. Perubahan terjadi pada ranking yang dipakai untuk memilih token dari sekumpulan kandidat terbatas. Pemilihan kandidat dimulai dari probabilitas model Pada langkah decoding t, model menghasilkan distribusi kondisional

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Eviction Cache untuk Streaming

KV cache dengan kapasitas tetap dapat mencegah memori inferensi terus bertambah pada aliran token yang panjang. Namun, membuang semua token lama secara ketat berdasarkan urutan kedatangan dapat mengganggu attention lebih besar daripada sekadar hilangnya isi token tersebut. Pada sebagian transformer autoregresif, posisi awal menerima bobot attention yang berarti walaupun semantik tokennya tidak berkaitan langsung dengan prediksi saat ini. Posisi seperti ini disebut attention sink. Konsekuensi pada serving cukup spesifik: sliding cache yang mempertahankan prefix awal kecil bersama token terbaru dapat berperilaku berbeda dari cache berukuran sama yang hanya berisi token paling baru. Mekanisme ini berkaitan dengan state attention dan pengelolaan posisi, bukan pemulihan teks lama yang sudah dibuang.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Penalti Jarak Langsung ke Logit Attention

Attention with Linear Biases (ALiBi) mengubah skor causal attention sebelum softmax dengan menambahkan penalti yang membesar seiring jarak antartoken. Posisi masuk melalui jalur skor, bukan melalui vektor posisi yang ditambahkan ke representasi setiap token. Untuk query pada posisi i yang mengakses key pada posisi j, satu head dapat ditulis secara skematis sebagai: score(i, j) = q_i · k_j / sqrt(d_k) - m_h * (i - j) untuk posisi kausal j <= i. Slope positif m_h bersifat spesifik untuk attention head h. Causal mask tetap mencegah akses ke posisi masa depan; komponen linear hanya mengubah preferensi relatif di antara posisi yang masih terlihat.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Bias Proporsional Jarak pada Skor Attention

ALiBi mengubah skor attention sebelum softmax, bukan menambahkan vektor posisi ke representasi token. Pada transformer kausal, key yang berada semakin jauh di belakang query menerima offset negatif yang semakin besar. Offset tersebut linear terhadap jarak token dan memakai slope yang terkait dengan attention head. Bentuk sederhana untuk skor head h dapat ditulis sebagai: score_h(i, j) = q_i k_j^T / sqrt(d) - m_h * (i - j) untuk pasangan kausal yang diizinkan dengan j <= i dan slope positif m_h. Causal mask tetap menentukan posisi masa depan yang tidak dapat diakses. ALiBi mengubah skor relatif di antara posisi yang masih diizinkan.

Kecerdasan Buatan 24 Sep 2026 5 min read

Activation Outlier Mendistorsi Skala Kuantisasi Low-Bit

Sebuah tensor dapat direpresentasikan dengan baik dalam floating point tetapi sulit dipetakan ke rentang integer yang kecil. Masalah ini terasa ketika sebagian besar nilai aktivasi berada dalam interval sempit, sementara sedikit nilai memiliki magnitudo jauh lebih besar. Skala kuantisasi bersama harus mencakup nilai ekstrem tersebut, sehingga nilai biasa hanya mendapat sebagian kecil level representasi yang tersedia. Itulah dampak praktis activation outlier pada inference low-bit. Masalahnya bukan sekadar sebuah outlier memiliki nilai numerik besar. Lokasi, persistensi, dan hubungannya dengan sumbu tempat skala digunakan bersama menentukan apakah outlier tersebut benar-benar merusak representasi hasil kuantisasi.

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.