Langsung ke konten

Arsip

Transformers

8 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Rotary Position Embedding Mengubah Indeks Absolut Menjadi Fase Relatif pada Attention

Self-attention dapat membandingkan isi token tanpa memberi urutan pada posisi token. Rotary Position Embedding (RoPE) memasukkan posisi ke dalam perbandingan itu dengan merotasi pasangan koordinat pada query dan key. Setiap token menerima rotasi berdasarkan indeks absolut, tetapi inner product query-key mereduksi kedua sudut absolut tersebut menjadi selisih sudut. Pembatalan secara aljabar ini merupakan mekanisme utama RoPE. Tidak ada vektor posisi yang harus ditambahkan ke hidden state. Posisi mengubah orientasi komponen query dan key sebelum dot product dihitung.

Kecerdasan Buatan 24 Sep 2026 5 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menskalakan vektor berdasarkan root mean square tanpa lebih dulu mengurangi nilai rata-rata vektor tersebut. Ketiadaan mean centering ini menjadi perbedaan utama terhadap LayerNorm: keduanya dapat mengendalikan skala vektor, tetapi hanya LayerNorm yang secara eksplisit menggeser koordinat agar rata-rata sampelnya berada di nol. Untuk hidden vector x dengan lebar d, bentuk RMSNorm yang umum adalah: rms = sqrt((1/d) * sum(x_i^2) + epsilon) y_i = gain_i * x_i / rms Posisi epsilon, presisi numerik saat reduksi, dan keberadaan affine term tambahan dapat berbeda antar-implementasi. Struktur utamanya tetap berupa pembagian dengan statistik RMS, bukan standard deviation yang dihitung setelah mean dikurangi.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prediksi Multi-Token Menambahkan Loss Token Masa Depan Paralel pada Trunk Model Bersama

Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi t: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token x_(t+1). Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut. Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 23 Sep 2026 5 min read

Kapasitas Switch Routing Mengubah Ketimpangan Expert Menjadi Token Overflow

Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch. Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.

Kecerdasan Buatan 15 Sep 2026 4 min read

Pertahankan Attention Sinks pada Streaming Transformers

Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya. Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.

Kecerdasan Buatan 15 Sep 2026 4 min read

Isolasi Attention Antar-Sequence Training yang Dipack

Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama. Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.

Kecerdasan Buatan 14 Sep 2026 6 min read

Batasi Logit Ekstrem dengan Soft Capping

Transformer dapat menghasilkan logit dengan magnitudo yang jauh melampaui rentang yang diperlukan untuk menyatakan preferensi kuat. Skor attention yang besar dapat membuat distribusi softmax sangat terkonsentrasi, sedangkan logit output yang besar dapat membuat probabilitas token hampir one-hot. Hard clamp dapat membatasi nilai tersebut, tetapi menghasilkan wilayah datar dengan perubahan turunan yang mendadak pada ambang batas. Logit soft capping memakai fungsi saturasi yang halus sebagai gantinya. Salah satu bentuk yang umum adalah: