Langsung ke konten

Arsip

Transformer

52 artikel
Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 4 min read

RMSNorm Menskalakan Aktivasi Tanpa Memusatkan Mean

RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya. Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya. Denominator berasal dari momen kedua mentah Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

Kecerdasan Buatan 23 Sep 2026 5 min read

RMSNorm Mengatur Skala Aktivasi Tanpa Memusatkan Mean

RMSNorm menormalisasi vektor menggunakan root mean square, bukan standard deviation setelah centering. Perbedaan kecil ini menghilangkan pengurangan mean dari tahap normalisasi. Akibatnya, RMSNorm dan LayerNorm dapat merespons perubahan skala dengan pola serupa pada kondisi tertentu, tetapi memberi respons berbeda terhadap pergeseran aditif pada hidden state. Perbedaan tersebut relevan pada implementasi transformer karena normalisasi menjadi bagian dari geometri residual path. Mengganti satu aturan normalisasi dengan aturan lain bukan sekadar mengganti rangkaian operasi aritmetika; pergantian itu mengubah transformasi aktivasi yang dibatalkan dan informasi yang tetap diteruskan ke komputasi berikutnya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses

Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.

Kecerdasan Buatan 23 Sep 2026 4 min read

KV Cache RoPE Mempertahankan Posisi Token saat Decoding Inkremental

Pada decoder dengan rotary position embeddings, key yang masuk ke KV cache sudah membawa rotasi sesuai posisi tokennya. Decoding inkremental dapat memakai key tersebut secara langsung. Memberikan rotasi posisi token saat ini sekali lagi ke key lama justru mengubah geometri attention. Akibatnya, state posisi merupakan bagian dari kontrak cache meskipun API cache tampak hanya menyimpan tensor. Rotasi terjadi sebelum key dipakai oleh attention Untuk satu pasangan komponen dua dimensi, RoPE menerapkan rotasi yang bergantung pada posisi. Jika (R_m) menyatakan rotasi pada posisi (m), query dan key menjadi

Kecerdasan Buatan 23 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Sudut Relatif pada Konteks Lebih Panjang

Rotary position embeddings mengodekan posisi dengan merotasi komponen query dan key memakai sudut yang diturunkan dari indeks token. Ketika model dijalankan melampaui rentang posisi yang dipakai saat optimisasi awal, sudut tersebut dapat masuk ke rezim yang tidak ditemui model sebelumnya. Position interpolation menangani batas ini dengan memetakan sequence yang lebih panjang ke rentang koordinat posisi yang lebih kecil sebelum sudut rotary dihitung. Mekanisme ini tidak menambahkan token ekstra ke state arsitektural model. Yang berubah adalah koordinat yang diberikan ke transformasi posisi. Perbedaan tersebut penting karena kemampuan runtime menerima input lebih panjang dan mutu perilaku model pada panjang itu merupakan dua hal terpisah.

Kecerdasan Buatan 23 Sep 2026 4 min read

Grouped-Query Attention Membagi Head Key-Value ke Beberapa Head Query

Grouped-query attention mengubah satu bagian spesifik dari multi-head attention: beberapa head query menggunakan head key dan value yang sama. Proyeksi query tetap terpisah, sehingga head-head query tersebut dapat menghasilkan bobot attention yang berbeda, tetapi semuanya membaca key dan value dari representasi hasil proyeksi yang dipakai bersama. Perbedaan ini relevan saat inferensi. Cache pada decoder menyimpan key dan value dari posisi sebelumnya, bukan query. Mengurangi jumlah head key-value karena itu dapat mengurangi penyimpanan KV cache tanpa harus mengurangi jumlah head query dengan faktor yang sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Grouped-Query Attention Berbagi KV Head di Antara Grup Query

Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Entropi Attention Mengukur Konsentrasi, Bukan Kepentingan Kausal

Sebuah attention head dapat menempatkan sebagian besar massa probabilitas pada satu posisi tanpa memberikan bukti kuat bahwa posisi tersebut mengendalikan output akhir model. Entropi bobot attention mengukur konsentrasi, bukan pengaruh kausal. Pemisahan ini relevan saat attention map dipakai sebagai diagnostik. Entropi dapat menunjukkan apakah sebuah head menyebarkan massa secara luas atau memusatkannya pada sedikit posisi untuk query tertentu. Nilai itu sendiri tidak menetapkan bahwa token dengan bobot tertinggi membawa fitur yang menentukan prediksi downstream.

Kecerdasan Buatan 22 Sep 2026 6 min read

Reuse Prefix KV Cache Bergantung pada Riwayat Token yang Identik

Satu entri KV cache bukan representasi yang dapat dipakai ulang untuk sembarang teks yang tampak mirip. Pada transformer autoregresif, key dan value yang tersimpan adalah state perantara yang dihasilkan untuk prefix token tertentu dalam konteks eksekusi tertentu. Reuse valid hanya jika request baru mencapai batas state yang sama. Batas itu lebih ketat daripada kecocokan karakter yang terlihat. Tokenisasi, urutan token, penanganan posisi, identitas model, state adapter, serta input lain yang memengaruhi hidden state dapat menentukan apakah prefix dalam cache masih mewakili komputasi yang dibutuhkan request baru.

Kecerdasan Buatan 22 Sep 2026 6 min read

Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention

Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.

Kecerdasan Buatan 18 Sep 2026 4 min read

Perlakukan Logit Lens sebagai Readout, Bukan Jejak Kausal

Sebuah transformer dapat menampilkan residual state intermediate yang sangat mendukung satu token saat diproyeksikan dengan proyeksi kosakata akhir model, lalu menghasilkan token lain setelah block berikutnya dijalankan. Logit lens membuat preferensi intermediate itu terlihat. Hasil tersebut tidak menetapkan bahwa preferensi itu menyebabkan output akhir. Batas ini relevan saat developer memakai peringkat token per layer untuk memeriksa perilaku model. Logit lens adalah readout: metode ini menanyakan apa yang akan dilaporkan output head model jika diterapkan pada representasi intermediate. Forward pass aktual mengajukan persoalan berbeda karena setiap block yang tersisa dapat mengubah representasi tersebut sebelum readout akhir.

Kecerdasan Buatan 17 Sep 2026 7 min read

Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts

Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih. Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.

Kecerdasan Buatan 17 Sep 2026 6 min read

Mempertahankan Attention Sink dalam KV Cache Terbatas

KV cache terbatas tampak cocok dengan aturan eviction sederhana: setelah cache penuh, buang pasangan key-value tertua dan pertahankan token terbaru. Pada sebagian transformer decoder-only, aturan ini dapat menurunkan kualitas generasi secara tajam setelah urutan melewati jendela yang dipertahankan. Kegagalan tersebut tidak hanya berasal dari hilangnya konten semantik lama. Token awal dapat menerima attention besar meski teksnya hanya membawa sedikit informasi yang berguna untuk prediksi saat ini. Perilaku ini umum disebut attention sink. Dampaknya penting bagi desain inferensi streaming karena kebijakan cache yang mempertahankan prefix awal kecil ditambah sliding window terbaru dapat berperilaku sangat berbeda dari sliding window murni dengan batas memori yang serupa.

Kecerdasan Buatan 16 Sep 2026 6 min read

Uji Mekanisme Transformer dengan Activation Patching

Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.

Kecerdasan Buatan 16 Sep 2026 6 min read

Perluas Context RoPE dengan Positional Interpolation

Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization. Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.

Kecerdasan Buatan 16 Sep 2026 5 min read

Pangkas Head Attention Transformer dengan Dampak yang Terukur

Sebuah blok multi-head attention dapat memiliki head yang ketika dihapus hanya sedikit mengubah metrik target pada set evaluasi tertentu. Pengamatan ini membuat pemangkasan head attention menarik: identifikasi head berdampak rendah, hapus kontribusinya, lalu pertahankan head yang lebih penting bagi workload target. Bagian yang sulit bukan membuat output sebuah head menjadi nol. Yang perlu ditentukan adalah apa yang sebenarnya diukur oleh intervensi tersebut dan apakah model hasilnya benar-benar mengeksekusi lebih sedikit pekerjaan. Head yang dimask, head yang dihapus secara struktural, dan kernel attention yang lebih cepat adalah gagasan yang berkaitan, tetapi bukan hasil yang sama.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context

Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi. Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca State Intermediate Transformer dengan Logit Lens

Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model. Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca Prediksi Intermediate Transformer dengan Tuned Lens

Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman. Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.

Kecerdasan Buatan 15 Sep 2026 6 min read

Kuantisasi KV Cache dengan Error Budget yang Eksplisit

Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator. Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.

Kecerdasan Buatan 14 Sep 2026 5 min read

Perbandingan RMSNorm dan Layer Normalization

Layer normalisasi dapat terlihat saling menggantikan ketika bentuk output-nya serupa, tetapi invariansinya tidak sama. RMSNorm menskalakan ulang vektor aktivasi menggunakan root mean square tanpa terlebih dahulu mengurangi nilai rata-rata vektor. Layer normalization melakukan centering pada vektor, lalu menskalakannya menggunakan varians. Tidak adanya operasi centering merupakan perbedaan utamanya. Hal ini mengubah transformasi mana pada vektor aktivasi yang hilang setelah normalisasi dan mana yang tetap terlihat oleh bagian jaringan berikutnya. Kedua operasi menormalisasi besaran yang berbeda Untuk vektor aktivasi x dengan d komponen, LayerNorm menghitung mean dan varians pada dimensi yang dinormalisasi: