Langsung ke konten

Arsip

Transformer

52 artikel
Kecerdasan Buatan 13 Sep 2026 6 min read

Perbandingan RMSNorm dan LayerNorm pada Transformer

LayerNorm dan RMSNorm dapat menempati posisi struktural yang sama pada transformer sambil menerapkan operasi berbeda pada residual stream. LayerNorm mengurangi feature mean sebelum melakukan scaling berdasarkan ukuran penyebaran. RMSNorm melewati operasi centering dan melakukan scaling langsung dari root mean square feature. Perbedaan aljabar kecil tersebut mengubah transformasi mana pada vektor aktivasi yang dihapus oleh normalisasi. Artinya, mengganti satu operasi dengan yang lain secara umum bukan edit yang mempertahankan fungsi model yang sudah ada.

Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.

Kecerdasan Buatan 05 Sep 2026 9 min read

Ukur Konsentrasi Attention dengan Entropi

Attention pada Transformer sering diperiksa sebagai matriks bobot. Cara ini cukup untuk beberapa contoh, tetapi menjadi sulit ketika Anda perlu membandingkan banyak head, layer, token, atau beberapa model run. Ringkasan yang berguna adalah entropi attention: angka yang menggambarkan seberapa terkonsentrasi atau tersebar suatu distribusi attention. Entropi dapat menjawab pertanyaan yang sempit tetapi praktis: apakah query menempatkan sebagian besar massa attention pada sedikit posisi yang tersedia, atau menyebarkannya secara luas? Entropi tidak memberi tahu apakah model benar, apakah sebuah token menyebabkan prediksi, atau apakah sebuah head penting. Dengan memahami batas tersebut, entropi menjadi diagnostik ringkas untuk perilaku attention.