Langsung ke konten

Arsip

Artificial Intelligence

52 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Contrastive Search Memberi Penalti pada Repetisi Hidden State Saat Decoding

Generasi autoregresif menghasilkan distribusi token berikutnya, tetapi decoder tetap harus menentukan kandidat yang akan ditambahkan. Contrastive search mengubah keputusan tersebut dengan menggabungkan probabilitas model dan penalti untuk kandidat yang menghasilkan hidden state terlalu mirip dengan hidden state yang sudah ada pada prefix. Mekanisme ini bekerja saat inference. Parameter model dan distribusi next-token tidak diubah. Perubahan terjadi pada ranking yang dipakai untuk memilih token dari sekumpulan kandidat terbatas. Pemilihan kandidat dimulai dari probabilitas model Pada langkah decoding t, model menghasilkan distribusi kondisional

Kecerdasan Buatan 24 Sep 2026 5 min read

Codebook Collapse Membuat Entri Vector Quantizer Tidak Terpakai

Sebuah vector quantizer dapat menyediakan ribuan entri codebook tetapi berulang kali memilih hanya sebagian kecil di antaranya. Ukuran vocabulary yang dikonfigurasi kemudian melebih-lebihkan kapasitas diskret yang benar-benar dipakai. Kondisi ini sering disebut codebook collapse: beberapa entri menerima banyak assignment, sedangkan entri lain menjadi tidak aktif atau hampir tidak aktif. Masalah tersebut bukan sekadar kekurangan parameter. Penyebabnya berada pada interaksi antara output encoder, aturan assignment, dan prosedur pembaruan vektor kode. Setelah assignment terkonsentrasi pada sebagian entri, entri yang tidak terpakai dapat menerima sangat sedikit sinyal, atau tidak menerima sinyal sama sekali, untuk bergerak menuju wilayah yang ditempati output encoder.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Activation Outlier Mendistorsi Skala Kuantisasi Low-Bit

Sebuah tensor dapat direpresentasikan dengan baik dalam floating point tetapi sulit dipetakan ke rentang integer yang kecil. Masalah ini terasa ketika sebagian besar nilai aktivasi berada dalam interval sempit, sementara sedikit nilai memiliki magnitudo jauh lebih besar. Skala kuantisasi bersama harus mencakup nilai ekstrem tersebut, sehingga nilai biasa hanya mendapat sebagian kecil level representasi yang tersedia. Itulah dampak praktis activation outlier pada inference low-bit. Masalahnya bukan sekadar sebuah outlier memiliki nilai numerik besar. Lokasi, persistensi, dan hubungannya dengan sumbu tempat skala digunakan bersama menentukan apakah outlier tersebut benar-benar merusak representasi hasil kuantisasi.

Kecerdasan Buatan 24 Sep 2026 4 min read

Activation Checkpointing Menukar Aktivasi Tersimpan dengan Rekomputasi

Activation checkpointing mengubah tensor forward pass yang tetap berada di memori sampai backpropagation. Alih-alih menyimpan setiap aktivasi intermediate yang diperlukan untuk perhitungan gradien, region yang memakai checkpoint mempertahankan state pada boundary tertentu dan membentuk kembali intermediate yang dibuang ketika backward pass mencapai region tersebut. Mekanisme ini mengurangi memori aktivasi dengan biaya komputasi tambahan. Parameter model, state optimizer, dan gradien tidak ikut mengecil, sehingga dampaknya terhadap total memori training bergantung pada porsi footprint yang berasal dari aktivasi.

Kecerdasan Buatan 23 Sep 2026 4 min read

Temperature Scaling Mengubah Sampling Tanpa Mengubah Urutan Logit

Temperature sering tersedia sebagai satu parameter generasi, tetapi efeknya lebih sempit daripada kendali umum atas kualitas output. Untuk sebuah vektor logit finite yang tetap, temperature positif mengubah skala selisih sebelum softmax. Probabilitas hasilnya berubah tanpa mengubah relasi logit mana yang lebih besar. Perbedaan ini relevan ketika serving layer menggabungkan temperature dengan greedy selection, top-k filtering, top-p filtering, penalty, atau penanganan khusus untuk temperature nol. Nilai numerik yang sama dapat berada dalam pipeline decoding yang berbeda meski operasi scaling dasarnya sederhana.

Kecerdasan Buatan 23 Sep 2026 4 min read

Speculative Sampling Mempertahankan Distribusi Target lewat Koreksi Rejection

Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection. Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target. Acceptance bergantung pada rasio probabilitas Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).

Kecerdasan Buatan 23 Sep 2026 5 min read

Speculative Decoding Memverifikasi Token Draft Sebelum Diterima

Generasi autoregresif biasanya maju satu token setiap iterasi: model menghitung distribusi token berikutnya, aturan decoding memilih token, lalu token tersebut masuk ke konteks untuk forward berikutnya. Speculative decoding mengubah jadwal eksekusi ini. Proses draft yang lebih murah mengusulkan beberapa token ke depan, sementara model target tetap menentukan usulan mana yang boleh masuk ke sequence hasil. Pemisahan peran itu merupakan batas utamanya. Token draft adalah prediksi terhadap keputusan model target di posisi mendatang, bukan distribusi pengganti yang dapat langsung ditambahkan. Implementasi serving harus memverifikasinya memakai skor model target dan menerapkan aturan penerimaan dari algoritma speculative yang digunakan.

Kecerdasan Buatan 23 Sep 2026 3 min read

Softmax Stabil Mengurangi Logit Maksimum Sebelum Eksponensiasi

Decoder dapat menerima logit yang cukup besar sehingga eksponensiasi langsung tidak aman secara numerik, padahal distribusi probabilitas yang dimaksud tetap biasa. Softmax tidak mengharuskan eksponensiasi terhadap nilai awal. Mengurangi semua logit dengan logit terbesar menghasilkan distribusi yang sama dalam aritmetika real eksak sekaligus memindahkan nilai eksponensial ke rentang numerik yang lebih aman. Pergeseran ini merupakan sifat softmax, bukan heuristik khusus model tertentu. Pergeseran bersama hilang saat normalisasi Untuk logit (z_1,\ldots,z_n), softmax menghasilkan

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.

Kecerdasan Buatan 23 Sep 2026 4 min read

RMSNorm Menskalakan Aktivasi Tanpa Memusatkan Mean

RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya. Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya. Denominator berasal dari momen kedua mentah Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

Kecerdasan Buatan 23 Sep 2026 5 min read

Repetition Penalty Mengubah Logit untuk ID Token yang Sudah Muncul

Repetition penalty dapat bekerja sebelum sampling dengan mengubah logit milik ID token yang sudah terdapat dalam riwayat token tertentu. Operasi ini tidak harus membandingkan kata, frasa, atau string hasil render. Unit yang diperiksa dapat berupa ID integer dari tokenizer, sehingga makna mekanismenya lebih sempit daripada kesan yang diberikan oleh namanya. Perbedaan tersebut terlihat saat decoder menghasilkan token subword. Dua string yang tampak serupa dapat tersusun dari urutan token berbeda, sedangkan satu token yang dipakai di dalam kata berbeda tetap dapat ditandai sebagai token yang sudah muncul.

Kecerdasan Buatan 23 Sep 2026 5 min read

PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu

KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU. Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Mendominasi Skala Kuantisasi Per-Tensor

Quantizer per-tensor memetakan setiap nilai dalam tensor aktivasi melalui satu skala bersama. Keterikatan ini menjadi relevan saat sebagian besar aktivasi berada dalam interval sempit, tetapi beberapa nilai memiliki magnitudo jauh lebih besar. Nilai besar tersebut dapat menentukan skala, sedangkan area pusat yang padat direpresentasikan dengan jarak antarnilai yang lebih kasar daripada kebutuhan rentangnya sendiri. Ini bukan berarti setiap aktivasi besar merupakan error atau aman untuk dihapus. Outlier dapat membawa state model yang berguna. Persoalannya bersifat numerik: satu skala harus mencakup nilai dengan magnitudo yang sangat berbeda.

Kecerdasan Buatan 23 Sep 2026 4 min read

Normalisasi L2 Mengubah Dot Product Embedding Menjadi Cosine Similarity

Dua vektor embedding dapat mengarah hampir sama tetapi memiliki magnitudo yang sangat berbeda. Dot product mentah merespons kedua sifat tersebut. Normalisasi L2 menghapus komponen magnitudo, sehingga operasi dot product yang sama berubah menjadi perbandingan arah. Perubahan ini bukan sekadar penyesuaian numerik. Objektif retrieval ikut berubah ketika norm vektor membawa informasi atau berbeda antar-item. Dot product memuat komponen magnitudo Untuk vektor nonzero (x) dan (y), [ x \cdot y = |x|_2 |y|_2 \cos(\theta), ]

Kecerdasan Buatan 23 Sep 2026 4 min read

Logit Bias Mengubah Odds Token Sebelum Sampling

Bias pada level token umumnya diterapkan pada skor model sebelum probabilitas dinormalisasi. Posisi operasi ini menentukan efeknya. Penambahan konstanta pada logit satu token mengubah odds token tersebut relatif terhadap semua token yang tidak menerima konstanta yang sama, tanpa mengubah parameter model maupun hidden state saat itu. Mekanismenya sederhana, tetapi dampak operasionalnya bergantung pada pipeline decoding yang mengikutinya. Bias aditif bekerja pada selisih skor Untuk vocabulary dengan logit (z_1, \ldots, z_V), softmax memberikan probabilitas token (i) sebesar

Kecerdasan Buatan 23 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target Sebelum Cross-Entropy

Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah. Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.

Kecerdasan Buatan 23 Sep 2026 4 min read

KV Cache RoPE Mempertahankan Posisi Token saat Decoding Inkremental

Pada decoder dengan rotary position embeddings, key yang masuk ke KV cache sudah membawa rotasi sesuai posisi tokennya. Decoding inkremental dapat memakai key tersebut secara langsung. Memberikan rotasi posisi token saat ini sekali lagi ke key lama justru mengubah geometri attention. Akibatnya, state posisi merupakan bagian dari kontrak cache meskipun API cache tampak hanya menyimpan tensor. Rotasi terjadi sebelum key dipakai oleh attention Untuk satu pasangan komponen dua dimensi, RoPE menerapkan rotasi yang bergantung pada posisi. Jika (R_m) menyatakan rotasi pada posisi (m), query dan key menjadi

Kecerdasan Buatan 23 Sep 2026 5 min read

Kapasitas Switch Routing Mengubah Ketimpangan Expert Menjadi Token Overflow

Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch. Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.

Kecerdasan Buatan 23 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Sudut Relatif pada Konteks Lebih Panjang

Rotary position embeddings mengodekan posisi dengan merotasi komponen query dan key memakai sudut yang diturunkan dari indeks token. Ketika model dijalankan melampaui rentang posisi yang dipakai saat optimisasi awal, sudut tersebut dapat masuk ke rezim yang tidak ditemui model sebelumnya. Position interpolation menangani batas ini dengan memetakan sequence yang lebih panjang ke rentang koordinat posisi yang lebih kecil sebelum sudut rotary dihitung. Mekanisme ini tidak menambahkan token ekstra ke state arsitektural model. Yang berubah adalah koordinat yang diberikan ke transformasi posisi. Perbedaan tersebut penting karena kemampuan runtime menerima input lebih panjang dan mutu perilaku model pada panjang itu merupakan dua hal terpisah.

Kecerdasan Buatan 23 Sep 2026 4 min read

Grouped-Query Attention Membagi Head Key-Value ke Beberapa Head Query

Grouped-query attention mengubah satu bagian spesifik dari multi-head attention: beberapa head query menggunakan head key dan value yang sama. Proyeksi query tetap terpisah, sehingga head-head query tersebut dapat menghasilkan bobot attention yang berbeda, tetapi semuanya membaca key dan value dari representasi hasil proyeksi yang dipakai bersama. Perbedaan ini relevan saat inferensi. Cache pada decoder menyimpan key dan value dari posisi sebelumnya, bukan query. Mengurangi jumlah head key-value karena itu dapat mengurangi penyimpanan KV cache tanpa harus mengurangi jumlah head query dengan faktor yang sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Grouped-Query Attention Berbagi KV Head di Antara Grup Query

Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.

Kecerdasan Buatan 23 Sep 2026 4 min read

Global Gradient Clipping Membatasi Norm Sebelum Langkah Optimizer

Satu langkah training dapat menghasilkan gradient dengan besar gabungan yang jauh melampaui langkah di sekitarnya. Global norm clipping mengubah kumpulan gradient tersebut sebelum diproses optimizer. Saat norm yang diukur melewati ambang yang ditetapkan, setiap gradient terpilih dikalikan dengan faktor skala yang sama. Batas mekanismenya perlu dinyatakan dengan tepat. Clipping mengendalikan norm gradient yang diberikan ke optimizer. Operasi ini tidak secara langsung menetapkan batas yang sama pada perubahan parameter, terutama ketika optimizer menyimpan momentum atau state adaptif.