Langsung ke konten

Topic archive

Kecerdasan Buatan

Kecerdasan buatan mencakup machine learning, deep learning, dan sistem yang menerapkan model untuk menyelesaikan berbagai tugas praktis.

147 articles
Kecerdasan Buatan 23 Sep 2026 4 min read

Speculative Sampling Mempertahankan Distribusi Target lewat Koreksi Rejection

Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection. Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target. Acceptance bergantung pada rasio probabilitas Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).

Kecerdasan Buatan 23 Sep 2026 5 min read

Speculative Decoding Memverifikasi Token Draft Sebelum Diterima

Generasi autoregresif biasanya maju satu token setiap iterasi: model menghitung distribusi token berikutnya, aturan decoding memilih token, lalu token tersebut masuk ke konteks untuk forward berikutnya. Speculative decoding mengubah jadwal eksekusi ini. Proses draft yang lebih murah mengusulkan beberapa token ke depan, sementara model target tetap menentukan usulan mana yang boleh masuk ke sequence hasil. Pemisahan peran itu merupakan batas utamanya. Token draft adalah prediksi terhadap keputusan model target di posisi mendatang, bukan distribusi pengganti yang dapat langsung ditambahkan. Implementasi serving harus memverifikasinya memakai skor model target dan menerapkan aturan penerimaan dari algoritma speculative yang digunakan.

Kecerdasan Buatan 23 Sep 2026 3 min read

Softmax Stabil Mengurangi Logit Maksimum Sebelum Eksponensiasi

Decoder dapat menerima logit yang cukup besar sehingga eksponensiasi langsung tidak aman secara numerik, padahal distribusi probabilitas yang dimaksud tetap biasa. Softmax tidak mengharuskan eksponensiasi terhadap nilai awal. Mengurangi semua logit dengan logit terbesar menghasilkan distribusi yang sama dalam aritmetika real eksak sekaligus memindahkan nilai eksponensial ke rentang numerik yang lebih aman. Pergeseran ini merupakan sifat softmax, bukan heuristik khusus model tertentu. Pergeseran bersama hilang saat normalisasi Untuk logit (z_1,\ldots,z_n), softmax menghasilkan

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 4 min read

RMSNorm Menskalakan Aktivasi Tanpa Memusatkan Mean

RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya. Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya. Denominator berasal dari momen kedua mentah Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

Kecerdasan Buatan 23 Sep 2026 5 min read

RMSNorm Mengatur Skala Aktivasi Tanpa Memusatkan Mean

RMSNorm menormalisasi vektor menggunakan root mean square, bukan standard deviation setelah centering. Perbedaan kecil ini menghilangkan pengurangan mean dari tahap normalisasi. Akibatnya, RMSNorm dan LayerNorm dapat merespons perubahan skala dengan pola serupa pada kondisi tertentu, tetapi memberi respons berbeda terhadap pergeseran aditif pada hidden state. Perbedaan tersebut relevan pada implementasi transformer karena normalisasi menjadi bagian dari geometri residual path. Mengganti satu aturan normalisasi dengan aturan lain bukan sekadar mengganti rangkaian operasi aritmetika; pergantian itu mengubah transformasi aktivasi yang dibatalkan dan informasi yang tetap diteruskan ke komputasi berikutnya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Reuse Prefix KV Cache Bergantung pada Identitas Konteks yang Tepat

Prefix cache dapat menghilangkan komputasi prefill yang berulang tanpa mengubah output model, tetapi hanya jika key dan value yang tersimpan mewakili konteks prefix yang sama dengan state yang seharusnya dihasilkan request baru. Kecocokan teks yang terlihat belum cukup. Jalur serving pada akhirnya bekerja dengan token ID, posisi, parameter model, dan state attention yang bergantung pada implementasi. Batas ini membuat prefix caching berbeda dari cache teks biasa. Cache teks menyimpan hasil yang terkait dengan sebuah input. KV prefix cache menyimpan state perantara yang validitasnya bergantung pada komputasi yang membentuknya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Repetition Penalty Mengubah Logit untuk ID Token yang Sudah Muncul

Repetition penalty dapat bekerja sebelum sampling dengan mengubah logit milik ID token yang sudah terdapat dalam riwayat token tertentu. Operasi ini tidak harus membandingkan kata, frasa, atau string hasil render. Unit yang diperiksa dapat berupa ID integer dari tokenizer, sehingga makna mekanismenya lebih sempit daripada kesan yang diberikan oleh namanya. Perbedaan tersebut terlihat saat decoder menghasilkan token subword. Dua string yang tampak serupa dapat tersusun dari urutan token berbeda, sedangkan satu token yang dipakai di dalam kata berbeda tetap dapat ditandai sebagai token yang sudah muncul.

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Penalti Repetisi Mengubah Skor Token Berdasarkan Output Sebelumnya

Penalti repetisi mengubah distribusi next-token tanpa mengubah parameter model atau komputasi hidden state. Model tetap menghasilkan logit dari konteks saat ini, tetapi decoder mengubah skor tertentu berdasarkan token yang sudah muncul. Sampling kemudian bekerja pada skor hasil perubahan tersebut, bukan langsung pada output model. Pemisahan ini relevan saat mereproduksi perilaku generation. Dua sistem dapat menjalankan bobot model dan token ID yang identik tetapi menghasilkan continuation berbeda karena rumus penalti, cakupan riwayat token, atau posisi aturan itu dalam pipeline decoding tidak sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu

KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU. Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi

Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi. Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Mendominasi Skala Kuantisasi Per-Tensor

Quantizer per-tensor memetakan setiap nilai dalam tensor aktivasi melalui satu skala bersama. Keterikatan ini menjadi relevan saat sebagian besar aktivasi berada dalam interval sempit, tetapi beberapa nilai memiliki magnitudo jauh lebih besar. Nilai besar tersebut dapat menentukan skala, sedangkan area pusat yang padat direpresentasikan dengan jarak antarnilai yang lebih kasar daripada kebutuhan rentangnya sendiri. Ini bukan berarti setiap aktivasi besar merupakan error atau aman untuk dihapus. Outlier dapat membawa state model yang berguna. Persoalannya bersifat numerik: satu skala harus mencakup nilai dengan magnitudo yang sangat berbeda.

Kecerdasan Buatan 23 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Peringkat Sequence

Beam search memberi peringkat pada sequence parsial memakai skor yang terakumulasi sepanjang proses decoding. Jika skor tersebut berupa jumlah log-probability token, setiap token tambahan biasanya menyumbang nilai non-positif. Kandidat yang lebih panjang mendapat lebih banyak kesempatan untuk menurunkan skor mentahnya, bahkan ketika continuation-nya tetap masuk akal secara lokal. Sifat ini bukan cacat pada teori probabilitas. Efek tersebut muncul karena sequence lengkap dengan jumlah faktor kondisional berbeda sedang dibandingkan. Persoalannya menjadi relevan pada implementasi ketika decoder diharapkan menghasilkan completion yang berguna, bukan sekadar mengurutkan sequence berdasarkan probabilitas model tanpa penyesuaian.

Kecerdasan Buatan 23 Sep 2026 4 min read

Normalisasi L2 Mengubah Dot Product Embedding Menjadi Cosine Similarity

Dua vektor embedding dapat mengarah hampir sama tetapi memiliki magnitudo yang sangat berbeda. Dot product mentah merespons kedua sifat tersebut. Normalisasi L2 menghapus komponen magnitudo, sehingga operasi dot product yang sama berubah menjadi perbandingan arah. Perubahan ini bukan sekadar penyesuaian numerik. Objektif retrieval ikut berubah ketika norm vektor membawa informasi atau berbeda antar-item. Dot product memuat komponen magnitudo Untuk vektor nonzero (x) dan (y), [ x \cdot y = |x|_2 |y|_2 \cos(\theta), ]

Kecerdasan Buatan 23 Sep 2026 4 min read

Logit Bias Mengubah Odds Token Sebelum Sampling

Bias pada level token umumnya diterapkan pada skor model sebelum probabilitas dinormalisasi. Posisi operasi ini menentukan efeknya. Penambahan konstanta pada logit satu token mengubah odds token tersebut relatif terhadap semua token yang tidak menerima konstanta yang sama, tanpa mengubah parameter model maupun hidden state saat itu. Mekanismenya sederhana, tetapi dampak operasionalnya bergantung pada pipeline decoding yang mengikutinya. Bias aditif bekerja pada selisih skor Untuk vocabulary dengan logit (z_1, \ldots, z_V), softmax memberikan probabilitas token (i) sebesar

Kecerdasan Buatan 23 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target Sebelum Cross-Entropy

Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah. Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.

Kecerdasan Buatan 23 Sep 2026 5 min read

KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses

Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.

Kecerdasan Buatan 23 Sep 2026 4 min read

KV Cache RoPE Mempertahankan Posisi Token saat Decoding Inkremental

Pada decoder dengan rotary position embeddings, key yang masuk ke KV cache sudah membawa rotasi sesuai posisi tokennya. Decoding inkremental dapat memakai key tersebut secara langsung. Memberikan rotasi posisi token saat ini sekali lagi ke key lama justru mengubah geometri attention. Akibatnya, state posisi merupakan bagian dari kontrak cache meskipun API cache tampak hanya menyimpan tensor. Rotasi terjadi sebelum key dipakai oleh attention Untuk satu pasangan komponen dua dimensi, RoPE menerapkan rotasi yang bergantung pada posisi. Jika (R_m) menyatakan rotasi pada posisi (m), query dan key menjadi

Kecerdasan Buatan 23 Sep 2026 5 min read

Kapasitas Switch Routing Mengubah Ketimpangan Expert Menjadi Token Overflow

Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch. Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.

Kecerdasan Buatan 23 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Sudut Relatif pada Konteks Lebih Panjang

Rotary position embeddings mengodekan posisi dengan merotasi komponen query dan key memakai sudut yang diturunkan dari indeks token. Ketika model dijalankan melampaui rentang posisi yang dipakai saat optimisasi awal, sudut tersebut dapat masuk ke rezim yang tidak ditemui model sebelumnya. Position interpolation menangani batas ini dengan memetakan sequence yang lebih panjang ke rentang koordinat posisi yang lebih kecil sebelum sudut rotary dihitung. Mekanisme ini tidak menambahkan token ekstra ke state arsitektural model. Yang berubah adalah koordinat yang diberikan ke transformasi posisi. Perbedaan tersebut penting karena kemampuan runtime menerima input lebih panjang dan mutu perilaku model pada panjang itu merupakan dua hal terpisah.

Kecerdasan Buatan 23 Sep 2026 4 min read

Grouped-Query Attention Membagi Head Key-Value ke Beberapa Head Query

Grouped-query attention mengubah satu bagian spesifik dari multi-head attention: beberapa head query menggunakan head key dan value yang sama. Proyeksi query tetap terpisah, sehingga head-head query tersebut dapat menghasilkan bobot attention yang berbeda, tetapi semuanya membaca key dan value dari representasi hasil proyeksi yang dipakai bersama. Perbedaan ini relevan saat inferensi. Cache pada decoder menyimpan key dan value dari posisi sebelumnya, bukan query. Mengurangi jumlah head key-value karena itu dapat mengurangi penyimpanan KV cache tanpa harus mengurangi jumlah head query dengan faktor yang sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Grouped-Query Attention Berbagi KV Head di Antara Grup Query

Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.