Langsung ke konten

Arsip

Inferensi

30 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Secara Paralel

Generasi autoregresif biasanya menetapkan satu token sebelum langkah model target berikutnya dapat dievaluasi. Speculative decoding mengubah pola eksekusi tersebut. Distribusi proposal yang lebih murah menghasilkan blok kandidat pendek, sementara model target mengevaluasi posisi-posisi kandidat itu bersama-sama. Aturan penerimaan kemudian menentukan seberapa banyak bagian blok yang dapat menjadi output. Mekanisme ini bukan batching biasa. Token di dalam proposal tetap dihasilkan secara autoregresif, dan model target tetap menentukan distribusi output yang dituju ketika algoritma speculative sampling eksak digunakan. Perubahan yang berguna terletak pada verifikasi: satu pass yang mahal dapat mencakup beberapa posisi output jika cukup banyak proposal diterima.

Kecerdasan Buatan 24 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Sequence yang Terpilih

Beam search dapat memilih sequence pendek walaupun continuation yang lebih panjang berisi token-token yang secara lokal masuk akal. Efek ini berasal dari aturan skornya: log-probability token biasanya diakumulasi sepanjang sequence, dan setiap token tambahan menyumbangkan satu nilai non-positif lagi. Normalisasi panjang mengubah tekanan ranking tersebut, tetapi tidak mengubah probabilitas model yang menghasilkan token. Pemisahan itu penting pada sistem generasi. Skor decoding adalah objektif saat inferensi untuk membandingkan hipotesis. Skor tersebut tidak otomatis menjadi probabilitas terkalibrasi untuk output yang sudah selesai, dan mengubahnya dapat mengganti sequence terpilih tanpa mengubah parameter model.

Kecerdasan Buatan 24 Sep 2026 6 min read

Kuantisasi KV Cache Menukar Presisi dengan Memori Serving

Decoding autoregresif menyimpan key dan value attention dari token sebelumnya agar setiap token baru dapat memakai kembali proyeksi yang sudah dihitung. KV cache tersebut membesar mengikuti panjang sequence, jumlah layer, batch size, serta jumlah dan lebar head key/value yang disimpan. Menurunkan presisi numeriknya dapat mengurangi byte yang ditempati tensor cache, tetapi nilai yang dipakai oleh operasi attention berikutnya juga ikut berubah. Karena itu, kuantisasi KV cache berbeda dari kompresi data yang hanya disimpan lalu dipulihkan tanpa kehilangan informasi. Cache terkuantisasi tetap berada pada jalur inferensi. Setiap query berikutnya dapat berinteraksi dengan key dan value hasil aproksimasi, sehingga persoalannya bukan sekadar berapa byte yang berkurang, tetapi juga di bagian mana error kuantisasi masuk ke attention dan bagaimana implementasi serving membatasinya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Kecerdasan Buatan 23 Sep 2026 5 min read

Speculative Decoding Memverifikasi Token Draft Sebelum Diterima

Generasi autoregresif biasanya maju satu token setiap iterasi: model menghitung distribusi token berikutnya, aturan decoding memilih token, lalu token tersebut masuk ke konteks untuk forward berikutnya. Speculative decoding mengubah jadwal eksekusi ini. Proses draft yang lebih murah mengusulkan beberapa token ke depan, sementara model target tetap menentukan usulan mana yang boleh masuk ke sequence hasil. Pemisahan peran itu merupakan batas utamanya. Token draft adalah prediksi terhadap keputusan model target di posisi mendatang, bukan distribusi pengganti yang dapat langsung ditambahkan. Implementasi serving harus memverifikasinya memakai skor model target dan menerapkan aturan penerimaan dari algoritma speculative yang digunakan.

Kecerdasan Buatan 23 Sep 2026 3 min read

Softmax Stabil Mengurangi Logit Maksimum Sebelum Eksponensiasi

Decoder dapat menerima logit yang cukup besar sehingga eksponensiasi langsung tidak aman secara numerik, padahal distribusi probabilitas yang dimaksud tetap biasa. Softmax tidak mengharuskan eksponensiasi terhadap nilai awal. Mengurangi semua logit dengan logit terbesar menghasilkan distribusi yang sama dalam aritmetika real eksak sekaligus memindahkan nilai eksponensial ke rentang numerik yang lebih aman. Pergeseran ini merupakan sifat softmax, bukan heuristik khusus model tertentu. Pergeseran bersama hilang saat normalisasi Untuk logit (z_1,\ldots,z_n), softmax menghasilkan

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 5 min read

Reuse Prefix KV Cache Bergantung pada Identitas Konteks yang Tepat

Prefix cache dapat menghilangkan komputasi prefill yang berulang tanpa mengubah output model, tetapi hanya jika key dan value yang tersimpan mewakili konteks prefix yang sama dengan state yang seharusnya dihasilkan request baru. Kecocokan teks yang terlihat belum cukup. Jalur serving pada akhirnya bekerja dengan token ID, posisi, parameter model, dan state attention yang bergantung pada implementasi. Batas ini membuat prefix caching berbeda dari cache teks biasa. Cache teks menyimpan hasil yang terkait dengan sebuah input. KV prefix cache menyimpan state perantara yang validitasnya bergantung pada komputasi yang membentuknya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu

KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU. Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi

Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi. Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Mendominasi Skala Kuantisasi Per-Tensor

Quantizer per-tensor memetakan setiap nilai dalam tensor aktivasi melalui satu skala bersama. Keterikatan ini menjadi relevan saat sebagian besar aktivasi berada dalam interval sempit, tetapi beberapa nilai memiliki magnitudo jauh lebih besar. Nilai besar tersebut dapat menentukan skala, sedangkan area pusat yang padat direpresentasikan dengan jarak antarnilai yang lebih kasar daripada kebutuhan rentangnya sendiri. Ini bukan berarti setiap aktivasi besar merupakan error atau aman untuk dihapus. Outlier dapat membawa state model yang berguna. Persoalannya bersifat numerik: satu skala harus mencakup nilai dengan magnitudo yang sangat berbeda.

Kecerdasan Buatan 23 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Peringkat Sequence

Beam search memberi peringkat pada sequence parsial memakai skor yang terakumulasi sepanjang proses decoding. Jika skor tersebut berupa jumlah log-probability token, setiap token tambahan biasanya menyumbang nilai non-positif. Kandidat yang lebih panjang mendapat lebih banyak kesempatan untuk menurunkan skor mentahnya, bahkan ketika continuation-nya tetap masuk akal secara lokal. Sifat ini bukan cacat pada teori probabilitas. Efek tersebut muncul karena sequence lengkap dengan jumlah faktor kondisional berbeda sedang dibandingkan. Persoalannya menjadi relevan pada implementasi ketika decoder diharapkan menghasilkan completion yang berguna, bukan sekadar mengurutkan sequence berdasarkan probabilitas model tanpa penyesuaian.

Kecerdasan Buatan 23 Sep 2026 5 min read

KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses

Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.

Kecerdasan Buatan 23 Sep 2026 4 min read

Grouped-Query Attention Membagi Head Key-Value ke Beberapa Head Query

Grouped-query attention mengubah satu bagian spesifik dari multi-head attention: beberapa head query menggunakan head key dan value yang sama. Proyeksi query tetap terpisah, sehingga head-head query tersebut dapat menghasilkan bobot attention yang berbeda, tetapi semuanya membaca key dan value dari representasi hasil proyeksi yang dipakai bersama. Perbedaan ini relevan saat inferensi. Cache pada decoder menyimpan key dan value dari posisi sebelumnya, bukan query. Mengurangi jumlah head key-value karena itu dapat mengurangi penyimpanan KV cache tanpa harus mengurangi jumlah head query dengan faktor yang sama.

Kecerdasan Buatan 23 Sep 2026 6 min read

Bias Logit Aditif Mengubah Odds Token Sebelum Sampling

Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya. Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.

Kecerdasan Buatan 22 Sep 2026 5 min read

Top-p Sampling Membentuk Ulang Set Kandidat pada Setiap Token

Top-p sampling tidak mempertahankan shortlist token yang tetap sepanjang generation. Pada setiap langkah decoding, model menghasilkan vektor logit baru, vektor itu menjadi distribusi probabilitas, lalu sampler membentuk set kandidat baru dengan massa probabilitas kumulatif yang mencapai threshold terkonfigurasi. Konsekuensinya mudah terlewat pada kode serving: nilai top_p yang sama dapat memasukkan dua token pada satu langkah dan puluhan token pada langkah lain. Parameter ini mengendalikan massa probabilitas, bukan jumlah kandidat. Cutoff mengikuti distribusi saat ini Untuk vocabulary dengan probabilitas token p_1, p_2, ..., p_V, urutkan token dari probabilitas tertinggi ke terendah:

Kecerdasan Buatan 22 Sep 2026 6 min read

Speculative Decoding Menghubungkan Kecepatan Draft dengan Tingkat Penerimaan

Generasi autoregresif biasanya maju satu token yang diterima pada satu waktu. Setiap token baru memperpanjang prefix, sehingga evaluasi target model berikutnya bergantung pada token yang dipilih pada posisi sebelumnya. Speculative decoding mengubah jadwal eksekusi: proses draft yang lebih murah mengusulkan beberapa token ke depan, lalu target model mengevaluasi posisi tersebut bersama-sama dan menentukan seberapa panjang proposal yang dapat dipertahankan. Susunan ini dapat mengurangi jumlah pemanggilan target model yang bersifat serial untuk setiap token output. Verifikasi tetap memiliki biaya, dan blok draft yang lebih panjang tidak otomatis lebih baik. Titik operasi yang berguna bergantung pada kecepatan pembuatan proposal, seberapa sering proposal lolos verifikasi target, dan biaya yang ditanggung serving stack untuk pekerjaan yang akhirnya ditolak.

Kecerdasan Buatan 22 Sep 2026 6 min read

Reuse Prefix KV Cache Bergantung pada Riwayat Token yang Identik

Satu entri KV cache bukan representasi yang dapat dipakai ulang untuk sembarang teks yang tampak mirip. Pada transformer autoregresif, key dan value yang tersimpan adalah state perantara yang dihasilkan untuk prefix token tertentu dalam konteks eksekusi tertentu. Reuse valid hanya jika request baru mencapai batas state yang sama. Batas itu lebih ketat daripada kecocokan karakter yang terlihat. Tokenisasi, urutan token, penanganan posisi, identitas model, state adapter, serta input lain yang memengaruhi hidden state dapat menentukan apakah prefix dalam cache masih mewakili komputasi yang dibutuhkan request baru.

Kecerdasan Buatan 22 Sep 2026 6 min read

Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention

Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.

Kecerdasan Buatan 19 Sep 2026 6 min read

Prefix Caching Memakai Ulang State KV Hanya pada Prefix Prompt yang Identik

Serving transformer autoregresif sering memproses prefix prompt yang sama pada banyak request: system message, header dokumen panjang, atau tool schema tetap dapat muncul sebelum teks khusus pengguna. Prefix caching menyimpan state key-value yang dihasilkan prefix bersama tersebut sehingga request berikutnya dapat melanjutkan komputasi dari batas cache tanpa menghitung ulang seluruh prefix. Batas yang berguna lebih sempit daripada sekadar “prompt yang mirip.” Reuse bergantung pada urutan token yang identik dan state model yang memengaruhi aktivasi tersimpan. Perubahan satu karakter dapat mempertahankan sebagian besar token, menggeser tokenisasi di sekitar perubahan, atau mengubah semua token setelah batas format tertentu. Cache hanya dapat memakai ulang bagian yang input efektifnya tetap identik.

Kecerdasan Buatan 19 Sep 2026 6 min read

Memori Ollama Gemma 3 270M Lebih Besar dari Ukuran File Model

Ollama mencantumkan gemma3:270m dengan ukuran sekitar 292 MB. Angka ini berguna untuk menghitung kebutuhan storage, tetapi bukan kebutuhan RAM. Nilai tersebut menggambarkan data model yang dikemas untuk varian default Ollama, yang memakai quantization Q8_0. Ketika inferensi berjalan, runtime juga membutuhkan memori untuk metadata model, execution buffer, state token, dan key-value cache yang dipakai attention. Perbedaan ini penting pada mesin dengan RAM kecil. Perangkat dengan RAM 512 MB sekilas terlihat cukup jika hanya dibandingkan dengan file model 292 MB, padahal sisa memori juga harus menampung Ollama dan sistem operasi. Konfigurasi context dapat mengubah total kebutuhan secara signifikan.

Kecerdasan Buatan 19 Sep 2026 8 min read

Memecah Prefill Panjang untuk Membatasi Jeda Decode pada Serving LLM

Prompt panjang dapat menempati akselerator selama interval scheduling yang jauh lebih besar dibanding satu iterasi decode. Saat serving engine mencampur prefill baru dengan request yang sudah menghasilkan token, perbedaan ini dapat terlihat sebagai jarak waktu antartoken output yang tidak teratur. Modelnya tidak berubah; interferensi muncul dari cara dua fase inferensi yang berbeda berbagi waktu eksekusi. Prefill memproses prompt dan membentuk key-value state yang dibutuhkan causal attention berikutnya. Decode kemudian memperpanjang sequence secara autoregresif, umumnya satu token baru per request aktif pada setiap iterasi. Kedua fase memberi tekanan yang berbeda pada hardware, sehingga memperlakukannya sebagai unit scheduling yang setara dapat menimbulkan jeda yang sebenarnya dapat dibatasi.