Langsung ke konten

Arsip

Inference

12 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Tanh Logit Soft Capping Membatasi Skor Ekstrem Sebelum Softmax

Softmax dapat menerima logit dengan magnitudo hingga berapa pun selama nilainya finite, tetapi selisih skor yang besar membuat keluarannya semakin terkonsentrasi. Tanh logit soft capping menyisipkan transformasi nonlinear terbatas sebelum softmax sehingga logit hasil transformasi tidak melewati magnitudo yang ditentukan. Untuk cap positif c, bentuk yang umum adalah: softcap(z; c) = c * tanh(z / c) Operasi ini bukan hard clipping pada ambang tertentu. Di sekitar nol perilakunya hampir linear, lalu magnitudo yang lebih besar dikompresi secara bertahap saat mendekati -c atau c.

Kecerdasan Buatan 24 Sep 2026 5 min read

Scheduling per Iterasi Membentuk Ulang Batch LLM di Antara Langkah Decode

Serving autoregresif tidak membuat semua request selesai pada titik yang sama. Sebuah sequence dapat menghasilkan token akhir setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah. Jika engine mempertahankan batch request awal sampai seluruh anggotanya selesai, sequence yang sudah berakhir meninggalkan kapasitas eksekusi yang tidak terisi di belakang sequence yang lebih panjang. Scheduling per iterasi memindahkan batas keputusan ke bagian yang lebih kecil. Request tidak lagi menjadi satu-satunya unit scheduling yang tidak dapat dipecah. Setelah satu iterasi model, kontrol kembali ke scheduler. Sequence yang selesai dapat keluar, pekerjaan yang menunggu dapat masuk, dan iterasi berikutnya dapat memakai kumpulan sequence aktif yang berbeda.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 23 Sep 2026 4 min read

Speculative Sampling Mempertahankan Distribusi Target lewat Koreksi Rejection

Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection. Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target. Acceptance bergantung pada rasio probabilitas Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).

Kecerdasan Buatan 16 Sep 2026 6 min read

Exposure Bias pada Decoding Autoregresif

Model autoregresif dapat menerima konteks yang lebih bersih saat training dibandingkan saat generation. Dengan teacher forcing, prediksi token berikutnya dikondisikan pada prefix referensi dari urutan training. Saat free-running decoding, model justru dikondisikan pada token yang dihasilkannya sendiri. Setelah sebuah token berbeda dari kelanjutan yang dituju, prediksi berikutnya bekerja pada prefix yang mungkin lebih jarang muncul dalam data training. Ketidakcocokan ini umum disebut exposure bias. Masalahnya bukan sekadar bahwa model autoregresif dapat membuat kesalahan. Intinya adalah distribusi prefix yang diberikan kepada model dapat berubah antara optimisasi dan generation, sementara satu penyimpangan awal dapat mengubah setiap prediksi kondisional sesudahnya.

Kecerdasan Buatan 15 Sep 2026 4 min read

Pertahankan Attention Sinks pada Streaming Transformers

Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya. Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.

Kecerdasan Buatan 14 Sep 2026 5 min read

Exposure Bias pada Generation Autoregresif

Model autoregresif dapat menerima prefix bersih pada setiap posisi training, tetapi tetap menghadapi distribusi input berbeda saat generation. Training umumnya memberi skor pada token referensi berikutnya sambil dikondisikan pada token referensi sebelumnya. Saat inference, prefix justru berisi output model sendiri. Ketidakcocokan ini disebut exposure bias. Dampaknya muncul karena kesalahan awal pada generation tidak hanya membuat satu token keliru. Token tersebut menjadi bagian dari konteks untuk prediksi berikutnya, sehingga model memasuki state prefix yang mungkin jarang atau tidak pernah muncul saat training.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kuantisasi KV Cache dengan Error Budget Key dan Value Terpisah

Inference transformer autoregressive menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke posisi terdahulu tanpa menghitung ulang seluruh prefix. KV cache tersebut bertambah bersama sequence length, jumlah layer, batch size, dan jumlah key-value head yang disimpan. Pada context panjang, jejak memorinya dapat langsung membatasi jumlah request konkuren atau context length yang dapat digunakan. Kuantisasi KV cache mengurangi byte per elemen yang disimpan. Namun, aproksimasi yang dihasilkan tidak setara dengan menguantisasi struktur data pasif. Cached key ikut dalam perhitungan attention score, sedangkan cached value dicampur berdasarkan attention weight yang dihasilkan. Error pada kedua tensor itu karena itu memasuki operasi attention pada titik yang berbeda.

Kecerdasan Buatan 12 Sep 2026 7 min read

Batasi Pertumbuhan KV Cache pada Streaming LLM Inference

Inference transformer autoregresif biasanya menyimpan state key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang state tersebut. Cache bertambah seiring panjang sequence. Untuk stream yang berjalan lama, pertumbuhan itu akhirnya menjadi kendala memori meskipun generation tetap berlangsung satu token pada satu waktu. KV cache eviction membatasi state tersebut dengan membuang posisi cache tertentu. Efek terhadap memori cukup langsung: lebih sedikit pasangan key-value yang dipertahankan berarti lebih sedikit ruang cache yang terpakai. Efek terhadap model lebih halus. Setelah sebuah posisi dihapus, layer attention berikutnya tidak dapat memakai key dan value yang sebelumnya di-cache dalam komputasi attention biasa. Kebijakan eviction dengan demikian mengubah penggunaan resource sekaligus riwayat attention efektif.

Kecerdasan Buatan 08 Sep 2026 10 min read

Hindari Kegagalan Batas Tokenisasi pada Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefiks, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berakhir tepat di posisi itu. Detail ini dapat menjadi penting ketika prompt berakhir pada posisi karakter yang, jika prompt dan kelanjutannya ditokenisasi bersama, biasanya berada di dalam token yang lebih besar. Masalah batas tokenisasi (tokenization boundary problem), yang juga disebut masalah token parsial (partial token problem), dapat membuat kelanjutan yang sebenarnya natural menjadi sangat kecil kemungkinannya.

Kecerdasan Buatan 08 Sep 2026 8 min read

Hindari Kegagalan Batas Tokenisasi dalam Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefix, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berhenti tepat pada posisi itu. Detail ini dapat berpengaruh ketika prompt berakhir pada posisi karakter yang, jika prompt dan continuation ditokenisasi bersama, seharusnya berada di dalam token yang lebih besar. Masalah batas tokenisasi, yang juga disebut partial token problem, dapat membuat continuation yang sebenarnya natural menjadi sangat tidak mungkin.

Kecerdasan Buatan 03 Sep 2026 9 min read

Batch Inference LLM untuk Throughput yang Lebih Baik

Server LLM dapat menerima banyak request pada saat yang sama, tetapi memproses setiap request secara terpisah sering kali merupakan cara yang tidak efisien untuk menggunakan akselerator. GPU dan perangkat keras serupa dirancang untuk menjalankan pekerjaan numerik paralel dalam jumlah besar. Satu request kecil dapat membuat sebagian kapasitas tersebut tidak terpakai. Batching menggabungkan pekerjaan dari beberapa request agar model dapat memproses lebih banyak pekerjaan secara bersamaan. Ini dapat meningkatkan throughput total, tetapi menghadirkan trade-off penting: menunggu batch terbentuk dapat menunda request individual, dan request dengan panjang sequence berbeda tidak menghabiskan jumlah pekerjaan yang sama.