Langsung ke konten

Arsip

Model Bahasa

15 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Contrastive Search Memberi Penalti pada Repetisi Hidden State Saat Decoding

Generasi autoregresif menghasilkan distribusi token berikutnya, tetapi decoder tetap harus menentukan kandidat yang akan ditambahkan. Contrastive search mengubah keputusan tersebut dengan menggabungkan probabilitas model dan penalti untuk kandidat yang menghasilkan hidden state terlalu mirip dengan hidden state yang sudah ada pada prefix. Mekanisme ini bekerja saat inference. Parameter model dan distribusi next-token tidak diubah. Perubahan terjadi pada ranking yang dipakai untuk memilih token dari sekumpulan kandidat terbatas. Pemilihan kandidat dimulai dari probabilitas model Pada langkah decoding t, model menghasilkan distribusi kondisional

Kecerdasan Buatan 23 Sep 2026 3 min read

Softmax Stabil Mengurangi Logit Maksimum Sebelum Eksponensiasi

Decoder dapat menerima logit yang cukup besar sehingga eksponensiasi langsung tidak aman secara numerik, padahal distribusi probabilitas yang dimaksud tetap biasa. Softmax tidak mengharuskan eksponensiasi terhadap nilai awal. Mengurangi semua logit dengan logit terbesar menghasilkan distribusi yang sama dalam aritmetika real eksak sekaligus memindahkan nilai eksponensial ke rentang numerik yang lebih aman. Pergeseran ini merupakan sifat softmax, bukan heuristik khusus model tertentu. Pergeseran bersama hilang saat normalisasi Untuk logit (z_1,\ldots,z_n), softmax menghasilkan

Kecerdasan Buatan 23 Sep 2026 6 min read

Sliding-Window Attention Membatasi State KV Aktif Berdasarkan Jarak Token

Sliding-window attention menetapkan batas jarak token yang terbatas pada causal attention. Pada posisi (t), sebuah query hanya dapat mengakses interval terbaru dari posisi key dan value, bukan seluruh prefix. Setelah suatu posisi cache berada permanen di luar interval tersebut, query berikutnya yang memakai aturan lokal yang sama tidak dapat lagi mengaksesnya. Batas ini mengubah state yang perlu dipertahankan saat decoding autoregresif. Full causal attention membuat state KV yang masih dapat dipakai terus bertambah bersama panjang sequence. Window lokal berukuran tetap dapat menjaga rentang KV aktif tetap terbatas, selama runtime membuang atau menimpa entri yang sudah tidak dapat dijangkau.

Kecerdasan Buatan 23 Sep 2026 4 min read

RMSNorm Menskalakan Aktivasi Tanpa Memusatkan Mean

RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya. Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya. Denominator berasal dari momen kedua mentah Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

Kecerdasan Buatan 23 Sep 2026 5 min read

Repetition Penalty Mengubah Logit untuk ID Token yang Sudah Muncul

Repetition penalty dapat bekerja sebelum sampling dengan mengubah logit milik ID token yang sudah terdapat dalam riwayat token tertentu. Operasi ini tidak harus membandingkan kata, frasa, atau string hasil render. Unit yang diperiksa dapat berupa ID integer dari tokenizer, sehingga makna mekanismenya lebih sempit daripada kesan yang diberikan oleh namanya. Perbedaan tersebut terlihat saat decoder menghasilkan token subword. Dua string yang tampak serupa dapat tersusun dari urutan token berbeda, sedangkan satu token yang dipakai di dalam kata berbeda tetap dapat ditandai sebagai token yang sudah muncul.

Kecerdasan Buatan 23 Sep 2026 5 min read

PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu

KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU. Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.

Kecerdasan Buatan 23 Sep 2026 5 min read

Grouped-Query Attention Berbagi KV Head di Antara Grup Query

Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.

Kecerdasan Buatan 22 Sep 2026 6 min read

Speculative Decoding Menghubungkan Kecepatan Draft dengan Tingkat Penerimaan

Generasi autoregresif biasanya maju satu token yang diterima pada satu waktu. Setiap token baru memperpanjang prefix, sehingga evaluasi target model berikutnya bergantung pada token yang dipilih pada posisi sebelumnya. Speculative decoding mengubah jadwal eksekusi: proses draft yang lebih murah mengusulkan beberapa token ke depan, lalu target model mengevaluasi posisi tersebut bersama-sama dan menentukan seberapa panjang proposal yang dapat dipertahankan. Susunan ini dapat mengurangi jumlah pemanggilan target model yang bersifat serial untuk setiap token output. Verifikasi tetap memiliki biaya, dan blok draft yang lebih panjang tidak otomatis lebih baik. Titik operasi yang berguna bergantung pada kecepatan pembuatan proposal, seberapa sering proposal lolos verifikasi target, dan biaya yang ditanggung serving stack untuk pekerjaan yang akhirnya ditolak.

Kecerdasan Buatan 19 Sep 2026 6 min read

Prefix Caching Memakai Ulang State KV Hanya pada Prefix Prompt yang Identik

Serving transformer autoregresif sering memproses prefix prompt yang sama pada banyak request: system message, header dokumen panjang, atau tool schema tetap dapat muncul sebelum teks khusus pengguna. Prefix caching menyimpan state key-value yang dihasilkan prefix bersama tersebut sehingga request berikutnya dapat melanjutkan komputasi dari batas cache tanpa menghitung ulang seluruh prefix. Batas yang berguna lebih sempit daripada sekadar “prompt yang mirip.” Reuse bergantung pada urutan token yang identik dan state model yang memengaruhi aktivasi tersimpan. Perubahan satu karakter dapat mempertahankan sebagian besar token, menggeser tokenisasi di sekitar perubahan, atau mengubah semua token setelah batas format tertentu. Cache hanya dapat memakai ulang bagian yang input efektifnya tetap identik.

Kecerdasan Buatan 19 Sep 2026 8 min read

Memecah Prefill Panjang untuk Membatasi Jeda Decode pada Serving LLM

Prompt panjang dapat menempati akselerator selama interval scheduling yang jauh lebih besar dibanding satu iterasi decode. Saat serving engine mencampur prefill baru dengan request yang sudah menghasilkan token, perbedaan ini dapat terlihat sebagai jarak waktu antartoken output yang tidak teratur. Modelnya tidak berubah; interferensi muncul dari cara dua fase inferensi yang berbeda berbagi waktu eksekusi. Prefill memproses prompt dan membentuk key-value state yang dibutuhkan causal attention berikutnya. Decode kemudian memperpanjang sequence secara autoregresif, umumnya satu token baru per request aktif pada setiap iterasi. Kedua fase memberi tekanan yang berbeda pada hardware, sehingga memperlakukannya sebagai unit scheduling yang setara dapat menimbulkan jeda yang sebenarnya dapat dibatasi.

Kecerdasan Buatan 18 Sep 2026 4 min read

Perlakukan Logit Lens sebagai Readout, Bukan Jejak Kausal

Sebuah transformer dapat menampilkan residual state intermediate yang sangat mendukung satu token saat diproyeksikan dengan proyeksi kosakata akhir model, lalu menghasilkan token lain setelah block berikutnya dijalankan. Logit lens membuat preferensi intermediate itu terlihat. Hasil tersebut tidak menetapkan bahwa preferensi itu menyebabkan output akhir. Batas ini relevan saat developer memakai peringkat token per layer untuk memeriksa perilaku model. Logit lens adalah readout: metode ini menanyakan apa yang akan dilaporkan output head model jika diterapkan pada representasi intermediate. Forward pass aktual mengajukan persoalan berbeda karena setiap block yang tersisa dapat mengubah representasi tersebut sebelum readout akhir.

Kecerdasan Buatan 17 Sep 2026 5 min read

Teacher Forcing Menciptakan Kesenjangan Distribusi Prefix

Model autoregresif memprediksi token berikutnya dari sebuah prefix. Dalam training dengan teacher forcing, prefix tersebut biasanya berasal dari sequence referensi. Saat generasi, prefix berisi token yang dikeluarkan model sendiri. Satu kesalahan prediksi karena itu dapat mengubah konteks yang digunakan untuk seluruh prediksi berikutnya. Perbedaan ini sering disebut exposure bias. Detail engineering yang lebih berguna adalah bahwa training dan generasi dapat menyajikan distribusi prefix yang berbeda kepada predictor kondisional yang sama. Validasi token-level pada prefix referensi yang bersih tidak sepenuhnya menggambarkan perilaku ketika model memasuki prefix yang jarang muncul selama training.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca State Intermediate Transformer dengan Logit Lens

Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model. Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca Prediksi Intermediate Transformer dengan Tuned Lens

Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman. Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.

Kecerdasan Buatan 06 Sep 2026 9 min read

Direct Preference Optimization untuk Alignment LLM

Supervised fine-tuning dapat membuat model bahasa meniru jawaban yang baik, tetapi banyak persoalan alignment lebih mudah dinyatakan sebagai perbandingan: dari dua respons untuk prompt yang sama, respons mana yang lebih baik? Dataset preferensi menangkap sinyal itu sebagai tripel yang berisi prompt, respons pilihan, dan respons yang ditolak. Tantangannya adalah mengubah perbandingan tersebut menjadi pembaruan model tanpa memperlakukan preferensi subjektif sebagai target next-token biasa. Direct Preference Optimization (DPO) menawarkan satu pendekatan praktis. DPO melatih policy model agar meningkatkan preferensi relatif terhadap respons pilihan dibanding respons yang ditolak, sambil mengukur perubahan itu terhadap model referensi yang tetap. Berbeda dari pipeline reinforcement learning from human feedback yang umum, DPO standar tidak memerlukan pelatihan reward model terpisah lalu menjalankan optimizer reinforcement learning.