Langsung ke konten

Arsip

Large Language Models

3 artikel
Kecerdasan Buatan 16 Sep 2026 6 min read

Perluas Context RoPE dengan Positional Interpolation

Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization. Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context

Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi. Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kendalikan Repetisi dengan Contrastive Search Decoding

Greedy decoding dapat terus memilih token yang secara lokal paling mungkin bahkan ketika continuation yang dihasilkan menjadi repetitif. Sampling dapat memutus pola tersebut, tetapi melakukannya dengan menambahkan randomness. Contrastive search mengambil jalur lain: untuk input dan setting yang tetap, ia tetap deterministik sambil menilai likely next-token candidate terhadap representation-level repetition penalty. Metode ini menggabungkan dua sinyal yang menjelaskan properti candidate berbeda. Language-model probability mengutamakan token yang cocok dengan prefix saat ini. Degeneration penalty menurunkan nilai candidate yang new hidden representation-nya terlalu mirip dengan representasi yang sudah ada dalam generated context.