Langsung ke konten

Arsip

LLM

18 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Scheduling per Iterasi Membentuk Ulang Batch LLM di Antara Langkah Decode

Serving autoregresif tidak membuat semua request selesai pada titik yang sama. Sebuah sequence dapat menghasilkan token akhir setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah. Jika engine mempertahankan batch request awal sampai seluruh anggotanya selesai, sequence yang sudah berakhir meninggalkan kapasitas eksekusi yang tidak terisi di belakang sequence yang lebih panjang. Scheduling per iterasi memindahkan batas keputusan ke bagian yang lebih kecil. Request tidak lagi menjadi satu-satunya unit scheduling yang tidak dapat dipecah. Setelah satu iterasi model, kontrol kembali ke scheduler. Sequence yang selesai dapat keluar, pekerjaan yang menunggu dapat masuk, dan iterasi berikutnya dapat memakai kumpulan sequence aktif yang berbeda.

Kecerdasan Buatan 16 Sep 2026 6 min read

Uji Mekanisme Transformer dengan Activation Patching

Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.

Kecerdasan Buatan 16 Sep 2026 6 min read

Exposure Bias pada Decoding Autoregresif

Model autoregresif dapat menerima konteks yang lebih bersih saat training dibandingkan saat generation. Dengan teacher forcing, prediksi token berikutnya dikondisikan pada prefix referensi dari urutan training. Saat free-running decoding, model justru dikondisikan pada token yang dihasilkannya sendiri. Setelah sebuah token berbeda dari kelanjutan yang dituju, prediksi berikutnya bekerja pada prefix yang mungkin lebih jarang muncul dalam data training. Ketidakcocokan ini umum disebut exposure bias. Masalahnya bukan sekadar bahwa model autoregresif dapat membuat kesalahan. Intinya adalah distribusi prefix yang diberikan kepada model dapat berubah antara optimisasi dan generation, sementara satu penyimpangan awal dapat mengubah setiap prediksi kondisional sesudahnya.

Kecerdasan Buatan 14 Sep 2026 5 min read

Exposure Bias pada Generation Autoregresif

Model autoregresif dapat menerima prefix bersih pada setiap posisi training, tetapi tetap menghadapi distribusi input berbeda saat generation. Training umumnya memberi skor pada token referensi berikutnya sambil dikondisikan pada token referensi sebelumnya. Saat inference, prefix justru berisi output model sendiri. Ketidakcocokan ini disebut exposure bias. Dampaknya muncul karena kesalahan awal pada generation tidak hanya membuat satu token keliru. Token tersebut menjadi bagian dari konteks untuk prediksi berikutnya, sehingga model memasuki state prefix yang mungkin jarang atau tidak pernah muncul saat training.

Kecerdasan Buatan 14 Sep 2026 6 min read

Batasi Logit Ekstrem dengan Soft Capping

Transformer dapat menghasilkan logit dengan magnitudo yang jauh melampaui rentang yang diperlukan untuk menyatakan preferensi kuat. Skor attention yang besar dapat membuat distribusi softmax sangat terkonsentrasi, sedangkan logit output yang besar dapat membuat probabilitas token hampir one-hot. Hard clamp dapat membatasi nilai tersebut, tetapi menghasilkan wilayah datar dengan perubahan turunan yang mendadak pada ambang batas. Logit soft capping memakai fungsi saturasi yang halus sebagai gantinya. Salah satu bentuk yang umum adalah:

Kecerdasan Buatan 13 Sep 2026 7 min read

Kuantisasi KV Cache dengan Error Budget Key dan Value Terpisah

Inference transformer autoregressive menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke posisi terdahulu tanpa menghitung ulang seluruh prefix. KV cache tersebut bertambah bersama sequence length, jumlah layer, batch size, dan jumlah key-value head yang disimpan. Pada context panjang, jejak memorinya dapat langsung membatasi jumlah request konkuren atau context length yang dapat digunakan. Kuantisasi KV cache mengurangi byte per elemen yang disimpan. Namun, aproksimasi yang dihasilkan tidak setara dengan menguantisasi struktur data pasif. Cached key ikut dalam perhitungan attention score, sedangkan cached value dicampur berdasarkan attention weight yang dihasilkan. Error pada kedua tensor itu karena itu memasuki operasi attention pada titik yang berbeda.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kendalikan Bias Panjang Sequence dalam Beam Search

Beam search dapat mengembalikan sequence yang lebih pendek meskipun kandidat yang lebih panjang berisi token yang masuk akal secara lokal pada setiap posisi. Perilaku ini mengikuti langsung dari scoring sequence: model autoregressive mengalikan conditional probability token, atau secara ekuivalen menjumlahkan log probability-nya. Karena probability token paling besar bernilai satu, setiap token tambahan menyumbangkan log term yang tidak positif. Aritmetika tersebut menjadikan panjang sequence bagian dari decoding. Beam width mengubah kandidat mana yang bertahan, tetapi tidak menghilangkan efek scoring. Karena itu, decoder memerlukan kebijakan yang disengaja untuk membandingkan hypothesis dengan panjang berbeda dan menentukan kapan hypothesis yang sudah lengkap cukup baik untuk menghentikan search.

Kecerdasan Buatan 13 Sep 2026 6 min read

Gunakan Ulang State Prefix Bersama pada Inferensi LLM

Inferensi LLM autoregresif sering memproses token awal yang sama pada banyak request. System prompt tetap, schema tool, atau prefix dokumen dapat berisi ribuan token sebelum teks khusus request dimulai. Menghitung state attention untuk prefix identik pada setiap request berarti mengulang pekerjaan prefill yang sebelumnya sudah menghasilkan key dan value cache yang sama dalam kondisi eksekusi yang kompatibel. Prefix caching menyimpan state attention yang dapat digunakan ulang untuk prefix token bersama. Mekanisme ini mengurangi komputasi prefill saat terjadi cache hit, tetapi tidak membuat prompt yang sekadar mirip dapat saling dipertukarkan. Unit yang dapat digunakan ulang terikat pada state input model yang tepat, bukan kemiripan semantik.

Kecerdasan Buatan 12 Sep 2026 10 min read

Selaraskan LLM dengan Direct Preference Optimization

Selaraskan LLM dengan Direct Preference Optimization Supervised fine-tuning bekerja baik ketika Anda dapat menyediakan respons target untuk setiap prompt. Pendekatan ini menjadi kurang alami ketika sinyalnya bersifat komparatif: satu jawaban lebih disukai daripada jawaban lain, tetapi keduanya bukan target sempurna untuk disalin. Direct Preference Optimization (DPO) mengubah pasangan preferensi tersebut menjadi objektif pelatihan untuk model bahasa tanpa memerlukan reward model yang dilatih terpisah atau tahap reinforcement learning secara online. Kesederhanaan ini membuat DPO menarik untuk gaya respons, kepatuhan terhadap instruksi, dan tugas lain ketika penilaian berpasangan lebih mudah dikumpulkan daripada completion ideal. Metode ini tetap memiliki batasan penting. Perilakunya bergantung pada data preferensi, kebijakan referensi yang tetap, dan kekuatan regularisasi yang mengendalikan seberapa agresif kebijakan hasil tuning menjauh dari referensi tersebut.

Kecerdasan Buatan 12 Sep 2026 7 min read

Batasi Pertumbuhan KV Cache pada Streaming LLM Inference

Inference transformer autoregresif biasanya menyimpan state key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang state tersebut. Cache bertambah seiring panjang sequence. Untuk stream yang berjalan lama, pertumbuhan itu akhirnya menjadi kendala memori meskipun generation tetap berlangsung satu token pada satu waktu. KV cache eviction membatasi state tersebut dengan membuang posisi cache tertentu. Efek terhadap memori cukup langsung: lebih sedikit pasangan key-value yang dipertahankan berarti lebih sedikit ruang cache yang terpakai. Efek terhadap model lebih halus. Setelah sebuah posisi dihapus, layer attention berikutnya tidak dapat memakai key dan value yang sebelumnya di-cache dalam komputasi attention biasa. Kebijakan eviction dengan demikian mengubah penggunaan resource sekaligus riwayat attention efektif.

Kecerdasan Buatan 11 Sep 2026 9 min read

Adaptasi Model Bahasa dengan Prefix Tuning

Adaptasi Model Bahasa dengan Prefix Tuning Full fine-tuning mengubah bobot model untuk setiap tugas. Cara ini bisa efektif, tetapi menyimpan dan melakukan serving checkpoint penuh yang terpisah untuk setiap tugas menjadi mahal ketika ukuran model dan jumlah tugas bertambah. Prefix tuning menawarkan susunan berbeda: pertahankan model pretrained dalam keadaan beku dan latih sekumpulan kecil state spesifik tugas yang ikut berpartisipasi dalam attention. Artikel ini membangun model mental praktis untuk prefix tuning, menunjukkan perbedaannya dari text prompt dan adapter bobot low-rank, serta menjelaskan trade-off yang penting ketika melatih atau melakukan serving beberapa varian tugas.

Kecerdasan Buatan 09 Sep 2026 9 min read

Sampling LLM: Temperature, Top-K, dan Top-P

Language model biasanya tidak menghasilkan satu next token yang tak terelakkan. Berdasarkan prefix, model memberi skor pada banyak token yang mungkin. Algoritma decoding kemudian menentukan cara mengubah skor tersebut menjadi output berikutnya. Tahap terakhir ini penting. Sampling yang terlalu bebas dapat membuat model bergeser ke continuation yang tidak mungkin. Sampling yang terlalu dibatasi dapat membuat output repetitif atau kehilangan variasi yang berguna. Parameter seperti temperature, top-k, dan top-p mengontrol bagian berbeda dari trade-off ini, sehingga memperlakukannya sebagai satu “creativity setting” akan menghasilkan perilaku yang membingungkan.

Kecerdasan Buatan 08 Sep 2026 10 min read

Hindari Kegagalan Batas Tokenisasi pada Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefiks, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berakhir tepat di posisi itu. Detail ini dapat menjadi penting ketika prompt berakhir pada posisi karakter yang, jika prompt dan kelanjutannya ditokenisasi bersama, biasanya berada di dalam token yang lebih besar. Masalah batas tokenisasi (tokenization boundary problem), yang juga disebut masalah token parsial (partial token problem), dapat membuat kelanjutan yang sebenarnya natural menjadi sangat kecil kemungkinannya.

Kecerdasan Buatan 08 Sep 2026 8 min read

Hindari Kegagalan Batas Tokenisasi dalam Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefix, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berhenti tepat pada posisi itu. Detail ini dapat berpengaruh ketika prompt berakhir pada posisi karakter yang, jika prompt dan continuation ditokenisasi bersama, seharusnya berada di dalam token yang lebih besar. Masalah batas tokenisasi, yang juga disebut partial token problem, dapat membuat continuation yang sebenarnya natural menjadi sangat tidak mungkin.

Kecerdasan Buatan 08 Sep 2026 9 min read

Ambil Evidence Multi-Hop dengan Graph RAG

Retrieval-augmented generation (RAG) biasanya dimulai dari gagasan sederhana: cari chunk teks yang mirip dengan pertanyaan, masukkan chunk paling relevan ke context model, lalu minta model menjawab berdasarkan evidence tersebut. Pendekatan ini bekerja baik ketika jawaban terdapat dalam satu passage atau beberapa passage yang masing-masing mudah diambil. Sebagian pertanyaan lebih sulit karena evidence yang berguna terhubung oleh relasi, bukan sekadar kemiripan kata. Developer mungkin perlu menjawab, “Service mana yang bergantung pada library yang dikelola tim pemilik Payments API?” Tidak ada satu chunk yang harus memuat semua kata itu. Jawabannya dapat memerlukan penelusuran beberapa hubungan antara service, library, tim, dan API.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.

Kecerdasan Buatan 03 Sep 2026 9 min read

Batch Inference LLM untuk Throughput yang Lebih Baik

Server LLM dapat menerima banyak request pada saat yang sama, tetapi memproses setiap request secara terpisah sering kali merupakan cara yang tidak efisien untuk menggunakan akselerator. GPU dan perangkat keras serupa dirancang untuk menjalankan pekerjaan numerik paralel dalam jumlah besar. Satu request kecil dapat membuat sebagian kapasitas tersebut tidak terpakai. Batching menggabungkan pekerjaan dari beberapa request agar model dapat memproses lebih banyak pekerjaan secara bersamaan. Ini dapat meningkatkan throughput total, tetapi menghadirkan trade-off penting: menunggu batch terbentuk dapat menunda request individual, dan request dengan panjang sequence berbeda tidak menghabiskan jumlah pekerjaan yang sama.

Kecerdasan Buatan 02 Sep 2026 5 min read

Atur Anggaran Context Window LLM Tanpa Kehilangan Instruksi Penting

Aplikasi large language model jarang gagal hanya karena prompt kelebihan satu token. Kegagalan biasanya terjadi karena pertumbuhan context ditangani tanpa prioritas. Riwayat chat membesar, retrieval mengembalikan lebih banyak passage, hasil tool menjadi panjang, dan pada akhirnya aplikasi memangkas teks mana pun yang paling mudah dipotong. Desain yang lebih aman memperlakukan context window sebagai anggaran dengan alokasi eksplisit. Tujuannya bukan mengisi setiap token yang tersedia, melainkan mempertahankan informasi yang mengendalikan perilaku sekaligus menyisakan ruang yang cukup untuk jawaban lengkap.