Langsung ke konten

Arsip

Inferensi

30 artikel
Kecerdasan Buatan 19 Sep 2026 7 min read

Ke Mana Waktu Inferensi PEGASUS-XSum Dihabiskan

google/pegasus-xsum adalah checkpoint untuk summarization, bukan utilitas teks berukuran kecil. Latensinya mengikuti pekerjaan yang memang dilakukan Transformer encoder-decoder besar: sumber harus di-encode terlebih dahulu, lalu decoder dijalankan berulang kali sampai ringkasan selesai. Di CPU, fase kedua biasanya membuat output yang pendek terasa jauh lebih mahal daripada yang diperkirakan. Paper PEGASUS menjelaskan Transformer encoder-decoder yang di-pretrain dengan Gap Sentences Generation dan melaporkan model terbaik berukuran 568 juta parameter. Checkpoint XSum kemudian di-fine-tune untuk abstractive summarization pada satu dokumen. Kombinasi ini berguna ketika kualitas ringkasan menjadi prioritas, tetapi pekerjaan inferensinya jelas lebih besar daripada sekadar mengambil beberapa kalimat sumber atau menjalankan classifier kecil.

Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kendalikan Bias Panjang Sequence dalam Beam Search

Beam search dapat mengembalikan sequence yang lebih pendek meskipun kandidat yang lebih panjang berisi token yang masuk akal secara lokal pada setiap posisi. Perilaku ini mengikuti langsung dari scoring sequence: model autoregressive mengalikan conditional probability token, atau secara ekuivalen menjumlahkan log probability-nya. Karena probability token paling besar bernilai satu, setiap token tambahan menyumbangkan log term yang tidak positif. Aritmetika tersebut menjadikan panjang sequence bagian dari decoding. Beam width mengubah kandidat mana yang bertahan, tetapi tidak menghilangkan efek scoring. Karena itu, decoder memerlukan kebijakan yang disengaja untuk membandingkan hypothesis dengan panjang berbeda dan menentukan kapan hypothesis yang sudah lengkap cukup baik untuk menghentikan search.

Kecerdasan Buatan 13 Sep 2026 6 min read

Gunakan Ulang State Prefix Bersama pada Inferensi LLM

Inferensi LLM autoregresif sering memproses token awal yang sama pada banyak request. System prompt tetap, schema tool, atau prefix dokumen dapat berisi ribuan token sebelum teks khusus request dimulai. Menghitung state attention untuk prefix identik pada setiap request berarti mengulang pekerjaan prefill yang sebelumnya sudah menghasilkan key dan value cache yang sama dalam kondisi eksekusi yang kompatibel. Prefix caching menyimpan state attention yang dapat digunakan ulang untuk prefix token bersama. Mekanisme ini mengurangi komputasi prefill saat terjadi cache hit, tetapi tidak membuat prompt yang sekadar mirip dapat saling dipertukarkan. Unit yang dapat digunakan ulang terikat pada state input model yang tepat, bukan kemiripan semantik.

Kecerdasan Buatan 09 Sep 2026 9 min read

Sampling LLM: Temperature, Top-K, dan Top-P

Language model biasanya tidak menghasilkan satu next token yang tak terelakkan. Berdasarkan prefix, model memberi skor pada banyak token yang mungkin. Algoritma decoding kemudian menentukan cara mengubah skor tersebut menjadi output berikutnya. Tahap terakhir ini penting. Sampling yang terlalu bebas dapat membuat model bergeser ke continuation yang tidak mungkin. Sampling yang terlalu dibatasi dapat membuat output repetitif atau kehilangan variasi yang berguna. Parameter seperti temperature, top-k, dan top-p mengontrol bagian berbeda dari trade-off ini, sehingga memperlakukannya sebagai satu “creativity setting” akan menghasilkan perilaku yang membingungkan.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.