Langsung ke konten

Arsip

Kecerdasan Buatan

95 artikel
Kecerdasan Buatan 23 Sep 2026 5 min read

KV Cache Sliding Window Mengubah Token yang Tetap Dapat Diakses

Decoding autoregresif dapat memakai ulang tensor key dan value dari posisi token sebelumnya tanpa menghitungnya kembali pada setiap tahap. KV cache konvensional karena itu bertambah seiring generation berjalan. Sliding-window cache membatasi state yang dipertahankan dengan menyimpan hanya area terbaru. Batas memori tersebut tidak sekadar mengubah ukuran alokasi. Setelah entri key-value lama dikeluarkan, operasi attention berikutnya tidak dapat lagi mengakses posisi itu secara langsung melalui cache. Perilaku akhirnya bergantung pada pola attention model, skema posisi, implementasi cache, dan kemungkinan adanya layer dengan rentang attention berbeda.

Kecerdasan Buatan 23 Sep 2026 5 min read

Entropi Attention Mengukur Konsentrasi, Bukan Kepentingan Kausal

Sebuah attention head dapat menempatkan sebagian besar massa probabilitas pada satu posisi tanpa memberikan bukti kuat bahwa posisi tersebut mengendalikan output akhir model. Entropi bobot attention mengukur konsentrasi, bukan pengaruh kausal. Pemisahan ini relevan saat attention map dipakai sebagai diagnostik. Entropi dapat menunjukkan apakah sebuah head menyebarkan massa secara luas atau memusatkannya pada sedikit posisi untuk query tertentu. Nilai itu sendiri tidak menetapkan bahwa token dengan bobot tertinggi membawa fitur yang menentukan prediksi downstream.

Kecerdasan Buatan 23 Sep 2026 6 min read

Bias Logit Aditif Mengubah Odds Token Sebelum Sampling

Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya. Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.

Kecerdasan Buatan 22 Sep 2026 5 min read

Top-p Sampling Membentuk Ulang Set Kandidat pada Setiap Token

Top-p sampling tidak mempertahankan shortlist token yang tetap sepanjang generation. Pada setiap langkah decoding, model menghasilkan vektor logit baru, vektor itu menjadi distribusi probabilitas, lalu sampler membentuk set kandidat baru dengan massa probabilitas kumulatif yang mencapai threshold terkonfigurasi. Konsekuensinya mudah terlewat pada kode serving: nilai top_p yang sama dapat memasukkan dua token pada satu langkah dan puluhan token pada langkah lain. Parameter ini mengendalikan massa probabilitas, bukan jumlah kandidat. Cutoff mengikuti distribusi saat ini Untuk vocabulary dengan probabilitas token p_1, p_2, ..., p_V, urutkan token dari probabilitas tertinggi ke terendah:

Kecerdasan Buatan 22 Sep 2026 6 min read

Speculative Decoding Menghubungkan Kecepatan Draft dengan Tingkat Penerimaan

Generasi autoregresif biasanya maju satu token yang diterima pada satu waktu. Setiap token baru memperpanjang prefix, sehingga evaluasi target model berikutnya bergantung pada token yang dipilih pada posisi sebelumnya. Speculative decoding mengubah jadwal eksekusi: proses draft yang lebih murah mengusulkan beberapa token ke depan, lalu target model mengevaluasi posisi tersebut bersama-sama dan menentukan seberapa panjang proposal yang dapat dipertahankan. Susunan ini dapat mengurangi jumlah pemanggilan target model yang bersifat serial untuk setiap token output. Verifikasi tetap memiliki biaya, dan blok draft yang lebih panjang tidak otomatis lebih baik. Titik operasi yang berguna bergantung pada kecepatan pembuatan proposal, seberapa sering proposal lolos verifikasi target, dan biaya yang ditanggung serving stack untuk pekerjaan yang akhirnya ditolak.

Kecerdasan Buatan 22 Sep 2026 6 min read

Reuse Prefix KV Cache Bergantung pada Riwayat Token yang Identik

Satu entri KV cache bukan representasi yang dapat dipakai ulang untuk sembarang teks yang tampak mirip. Pada transformer autoregresif, key dan value yang tersimpan adalah state perantara yang dihasilkan untuk prefix token tertentu dalam konteks eksekusi tertentu. Reuse valid hanya jika request baru mencapai batas state yang sama. Batas itu lebih ketat daripada kecocokan karakter yang terlihat. Tokenisasi, urutan token, penanganan posisi, identitas model, state adapter, serta input lain yang memengaruhi hidden state dapat menentukan apakah prefix dalam cache masih mewakili komputasi yang dibutuhkan request baru.

Kecerdasan Buatan 22 Sep 2026 6 min read

Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention

Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.

Kecerdasan Buatan 22 Sep 2026 6 min read

Cosine Similarity Mengabaikan Magnitudo Embedding

Dua vektor embedding dapat mengarah ke arah yang sama meski memiliki norm yang sangat berbeda. Cosine similarity memberi keduanya skor arah yang sama. Raw dot product tidak demikian. Perbedaan ini menjadi batas implementasi ketika sistem retrieval mengganti metrik index, menormalisasi vektor saat ingestion, atau mencampur embedding dari pipeline yang berbeda. Persoalannya bukan menentukan satu metrik yang unggul untuk semua kasus. Yang perlu ditetapkan adalah apakah magnitudo vektor membawa informasi yang memang hendak dipertahankan oleh kontrak scoring. Setelah vektor dinormalisasi menjadi unit length, informasi magnitudo tersebut tidak lagi ikut dalam perhitungan similarity.

Kecerdasan Buatan 19 Sep 2026 6 min read

Prefix Caching Memakai Ulang State KV Hanya pada Prefix Prompt yang Identik

Serving transformer autoregresif sering memproses prefix prompt yang sama pada banyak request: system message, header dokumen panjang, atau tool schema tetap dapat muncul sebelum teks khusus pengguna. Prefix caching menyimpan state key-value yang dihasilkan prefix bersama tersebut sehingga request berikutnya dapat melanjutkan komputasi dari batas cache tanpa menghitung ulang seluruh prefix. Batas yang berguna lebih sempit daripada sekadar “prompt yang mirip.” Reuse bergantung pada urutan token yang identik dan state model yang memengaruhi aktivasi tersimpan. Perubahan satu karakter dapat mempertahankan sebagian besar token, menggeser tokenisasi di sekitar perubahan, atau mengubah semua token setelah batas format tertentu. Cache hanya dapat memakai ulang bagian yang input efektifnya tetap identik.

Kecerdasan Buatan 19 Sep 2026 6 min read

Memori Ollama Gemma 3 270M Lebih Besar dari Ukuran File Model

Ollama mencantumkan gemma3:270m dengan ukuran sekitar 292 MB. Angka ini berguna untuk menghitung kebutuhan storage, tetapi bukan kebutuhan RAM. Nilai tersebut menggambarkan data model yang dikemas untuk varian default Ollama, yang memakai quantization Q8_0. Ketika inferensi berjalan, runtime juga membutuhkan memori untuk metadata model, execution buffer, state token, dan key-value cache yang dipakai attention. Perbedaan ini penting pada mesin dengan RAM kecil. Perangkat dengan RAM 512 MB sekilas terlihat cukup jika hanya dibandingkan dengan file model 292 MB, padahal sisa memori juga harus menampung Ollama dan sistem operasi. Konfigurasi context dapat mengubah total kebutuhan secara signifikan.

Kecerdasan Buatan 19 Sep 2026 8 min read

Memecah Prefill Panjang untuk Membatasi Jeda Decode pada Serving LLM

Prompt panjang dapat menempati akselerator selama interval scheduling yang jauh lebih besar dibanding satu iterasi decode. Saat serving engine mencampur prefill baru dengan request yang sudah menghasilkan token, perbedaan ini dapat terlihat sebagai jarak waktu antartoken output yang tidak teratur. Modelnya tidak berubah; interferensi muncul dari cara dua fase inferensi yang berbeda berbagi waktu eksekusi. Prefill memproses prompt dan membentuk key-value state yang dibutuhkan causal attention berikutnya. Decode kemudian memperpanjang sequence secara autoregresif, umumnya satu token baru per request aktif pada setiap iterasi. Kedua fase memberi tekanan yang berbeda pada hardware, sehingga memperlakukannya sebagai unit scheduling yang setara dapat menimbulkan jeda yang sebenarnya dapat dibatasi.

Kecerdasan Buatan 19 Sep 2026 7 min read

Ke Mana Waktu Inferensi PEGASUS-XSum Dihabiskan

google/pegasus-xsum adalah checkpoint untuk summarization, bukan utilitas teks berukuran kecil. Latensinya mengikuti pekerjaan yang memang dilakukan Transformer encoder-decoder besar: sumber harus di-encode terlebih dahulu, lalu decoder dijalankan berulang kali sampai ringkasan selesai. Di CPU, fase kedua biasanya membuat output yang pendek terasa jauh lebih mahal daripada yang diperkirakan. Paper PEGASUS menjelaskan Transformer encoder-decoder yang di-pretrain dengan Gap Sentences Generation dan melaporkan model terbaik berukuran 568 juta parameter. Checkpoint XSum kemudian di-fine-tune untuk abstractive summarization pada satu dokumen. Kombinasi ini berguna ketika kualitas ringkasan menjadi prioritas, tetapi pekerjaan inferensinya jelas lebih besar daripada sekadar mengambil beberapa kalimat sumber atau menjalankan classifier kecil.

Kecerdasan Buatan 19 Sep 2026 7 min read

Estimasi Kedalaman Monokular dengan MiDaS dan DPT

Satu kamera RGB merekam koordinat gambar dan warna, bukan jarak fisik dari lensa ke setiap permukaan yang terlihat. Model kedalaman monokular memperkirakan struktur kedalaman yang hilang dari bukti visual yang dipelajari selama training. Perbedaan ini penting saat menggunakan MiDaS atau DPT: peta kedalaman yang terlihat meyakinkan tidak otomatis berarti nilai setiap piksel adalah jarak dalam meter. MiDaS adalah proyek open-source untuk estimasi kedalaman relatif monokular yang robust. DPT, atau Dense Prediction Transformer, merupakan arsitektur untuk dense prediction yang juga digunakan sebagai backbone pada sejumlah model MiDaS. Keduanya membuat estimasi kedalaman dengan satu kamera menjadi praktis, tetapi tidak menghilangkan ambiguitas geometris yang melekat pada satu gambar RGB tanpa constraint tambahan.

Kecerdasan Buatan 18 Sep 2026 4 min read

Perlakukan Logit Lens sebagai Readout, Bukan Jejak Kausal

Sebuah transformer dapat menampilkan residual state intermediate yang sangat mendukung satu token saat diproyeksikan dengan proyeksi kosakata akhir model, lalu menghasilkan token lain setelah block berikutnya dijalankan. Logit lens membuat preferensi intermediate itu terlihat. Hasil tersebut tidak menetapkan bahwa preferensi itu menyebabkan output akhir. Batas ini relevan saat developer memakai peringkat token per layer untuk memeriksa perilaku model. Logit lens adalah readout: metode ini menanyakan apa yang akan dilaporkan output head model jika diterapkan pada representasi intermediate. Forward pass aktual mengajukan persoalan berbeda karena setiap block yang tersisa dapat mengubah representasi tersebut sebelum readout akhir.

Kecerdasan Buatan 18 Sep 2026 5 min read

Hitung Ulang Statistik BatchNorm Setelah Weight Averaging

Merata-ratakan dua checkpoint jaringan neural dapat menghasilkan vektor parameter yang berguna, tetapi meninggalkan statistik berjalan BatchNorm yang terikat pada jaringan berbeda. Bobot menentukan satu kumpulan aktivasi; running mean dan running variance yang tersimpan dapat menggambarkan aktivasi dari bobot sebelumnya. Inferensi kemudian menggabungkan state dari dua titik berbeda di ruang parameter. Ketidakcocokan ini mudah terlewat karena statistik berjalan BatchNorm merupakan buffer, bukan parameter yang dioptimalkan, pada banyak implementasi. Prosedur weight averaging dapat menangani semua bobot dengan benar dan tetap menghasilkan state inferensi yang tidak konsisten secara internal.

Kecerdasan Buatan 17 Sep 2026 5 min read

Teacher Forcing Menciptakan Kesenjangan Distribusi Prefix

Model autoregresif memprediksi token berikutnya dari sebuah prefix. Dalam training dengan teacher forcing, prefix tersebut biasanya berasal dari sequence referensi. Saat generasi, prefix berisi token yang dikeluarkan model sendiri. Satu kesalahan prediksi karena itu dapat mengubah konteks yang digunakan untuk seluruh prediksi berikutnya. Perbedaan ini sering disebut exposure bias. Detail engineering yang lebih berguna adalah bahwa training dan generasi dapat menyajikan distribusi prefix yang berbeda kepada predictor kondisional yang sama. Validasi token-level pada prefix referensi yang bersih tidak sepenuhnya menggambarkan perilaku ketika model memasuki prefix yang jarang muncul selama training.

Kecerdasan Buatan 17 Sep 2026 6 min read

Selective Classification Menukar Coverage dengan Tingkat Error

Classifier biasanya mengembalikan label untuk setiap input, bahkan ketika distribusi skornya hampir seimbang atau input berada jauh dari data yang familiar. Selective classification mengubah antarmuka tersebut: sistem dapat mengembalikan prediksi atau abstain. Aturan penerimaan kemudian menentukan berapa banyak input yang menerima prediksi dan seberapa sering prediksi yang diterima itu salah. Ini tidak sama dengan membuat classifier secara intrinsik lebih akurat. Abstention memindahkan sebagian kasus keluar dari himpunan keputusan otomatis. Nilainya bergantung pada kemampuan selection score mengurutkan kasus sulit dengan cukup baik sehingga input yang ditolak memuat porsi error yang lebih besar.

Kecerdasan Buatan 17 Sep 2026 7 min read

Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts

Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih. Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.

Kecerdasan Buatan 17 Sep 2026 6 min read

Prediction Set Konformal Membutuhkan Data Kalibrasi yang Exchangeable

Classifier yang menghasilkan 0.93 untuk satu kelas tidak otomatis memberikan pernyataan statistik bahwa kelas tersebut benar dengan probabilitas 0.93. Conformal prediction mengambil pendekatan berbeda: metode ini menggunakan contoh berlabel yang ditahan untuk membentuk sekumpulan label kandidat dengan target marginal coverage tertentu. Pada split conformal classification, base model dapat tetap tidak berubah. Jaminannya berasal dari peringkat skor conformity atau nonconformity sebuah contoh uji terhadap skor yang dihitung pada sampel kalibrasi yang exchangeable. Asumsi inilah yang menentukan cakupan pernyataan coverage tersebut.

Kecerdasan Buatan 17 Sep 2026 6 min read

Mempertahankan Attention Sink dalam KV Cache Terbatas

KV cache terbatas tampak cocok dengan aturan eviction sederhana: setelah cache penuh, buang pasangan key-value tertua dan pertahankan token terbaru. Pada sebagian transformer decoder-only, aturan ini dapat menurunkan kualitas generasi secara tajam setelah urutan melewati jendela yang dipertahankan. Kegagalan tersebut tidak hanya berasal dari hilangnya konten semantik lama. Token awal dapat menerima attention besar meski teksnya hanya membawa sedikit informasi yang berguna untuk prediksi saat ini. Perilaku ini umum disebut attention sink. Dampaknya penting bagi desain inferensi streaming karena kebijakan cache yang mempertahankan prefix awal kecil ditambah sliding window terbaru dapat berperilaku sangat berbeda dari sliding window murni dengan batas memori yang serupa.

Kecerdasan Buatan 17 Sep 2026 5 min read

Evaluasi Klasifikator Probabilistik dengan Brier Score

Dua klasifikator dapat menghasilkan label prediksi dan akurasi yang sama, tetapi memberikan probabilitas yang sangat berbeda untuk label tersebut. Sistem yang selalu menghasilkan 0.51 untuk keputusan biner yang benar tidak membuat klaim probabilistik yang sama dengan sistem yang menghasilkan 0.99, meskipun akurasi berbasis threshold dapat memperlakukan keduanya secara identik. Brier score mempertahankan perbedaan itu. Metrik ini mengukur squared error antara probabilitas prediksi dan hasil yang benar-benar terjadi, sehingga kelas yang dipilih maupun besar probabilitas untuk setiap hasil ikut memengaruhi skor. Ini berguna ketika komponen downstream memakai probabilitas untuk ranking, threshold, abstention, atau keputusan berbasis expected cost.

Kecerdasan Buatan 17 Sep 2026 5 min read

Batasi Pergeseran Parameter dengan Elastic Weight Consolidation

Fine-tuning neural network pada task baru dapat menggeser parameter dari nilai yang mendukung task sebelumnya. Objective baru tidak memiliki alasan inheren untuk mempertahankan perilaku lama ketika data task sebelumnya tidak ikut dalam update. Elastic weight consolidation, atau EWC, menambahkan constraint di parameter space untuk mengurangi pergeseran tersebut. Constraint ini selektif, bukan seragam. Parameter yang diperkirakan lebih berpengaruh bagi task sebelumnya menerima penalti lebih besar ketika bergerak, sedangkan parameter dengan importance lebih rendah dapat berubah lebih bebas. EWC karena itu bukan sekadar weight decay menuju nol.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Gradient Noise Sebelum Menaikkan Batch Size

Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Anisotropi Embedding Sebelum Vector Search

Cosine similarity mengasumsikan bahwa arah vector membawa daya pembeda yang berguna. Asumsi ini menjadi kurang informatif ketika banyak embedding menempati wilayah ruang yang sempit. Dalam kondisi tersebut, item yang tidak berkaitan dapat berbagi komponen arah yang besar, skor cosine dapat berkumpul dalam rentang sempit, dan perbedaan residual kecil akhirnya menentukan ranking. Pola geometris ini sering disebut anisotropi embedding. Pola tersebut sudah ada sebelum vector index memilih kandidat, sehingga tuning index saja tidak dapat memastikan apakah representasi memiliki pemisahan sudut yang cukup untuk tugas retrieval.