Langsung ke konten

Arsip

Artificial Intelligence

52 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Temperature Scaling Mengkalibrasi Ulang Confidence Classifier Tanpa Mengubah Urutan Kelas

Sebuah classifier dapat menempatkan kelas yang benar di atas semua alternatif, tetapi menghasilkan probabilitas yang secara sistematis terlalu terkonsentrasi atau terlalu menyebar. Temperature scaling menangani ketidakselarasan itu setelah training dengan menerapkan satu skalar pada logit sebelum softmax. Confidence yang dilaporkan berubah tanpa mengubah parameter classifier utama. Batas mekanismenya sempit. Metode ini tidak memperbaiki urutan kelas yang keliru, tidak menambahkan informasi pada representasi, dan tidak membuat setiap probabilitas individual menjadi akurat. Sasaran utamanya adalah hubungan antara confidence dan hasil yang teramati pada data yang representatif terhadap deployment.

Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Target

Generasi autoregresif biasanya menjalankan model target sekali untuk setiap token yang dikeluarkan. Speculative decoding mengubah pola eksekusi itu: model draft yang lebih murah mengusulkan beberapa token, kemudian model target mengevaluasi blok proposal tersebut dalam satu verification pass. Peluang pengurangan latensi berasal dari pekerjaan model target untuk beberapa posisi sekaligus, bukan dari menganggap keluaran draft sebagai hasil final. Token draft hanya berstatus proposal Misalkan model target mendefinisikan distribusi p dan model draft mendefinisikan distribusi q pada suatu posisi. Model draft mengambil kandidat token dari q. Tahap verifikasi kemudian menentukan apakah kandidat tersebut dapat dipertahankan sebagai sampel yang konsisten dengan p.

Kecerdasan Buatan 24 Sep 2026 6 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Sampling Target

Decoding autoregresif biasanya menetapkan satu token setelah setiap evaluasi model target. Menghasilkan K token membentuk rantai dependensi serial: token t+1 belum dapat di-sampling sebelum token t ditetapkan dan menjadi bagian dari prefix. Speculative decoding mengubah jumlah progres yang dapat diperoleh dari satu pemanggilan model target tanpa menghapus dependensi kausal tersebut. Model draft yang lebih murah terlebih dahulu mengusulkan beberapa token lanjutan. Model target kemudian mengevaluasi posisi kandidat itu bersama-sama. Token dengan probabilitas draft yang kompatibel terhadap distribusi target dapat diterima, sedangkan posisi pertama yang ditolak dikoreksi memakai distribusi residual. Sampel akhir tetap mengikuti distribusi model target ketika prosedur acceptance dan koreksi diterapkan sesuai formulasi algoritmanya.

Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Secara Paralel

Generasi autoregresif biasanya menetapkan satu token sebelum langkah model target berikutnya dapat dievaluasi. Speculative decoding mengubah pola eksekusi tersebut. Distribusi proposal yang lebih murah menghasilkan blok kandidat pendek, sementara model target mengevaluasi posisi-posisi kandidat itu bersama-sama. Aturan penerimaan kemudian menentukan seberapa banyak bagian blok yang dapat menjadi output. Mekanisme ini bukan batching biasa. Token di dalam proposal tetap dihasilkan secara autoregresif, dan model target tetap menentukan distribusi output yang dituju ketika algoritma speculative sampling eksak digunakan. Perubahan yang berguna terletak pada verifikasi: satu pass yang mahal dapat mencakup beberapa posisi output jika cukup banyak proposal diterima.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal

Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 4 min read

Rotary Position Embedding Mengubah Indeks Absolut Menjadi Fase Relatif pada Attention

Self-attention dapat membandingkan isi token tanpa memberi urutan pada posisi token. Rotary Position Embedding (RoPE) memasukkan posisi ke dalam perbandingan itu dengan merotasi pasangan koordinat pada query dan key. Setiap token menerima rotasi berdasarkan indeks absolut, tetapi inner product query-key mereduksi kedua sudut absolut tersebut menjadi selisih sudut. Pembatalan secara aljabar ini merupakan mekanisme utama RoPE. Tidak ada vektor posisi yang harus ditambahkan ke hidden state. Posisi mengubah orientasi komponen query dan key sebelum dot product dihitung.

Kecerdasan Buatan 24 Sep 2026 4 min read

RoPE Mengodekan Offset Relatif melalui Fase Query-Key yang Diputar

Rotary Position Embedding (RoPE) menerapkan rotasi berbasis posisi pada koordinat query dan key sebelum dot product attention dihitung. Skor yang dihasilkan membawa posisi relatif melalui selisih fase kedua rotasi tersebut, bukan melalui vektor posisi aditif yang ditempelkan pada representasi token. Perbedaan ini bersifat struktural. RoPE memakai indeks absolut untuk menentukan setiap rotasi, tetapi inner product antara query dan key dapat ditulis sebagai fungsi offset di antara kedua posisi. Pasangan koordinat membawa frekuensi sudut yang berbeda RoPE membagi query atau key berdimensi genap menjadi pasangan koordinat dua dimensi. Untuk satu pasangan, posisi m menerapkan rotasi

Kecerdasan Buatan 24 Sep 2026 5 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menskalakan vektor berdasarkan root mean square tanpa lebih dulu mengurangi nilai rata-rata vektor tersebut. Ketiadaan mean centering ini menjadi perbedaan utama terhadap LayerNorm: keduanya dapat mengendalikan skala vektor, tetapi hanya LayerNorm yang secara eksplisit menggeser koordinat agar rata-rata sampelnya berada di nol. Untuk hidden vector x dengan lebar d, bentuk RMSNorm yang umum adalah: rms = sqrt((1/d) * sum(x_i^2) + epsilon) y_i = gain_i * x_i / rms Posisi epsilon, presisi numerik saat reduksi, dan keberadaan affine term tambahan dapat berbeda antar-implementasi. Struktur utamanya tetap berupa pembagian dengan statistik RMS, bukan standard deviation yang dihitung setelah mean dikurangi.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama

Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru. Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix Caching Menggunakan Ulang State KV untuk Prefix Token Identik

Serving autoregresif sering menerima request yang dimulai dengan urutan token panjang yang sama. System prompt, tool schema, header dokumen tetap, atau konteks berulang lain dapat membuat model menghitung state attention untuk prefix yang sama berkali-kali. Prefix caching menargetkan pekerjaan prefill yang berulang itu dengan mempertahankan state key-value yang kompatibel dan menghubungkan request berikutnya ke state tersebut. Batas penggunaan ulang adalah state token yang identik, bukan kemiripan semantik. Dua prompt yang menyampaikan maksud serupa tetapi menghasilkan token berbeda tidak memiliki entry prefix cache yang dapat dipertukarkan.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prediksi Multi-Token Menambahkan Loss Token Masa Depan Paralel pada Trunk Model Bersama

Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi t: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token x_(t+1). Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut. Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.

Kecerdasan Buatan 24 Sep 2026 5 min read

PagedAttention Memisahkan Urutan KV Logis dari Blok Cache Fisik

Serving autoregresif menyimpan state key-value yang terus bertambah untuk setiap sequence aktif. Jika seluruh state itu harus berada pada satu area fisik kontigu yang disiapkan untuk sebuah request, alokasi ikut terikat pada panjang sequence yang belum pasti. Reservasi terlalu besar membuang kapasitas, sedangkan memperbesar atau memindahkan area yang terus tumbuh menambah persoalan manajemen memori. PagedAttention mengubah batas alokasi tersebut. Sequence direpresentasikan sebagai blok KV logis, sementara blok fisiknya dapat berada di lokasi cache pool yang tidak bersebelahan.

Kecerdasan Buatan 24 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Sequence yang Terpilih

Beam search dapat memilih sequence pendek walaupun continuation yang lebih panjang berisi token-token yang secara lokal masuk akal. Efek ini berasal dari aturan skornya: log-probability token biasanya diakumulasi sepanjang sequence, dan setiap token tambahan menyumbangkan satu nilai non-positif lagi. Normalisasi panjang mengubah tekanan ranking tersebut, tetapi tidak mengubah probabilitas model yang menghasilkan token. Pemisahan itu penting pada sistem generasi. Skor decoding adalah objektif saat inferensi untuk membandingkan hipotesis. Skor tersebut tidak otomatis menjadi probabilitas terkalibrasi untuk output yang sudah selesai, dan mengubahnya dapat mengganti sequence terpilih tanpa mengubah parameter model.

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 24 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target ke Seluruh Kelas

Classifier yang dilatih dengan target one-hot menempatkan seluruh massa probabilitas target pada satu kelas. Label smoothing mengubah target tersebut sebelum cross-entropy dihitung: sebagian massa dipindahkan dari kelas yang ditetapkan lalu diberikan kepada kelas lain. Arsitektur network dapat tetap sama, tetapi objective optimisasinya sudah berbeda. Perbedaan ini relevan saat menafsirkan confidence, nilai loss, dan konfigurasi implementasi. Label smoothing bukan operasi post-processing pada probabilitas prediksi. Mekanisme ini mengubah distribusi target yang menghasilkan sinyal training.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert MoE Membatasi Routing Token

Layer Mixture-of-Experts yang sparse dapat memiliki banyak jaringan expert sambil hanya mengaktifkan sebagian kecil untuk setiap token. Conditional computation ini bergantung pada router, tetapi skor router saja tidak menentukan graph yang benar-benar dieksekusi. Pada implementasi dengan batch expert terbatas, setiap expert juga memiliki jumlah slot token yang terbatas. Kondisi ini menambahkan batas kedua setelah pemilihan expert: sebuah token dapat memilih expert yang sudah tidak memiliki kapasitas. Penanganan overflow tersebut merupakan keputusan implementasi dan arsitektur yang berdampak langsung pada training dan serving.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow

Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert. Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.

Kecerdasan Buatan 24 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Indeks Sebelum Rotasi

Rotary position embeddings menerapkan rotasi yang bergantung pada posisi ke komponen query dan key sebelum dot product dihitung. Jika model dilatih dengan posisi sampai panjang acuan tertentu, memasukkan indeks yang jauh lebih besar langsung ke aturan rotasi yang sama dapat membawa attention ke rentang sudut yang tidak tercakup oleh rentang posisi saat training. Interpolasi posisi mengubah koordinat yang diberikan kepada RoPE. Untuk faktor ekstensi s > 1, bentuk sederhananya memetakan

Kecerdasan Buatan 24 Sep 2026 6 min read

Grouped-Query Attention Mengecilkan KV Cache dengan Berbagi Head Key-Value

Grouped-query attention mengubah jumlah key dan value head yang harus disimpan selama decoding autoregresif. Setiap query head tidak lagi selalu memiliki pasangan key-value sendiri. Beberapa query head memakai key-value head yang sama. Sisi query tetap dapat memiliki banyak head, sedangkan state KV persisten menggunakan lebih sedikit proyeksi independen. Perubahan ini berada pada arsitektur attention, bukan codec kompresi cache. Cache menjadi lebih kecil karena model memang menghasilkan lebih sedikit key dan value head yang berbeda untuk setiap token.

Kecerdasan Buatan 24 Sep 2026 4 min read

Global Gradient Norm Clipping Menskalakan Ulang Gradient Parameter dengan Satu Faktor Bersama

Global gradient norm clipping memperlakukan gradient parameter saat ini sebagai satu vektor agregat. Jika norm-nya melampaui ambang, setiap gradient yang terlibat dikalikan dengan koefisien yang sama. Operasi ini mengubah besar update sambil mempertahankan arah vektor gradient agregat, selain perbedaan yang dapat muncul akibat presisi numerik terbatas. Satu norm mengendalikan seluruh kumpulan gradient Misalkan gradient parameter adalah g_1, g_2, ... g_m. Untuk p-norm, global clipping terlebih dahulu menghitung norm yang ekuivalen dengan hasil konkatenasi seluruh gradient:

Kecerdasan Buatan 24 Sep 2026 5 min read

FlashAttention Menghitung Softmax Eksak per Tile Tanpa Menyimpan Matriks Skor Penuh

Scaled dot-product attention standar membentuk matriks skor dengan dua sumbu panjang yang sama-sama mengikuti posisi sequence. Untuk satu attention head, S = QK^T / sqrt(d) P = softmax(S) O = PV definisi matematisnya ringkas, tetapi implementasi GPU langsung dapat menulis intermediate besar S dan P ke high-bandwidth memory lalu membacanya kembali. FlashAttention mengubah aliran data tersebut. Query, key, dan value diproses dalam blok di memori on-chip, sementara state softmax per baris dibawa dari satu tile ke tile berikutnya agar seluruh tile skor tetap dapat digabungkan secara eksak.