Langsung ke konten

Topic archive

Kecerdasan Buatan

Kecerdasan buatan mencakup machine learning, deep learning, dan sistem yang menerapkan model untuk menyelesaikan berbagai tugas praktis.

147 articles
Kecerdasan Buatan 24 Sep 2026 5 min read

Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi

Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention. Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengurangi Byte Cache dengan Biaya Akurasi dan Kernel yang Terpisah

Decoding autoregresif mempertahankan tensor key dan value dari token sebelumnya, sehingga memori KV cache bertambah bersama konteks yang disimpan. Kuantisasi tensor tersebut mengubah komponen langsung pada footprint memori: setiap elemen cache disimpan dengan bit lebih sedikit. Kapasitas tambahan itu memiliki biaya berupa error representasi serta kebutuhan skema scaling, storage, dan kernel yang sesuai. Presisi cache terpisah dari presisi weight Model weights dan state KV memiliki lifetime berbeda. Weights tetap tersedia lintas request, sedangkan tensor KV dibuat dari setiap request dan bertambah saat sequence berjalan. Format numerik weights dan cache karena itu dapat dipilih secara terpisah.

Kecerdasan Buatan 24 Sep 2026 4 min read

Kuantisasi KV Cache Mengganggu Attention melalui Key dan Value Tersimpan

Saat inference autoregresif, key dan value yang sudah dihitung digunakan kembali dari KV cache sehingga tidak perlu dihitung ulang untuk setiap token baru. Kuantisasi pada cache tersebut mengubah lebih dari sekadar representasi byte. Aproksimasi yang tersimpan menjadi input bagi operasi attention berikutnya, sehingga error-nya dapat mengubah attention score sekaligus vektor yang digabungkan oleh score tersebut. Batas ini berbeda dari kuantisasi weight model. Tensor weight dipakai kembali lintas request, sedangkan state KV dibentuk dari sequence yang sedang diproses dan bertambah mengikuti panjang cache. Rentang numeriknya juga dapat berbeda antar-layer, head, posisi, dan request.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert MoE Membatasi Routing Token

Layer Mixture-of-Experts yang sparse dapat memiliki banyak jaringan expert sambil hanya mengaktifkan sebagian kecil untuk setiap token. Conditional computation ini bergantung pada router, tetapi skor router saja tidak menentukan graph yang benar-benar dieksekusi. Pada implementasi dengan batch expert terbatas, setiap expert juga memiliki jumlah slot token yang terbatas. Kondisi ini menambahkan batas kedua setelah pemilihan expert: sebuah token dapat memilih expert yang sudah tidak memiliki kapasitas. Penanganan overflow tersebut merupakan keputusan implementasi dan arsitektur yang berdampak langsung pada training dan serving.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow

Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert. Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.

Kecerdasan Buatan 24 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Indeks Sebelum Rotasi

Rotary position embeddings menerapkan rotasi yang bergantung pada posisi ke komponen query dan key sebelum dot product dihitung. Jika model dilatih dengan posisi sampai panjang acuan tertentu, memasukkan indeks yang jauh lebih besar langsung ke aturan rotasi yang sama dapat membawa attention ke rentang sudut yang tidak tercakup oleh rentang posisi saat training. Interpolasi posisi mengubah koordinat yang diberikan kepada RoPE. Untuk faktor ekstensi s > 1, bentuk sederhananya memetakan

Kecerdasan Buatan 24 Sep 2026 6 min read

Grouped-Query Attention Mengecilkan KV Cache dengan Berbagi Head Key-Value

Grouped-query attention mengubah jumlah key dan value head yang harus disimpan selama decoding autoregresif. Setiap query head tidak lagi selalu memiliki pasangan key-value sendiri. Beberapa query head memakai key-value head yang sama. Sisi query tetap dapat memiliki banyak head, sedangkan state KV persisten menggunakan lebih sedikit proyeksi independen. Perubahan ini berada pada arsitektur attention, bukan codec kompresi cache. Cache menjadi lebih kecil karena model memang menghasilkan lebih sedikit key dan value head yang berbeda untuk setiap token.

Kecerdasan Buatan 24 Sep 2026 5 min read

Grouped-Query Attention Membagi Head Key-Value di Antara Grup Query

Multi-head attention tidak mengharuskan setiap head query memiliki head key dan head value yang berbeda. Grouped-query attention, atau GQA, membagi head query ke dalam beberapa grup dan memberikan satu head key-value untuk setiap grup. Proyeksi query tetap terpisah, tetapi beberapa head query membaca key dan value hasil proyeksi yang sama. Perbedaan ini mengubah bentuk parameter dan state yang disimpan di cache tanpa menyatukan head query menjadi satu komputasi attention. Setiap head query tetap menghasilkan skor attention sendiri karena vektor query-nya berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Global Gradient Norm Clipping Menskalakan Ulang Gradient Parameter dengan Satu Faktor Bersama

Global gradient norm clipping memperlakukan gradient parameter saat ini sebagai satu vektor agregat. Jika norm-nya melampaui ambang, setiap gradient yang terlibat dikalikan dengan koefisien yang sama. Operasi ini mengubah besar update sambil mempertahankan arah vektor gradient agregat, selain perbedaan yang dapat muncul akibat presisi numerik terbatas. Satu norm mengendalikan seluruh kumpulan gradient Misalkan gradient parameter adalah g_1, g_2, ... g_m. Untuk p-norm, global clipping terlebih dahulu menghitung norm yang ekuivalen dengan hasil konkatenasi seluruh gradient:

Kecerdasan Buatan 24 Sep 2026 5 min read

FlashAttention Menghitung Softmax Eksak per Tile Tanpa Menyimpan Matriks Skor Penuh

Scaled dot-product attention standar membentuk matriks skor dengan dua sumbu panjang yang sama-sama mengikuti posisi sequence. Untuk satu attention head, S = QK^T / sqrt(d) P = softmax(S) O = PV definisi matematisnya ringkas, tetapi implementasi GPU langsung dapat menulis intermediate besar S dan P ke high-bandwidth memory lalu membacanya kembali. FlashAttention mengubah aliran data tersebut. Query, key, dan value diproses dalam blok di memori on-chip, sementara state softmax per baris dibawa dari satu tile ke tile berikutnya agar seluruh tile skor tetap dapat digabungkan secara eksak.

Kecerdasan Buatan 24 Sep 2026 5 min read

Expert Parallelism Mengubah Routing MoE Menjadi Komunikasi All-to-All

Layer Mixture-of-Experts yang aktif secara sparse dapat menyimpan banyak parameter expert sambil mengirim setiap token hanya ke sebagian kecil expert. Ketika expert tersebut dipartisi ke beberapa perangkat, aktivasi sparse tidak berarti eksekusinya tetap lokal. Token yang memilih expert remote harus berpindah ke perangkat pemilik expert, lalu output expert harus kembali ke perangkat yang melanjutkan komputasi model. Perpindahan ini merupakan biaya sistem utama expert parallelism. Router membuat pilihan logis, sedangkan runtime terdistribusi harus mengubah pilihan itu menjadi komunikasi, batch expert lokal, komputasi expert, dan pertukaran balik.

Kecerdasan Buatan 24 Sep 2026 5 min read

Contrastive Search Memberi Penalti pada Repetisi Hidden State Saat Decoding

Generasi autoregresif menghasilkan distribusi token berikutnya, tetapi decoder tetap harus menentukan kandidat yang akan ditambahkan. Contrastive search mengubah keputusan tersebut dengan menggabungkan probabilitas model dan penalti untuk kandidat yang menghasilkan hidden state terlalu mirip dengan hidden state yang sudah ada pada prefix. Mekanisme ini bekerja saat inference. Parameter model dan distribusi next-token tidak diubah. Perubahan terjadi pada ranking yang dipakai untuk memilih token dari sekumpulan kandidat terbatas. Pemilihan kandidat dimulai dari probabilitas model Pada langkah decoding t, model menghasilkan distribusi kondisional

Kecerdasan Buatan 24 Sep 2026 5 min read

Continuous Batching Mengganti Kelompok Request Statis dengan Scheduling per Iterasi

Generasi autoregresif tidak menyelesaikan setiap request pada iterasi yang sama. Satu sequence dapat menghasilkan stop token setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah berikutnya. Batch statis mengikat request tersebut sampai batas batch tercapai. Continuous batching memutus ikatan itu dengan mengizinkan himpunan aktif berubah di antara iterasi model. Perubahan utamanya berada pada granularitas scheduling. Request tidak lagi menjadi unit scheduling yang tidak dapat dipecah selama seluruh proses generasi. Sistem serving dapat membentuk batch eksekusi untuk satu iterasi, memperbarui state request setelah iterasi tersebut, mengeluarkan sequence yang selesai, lalu memasukkan pekerjaan antrean sebelum langkah eksekusi berikutnya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Codebook Collapse Membuat Entri Vector Quantizer Tidak Terpakai

Sebuah vector quantizer dapat menyediakan ribuan entri codebook tetapi berulang kali memilih hanya sebagian kecil di antaranya. Ukuran vocabulary yang dikonfigurasi kemudian melebih-lebihkan kapasitas diskret yang benar-benar dipakai. Kondisi ini sering disebut codebook collapse: beberapa entri menerima banyak assignment, sedangkan entri lain menjadi tidak aktif atau hampir tidak aktif. Masalah tersebut bukan sekadar kekurangan parameter. Penyebabnya berada pada interaksi antara output encoder, aturan assignment, dan prosedur pembaruan vektor kode. Setelah assignment terkonsentrasi pada sebagian entri, entri yang tidak terpakai dapat menerima sangat sedikit sinyal, atau tidak menerima sinyal sama sekali, untuk bergerak menuju wilayah yang ditempati output encoder.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menyerap Massa Probabilitas Tanpa Membawa Konten yang Sesuai

Sebuah head pada causal attention dapat memberi massa probabilitas yang cukup besar ke token awal meski token tersebut bukan pasangan semantik yang kuat bagi query saat ini. Posisi itu kemudian bertindak sebagai attention sink: key miliknya menjadi tujuan yang tersedia bagi probabilitas yang tidak diarahkan head ke posisi pembawa konten. Perilaku ini relevan pada serving autoregresif karena kebijakan KV cache dapat mempertahankan token terbaru tetapi tetap mengubah perilaku model secara tajam jika posisi sink dibuang. Recency saja tidak menjelaskan fungsi setiap key yang tersimpan di cache.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Streaming KV Cache Berjendela

Decoder dapat membatasi ukuran KV cache dengan membuang state yang keluar dari jendela token terbaru. Batas memori ini berguna, tetapi eviction sederhana dapat menurunkan kualitas generasi secara tajam meski token yang dibuang tidak tampak membawa informasi semantik penting. Sedikit state key-value dari awal urutan dapat mengubah perilaku tersebut. Efek ini berkaitan dengan attention sink: posisi awal yang menerima massa attention besar walaupun isi tokennya tidak penting bagi prediksi saat ini. StreamingLLM melaporkan bahwa mempertahankan state awal tersebut bersama jendela bergulir berisi state terbaru dapat memulihkan perilaku model bahasa yang stabil ketika eviction berjendela biasa gagal mempertahankannya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Eviction Cache untuk Streaming

KV cache dengan kapasitas tetap dapat mencegah memori inferensi terus bertambah pada aliran token yang panjang. Namun, membuang semua token lama secara ketat berdasarkan urutan kedatangan dapat mengganggu attention lebih besar daripada sekadar hilangnya isi token tersebut. Pada sebagian transformer autoregresif, posisi awal menerima bobot attention yang berarti walaupun semantik tokennya tidak berkaitan langsung dengan prediksi saat ini. Posisi seperti ini disebut attention sink. Konsekuensi pada serving cukup spesifik: sliding cache yang mempertahankan prefix awal kecil bersama token terbaru dapat berperilaku berbeda dari cache berukuran sama yang hanya berisi token paling baru. Mekanisme ini berkaitan dengan state attention dan pengelolaan posisi, bukan pemulihan teks lama yang sudah dibuang.

Kecerdasan Buatan 24 Sep 2026 4 min read

Anisotropi Embedding Memampatkan Rentang Cosine Similarity

Dua kandidat embedding dapat memiliki kecocokan semantik yang berbeda tetapi memperoleh skor cosine dalam interval yang sempit. Implementasi fungsi similarity belum tentu bermasalah. Pemampatan tersebut dapat berasal dari geometri ruang embedding: vektor cenderung menempati arah tertentu alih-alih tersebar merata pada dimensi yang tersedia. Konsentrasi arah ini umum disebut anisotropi. Anisotropi berpengaruh pada retrieval karena cosine similarity mengukur alignment sudut. Ketika banyak vektor memiliki komponen bersama yang cukup besar, pasangan yang tidak berkaitan dapat memiliki baseline alignment yang lebih tinggi. Pasangan relevan masih dapat memperoleh skor lebih tinggi, tetapi jarak skor yang tersedia antara kandidat relevan dan tidak relevan dapat menyempit.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Penalti Jarak Langsung ke Logit Attention

Attention with Linear Biases (ALiBi) mengubah skor causal attention sebelum softmax dengan menambahkan penalti yang membesar seiring jarak antartoken. Posisi masuk melalui jalur skor, bukan melalui vektor posisi yang ditambahkan ke representasi setiap token. Untuk query pada posisi i yang mengakses key pada posisi j, satu head dapat ditulis secara skematis sebagai: score(i, j) = q_i · k_j / sqrt(d_k) - m_h * (i - j) untuk posisi kausal j <= i. Slope positif m_h bersifat spesifik untuk attention head h. Causal mask tetap mencegah akses ke posisi masa depan; komponen linear hanya mengubah preferensi relatif di antara posisi yang masih terlihat.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Bias Proporsional Jarak pada Skor Attention

ALiBi mengubah skor attention sebelum softmax, bukan menambahkan vektor posisi ke representasi token. Pada transformer kausal, key yang berada semakin jauh di belakang query menerima offset negatif yang semakin besar. Offset tersebut linear terhadap jarak token dan memakai slope yang terkait dengan attention head. Bentuk sederhana untuk skor head h dapat ditulis sebagai: score_h(i, j) = q_i k_j^T / sqrt(d) - m_h * (i - j) untuk pasangan kausal yang diizinkan dengan j <= i dan slope positif m_h. Causal mask tetap menentukan posisi masa depan yang tidak dapat diakses. ALiBi mengubah skor relatif di antara posisi yang masih diizinkan.

Kecerdasan Buatan 24 Sep 2026 5 min read

Activation Outlier Mendistorsi Skala Kuantisasi Low-Bit

Sebuah tensor dapat direpresentasikan dengan baik dalam floating point tetapi sulit dipetakan ke rentang integer yang kecil. Masalah ini terasa ketika sebagian besar nilai aktivasi berada dalam interval sempit, sementara sedikit nilai memiliki magnitudo jauh lebih besar. Skala kuantisasi bersama harus mencakup nilai ekstrem tersebut, sehingga nilai biasa hanya mendapat sebagian kecil level representasi yang tersedia. Itulah dampak praktis activation outlier pada inference low-bit. Masalahnya bukan sekadar sebuah outlier memiliki nilai numerik besar. Lokasi, persistensi, dan hubungannya dengan sumbu tempat skala digunakan bersama menentukan apakah outlier tersebut benar-benar merusak representasi hasil kuantisasi.

Kecerdasan Buatan 24 Sep 2026 4 min read

Activation Checkpointing Menukar Aktivasi Tersimpan dengan Rekomputasi

Activation checkpointing mengubah tensor forward pass yang tetap berada di memori sampai backpropagation. Alih-alih menyimpan setiap aktivasi intermediate yang diperlukan untuk perhitungan gradien, region yang memakai checkpoint mempertahankan state pada boundary tertentu dan membentuk kembali intermediate yang dibuang ketika backward pass mencapai region tersebut. Mekanisme ini mengurangi memori aktivasi dengan biaya komputasi tambahan. Parameter model, state optimizer, dan gradien tidak ikut mengecil, sehingga dampaknya terhadap total memori training bergantung pada porsi footprint yang berasal dari aktivasi.

Kecerdasan Buatan 23 Sep 2026 4 min read

Temperature Scaling Mengubah Sampling Tanpa Mengubah Urutan Logit

Temperature sering tersedia sebagai satu parameter generasi, tetapi efeknya lebih sempit daripada kendali umum atas kualitas output. Untuk sebuah vektor logit finite yang tetap, temperature positif mengubah skala selisih sebelum softmax. Probabilitas hasilnya berubah tanpa mengubah relasi logit mana yang lebih besar. Perbedaan ini relevan ketika serving layer menggabungkan temperature dengan greedy selection, top-k filtering, top-p filtering, penalty, atau penanganan khusus untuk temperature nol. Nilai numerik yang sama dapat berada dalam pipeline decoding yang berbeda meski operasi scaling dasarnya sederhana.

Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.