Langsung ke konten

Topic archive

Kecerdasan Buatan

Kecerdasan buatan mencakup machine learning, deep learning, dan sistem yang menerapkan model untuk menyelesaikan berbagai tugas praktis.

147 articles
Kecerdasan Buatan 24 Sep 2026 5 min read

Temperature Scaling Mengkalibrasi Ulang Confidence Classifier Tanpa Mengubah Urutan Kelas

Sebuah classifier dapat menempatkan kelas yang benar di atas semua alternatif, tetapi menghasilkan probabilitas yang secara sistematis terlalu terkonsentrasi atau terlalu menyebar. Temperature scaling menangani ketidakselarasan itu setelah training dengan menerapkan satu skalar pada logit sebelum softmax. Confidence yang dilaporkan berubah tanpa mengubah parameter classifier utama. Batas mekanismenya sempit. Metode ini tidak memperbaiki urutan kelas yang keliru, tidak menambahkan informasi pada representasi, dan tidak membuat setiap probabilitas individual menjadi akurat. Sasaran utamanya adalah hubungan antara confidence dan hasil yang teramati pada data yang representatif terhadap deployment.

Kecerdasan Buatan 24 Sep 2026 5 min read

Tanh Logit Soft Capping Membatasi Skor Ekstrem Sebelum Softmax

Softmax dapat menerima logit dengan magnitudo hingga berapa pun selama nilainya finite, tetapi selisih skor yang besar membuat keluarannya semakin terkonsentrasi. Tanh logit soft capping menyisipkan transformasi nonlinear terbatas sebelum softmax sehingga logit hasil transformasi tidak melewati magnitudo yang ditentukan. Untuk cap positif c, bentuk yang umum adalah: softcap(z; c) = c * tanh(z / c) Operasi ini bukan hard clipping pada ambang tertentu. Di sekitar nol perilakunya hampir linear, lalu magnitudo yang lebih besar dikompresi secara bertahap saat mendekati -c atau c.

Kecerdasan Buatan 24 Sep 2026 5 min read

SwiGLU Mengendalikan Kanal Feed-Forward Transformer dengan Proyeksi Kedua

SwiGLU membagi input feed-forward transformer ke dua jalur proyeksi, menerapkan SiLU pada satu jalur, lalu mengalikan kedua hasil secara elemen per elemen. Proyeksi kedua bukan statistik tambahan: nilainya langsung mengendalikan jalur yang sudah diaktivasi sebelum proyeksi output. Untuk hidden state x, bentuk struktural yang umum adalah: g = SiLU(x W_gate) u = x W_up h = g * u y = h W_down Bias, orientasi proyeksi, lebar intermediate, dan nama parameter dapat berbeda antar arsitektur. Batas yang mendefinisikan operasi ini adalah perkalian elemen per elemen antara cabang proyeksi nonlinear dan cabang proyeksi lainnya.

Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Target

Generasi autoregresif biasanya menjalankan model target sekali untuk setiap token yang dikeluarkan. Speculative decoding mengubah pola eksekusi itu: model draft yang lebih murah mengusulkan beberapa token, kemudian model target mengevaluasi blok proposal tersebut dalam satu verification pass. Peluang pengurangan latensi berasal dari pekerjaan model target untuk beberapa posisi sekaligus, bukan dari menganggap keluaran draft sebagai hasil final. Token draft hanya berstatus proposal Misalkan model target mendefinisikan distribusi p dan model draft mendefinisikan distribusi q pada suatu posisi. Model draft mengambil kandidat token dari q. Tahap verifikasi kemudian menentukan apakah kandidat tersebut dapat dipertahankan sebagai sampel yang konsisten dengan p.

Kecerdasan Buatan 24 Sep 2026 6 min read

Speculative Decoding Memverifikasi Token Draft Tanpa Mengubah Distribusi Sampling Target

Decoding autoregresif biasanya menetapkan satu token setelah setiap evaluasi model target. Menghasilkan K token membentuk rantai dependensi serial: token t+1 belum dapat di-sampling sebelum token t ditetapkan dan menjadi bagian dari prefix. Speculative decoding mengubah jumlah progres yang dapat diperoleh dari satu pemanggilan model target tanpa menghapus dependensi kausal tersebut. Model draft yang lebih murah terlebih dahulu mengusulkan beberapa token lanjutan. Model target kemudian mengevaluasi posisi kandidat itu bersama-sama. Token dengan probabilitas draft yang kompatibel terhadap distribusi target dapat diterima, sedangkan posisi pertama yang ditolak dikoreksi memakai distribusi residual. Sampel akhir tetap mengikuti distribusi model target ketika prosedur acceptance dan koreksi diterapkan sesuai formulasi algoritmanya.

Kecerdasan Buatan 24 Sep 2026 4 min read

Speculative Decoding Memverifikasi Token Draft Secara Paralel

Generasi autoregresif biasanya menetapkan satu token sebelum langkah model target berikutnya dapat dievaluasi. Speculative decoding mengubah pola eksekusi tersebut. Distribusi proposal yang lebih murah menghasilkan blok kandidat pendek, sementara model target mengevaluasi posisi-posisi kandidat itu bersama-sama. Aturan penerimaan kemudian menentukan seberapa banyak bagian blok yang dapat menjadi output. Mekanisme ini bukan batching biasa. Token di dalam proposal tetap dihasilkan secara autoregresif, dan model target tetap menentukan distribusi output yang dituju ketika algoritma speculative sampling eksak digunakan. Perubahan yang berguna terletak pada verifikasi: satu pass yang mahal dapat mencakup beberapa posisi output jika cukup banyak proposal diterima.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal

Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sequence Packing Memerlukan Attention Mask yang Sadar Batas

Sequence packing mengurangi padding dengan menempatkan beberapa contoh berpanjang variabel ke dalam satu buffer token. Layout penyimpanannya dapat terlihat seperti satu sequence panjang, tetapi setiap contoh tetap independen secara semantik. Causal mask standar tidak menjaga independensi tersebut dengan sendirinya. Pada Transformer decoder-only, causal masking mencegah attention menuju posisi masa depan. Mekanisme ini biasanya tidak mencegah attention menuju posisi sebelumnya yang berasal dari contoh lain dalam buffer yang sama. Jika batas diabaikan, token pada contoh berikutnya dapat mengakses key dan value dari contoh sebelumnya. Model akhirnya menerima konteks yang semestinya dipisahkan oleh data pipeline.

Kecerdasan Buatan 24 Sep 2026 5 min read

Scheduling per Iterasi Membentuk Ulang Batch LLM di Antara Langkah Decode

Serving autoregresif tidak membuat semua request selesai pada titik yang sama. Sebuah sequence dapat menghasilkan token akhir setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah. Jika engine mempertahankan batch request awal sampai seluruh anggotanya selesai, sequence yang sudah berakhir meninggalkan kapasitas eksekusi yang tidak terisi di belakang sequence yang lebih panjang. Scheduling per iterasi memindahkan batas keputusan ke bagian yang lebih kecil. Request tidak lagi menjadi satu-satunya unit scheduling yang tidak dapat dipecah. Setelah satu iterasi model, kontrol kembali ke scheduler. Sequence yang selesai dapat keluar, pekerjaan yang menunggu dapat masuk, dan iterasi berikutnya dapat memakai kumpulan sequence aktif yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

Rotary Position Embedding Mengubah Indeks Absolut Menjadi Fase Relatif pada Attention

Self-attention dapat membandingkan isi token tanpa memberi urutan pada posisi token. Rotary Position Embedding (RoPE) memasukkan posisi ke dalam perbandingan itu dengan merotasi pasangan koordinat pada query dan key. Setiap token menerima rotasi berdasarkan indeks absolut, tetapi inner product query-key mereduksi kedua sudut absolut tersebut menjadi selisih sudut. Pembatalan secara aljabar ini merupakan mekanisme utama RoPE. Tidak ada vektor posisi yang harus ditambahkan ke hidden state. Posisi mengubah orientasi komponen query dan key sebelum dot product dihitung.

Kecerdasan Buatan 24 Sep 2026 4 min read

RoPE Mengodekan Offset Relatif melalui Fase Query-Key yang Diputar

Rotary Position Embedding (RoPE) menerapkan rotasi berbasis posisi pada koordinat query dan key sebelum dot product attention dihitung. Skor yang dihasilkan membawa posisi relatif melalui selisih fase kedua rotasi tersebut, bukan melalui vektor posisi aditif yang ditempelkan pada representasi token. Perbedaan ini bersifat struktural. RoPE memakai indeks absolut untuk menentukan setiap rotasi, tetapi inner product antara query dan key dapat ditulis sebagai fungsi offset di antara kedua posisi. Pasangan koordinat membawa frekuensi sudut yang berbeda RoPE membagi query atau key berdimensi genap menjadi pasangan koordinat dua dimensi. Untuk satu pasangan, posisi m menerapkan rotasi

Kecerdasan Buatan 24 Sep 2026 4 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menormalisasi vektor hidden state tanpa mengurangi mean koordinatnya. Satu perbedaan ini memisahkannya dari LayerNorm pada antarmuka matematis: RMSNorm mengendalikan skala melalui statistik root mean square, sedangkan offset yang sama pada seluruh koordinat tetap menjadi bagian dari representasi yang ditransformasikan. Untuk vektor x dengan lebar D, salah satu bentuk umum RMSNorm adalah: rms(x) = sqrt(mean(x_i^2) + eps) y_i = g_i * x_i / rms(x) Di sini g_i adalah skala per koordinat yang dapat dilatih dan eps adalah nilai positif kecil yang ditentukan implementasi model. Parameterisasi dan detail numerik yang tepat merupakan bagian dari kontrak checkpoint dan runtime.

Kecerdasan Buatan 24 Sep 2026 5 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menskalakan vektor berdasarkan root mean square tanpa lebih dulu mengurangi nilai rata-rata vektor tersebut. Ketiadaan mean centering ini menjadi perbedaan utama terhadap LayerNorm: keduanya dapat mengendalikan skala vektor, tetapi hanya LayerNorm yang secara eksplisit menggeser koordinat agar rata-rata sampelnya berada di nol. Untuk hidden vector x dengan lebar d, bentuk RMSNorm yang umum adalah: rms = sqrt((1/d) * sum(x_i^2) + epsilon) y_i = gain_i * x_i / rms Posisi epsilon, presisi numerik saat reduksi, dan keberadaan affine term tambahan dapat berbeda antar-implementasi. Struktur utamanya tetap berupa pembagian dengan statistik RMS, bukan standard deviation yang dihitung setelah mean dikurangi.

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama

Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru. Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix Caching Menggunakan Ulang State KV untuk Prefix Token Identik

Serving autoregresif sering menerima request yang dimulai dengan urutan token panjang yang sama. System prompt, tool schema, header dokumen tetap, atau konteks berulang lain dapat membuat model menghitung state attention untuk prefix yang sama berkali-kali. Prefix caching menargetkan pekerjaan prefill yang berulang itu dengan mempertahankan state key-value yang kompatibel dan menghubungkan request berikutnya ke state tersebut. Batas penggunaan ulang adalah state token yang identik, bukan kemiripan semantik. Dua prompt yang menyampaikan maksud serupa tetapi menghasilkan token berbeda tidak memiliki entry prefix cache yang dapat dipertukarkan.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prediksi Multi-Token Menambahkan Loss Token Masa Depan Paralel pada Trunk Model Bersama

Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi t: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token x_(t+1). Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut. Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.

Kecerdasan Buatan 24 Sep 2026 5 min read

Position Interpolation Memampatkan Indeks RoPE ke Rentang Konteks Asli

Transformer berbasis RoPE mengaitkan posisi token dengan rotasi yang sudutnya bergantung pada indeks posisi dan frekuensi per dimensi. Saat sequence melewati rentang konteks yang dipakai dalam pelatihan, rotasi tersebut memakai indeks posisi di luar rezim yang pernah dihadapi model. Position Interpolation mengubah batas itu dengan menskalakan indeks yang diperpanjang kembali ke rentang asli sebelum transformasi rotary diterapkan. Untuk batas konteks asli L dan target konteks L' > L, pemetaan linear yang disederhanakan adalah:

Kecerdasan Buatan 24 Sep 2026 5 min read

PagedAttention Memisahkan Urutan KV Logis dari Blok Cache Fisik

Serving autoregresif menyimpan state key-value yang terus bertambah untuk setiap sequence aktif. Jika seluruh state itu harus berada pada satu area fisik kontigu yang disiapkan untuk sebuah request, alokasi ikut terikat pada panjang sequence yang belum pasti. Reservasi terlalu besar membuang kapasitas, sedangkan memperbesar atau memindahkan area yang terus tumbuh menambah persoalan manajemen memori. PagedAttention mengubah batas alokasi tersebut. Sequence direpresentasikan sebagai blok KV logis, sementara blok fisiknya dapat berada di lokasi cache pool yang tidak bersebelahan.

Kecerdasan Buatan 24 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Sequence yang Terpilih

Beam search dapat memilih sequence pendek walaupun continuation yang lebih panjang berisi token-token yang secara lokal masuk akal. Efek ini berasal dari aturan skornya: log-probability token biasanya diakumulasi sepanjang sequence, dan setiap token tambahan menyumbangkan satu nilai non-positif lagi. Normalisasi panjang mengubah tekanan ranking tersebut, tetapi tidak mengubah probabilitas model yang menghasilkan token. Pemisahan itu penting pada sistem generasi. Skor decoding adalah objektif saat inferensi untuk membandingkan hipotesis. Skor tersebut tidak otomatis menjadi probabilitas terkalibrasi untuk output yang sudah selesai, dan mengubahnya dapat mengganti sequence terpilih tanpa mengubah parameter model.

Kecerdasan Buatan 24 Sep 2026 4 min read

Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head

Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi. Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.

Kecerdasan Buatan 24 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target ke Seluruh Kelas

Classifier yang dilatih dengan target one-hot menempatkan seluruh massa probabilitas target pada satu kelas. Label smoothing mengubah target tersebut sebelum cross-entropy dihitung: sebagian massa dipindahkan dari kelas yang ditetapkan lalu diberikan kepada kelas lain. Arsitektur network dapat tetap sama, tetapi objective optimisasinya sudah berbeda. Perbedaan ini relevan saat menafsirkan confidence, nilai loss, dan konfigurasi implementasi. Label smoothing bukan operasi post-processing pada probabilitas prediksi. Mekanisme ini mengubah distribusi target yang menghasilkan sinyal training.

Kecerdasan Buatan 24 Sep 2026 6 min read

Kuantisasi KV Cache Menukar Presisi dengan Memori Serving

Decoding autoregresif menyimpan key dan value attention dari token sebelumnya agar setiap token baru dapat memakai kembali proyeksi yang sudah dihitung. KV cache tersebut membesar mengikuti panjang sequence, jumlah layer, batch size, serta jumlah dan lebar head key/value yang disimpan. Menurunkan presisi numeriknya dapat mengurangi byte yang ditempati tensor cache, tetapi nilai yang dipakai oleh operasi attention berikutnya juga ikut berubah. Karena itu, kuantisasi KV cache berbeda dari kompresi data yang hanya disimpan lalu dipulihkan tanpa kehilangan informasi. Cache terkuantisasi tetap berada pada jalur inferensi. Setiap query berikutnya dapat berinteraksi dengan key dan value hasil aproksimasi, sehingga persoalannya bukan sekadar berapa byte yang berkurang, tetapi juga di bagian mana error kuantisasi masuk ke attention dan bagaimana implementasi serving membatasinya.