Langsung ke konten

Arsip

Kecerdasan Buatan

95 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Tanh Logit Soft Capping Membatasi Skor Ekstrem Sebelum Softmax

Softmax dapat menerima logit dengan magnitudo hingga berapa pun selama nilainya finite, tetapi selisih skor yang besar membuat keluarannya semakin terkonsentrasi. Tanh logit soft capping menyisipkan transformasi nonlinear terbatas sebelum softmax sehingga logit hasil transformasi tidak melewati magnitudo yang ditentukan. Untuk cap positif c, bentuk yang umum adalah: softcap(z; c) = c * tanh(z / c) Operasi ini bukan hard clipping pada ambang tertentu. Di sekitar nol perilakunya hampir linear, lalu magnitudo yang lebih besar dikompresi secara bertahap saat mendekati -c atau c.

Kecerdasan Buatan 24 Sep 2026 5 min read

SwiGLU Mengendalikan Kanal Feed-Forward Transformer dengan Proyeksi Kedua

SwiGLU membagi input feed-forward transformer ke dua jalur proyeksi, menerapkan SiLU pada satu jalur, lalu mengalikan kedua hasil secara elemen per elemen. Proyeksi kedua bukan statistik tambahan: nilainya langsung mengendalikan jalur yang sudah diaktivasi sebelum proyeksi output. Untuk hidden state x, bentuk struktural yang umum adalah: g = SiLU(x W_gate) u = x W_up h = g * u y = h W_down Bias, orientasi proyeksi, lebar intermediate, dan nama parameter dapat berbeda antar arsitektur. Batas yang mendefinisikan operasi ini adalah perkalian elemen per elemen antara cabang proyeksi nonlinear dan cabang proyeksi lainnya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sequence Packing Memerlukan Attention Mask yang Sadar Batas

Sequence packing mengurangi padding dengan menempatkan beberapa contoh berpanjang variabel ke dalam satu buffer token. Layout penyimpanannya dapat terlihat seperti satu sequence panjang, tetapi setiap contoh tetap independen secara semantik. Causal mask standar tidak menjaga independensi tersebut dengan sendirinya. Pada Transformer decoder-only, causal masking mencegah attention menuju posisi masa depan. Mekanisme ini biasanya tidak mencegah attention menuju posisi sebelumnya yang berasal dari contoh lain dalam buffer yang sama. Jika batas diabaikan, token pada contoh berikutnya dapat mengakses key dan value dari contoh sebelumnya. Model akhirnya menerima konteks yang semestinya dipisahkan oleh data pipeline.

Kecerdasan Buatan 24 Sep 2026 5 min read

Scheduling per Iterasi Membentuk Ulang Batch LLM di Antara Langkah Decode

Serving autoregresif tidak membuat semua request selesai pada titik yang sama. Sebuah sequence dapat menghasilkan token akhir setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah. Jika engine mempertahankan batch request awal sampai seluruh anggotanya selesai, sequence yang sudah berakhir meninggalkan kapasitas eksekusi yang tidak terisi di belakang sequence yang lebih panjang. Scheduling per iterasi memindahkan batas keputusan ke bagian yang lebih kecil. Request tidak lagi menjadi satu-satunya unit scheduling yang tidak dapat dipecah. Setelah satu iterasi model, kontrol kembali ke scheduler. Sequence yang selesai dapat keluar, pekerjaan yang menunggu dapat masuk, dan iterasi berikutnya dapat memakai kumpulan sequence aktif yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menormalisasi vektor hidden state tanpa mengurangi mean koordinatnya. Satu perbedaan ini memisahkannya dari LayerNorm pada antarmuka matematis: RMSNorm mengendalikan skala melalui statistik root mean square, sedangkan offset yang sama pada seluruh koordinat tetap menjadi bagian dari representasi yang ditransformasikan. Untuk vektor x dengan lebar D, salah satu bentuk umum RMSNorm adalah: rms(x) = sqrt(mean(x_i^2) + eps) y_i = g_i * x_i / rms(x) Di sini g_i adalah skala per koordinat yang dapat dilatih dan eps adalah nilai positif kecil yang ditentukan implementasi model. Parameterisasi dan detail numerik yang tepat merupakan bagian dari kontrak checkpoint dan runtime.

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 24 Sep 2026 5 min read

Position Interpolation Memampatkan Indeks RoPE ke Rentang Konteks Asli

Transformer berbasis RoPE mengaitkan posisi token dengan rotasi yang sudutnya bergantung pada indeks posisi dan frekuensi per dimensi. Saat sequence melewati rentang konteks yang dipakai dalam pelatihan, rotasi tersebut memakai indeks posisi di luar rezim yang pernah dihadapi model. Position Interpolation mengubah batas itu dengan menskalakan indeks yang diperpanjang kembali ke rentang asli sebelum transformasi rotary diterapkan. Untuk batas konteks asli L dan target konteks L' > L, pemetaan linear yang disederhanakan adalah:

Kecerdasan Buatan 24 Sep 2026 6 min read

Kuantisasi KV Cache Menukar Presisi dengan Memori Serving

Decoding autoregresif menyimpan key dan value attention dari token sebelumnya agar setiap token baru dapat memakai kembali proyeksi yang sudah dihitung. KV cache tersebut membesar mengikuti panjang sequence, jumlah layer, batch size, serta jumlah dan lebar head key/value yang disimpan. Menurunkan presisi numeriknya dapat mengurangi byte yang ditempati tensor cache, tetapi nilai yang dipakai oleh operasi attention berikutnya juga ikut berubah. Karena itu, kuantisasi KV cache berbeda dari kompresi data yang hanya disimpan lalu dipulihkan tanpa kehilangan informasi. Cache terkuantisasi tetap berada pada jalur inferensi. Setiap query berikutnya dapat berinteraksi dengan key dan value hasil aproksimasi, sehingga persoalannya bukan sekadar berapa byte yang berkurang, tetapi juga di bagian mana error kuantisasi masuk ke attention dan bagaimana implementasi serving membatasinya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi

Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention. Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.

Kecerdasan Buatan 24 Sep 2026 5 min read

Grouped-Query Attention Membagi Head Key-Value di Antara Grup Query

Multi-head attention tidak mengharuskan setiap head query memiliki head key dan head value yang berbeda. Grouped-query attention, atau GQA, membagi head query ke dalam beberapa grup dan memberikan satu head key-value untuk setiap grup. Proyeksi query tetap terpisah, tetapi beberapa head query membaca key dan value hasil proyeksi yang sama. Perbedaan ini mengubah bentuk parameter dan state yang disimpan di cache tanpa menyatukan head query menjadi satu komputasi attention. Setiap head query tetap menghasilkan skor attention sendiri karena vektor query-nya berbeda.

Kecerdasan Buatan 24 Sep 2026 5 min read

Expert Parallelism Mengubah Routing MoE Menjadi Komunikasi All-to-All

Layer Mixture-of-Experts yang aktif secara sparse dapat menyimpan banyak parameter expert sambil mengirim setiap token hanya ke sebagian kecil expert. Ketika expert tersebut dipartisi ke beberapa perangkat, aktivasi sparse tidak berarti eksekusinya tetap lokal. Token yang memilih expert remote harus berpindah ke perangkat pemilik expert, lalu output expert harus kembali ke perangkat yang melanjutkan komputasi model. Perpindahan ini merupakan biaya sistem utama expert parallelism. Router membuat pilihan logis, sedangkan runtime terdistribusi harus mengubah pilihan itu menjadi komunikasi, batch expert lokal, komputasi expert, dan pertukaran balik.

Kecerdasan Buatan 24 Sep 2026 5 min read

Continuous Batching Mengganti Kelompok Request Statis dengan Scheduling per Iterasi

Generasi autoregresif tidak menyelesaikan setiap request pada iterasi yang sama. Satu sequence dapat menghasilkan stop token setelah beberapa langkah decode, sedangkan sequence lain masih aktif hingga ratusan langkah berikutnya. Batch statis mengikat request tersebut sampai batas batch tercapai. Continuous batching memutus ikatan itu dengan mengizinkan himpunan aktif berubah di antara iterasi model. Perubahan utamanya berada pada granularitas scheduling. Request tidak lagi menjadi unit scheduling yang tidak dapat dipecah selama seluruh proses generasi. Sistem serving dapat membentuk batch eksekusi untuk satu iterasi, memperbarui state request setelah iterasi tersebut, mengeluarkan sequence yang selesai, lalu memasukkan pekerjaan antrean sebelum langkah eksekusi berikutnya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Attention Sink Menstabilkan Eviction Cache untuk Streaming

KV cache dengan kapasitas tetap dapat mencegah memori inferensi terus bertambah pada aliran token yang panjang. Namun, membuang semua token lama secara ketat berdasarkan urutan kedatangan dapat mengganggu attention lebih besar daripada sekadar hilangnya isi token tersebut. Pada sebagian transformer autoregresif, posisi awal menerima bobot attention yang berarti walaupun semantik tokennya tidak berkaitan langsung dengan prediksi saat ini. Posisi seperti ini disebut attention sink. Konsekuensi pada serving cukup spesifik: sliding cache yang mempertahankan prefix awal kecil bersama token terbaru dapat berperilaku berbeda dari cache berukuran sama yang hanya berisi token paling baru. Mekanisme ini berkaitan dengan state attention dan pengelolaan posisi, bukan pemulihan teks lama yang sudah dibuang.

Kecerdasan Buatan 24 Sep 2026 4 min read

Anisotropi Embedding Memampatkan Rentang Cosine Similarity

Dua kandidat embedding dapat memiliki kecocokan semantik yang berbeda tetapi memperoleh skor cosine dalam interval yang sempit. Implementasi fungsi similarity belum tentu bermasalah. Pemampatan tersebut dapat berasal dari geometri ruang embedding: vektor cenderung menempati arah tertentu alih-alih tersebar merata pada dimensi yang tersedia. Konsentrasi arah ini umum disebut anisotropi. Anisotropi berpengaruh pada retrieval karena cosine similarity mengukur alignment sudut. Ketika banyak vektor memiliki komponen bersama yang cukup besar, pasangan yang tidak berkaitan dapat memiliki baseline alignment yang lebih tinggi. Pasangan relevan masih dapat memperoleh skor lebih tinggi, tetapi jarak skor yang tersedia antara kandidat relevan dan tidak relevan dapat menyempit.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Penalti Jarak Langsung ke Logit Attention

Attention with Linear Biases (ALiBi) mengubah skor causal attention sebelum softmax dengan menambahkan penalti yang membesar seiring jarak antartoken. Posisi masuk melalui jalur skor, bukan melalui vektor posisi yang ditambahkan ke representasi setiap token. Untuk query pada posisi i yang mengakses key pada posisi j, satu head dapat ditulis secara skematis sebagai: score(i, j) = q_i · k_j / sqrt(d_k) - m_h * (i - j) untuk posisi kausal j <= i. Slope positif m_h bersifat spesifik untuk attention head h. Causal mask tetap mencegah akses ke posisi masa depan; komponen linear hanya mengubah preferensi relatif di antara posisi yang masih terlihat.

Kecerdasan Buatan 24 Sep 2026 5 min read

ALiBi Menambahkan Bias Proporsional Jarak pada Skor Attention

ALiBi mengubah skor attention sebelum softmax, bukan menambahkan vektor posisi ke representasi token. Pada transformer kausal, key yang berada semakin jauh di belakang query menerima offset negatif yang semakin besar. Offset tersebut linear terhadap jarak token dan memakai slope yang terkait dengan attention head. Bentuk sederhana untuk skor head h dapat ditulis sebagai: score_h(i, j) = q_i k_j^T / sqrt(d) - m_h * (i - j) untuk pasangan kausal yang diizinkan dengan j <= i dan slope positif m_h. Causal mask tetap menentukan posisi masa depan yang tidak dapat diakses. ALiBi mengubah skor relatif di antara posisi yang masih diizinkan.

Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 5 min read

RMSNorm Mengatur Skala Aktivasi Tanpa Memusatkan Mean

RMSNorm menormalisasi vektor menggunakan root mean square, bukan standard deviation setelah centering. Perbedaan kecil ini menghilangkan pengurangan mean dari tahap normalisasi. Akibatnya, RMSNorm dan LayerNorm dapat merespons perubahan skala dengan pola serupa pada kondisi tertentu, tetapi memberi respons berbeda terhadap pergeseran aditif pada hidden state. Perbedaan tersebut relevan pada implementasi transformer karena normalisasi menjadi bagian dari geometri residual path. Mengganti satu aturan normalisasi dengan aturan lain bukan sekadar mengganti rangkaian operasi aritmetika; pergantian itu mengubah transformasi aktivasi yang dibatalkan dan informasi yang tetap diteruskan ke komputasi berikutnya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Reuse Prefix KV Cache Bergantung pada Identitas Konteks yang Tepat

Prefix cache dapat menghilangkan komputasi prefill yang berulang tanpa mengubah output model, tetapi hanya jika key dan value yang tersimpan mewakili konteks prefix yang sama dengan state yang seharusnya dihasilkan request baru. Kecocokan teks yang terlihat belum cukup. Jalur serving pada akhirnya bekerja dengan token ID, posisi, parameter model, dan state attention yang bergantung pada implementasi. Batas ini membuat prefix caching berbeda dari cache teks biasa. Cache teks menyimpan hasil yang terkait dengan sebuah input. KV prefix cache menyimpan state perantara yang validitasnya bergantung pada komputasi yang membentuknya.

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Penalti Repetisi Mengubah Skor Token Berdasarkan Output Sebelumnya

Penalti repetisi mengubah distribusi next-token tanpa mengubah parameter model atau komputasi hidden state. Model tetap menghasilkan logit dari konteks saat ini, tetapi decoder mengubah skor tertentu berdasarkan token yang sudah muncul. Sampling kemudian bekerja pada skor hasil perubahan tersebut, bukan langsung pada output model. Pemisahan ini relevan saat mereproduksi perilaku generation. Dua sistem dapat menjalankan bobot model dan token ID yang identik tetapi menghasilkan continuation berbeda karena rumus penalti, cakupan riwayat token, atau posisi aturan itu dalam pipeline decoding tidak sama.

Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi

Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi. Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.

Kecerdasan Buatan 23 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Peringkat Sequence

Beam search memberi peringkat pada sequence parsial memakai skor yang terakumulasi sepanjang proses decoding. Jika skor tersebut berupa jumlah log-probability token, setiap token tambahan biasanya menyumbang nilai non-positif. Kandidat yang lebih panjang mendapat lebih banyak kesempatan untuk menurunkan skor mentahnya, bahkan ketika continuation-nya tetap masuk akal secara lokal. Sifat ini bukan cacat pada teori probabilitas. Efek tersebut muncul karena sequence lengkap dengan jumlah faktor kondisional berbeda sedang dibandingkan. Persoalannya menjadi relevan pada implementasi ketika decoder diharapkan menghasilkan completion yang berguna, bukan sekadar mengurutkan sequence berdasarkan probabilitas model tanpa penyesuaian.