Langsung ke konten

Arsip

Kecerdasan Buatan

95 artikel
Kecerdasan Buatan 16 Sep 2026 6 min read

Ukur Anisotropi Embedding Sebelum Vector Retrieval

Cosine similarity sering diperlakukan sebagai perbandingan lokal antara satu query embedding dan satu candidate. Interpretasi itu menjadi kurang informatif ketika sebagian besar vector menempati sekumpulan arah yang sempit. Item yang tidak berhubungan kemudian dapat memiliki komponen bersama yang cukup besar, sehingga range angle yang digunakan retrieval untuk membedakan candidate menjadi terkompresi. Konsentrasi arah ini umum disebut embedding anisotropy. Ini adalah properti distribusi vector, bukan cacat yang dapat disimpulkan dari satu similarity score. Bagi developer, persoalan praktisnya adalah nilai cosine tetap tidak memiliki makna universal. Kegunaannya sebagian bergantung pada geometri populasi embedding tempat score tersebut dihasilkan.

Kecerdasan Buatan 16 Sep 2026 6 min read

Uji Mekanisme Transformer dengan Activation Patching

Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.

Kecerdasan Buatan 16 Sep 2026 6 min read

Pertahankan Sinyal Tingkat Token dengan Late Interaction Retrieval

Satu embedding memadatkan seluruh query atau document menjadi satu vector sebelum similarity dihitung. Representasi ini praktis untuk approximate nearest-neighbor search, tetapi setiap sinyal tingkat token harus berhasil bertahan melewati tahap kompresi tersebut. Late interaction retrieval mempertahankan properti independent encoding sambil menunda sebagian perbandingan query-document hingga search time. Perubahan utamanya ada pada representasi. Alih-alih menyimpan satu vector per document, model late interaction dapat mempertahankan sekumpulan contextual token vector. Query juga direpresentasikan dengan beberapa vector. Relevance kemudian dihitung dari interaksi antara dua himpunan tersebut, bukan dari satu global dot product.

Kecerdasan Buatan 16 Sep 2026 6 min read

Perluas Context RoPE dengan Positional Interpolation

Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization. Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.

Kecerdasan Buatan 16 Sep 2026 5 min read

Pangkas Head Attention Transformer dengan Dampak yang Terukur

Sebuah blok multi-head attention dapat memiliki head yang ketika dihapus hanya sedikit mengubah metrik target pada set evaluasi tertentu. Pengamatan ini membuat pemangkasan head attention menarik: identifikasi head berdampak rendah, hapus kontribusinya, lalu pertahankan head yang lebih penting bagi workload target. Bagian yang sulit bukan membuat output sebuah head menjadi nol. Yang perlu ditentukan adalah apa yang sebenarnya diukur oleh intervensi tersebut dan apakah model hasilnya benar-benar mengeksekusi lebih sedikit pekerjaan. Head yang dimask, head yang dihapus secara struktural, dan kernel attention yang lebih cepat adalah gagasan yang berkaitan, tetapi bukan hasil yang sama.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context

Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi. Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kendalikan Repetisi dengan Contrastive Search Decoding

Greedy decoding dapat terus memilih token yang secara lokal paling mungkin bahkan ketika continuation yang dihasilkan menjadi repetitif. Sampling dapat memutus pola tersebut, tetapi melakukannya dengan menambahkan randomness. Contrastive search mengambil jalur lain: untuk input dan setting yang tetap, ia tetap deterministik sambil menilai likely next-token candidate terhadap representation-level repetition penalty. Metode ini menggabungkan dua sinyal yang menjelaskan properti candidate berbeda. Language-model probability mengutamakan token yang cocok dengan prefix saat ini. Degeneration penalty menurunkan nilai candidate yang new hidden representation-nya terlalu mirip dengan representasi yang sudah ada dalam generated context.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.

Kecerdasan Buatan 16 Sep 2026 6 min read

Exposure Bias pada Decoding Autoregresif

Model autoregresif dapat menerima konteks yang lebih bersih saat training dibandingkan saat generation. Dengan teacher forcing, prediksi token berikutnya dikondisikan pada prefix referensi dari urutan training. Saat free-running decoding, model justru dikondisikan pada token yang dihasilkannya sendiri. Setelah sebuah token berbeda dari kelanjutan yang dituju, prediksi berikutnya bekerja pada prefix yang mungkin lebih jarang muncul dalam data training. Ketidakcocokan ini umum disebut exposure bias. Masalahnya bukan sekadar bahwa model autoregresif dapat membuat kesalahan. Intinya adalah distribusi prefix yang diberikan kepada model dapat berubah antara optimisasi dan generation, sementara satu penyimpangan awal dapat mengubah setiap prediksi kondisional sesudahnya.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca State Intermediate Transformer dengan Logit Lens

Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model. Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca Prediksi Intermediate Transformer dengan Tuned Lens

Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman. Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.

Kecerdasan Buatan 15 Sep 2026 4 min read

Pertahankan Attention Sinks pada Streaming Transformers

Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya. Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.

Kecerdasan Buatan 15 Sep 2026 6 min read

Memperhitungkan Label Smoothing pada Confidence Classifier

Classifier yang dilatih dengan target one-hot mendapat dorongan untuk memindahkan massa probabilitas ke kelas berlabel. Cross-entropy terus menurun saat model memberi kelas tersebut probabilitas yang semakin mendekati satu, bahkan setelah kelas prediksi sudah benar. Label smoothing mengubah tekanan ini dengan memberikan sedikit massa target kepada kelas lain. Perubahan tersebut mudah dianggap sebagai detail kecil pada loss function. Namun dampaknya tidak kecil ketika aplikasi menggunakan nilai probabilitas model. Target yang dilunakkan mengubah optimum yang didorong oleh objektif training, sehingga skor confidence dari model dengan smoothing tidak seharusnya ditafsirkan seolah berasal dari objektif yang sama dengan training one-hot biasa.

Kecerdasan Buatan 15 Sep 2026 4 min read

Memperhitungkan Hubness dalam Retrieval Embedding

Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness. Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.

Kecerdasan Buatan 15 Sep 2026 4 min read

Isolasi Attention Antar-Sequence Training yang Dipack

Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama. Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.

Kecerdasan Buatan 15 Sep 2026 5 min read

Batasi Norm Gradient dengan Cakupan yang Jelas

Gradient norm clipping mengubah update optimizer hanya ketika norm gradient yang diukur melampaui threshold yang dipilih. Operasinya terdengar lokal, tetapi perilakunya bergantung pada pilihan implementasi yang lebih luas: gradient mana yang ikut dihitung dalam norm. Dua training loop dapat menggunakan threshold dan optimizer yang sama tetapi menghasilkan update berbeda karena keduanya melakukan clipping pada kelompok parameter berbeda atau pada titik berbeda dalam siklus update. Hal ini membuat cakupan clipping menjadi bagian dari definisi optimisasi, bukan sekadar pengaman terhadap gradient yang sangat besar.

Kecerdasan Buatan 14 Sep 2026 5 min read

Perbandingan RMSNorm dan Layer Normalization

Layer normalisasi dapat terlihat saling menggantikan ketika bentuk output-nya serupa, tetapi invariansinya tidak sama. RMSNorm menskalakan ulang vektor aktivasi menggunakan root mean square tanpa terlebih dahulu mengurangi nilai rata-rata vektor. Layer normalization melakukan centering pada vektor, lalu menskalakannya menggunakan varians. Tidak adanya operasi centering merupakan perbedaan utamanya. Hal ini mengubah transformasi mana pada vektor aktivasi yang hilang setelah normalisasi dan mana yang tetap terlihat oleh bagian jaringan berikutnya. Kedua operasi menormalisasi besaran yang berbeda Untuk vektor aktivasi x dengan d komponen, LayerNorm menghitung mean dan varians pada dimensi yang dinormalisasi:

Kecerdasan Buatan 14 Sep 2026 5 min read

Exposure Bias pada Generation Autoregresif

Model autoregresif dapat menerima prefix bersih pada setiap posisi training, tetapi tetap menghadapi distribusi input berbeda saat generation. Training umumnya memberi skor pada token referensi berikutnya sambil dikondisikan pada token referensi sebelumnya. Saat inference, prefix justru berisi output model sendiri. Ketidakcocokan ini disebut exposure bias. Dampaknya muncul karena kesalahan awal pada generation tidak hanya membuat satu token keliru. Token tersebut menjadi bagian dari konteks untuk prediksi berikutnya, sehingga model memasuki state prefix yang mungkin jarang atau tidak pernah muncul saat training.

Kecerdasan Buatan 14 Sep 2026 6 min read

Batasi Logit Ekstrem dengan Soft Capping

Transformer dapat menghasilkan logit dengan magnitudo yang jauh melampaui rentang yang diperlukan untuk menyatakan preferensi kuat. Skor attention yang besar dapat membuat distribusi softmax sangat terkonsentrasi, sedangkan logit output yang besar dapat membuat probabilitas token hampir one-hot. Hard clamp dapat membatasi nilai tersebut, tetapi menghasilkan wilayah datar dengan perubahan turunan yang mendadak pada ambang batas. Logit soft capping memakai fungsi saturasi yang halus sebagai gantinya. Salah satu bentuk yang umum adalah:

Kecerdasan Buatan 14 Sep 2026 6 min read

Akumulasi Gradien di Beberapa Microbatch

Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama. Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.

Kecerdasan Buatan 13 Sep 2026 6 min read

Perbandingan RMSNorm dan LayerNorm pada Transformer

LayerNorm dan RMSNorm dapat menempati posisi struktural yang sama pada transformer sambil menerapkan operasi berbeda pada residual stream. LayerNorm mengurangi feature mean sebelum melakukan scaling berdasarkan ukuran penyebaran. RMSNorm melewati operasi centering dan melakukan scaling langsung dari root mean square feature. Perbedaan aljabar kecil tersebut mengubah transformasi mana pada vektor aktivasi yang dihapus oleh normalisasi. Artinya, mengganti satu operasi dengan yang lain secara umum bukan edit yang mempertahankan fungsi model yang sudah ada.

Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kuantisasi KV Cache dengan Error Budget Key dan Value Terpisah

Inference transformer autoregressive menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke posisi terdahulu tanpa menghitung ulang seluruh prefix. KV cache tersebut bertambah bersama sequence length, jumlah layer, batch size, dan jumlah key-value head yang disimpan. Pada context panjang, jejak memorinya dapat langsung membatasi jumlah request konkuren atau context length yang dapat digunakan. Kuantisasi KV cache mengurangi byte per elemen yang disimpan. Namun, aproksimasi yang dihasilkan tidak setara dengan menguantisasi struktur data pasif. Cached key ikut dalam perhitungan attention score, sedangkan cached value dicampur berdasarkan attention weight yang dihasilkan. Error pada kedua tensor itu karena itu memasuki operasi attention pada titik yang berbeda.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kendalikan Bias Panjang Sequence dalam Beam Search

Beam search dapat mengembalikan sequence yang lebih pendek meskipun kandidat yang lebih panjang berisi token yang masuk akal secara lokal pada setiap posisi. Perilaku ini mengikuti langsung dari scoring sequence: model autoregressive mengalikan conditional probability token, atau secara ekuivalen menjumlahkan log probability-nya. Karena probability token paling besar bernilai satu, setiap token tambahan menyumbangkan log term yang tidak positif. Aritmetika tersebut menjadikan panjang sequence bagian dari decoding. Beam width mengubah kandidat mana yang bertahan, tetapi tidak menghilangkan efek scoring. Karena itu, decoder memerlukan kebijakan yang disengaja untuk membandingkan hypothesis dengan panjang berbeda dan menentukan kapan hypothesis yang sudah lengkap cukup baik untuk menghentikan search.