Langsung ke konten

Topic archive

Kecerdasan Buatan

Kecerdasan buatan mencakup machine learning, deep learning, dan sistem yang menerapkan model untuk menyelesaikan berbagai tugas praktis.

147 articles
Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Gradient Noise Sebelum Menaikkan Batch Size

Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Anisotropi Embedding Sebelum Vector Search

Cosine similarity mengasumsikan bahwa arah vector membawa daya pembeda yang berguna. Asumsi ini menjadi kurang informatif ketika banyak embedding menempati wilayah ruang yang sempit. Dalam kondisi tersebut, item yang tidak berkaitan dapat berbagi komponen arah yang besar, skor cosine dapat berkumpul dalam rentang sempit, dan perbedaan residual kecil akhirnya menentukan ranking. Pola geometris ini sering disebut anisotropi embedding. Pola tersebut sudah ada sebelum vector index memilih kandidat, sehingga tuning index saja tidak dapat memastikan apakah representasi memiliki pemisahan sudut yang cukup untuk tugas retrieval.

Kecerdasan Buatan 16 Sep 2026 6 min read

Ukur Anisotropi Embedding Sebelum Vector Retrieval

Cosine similarity sering diperlakukan sebagai perbandingan lokal antara satu query embedding dan satu candidate. Interpretasi itu menjadi kurang informatif ketika sebagian besar vector menempati sekumpulan arah yang sempit. Item yang tidak berhubungan kemudian dapat memiliki komponen bersama yang cukup besar, sehingga range angle yang digunakan retrieval untuk membedakan candidate menjadi terkompresi. Konsentrasi arah ini umum disebut embedding anisotropy. Ini adalah properti distribusi vector, bukan cacat yang dapat disimpulkan dari satu similarity score. Bagi developer, persoalan praktisnya adalah nilai cosine tetap tidak memiliki makna universal. Kegunaannya sebagian bergantung pada geometri populasi embedding tempat score tersebut dihasilkan.

Kecerdasan Buatan 16 Sep 2026 6 min read

Uji Mekanisme Transformer dengan Activation Patching

Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.

Kecerdasan Buatan 16 Sep 2026 6 min read

Pertahankan Sinyal Tingkat Token dengan Late Interaction Retrieval

Satu embedding memadatkan seluruh query atau document menjadi satu vector sebelum similarity dihitung. Representasi ini praktis untuk approximate nearest-neighbor search, tetapi setiap sinyal tingkat token harus berhasil bertahan melewati tahap kompresi tersebut. Late interaction retrieval mempertahankan properti independent encoding sambil menunda sebagian perbandingan query-document hingga search time. Perubahan utamanya ada pada representasi. Alih-alih menyimpan satu vector per document, model late interaction dapat mempertahankan sekumpulan contextual token vector. Query juga direpresentasikan dengan beberapa vector. Relevance kemudian dihitung dari interaksi antara dua himpunan tersebut, bukan dari satu global dot product.

Kecerdasan Buatan 16 Sep 2026 6 min read

Perluas Context RoPE dengan Positional Interpolation

Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization. Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.

Kecerdasan Buatan 16 Sep 2026 5 min read

Pangkas Head Attention Transformer dengan Dampak yang Terukur

Sebuah blok multi-head attention dapat memiliki head yang ketika dihapus hanya sedikit mengubah metrik target pada set evaluasi tertentu. Pengamatan ini membuat pemangkasan head attention menarik: identifikasi head berdampak rendah, hapus kontribusinya, lalu pertahankan head yang lebih penting bagi workload target. Bagian yang sulit bukan membuat output sebuah head menjadi nol. Yang perlu ditentukan adalah apa yang sebenarnya diukur oleh intervensi tersebut dan apakah model hasilnya benar-benar mengeksekusi lebih sedikit pekerjaan. Head yang dimask, head yang dihapus secara struktural, dan kernel attention yang lebih cepat adalah gagasan yang berkaitan, tetapi bukan hasil yang sama.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context

Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi. Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kuantisasi Embedding Tanpa Menyamarkan Error Retrieval

Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan. Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kendalikan Repetisi dengan Contrastive Search Decoding

Greedy decoding dapat terus memilih token yang secara lokal paling mungkin bahkan ketika continuation yang dihasilkan menjadi repetitif. Sampling dapat memutus pola tersebut, tetapi melakukannya dengan menambahkan randomness. Contrastive search mengambil jalur lain: untuk input dan setting yang tetap, ia tetap deterministik sambil menilai likely next-token candidate terhadap representation-level repetition penalty. Metode ini menggabungkan dua sinyal yang menjelaskan properti candidate berbeda. Language-model probability mengutamakan token yang cocok dengan prefix saat ini. Degeneration penalty menurunkan nilai candidate yang new hidden representation-nya terlalu mirip dengan representasi yang sudah ada dalam generated context.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.

Kecerdasan Buatan 16 Sep 2026 6 min read

Exposure Bias pada Decoding Autoregresif

Model autoregresif dapat menerima konteks yang lebih bersih saat training dibandingkan saat generation. Dengan teacher forcing, prediksi token berikutnya dikondisikan pada prefix referensi dari urutan training. Saat free-running decoding, model justru dikondisikan pada token yang dihasilkannya sendiri. Setelah sebuah token berbeda dari kelanjutan yang dituju, prediksi berikutnya bekerja pada prefix yang mungkin lebih jarang muncul dalam data training. Ketidakcocokan ini umum disebut exposure bias. Masalahnya bukan sekadar bahwa model autoregresif dapat membuat kesalahan. Intinya adalah distribusi prefix yang diberikan kepada model dapat berubah antara optimisasi dan generation, sementara satu penyimpangan awal dapat mengubah setiap prediksi kondisional sesudahnya.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca State Intermediate Transformer dengan Logit Lens

Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model. Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca Prediksi Intermediate Transformer dengan Tuned Lens

Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman. Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.

Kecerdasan Buatan 15 Sep 2026 4 min read

Pertahankan Attention Sinks pada Streaming Transformers

Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya. Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.

Kecerdasan Buatan 15 Sep 2026 6 min read

Memperhitungkan Label Smoothing pada Confidence Classifier

Classifier yang dilatih dengan target one-hot mendapat dorongan untuk memindahkan massa probabilitas ke kelas berlabel. Cross-entropy terus menurun saat model memberi kelas tersebut probabilitas yang semakin mendekati satu, bahkan setelah kelas prediksi sudah benar. Label smoothing mengubah tekanan ini dengan memberikan sedikit massa target kepada kelas lain. Perubahan tersebut mudah dianggap sebagai detail kecil pada loss function. Namun dampaknya tidak kecil ketika aplikasi menggunakan nilai probabilitas model. Target yang dilunakkan mengubah optimum yang didorong oleh objektif training, sehingga skor confidence dari model dengan smoothing tidak seharusnya ditafsirkan seolah berasal dari objektif yang sama dengan training one-hot biasa.

Kecerdasan Buatan 15 Sep 2026 4 min read

Memperhitungkan Hubness dalam Retrieval Embedding

Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness. Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.

Kecerdasan Buatan 15 Sep 2026 6 min read

Kuantisasi KV Cache dengan Error Budget yang Eksplisit

Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator. Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.

Kecerdasan Buatan 15 Sep 2026 4 min read

Isolasi Attention Antar-Sequence Training yang Dipack

Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama. Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.

Kecerdasan Buatan 15 Sep 2026 5 min read

Batasi Norm Gradient dengan Cakupan yang Jelas

Gradient norm clipping mengubah update optimizer hanya ketika norm gradient yang diukur melampaui threshold yang dipilih. Operasinya terdengar lokal, tetapi perilakunya bergantung pada pilihan implementasi yang lebih luas: gradient mana yang ikut dihitung dalam norm. Dua training loop dapat menggunakan threshold dan optimizer yang sama tetapi menghasilkan update berbeda karena keduanya melakukan clipping pada kelompok parameter berbeda atau pada titik berbeda dalam siklus update. Hal ini membuat cakupan clipping menjadi bagian dari definisi optimisasi, bukan sekadar pengaman terhadap gradient yang sangat besar.

Kecerdasan Buatan 14 Sep 2026 5 min read

Perbandingan RMSNorm dan Layer Normalization

Layer normalisasi dapat terlihat saling menggantikan ketika bentuk output-nya serupa, tetapi invariansinya tidak sama. RMSNorm menskalakan ulang vektor aktivasi menggunakan root mean square tanpa terlebih dahulu mengurangi nilai rata-rata vektor. Layer normalization melakukan centering pada vektor, lalu menskalakannya menggunakan varians. Tidak adanya operasi centering merupakan perbedaan utamanya. Hal ini mengubah transformasi mana pada vektor aktivasi yang hilang setelah normalisasi dan mana yang tetap terlihat oleh bagian jaringan berikutnya. Kedua operasi menormalisasi besaran yang berbeda Untuk vektor aktivasi x dengan d komponen, LayerNorm menghitung mean dan varians pada dimensi yang dinormalisasi:

Kecerdasan Buatan 14 Sep 2026 5 min read

Exposure Bias pada Generation Autoregresif

Model autoregresif dapat menerima prefix bersih pada setiap posisi training, tetapi tetap menghadapi distribusi input berbeda saat generation. Training umumnya memberi skor pada token referensi berikutnya sambil dikondisikan pada token referensi sebelumnya. Saat inference, prefix justru berisi output model sendiri. Ketidakcocokan ini disebut exposure bias. Dampaknya muncul karena kesalahan awal pada generation tidak hanya membuat satu token keliru. Token tersebut menjadi bagian dari konteks untuk prediksi berikutnya, sehingga model memasuki state prefix yang mungkin jarang atau tidak pernah muncul saat training.

Kecerdasan Buatan 14 Sep 2026 6 min read

Batasi Logit Ekstrem dengan Soft Capping

Transformer dapat menghasilkan logit dengan magnitudo yang jauh melampaui rentang yang diperlukan untuk menyatakan preferensi kuat. Skor attention yang besar dapat membuat distribusi softmax sangat terkonsentrasi, sedangkan logit output yang besar dapat membuat probabilitas token hampir one-hot. Hard clamp dapat membatasi nilai tersebut, tetapi menghasilkan wilayah datar dengan perubahan turunan yang mendadak pada ambang batas. Logit soft capping memakai fungsi saturasi yang halus sebagai gantinya. Salah satu bentuk yang umum adalah:

Kecerdasan Buatan 14 Sep 2026 6 min read

Akumulasi Gradien di Beberapa Microbatch

Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama. Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.