Langsung ke konten

Arsip

Kecerdasan Buatan

95 artikel
Kecerdasan Buatan 13 Sep 2026 5 min read

Kalibrasi Confidence Klasifikator dengan Temperature Scaling

Sebuah klasifikator dapat memilih kelas yang benar tetapi memberikan probabilitas yang terlalu terkonsentrasi atau terlalu tersebar untuk aplikasi yang memakai skor tersebut. Temperature scaling menangani ketidaksesuaian ini setelah training model dengan menerapkan satu skalar positif pada logit sebelum softmax. Mekanismenya sengaja dibuat sempit. Metode ini mengubah ketajaman probabilitas, bukan informasi yang direpresentasikan oleh klasifikator. Batas tersebut membuat temperature scaling berguna ketika ranking kelas sudah memadai tetapi nilai confidence memerlukan kalibrasi terpisah.

Kecerdasan Buatan 13 Sep 2026 6 min read

Gunakan Ulang State Prefix Bersama pada Inferensi LLM

Inferensi LLM autoregresif sering memproses token awal yang sama pada banyak request. System prompt tetap, schema tool, atau prefix dokumen dapat berisi ribuan token sebelum teks khusus request dimulai. Menghitung state attention untuk prefix identik pada setiap request berarti mengulang pekerjaan prefill yang sebelumnya sudah menghasilkan key dan value cache yang sama dalam kondisi eksekusi yang kompatibel. Prefix caching menyimpan state attention yang dapat digunakan ulang untuk prefix token bersama. Mekanisme ini mengurangi komputasi prefill saat terjadi cache hit, tetapi tidak membuat prompt yang sekadar mirip dapat saling dipertukarkan. Unit yang dapat digunakan ulang terikat pada state input model yang tepat, bukan kemiripan semantik.

Kecerdasan Buatan 13 Sep 2026 6 min read

Bangun Set Klasifikasi dengan Split Conformal Prediction

Classifier biasanya mengembalikan satu label atau sebuah vektor skor kelas. Kedua output itu tidak secara langsung menyatakan berapa banyak label yang sebaiknya tetap dianggap masuk akal ketika sistem membutuhkan tingkat error yang terkendali. Split conformal prediction menambahkan lapisan kalibrasi yang mengubah skor tersebut menjadi prediction set. Properti yang berguna bukan bahwa setiap set individual memiliki probabilitas tetap untuk memuat label yang benar. Di bawah asumsi exchangeability standar, metode split conformal menargetkan coverage marginal pada contoh baru. Perbedaan ini menentukan cara implementasi sekaligus interpretasinya.

Kecerdasan Buatan 12 Sep 2026 10 min read

Selaraskan LLM dengan Direct Preference Optimization

Selaraskan LLM dengan Direct Preference Optimization Supervised fine-tuning bekerja baik ketika Anda dapat menyediakan respons target untuk setiap prompt. Pendekatan ini menjadi kurang alami ketika sinyalnya bersifat komparatif: satu jawaban lebih disukai daripada jawaban lain, tetapi keduanya bukan target sempurna untuk disalin. Direct Preference Optimization (DPO) mengubah pasangan preferensi tersebut menjadi objektif pelatihan untuk model bahasa tanpa memerlukan reward model yang dilatih terpisah atau tahap reinforcement learning secara online. Kesederhanaan ini membuat DPO menarik untuk gaya respons, kepatuhan terhadap instruksi, dan tugas lain ketika penilaian berpasangan lebih mudah dikumpulkan daripada completion ideal. Metode ini tetap memiliki batasan penting. Perilakunya bergantung pada data preferensi, kebijakan referensi yang tetap, dan kekuatan regularisasi yang mengendalikan seberapa agresif kebijakan hasil tuning menjauh dari referensi tersebut.

Kecerdasan Buatan 12 Sep 2026 7 min read

Batasi Pertumbuhan KV Cache pada Streaming LLM Inference

Inference transformer autoregresif biasanya menyimpan state key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang state tersebut. Cache bertambah seiring panjang sequence. Untuk stream yang berjalan lama, pertumbuhan itu akhirnya menjadi kendala memori meskipun generation tetap berlangsung satu token pada satu waktu. KV cache eviction membatasi state tersebut dengan membuang posisi cache tertentu. Efek terhadap memori cukup langsung: lebih sedikit pasangan key-value yang dipertahankan berarti lebih sedikit ruang cache yang terpakai. Efek terhadap model lebih halus. Setelah sebuah posisi dihapus, layer attention berikutnya tidak dapat memakai key dan value yang sebelumnya di-cache dalam komputasi attention biasa. Kebijakan eviction dengan demikian mengubah penggunaan resource sekaligus riwayat attention efektif.

Kecerdasan Buatan 12 Sep 2026 6 min read

Anisotropi Embedding Dapat Memampatkan Pemisahan Skor Cosine

Dua embedding vector dapat memiliki cosine similarity tinggi walaupun item yang diwakilinya tidak dekat dalam pengertian spesifik yang dibutuhkan sistem retrieval. Salah satu penyebab mismatch ini adalah anisotropi embedding: vector tersebar tidak merata di representation space, sering kali dengan sebagian besar massa terkonsentrasi di sekitar arah bersama. Cosine similarity menghilangkan pengaruh magnitude vector dari perbandingan, tetapi tidak menghapus komponen arah yang sama. Jika banyak vector sebagian mengarah ke arah yang sama, pasangan yang tidak terkait dapat memiliki baseline cosine yang tinggi. Perbedaan berguna antara item relevan dan tidak relevan kemudian harus muncul dalam rentang skor yang lebih sempit.

Kecerdasan Buatan 11 Sep 2026 9 min read

Bangun Prediction Set dengan Conformal Prediction

Bangun Prediction Set dengan Conformal Prediction Classifier biasanya mengembalikan satu label bahkan ketika beberapa label sama-sama masuk akal. Ini nyaman untuk interface software, tetapi dapat menyembunyikan ketidakpastian tepat pada kondisi ketika kesalahan mahal. Document router mungkin ragu antara billing dan account, tetapi argmax tetap mengeluarkan salah satunya. Conformal prediction menawarkan interface lain: kembalikan sekumpulan label dengan ukuran yang menyesuaikan bukti. Input yang mudah dapat menghasilkan satu label. Input ambigu dapat menghasilkan beberapa label. Di bawah asumsi tertentu, prosedur ini juga memberikan finite-sample coverage guarantee.

Kecerdasan Buatan 11 Sep 2026 9 min read

Adaptasi Model Bahasa dengan Prefix Tuning

Adaptasi Model Bahasa dengan Prefix Tuning Full fine-tuning mengubah bobot model untuk setiap tugas. Cara ini bisa efektif, tetapi menyimpan dan melakukan serving checkpoint penuh yang terpisah untuk setiap tugas menjadi mahal ketika ukuran model dan jumlah tugas bertambah. Prefix tuning menawarkan susunan berbeda: pertahankan model pretrained dalam keadaan beku dan latih sekumpulan kecil state spesifik tugas yang ikut berpartisipasi dalam attention. Artikel ini membangun model mental praktis untuk prefix tuning, menunjukkan perbedaannya dari text prompt dan adapter bobot low-rank, serta menjelaskan trade-off yang penting ketika melatih atau melakukan serving beberapa varian tugas.

Kecerdasan Buatan 10 Sep 2026 9 min read

Regularisasi Neural Network dengan Mixup

Regularisasi Neural Network dengan Mixup Sebuah neural network dapat menyesuaikan diri dengan contoh training-nya sambil tetap berperilaku tidak terduga di ruang di antara contoh-contoh tersebut. Jika dua input yang berdekatan berasal dari kelas berbeda, training standar memberi tahu model apa yang harus dilakukan pada titik ujung, tetapi sering kali hanya memberi sedikit informasi tentang titik-titik di antaranya. Mixup mengubah sinyal training tersebut. Alih-alih berlatih hanya pada contoh individual, mixup membuat contoh sintetis dengan menginterpolasi pasangan input beserta labelnya. Model kemudian diminta menghasilkan prediksi campuran yang sesuai. Ini bertindak sebagai regularizer karena membatasi bagaimana prediksi boleh berubah di antara contoh training.

Kecerdasan Buatan 09 Sep 2026 9 min read

Sampling LLM: Temperature, Top-K, dan Top-P

Language model biasanya tidak menghasilkan satu next token yang tak terelakkan. Berdasarkan prefix, model memberi skor pada banyak token yang mungkin. Algoritma decoding kemudian menentukan cara mengubah skor tersebut menjadi output berikutnya. Tahap terakhir ini penting. Sampling yang terlalu bebas dapat membuat model bergeser ke continuation yang tidak mungkin. Sampling yang terlalu dibatasi dapat membuat output repetitif atau kehilangan variasi yang berguna. Parameter seperti temperature, top-k, dan top-p mengontrol bagian berbeda dari trade-off ini, sehingga memperlakukannya sebagai satu “creativity setting” akan menghasilkan perilaku yang membingungkan.

Kecerdasan Buatan 08 Sep 2026 8 min read

Migrasikan Model Embedding Tanpa Merusak Retrieval

Mengganti model embedding dapat terlihat seperti upgrade dependency biasa: ganti identifier model, deploy service, lalu terus query vector index yang ada. Pendekatan tersebut dapat merusak retrieval secara diam-diam. Embedding memiliki makna relatif terhadap ruang representasi yang dihasilkan modelnya. Jika stored document vector dibuat oleh satu model sementara query vector baru dibuat oleh model lain, koordinat keduanya umumnya tidak memiliki makna bersama. Dimensi yang sama tidak cukup untuk membuat vektor kompatibel.

Kecerdasan Buatan 08 Sep 2026 10 min read

Hindari Kegagalan Batas Tokenisasi pada Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefiks, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berakhir tepat di posisi itu. Detail ini dapat menjadi penting ketika prompt berakhir pada posisi karakter yang, jika prompt dan kelanjutannya ditokenisasi bersama, biasanya berada di dalam token yang lebih besar. Masalah batas tokenisasi (tokenization boundary problem), yang juga disebut masalah token parsial (partial token problem), dapat membuat kelanjutan yang sebenarnya natural menjadi sangat kecil kemungkinannya.

Kecerdasan Buatan 08 Sep 2026 8 min read

Hindari Kegagalan Batas Tokenisasi dalam Generasi LLM

Aplikasi language model biasanya memperlakukan prompt sebagai teks: berikan sebuah prefix, lalu minta model melanjutkannya. Namun, model melihat sesuatu yang lebih spesifik. Tokenizer terlebih dahulu mengubah teks tersebut menjadi token, dan akhir prompt memaksa token terakhir berhenti tepat pada posisi itu. Detail ini dapat berpengaruh ketika prompt berakhir pada posisi karakter yang, jika prompt dan continuation ditokenisasi bersama, seharusnya berada di dalam token yang lebih besar. Masalah batas tokenisasi, yang juga disebut partial token problem, dapat membuat continuation yang sebenarnya natural menjadi sangat tidak mungkin.

Kecerdasan Buatan 08 Sep 2026 8 min read

Deteksi Input Out-of-Distribution dengan Energy Score

Classifier dapat sangat akurat pada test set tetapi tetap menghasilkan prediksi dengan confidence tinggi untuk input yang jauh berbeda dari data training. Classifier produk yang dilatih pada sepatu, tas, dan jam tangan dapat menerima foto sepeda tetapi tetap dipaksa memilih salah satu class yang dikenalnya. Ini menimbulkan masalah deployment: classification biasa menjawab class dikenal mana yang paling mungkin, sementara banyak sistem juga perlu menentukan apakah input cukup menyerupai data tempat classifier divalidasi.

Kecerdasan Buatan 08 Sep 2026 9 min read

Ambil Evidence Multi-Hop dengan Graph RAG

Retrieval-augmented generation (RAG) biasanya dimulai dari gagasan sederhana: cari chunk teks yang mirip dengan pertanyaan, masukkan chunk paling relevan ke context model, lalu minta model menjawab berdasarkan evidence tersebut. Pendekatan ini bekerja baik ketika jawaban terdapat dalam satu passage atau beberapa passage yang masing-masing mudah diambil. Sebagian pertanyaan lebih sulit karena evidence yang berguna terhubung oleh relasi, bukan sekadar kemiripan kata. Developer mungkin perlu menjawab, “Service mana yang bergantung pada library yang dikelola tim pemilik Payments API?” Tidak ada satu chunk yang harus memuat semua kata itu. Jawabannya dapat memerlukan penelusuran beberapa hubungan antara service, library, tim, dan API.

Kecerdasan Buatan 07 Sep 2026 9 min read

Rata-ratakan Bobot Neural Network dengan Stochastic Weight Averaging

Sebuah neural network jarang mengakhiri pelatihan tepat di satu-satunya titik berguna dalam ruang parameter. Menjelang akhir pelatihan, stochastic gradient descent (SGD) dapat mengunjungi beberapa konfigurasi parameter yang berdekatan dan semuanya berkinerja cukup baik, sementara checkpoint terakhir hanya mewakili salah satunya. Stochastic weight averaging (SWA) mengubah pengamatan tersebut menjadi teknik pelatihan sederhana: kumpulkan parameter model dari beberapa titik pada bagian akhir trajektori SGD lalu hitung rata-rata aritmetikanya. Hasilnya adalah satu model dengan bobot yang dirata-ratakan, sehingga inference tidak perlu menjalankan ensemble dari semua checkpoint yang dikumpulkan.

Kecerdasan Buatan 07 Sep 2026 9 min read

Adaptasi Neural Network dengan Gradient Reversal

Sebuah classifier dapat bekerja baik saat evaluasi lalu melemah setelah deployment karena input berubah. Foto produk mungkin berasal dari kamera baru, pesan dukungan dapat memakai kosakata berbeda, atau pembacaan sensor datang dari hardware lain. Mengumpulkan label untuk lingkungan baru bisa mahal meskipun contoh tanpa label mudah diperoleh. Domain-adversarial training menangani salah satu bentuk masalah ini. Metode ini meminta feature extractor mendukung tugas prediksi sekaligus membuat domain source dan target sulit dibedakan. Sebuah gradient reversal layer membuat kedua tujuan yang berlawanan itu dapat dilatih dengan backpropagation biasa dengan membalik gradient dari domain classifier sebelum mencapai feature extractor.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.

Kecerdasan Buatan 06 Sep 2026 9 min read

Direct Preference Optimization untuk Alignment LLM

Supervised fine-tuning dapat membuat model bahasa meniru jawaban yang baik, tetapi banyak persoalan alignment lebih mudah dinyatakan sebagai perbandingan: dari dua respons untuk prompt yang sama, respons mana yang lebih baik? Dataset preferensi menangkap sinyal itu sebagai tripel yang berisi prompt, respons pilihan, dan respons yang ditolak. Tantangannya adalah mengubah perbandingan tersebut menjadi pembaruan model tanpa memperlakukan preferensi subjektif sebagai target next-token biasa. Direct Preference Optimization (DPO) menawarkan satu pendekatan praktis. DPO melatih policy model agar meningkatkan preferensi relatif terhadap respons pilihan dibanding respons yang ditolak, sambil mengukur perubahan itu terhadap model referensi yang tetap. Berbeda dari pipeline reinforcement learning from human feedback yang umum, DPO standar tidak memerlukan pelatihan reward model terpisah lalu menjalankan optimizer reinforcement learning.

Kecerdasan Buatan 05 Sep 2026 9 min read

Ukur Konsentrasi Attention dengan Entropi

Attention pada Transformer sering diperiksa sebagai matriks bobot. Cara ini cukup untuk beberapa contoh, tetapi menjadi sulit ketika Anda perlu membandingkan banyak head, layer, token, atau beberapa model run. Ringkasan yang berguna adalah entropi attention: angka yang menggambarkan seberapa terkonsentrasi atau tersebar suatu distribusi attention. Entropi dapat menjawab pertanyaan yang sempit tetapi praktis: apakah query menempatkan sebagian besar massa attention pada sedikit posisi yang tersedia, atau menyebarkannya secara luas? Entropi tidak memberi tahu apakah model benar, apakah sebuah token menyebabkan prediksi, atau apakah sebuah head penting. Dengan memahami batas tersebut, entropi menjadi diagnostik ringkas untuk perilaku attention.

Kecerdasan Buatan 05 Sep 2026 9 min read

Model Ensembling untuk Menggabungkan Prediksi

Sebuah model machine learning dapat gagal karena pola yang spesifik terhadap proses pelatihannya: initialization, batch yang tersampel, data pelatihan, arsitektur, atau hyperparameter. Model lain dapat menghasilkan kesalahan yang berbeda. Ensembling memanfaatkan perbedaan tersebut dengan menggabungkan prediksi beberapa model alih-alih bergantung pada satu model saja. Idenya sederhana, tetapi ensemble yang berguna membutuhkan lebih dari sekadar merata-ratakan semua model yang tersedia. Model yang membuat kesalahan hampir identik memberikan sedikit informasi pelengkap, sedangkan model yang beragam dapat memperbaiki prediksi dengan konsekuensi tambahan biaya pelatihan, memori, dan inference.

Kecerdasan Buatan 03 Sep 2026 9 min read

Batch Inference LLM untuk Throughput yang Lebih Baik

Server LLM dapat menerima banyak request pada saat yang sama, tetapi memproses setiap request secara terpisah sering kali merupakan cara yang tidak efisien untuk menggunakan akselerator. GPU dan perangkat keras serupa dirancang untuk menjalankan pekerjaan numerik paralel dalam jumlah besar. Satu request kecil dapat membuat sebagian kapasitas tersebut tidak terpakai. Batching menggabungkan pekerjaan dari beberapa request agar model dapat memproses lebih banyak pekerjaan secara bersamaan. Ini dapat meningkatkan throughput total, tetapi menghadirkan trade-off penting: menunggu batch terbentuk dapat menunda request individual, dan request dengan panjang sequence berbeda tidak menghabiskan jumlah pekerjaan yang sama.

Kecerdasan Buatan 02 Sep 2026 5 min read

Atur Anggaran Context Window LLM Tanpa Kehilangan Instruksi Penting

Aplikasi large language model jarang gagal hanya karena prompt kelebihan satu token. Kegagalan biasanya terjadi karena pertumbuhan context ditangani tanpa prioritas. Riwayat chat membesar, retrieval mengembalikan lebih banyak passage, hasil tool menjadi panjang, dan pada akhirnya aplikasi memangkas teks mana pun yang paling mudah dipotong. Desain yang lebih aman memperlakukan context window sebagai anggaran dengan alokasi eksplisit. Tujuannya bukan mengisi setiap token yang tersedia, melainkan mempertahankan informasi yang mengendalikan perilaku sekaligus menyisakan ruang yang cukup untuk jawaban lengkap.