Langsung ke konten

Arsip

Training

4 artikel
Kecerdasan Buatan 17 Sep 2026 5 min read

Teacher Forcing Menciptakan Kesenjangan Distribusi Prefix

Model autoregresif memprediksi token berikutnya dari sebuah prefix. Dalam training dengan teacher forcing, prefix tersebut biasanya berasal dari sequence referensi. Saat generasi, prefix berisi token yang dikeluarkan model sendiri. Satu kesalahan prediksi karena itu dapat mengubah konteks yang digunakan untuk seluruh prediksi berikutnya. Perbedaan ini sering disebut exposure bias. Detail engineering yang lebih berguna adalah bahwa training dan generasi dapat menyajikan distribusi prefix yang berbeda kepada predictor kondisional yang sama. Validasi token-level pada prefix referensi yang bersih tidak sepenuhnya menggambarkan perilaku ketika model memasuki prefix yang jarang muncul selama training.

Kecerdasan Buatan 17 Sep 2026 5 min read

Membatasi Update Gradien dengan Global Norm Clipping

Satu langkah optimisasi dapat menghasilkan gradien dengan besar gabungan yang jauh melebihi langkah-langkah di sekitarnya. Jika gradien itu langsung diberikan kepada optimizer, update parameter yang dihasilkan dapat memindahkan model ke wilayah space parameter yang sangat berbeda. Global norm clipping membatasi besar gradien sebelum optimizer memakainya. Mekanismenya sederhana, tetapi perilakunya mudah disalahartikan. Mekanisme ini tidak membatasi setiap elemen gradien secara terpisah dan tidak menjamin norm update parameter yang tetap untuk optimizer adaptif. Mekanisme ini menskalakan ulang seluruh vektor gradien ketika norm yang dipilih melewati ambang.

Kecerdasan Buatan 16 Sep 2026 6 min read

Exposure Bias pada Decoding Autoregresif

Model autoregresif dapat menerima konteks yang lebih bersih saat training dibandingkan saat generation. Dengan teacher forcing, prediksi token berikutnya dikondisikan pada prefix referensi dari urutan training. Saat free-running decoding, model justru dikondisikan pada token yang dihasilkannya sendiri. Setelah sebuah token berbeda dari kelanjutan yang dituju, prediksi berikutnya bekerja pada prefix yang mungkin lebih jarang muncul dalam data training. Ketidakcocokan ini umum disebut exposure bias. Masalahnya bukan sekadar bahwa model autoregresif dapat membuat kesalahan. Intinya adalah distribusi prefix yang diberikan kepada model dapat berubah antara optimisasi dan generation, sementara satu penyimpangan awal dapat mengubah setiap prediksi kondisional sesudahnya.

Kecerdasan Buatan 14 Sep 2026 5 min read

Exposure Bias pada Generation Autoregresif

Model autoregresif dapat menerima prefix bersih pada setiap posisi training, tetapi tetap menghadapi distribusi input berbeda saat generation. Training umumnya memberi skor pada token referensi berikutnya sambil dikondisikan pada token referensi sebelumnya. Saat inference, prefix justru berisi output model sendiri. Ketidakcocokan ini disebut exposure bias. Dampaknya muncul karena kesalahan awal pada generation tidak hanya membuat satu token keliru. Token tersebut menjadi bagian dari konteks untuk prediksi berikutnya, sehingga model memasuki state prefix yang mungkin jarang atau tidak pernah muncul saat training.