Langsung ke konten

Arsip

Training Model

5 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Sequence Packing Memerlukan Attention Mask yang Sadar Batas

Sequence packing mengurangi padding dengan menempatkan beberapa contoh berpanjang variabel ke dalam satu buffer token. Layout penyimpanannya dapat terlihat seperti satu sequence panjang, tetapi setiap contoh tetap independen secara semantik. Causal mask standar tidak menjaga independensi tersebut dengan sendirinya. Pada Transformer decoder-only, causal masking mencegah attention menuju posisi masa depan. Mekanisme ini biasanya tidak mencegah attention menuju posisi sebelumnya yang berasal dari contoh lain dalam buffer yang sama. Jika batas diabaikan, token pada contoh berikutnya dapat mengakses key dan value dari contoh sebelumnya. Model akhirnya menerima konteks yang semestinya dipisahkan oleh data pipeline.

Kecerdasan Buatan 17 Sep 2026 5 min read

Batasi Pergeseran Parameter dengan Elastic Weight Consolidation

Fine-tuning neural network pada task baru dapat menggeser parameter dari nilai yang mendukung task sebelumnya. Objective baru tidak memiliki alasan inheren untuk mempertahankan perilaku lama ketika data task sebelumnya tidak ikut dalam update. Elastic weight consolidation, atau EWC, menambahkan constraint di parameter space untuk mengurangi pergeseran tersebut. Constraint ini selektif, bukan seragam. Parameter yang diperkirakan lebih berpengaruh bagi task sebelumnya menerima penalti lebih besar ketika bergerak, sedangkan parameter dengan importance lebih rendah dapat berubah lebih bebas. EWC karena itu bukan sekadar weight decay menuju nol.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Gradient Noise Sebelum Menaikkan Batch Size

Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.

Kecerdasan Buatan 15 Sep 2026 6 min read

Memperhitungkan Label Smoothing pada Confidence Classifier

Classifier yang dilatih dengan target one-hot mendapat dorongan untuk memindahkan massa probabilitas ke kelas berlabel. Cross-entropy terus menurun saat model memberi kelas tersebut probabilitas yang semakin mendekati satu, bahkan setelah kelas prediksi sudah benar. Label smoothing mengubah tekanan ini dengan memberikan sedikit massa target kepada kelas lain. Perubahan tersebut mudah dianggap sebagai detail kecil pada loss function. Namun dampaknya tidak kecil ketika aplikasi menggunakan nilai probabilitas model. Target yang dilunakkan mengubah optimum yang didorong oleh objektif training, sehingga skor confidence dari model dengan smoothing tidak seharusnya ditafsirkan seolah berasal dari objektif yang sama dengan training one-hot biasa.

Kecerdasan Buatan 15 Sep 2026 4 min read

Isolasi Attention Antar-Sequence Training yang Dipack

Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama. Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.