Langsung ke konten

Arsip

Pelatihan Model

8 artikel
Kecerdasan Buatan 23 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target Sebelum Cross-Entropy

Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah. Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.

Kecerdasan Buatan 23 Sep 2026 5 min read

Kapasitas Switch Routing Mengubah Ketimpangan Expert Menjadi Token Overflow

Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch. Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.

Kecerdasan Buatan 23 Sep 2026 4 min read

Global Gradient Clipping Membatasi Norm Sebelum Langkah Optimizer

Satu langkah training dapat menghasilkan gradient dengan besar gabungan yang jauh melampaui langkah di sekitarnya. Global norm clipping mengubah kumpulan gradient tersebut sebelum diproses optimizer. Saat norm yang diukur melewati ambang yang ditetapkan, setiap gradient terpilih dikalikan dengan faktor skala yang sama. Batas mekanismenya perlu dinyatakan dengan tepat. Clipping mengendalikan norm gradient yang diberikan ke optimizer. Operasi ini tidak secara langsung menetapkan batas yang sama pada perubahan parameter, terutama ketika optimizer menyimpan momentum atau state adaptif.

Kecerdasan Buatan 17 Sep 2026 7 min read

Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts

Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih. Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.

Kecerdasan Buatan 15 Sep 2026 5 min read

Batasi Norm Gradient dengan Cakupan yang Jelas

Gradient norm clipping mengubah update optimizer hanya ketika norm gradient yang diukur melampaui threshold yang dipilih. Operasinya terdengar lokal, tetapi perilakunya bergantung pada pilihan implementasi yang lebih luas: gradient mana yang ikut dihitung dalam norm. Dua training loop dapat menggunakan threshold dan optimizer yang sama tetapi menghasilkan update berbeda karena keduanya melakukan clipping pada kelompok parameter berbeda atau pada titik berbeda dalam siklus update. Hal ini membuat cakupan clipping menjadi bagian dari definisi optimisasi, bukan sekadar pengaman terhadap gradient yang sangat besar.

Kecerdasan Buatan 14 Sep 2026 6 min read

Akumulasi Gradien di Beberapa Microbatch

Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama. Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.

Kecerdasan Buatan 06 Sep 2026 9 min read

Direct Preference Optimization untuk Alignment LLM

Supervised fine-tuning dapat membuat model bahasa meniru jawaban yang baik, tetapi banyak persoalan alignment lebih mudah dinyatakan sebagai perbandingan: dari dua respons untuk prompt yang sama, respons mana yang lebih baik? Dataset preferensi menangkap sinyal itu sebagai tripel yang berisi prompt, respons pilihan, dan respons yang ditolak. Tantangannya adalah mengubah perbandingan tersebut menjadi pembaruan model tanpa memperlakukan preferensi subjektif sebagai target next-token biasa. Direct Preference Optimization (DPO) menawarkan satu pendekatan praktis. DPO melatih policy model agar meningkatkan preferensi relatif terhadap respons pilihan dibanding respons yang ditolak, sambil mengukur perubahan itu terhadap model referensi yang tetap. Berbeda dari pipeline reinforcement learning from human feedback yang umum, DPO standar tidak memerlukan pelatihan reward model terpisah lalu menjalankan optimizer reinforcement learning.