Langsung ke konten

Arsip

Optimisasi

9 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Global Gradient Norm Clipping Menskalakan Ulang Gradient Parameter dengan Satu Faktor Bersama

Global gradient norm clipping memperlakukan gradient parameter saat ini sebagai satu vektor agregat. Jika norm-nya melampaui ambang, setiap gradient yang terlibat dikalikan dengan koefisien yang sama. Operasi ini mengubah besar update sambil mempertahankan arah vektor gradient agregat, selain perbedaan yang dapat muncul akibat presisi numerik terbatas. Satu norm mengendalikan seluruh kumpulan gradient Misalkan gradient parameter adalah g_1, g_2, ... g_m. Untuk p-norm, global clipping terlebih dahulu menghitung norm yang ekuivalen dengan hasil konkatenasi seluruh gradient:

Kecerdasan Buatan 23 Sep 2026 4 min read

Label Smoothing Mendistribusikan Ulang Probabilitas Target Sebelum Cross-Entropy

Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah. Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.

Kecerdasan Buatan 23 Sep 2026 4 min read

Global Gradient Clipping Membatasi Norm Sebelum Langkah Optimizer

Satu langkah training dapat menghasilkan gradient dengan besar gabungan yang jauh melampaui langkah di sekitarnya. Global norm clipping mengubah kumpulan gradient tersebut sebelum diproses optimizer. Saat norm yang diukur melewati ambang yang ditetapkan, setiap gradient terpilih dikalikan dengan faktor skala yang sama. Batas mekanismenya perlu dinyatakan dengan tepat. Clipping mengendalikan norm gradient yang diberikan ke optimizer. Operasi ini tidak secara langsung menetapkan batas yang sama pada perubahan parameter, terutama ketika optimizer menyimpan momentum atau state adaptif.

Kecerdasan Buatan 18 Sep 2026 5 min read

Hitung Ulang Statistik BatchNorm Setelah Weight Averaging

Merata-ratakan dua checkpoint jaringan neural dapat menghasilkan vektor parameter yang berguna, tetapi meninggalkan statistik berjalan BatchNorm yang terikat pada jaringan berbeda. Bobot menentukan satu kumpulan aktivasi; running mean dan running variance yang tersimpan dapat menggambarkan aktivasi dari bobot sebelumnya. Inferensi kemudian menggabungkan state dari dua titik berbeda di ruang parameter. Ketidakcocokan ini mudah terlewat karena statistik berjalan BatchNorm merupakan buffer, bukan parameter yang dioptimalkan, pada banyak implementasi. Prosedur weight averaging dapat menangani semua bobot dengan benar dan tetap menghasilkan state inferensi yang tidak konsisten secara internal.

Kecerdasan Buatan 17 Sep 2026 5 min read

Batasi Pergeseran Parameter dengan Elastic Weight Consolidation

Fine-tuning neural network pada task baru dapat menggeser parameter dari nilai yang mendukung task sebelumnya. Objective baru tidak memiliki alasan inheren untuk mempertahankan perilaku lama ketika data task sebelumnya tidak ikut dalam update. Elastic weight consolidation, atau EWC, menambahkan constraint di parameter space untuk mengurangi pergeseran tersebut. Constraint ini selektif, bukan seragam. Parameter yang diperkirakan lebih berpengaruh bagi task sebelumnya menerima penalti lebih besar ketika bergerak, sedangkan parameter dengan importance lebih rendah dapat berubah lebih bebas. EWC karena itu bukan sekadar weight decay menuju nol.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Gradient Noise Sebelum Menaikkan Batch Size

Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.

Kecerdasan Buatan 15 Sep 2026 5 min read

Batasi Norm Gradient dengan Cakupan yang Jelas

Gradient norm clipping mengubah update optimizer hanya ketika norm gradient yang diukur melampaui threshold yang dipilih. Operasinya terdengar lokal, tetapi perilakunya bergantung pada pilihan implementasi yang lebih luas: gradient mana yang ikut dihitung dalam norm. Dua training loop dapat menggunakan threshold dan optimizer yang sama tetapi menghasilkan update berbeda karena keduanya melakukan clipping pada kelompok parameter berbeda atau pada titik berbeda dalam siklus update. Hal ini membuat cakupan clipping menjadi bagian dari definisi optimisasi, bukan sekadar pengaman terhadap gradient yang sangat besar.

Kecerdasan Buatan 14 Sep 2026 6 min read

Akumulasi Gradien di Beberapa Microbatch

Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama. Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.

Kecerdasan Buatan 07 Sep 2026 9 min read

Rata-ratakan Bobot Neural Network dengan Stochastic Weight Averaging

Sebuah neural network jarang mengakhiri pelatihan tepat di satu-satunya titik berguna dalam ruang parameter. Menjelang akhir pelatihan, stochastic gradient descent (SGD) dapat mengunjungi beberapa konfigurasi parameter yang berdekatan dan semuanya berkinerja cukup baik, sementara checkpoint terakhir hanya mewakili salah satunya. Stochastic weight averaging (SWA) mengubah pengamatan tersebut menjadi teknik pelatihan sederhana: kumpulkan parameter model dari beberapa titik pada bagian akhir trajektori SGD lalu hitung rata-rata aritmetikanya. Hasilnya adalah satu model dengan bobot yang dirata-ratakan, sehingga inference tidak perlu menjalankan ensemble dari semua checkpoint yang dikumpulkan.