Langsung ke konten

Arsip

Neural Networks

4 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Activation Checkpointing Menukar Aktivasi Tersimpan dengan Rekomputasi

Activation checkpointing mengubah tensor forward pass yang tetap berada di memori sampai backpropagation. Alih-alih menyimpan setiap aktivasi intermediate yang diperlukan untuk perhitungan gradien, region yang memakai checkpoint mempertahankan state pada boundary tertentu dan membentuk kembali intermediate yang dibuang ketika backward pass mencapai region tersebut. Mekanisme ini mengurangi memori aktivasi dengan biaya komputasi tambahan. Parameter model, state optimizer, dan gradien tidak ikut mengecil, sehingga dampaknya terhadap total memori training bergantung pada porsi footprint yang berasal dari aktivasi.

Kecerdasan Buatan 23 Sep 2026 4 min read

Global Gradient Clipping Membatasi Norm Sebelum Langkah Optimizer

Satu langkah training dapat menghasilkan gradient dengan besar gabungan yang jauh melampaui langkah di sekitarnya. Global norm clipping mengubah kumpulan gradient tersebut sebelum diproses optimizer. Saat norm yang diukur melewati ambang yang ditetapkan, setiap gradient terpilih dikalikan dengan faktor skala yang sama. Batas mekanismenya perlu dinyatakan dengan tepat. Clipping mengendalikan norm gradient yang diberikan ke optimizer. Operasi ini tidak secara langsung menetapkan batas yang sama pada perubahan parameter, terutama ketika optimizer menyimpan momentum atau state adaptif.

Kecerdasan Buatan 17 Sep 2026 5 min read

Membatasi Update Gradien dengan Global Norm Clipping

Satu langkah optimisasi dapat menghasilkan gradien dengan besar gabungan yang jauh melebihi langkah-langkah di sekitarnya. Jika gradien itu langsung diberikan kepada optimizer, update parameter yang dihasilkan dapat memindahkan model ke wilayah space parameter yang sangat berbeda. Global norm clipping membatasi besar gradien sebelum optimizer memakainya. Mekanismenya sederhana, tetapi perilakunya mudah disalahartikan. Mekanisme ini tidak membatasi setiap elemen gradien secara terpisah dan tidak menjamin norm update parameter yang tetap untuk optimizer adaptif. Mekanisme ini menskalakan ulang seluruh vektor gradien ketika norm yang dipilih melewati ambang.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Gradient Noise Sebelum Menaikkan Batch Size

Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.