Langsung ke konten

Arsip

Neural Network

10 artikel
Kecerdasan Buatan 23 Sep 2026 5 min read

Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi

Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi. Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.

Kecerdasan Buatan 17 Sep 2026 5 min read

Batasi Pergeseran Parameter dengan Elastic Weight Consolidation

Fine-tuning neural network pada task baru dapat menggeser parameter dari nilai yang mendukung task sebelumnya. Objective baru tidak memiliki alasan inheren untuk mempertahankan perilaku lama ketika data task sebelumnya tidak ikut dalam update. Elastic weight consolidation, atau EWC, menambahkan constraint di parameter space untuk mengurangi pergeseran tersebut. Constraint ini selektif, bukan seragam. Parameter yang diperkirakan lebih berpengaruh bagi task sebelumnya menerima penalti lebih besar ketika bergerak, sedangkan parameter dengan importance lebih rendah dapat berubah lebih bebas. EWC karena itu bukan sekadar weight decay menuju nol.

Kecerdasan Buatan 15 Sep 2026 6 min read

Memperhitungkan Label Smoothing pada Confidence Classifier

Classifier yang dilatih dengan target one-hot mendapat dorongan untuk memindahkan massa probabilitas ke kelas berlabel. Cross-entropy terus menurun saat model memberi kelas tersebut probabilitas yang semakin mendekati satu, bahkan setelah kelas prediksi sudah benar. Label smoothing mengubah tekanan ini dengan memberikan sedikit massa target kepada kelas lain. Perubahan tersebut mudah dianggap sebagai detail kecil pada loss function. Namun dampaknya tidak kecil ketika aplikasi menggunakan nilai probabilitas model. Target yang dilunakkan mengubah optimum yang didorong oleh objektif training, sehingga skor confidence dari model dengan smoothing tidak seharusnya ditafsirkan seolah berasal dari objektif yang sama dengan training one-hot biasa.

Kecerdasan Buatan 15 Sep 2026 5 min read

Batasi Norm Gradient dengan Cakupan yang Jelas

Gradient norm clipping mengubah update optimizer hanya ketika norm gradient yang diukur melampaui threshold yang dipilih. Operasinya terdengar lokal, tetapi perilakunya bergantung pada pilihan implementasi yang lebih luas: gradient mana yang ikut dihitung dalam norm. Dua training loop dapat menggunakan threshold dan optimizer yang sama tetapi menghasilkan update berbeda karena keduanya melakukan clipping pada kelompok parameter berbeda atau pada titik berbeda dalam siklus update. Hal ini membuat cakupan clipping menjadi bagian dari definisi optimisasi, bukan sekadar pengaman terhadap gradient yang sangat besar.

Kecerdasan Buatan 14 Sep 2026 5 min read

Perbandingan RMSNorm dan Layer Normalization

Layer normalisasi dapat terlihat saling menggantikan ketika bentuk output-nya serupa, tetapi invariansinya tidak sama. RMSNorm menskalakan ulang vektor aktivasi menggunakan root mean square tanpa terlebih dahulu mengurangi nilai rata-rata vektor. Layer normalization melakukan centering pada vektor, lalu menskalakannya menggunakan varians. Tidak adanya operasi centering merupakan perbedaan utamanya. Hal ini mengubah transformasi mana pada vektor aktivasi yang hilang setelah normalisasi dan mana yang tetap terlihat oleh bagian jaringan berikutnya. Kedua operasi menormalisasi besaran yang berbeda Untuk vektor aktivasi x dengan d komponen, LayerNorm menghitung mean dan varians pada dimensi yang dinormalisasi:

Kecerdasan Buatan 14 Sep 2026 6 min read

Akumulasi Gradien di Beberapa Microbatch

Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama. Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.

Kecerdasan Buatan 13 Sep 2026 6 min read

Perbandingan RMSNorm dan LayerNorm pada Transformer

LayerNorm dan RMSNorm dapat menempati posisi struktural yang sama pada transformer sambil menerapkan operasi berbeda pada residual stream. LayerNorm mengurangi feature mean sebelum melakukan scaling berdasarkan ukuran penyebaran. RMSNorm melewati operasi centering dan melakukan scaling langsung dari root mean square feature. Perbedaan aljabar kecil tersebut mengubah transformasi mana pada vektor aktivasi yang dihapus oleh normalisasi. Artinya, mengganti satu operasi dengan yang lain secara umum bukan edit yang mempertahankan fungsi model yang sudah ada.

Kecerdasan Buatan 10 Sep 2026 9 min read

Regularisasi Neural Network dengan Mixup

Regularisasi Neural Network dengan Mixup Sebuah neural network dapat menyesuaikan diri dengan contoh training-nya sambil tetap berperilaku tidak terduga di ruang di antara contoh-contoh tersebut. Jika dua input yang berdekatan berasal dari kelas berbeda, training standar memberi tahu model apa yang harus dilakukan pada titik ujung, tetapi sering kali hanya memberi sedikit informasi tentang titik-titik di antaranya. Mixup mengubah sinyal training tersebut. Alih-alih berlatih hanya pada contoh individual, mixup membuat contoh sintetis dengan menginterpolasi pasangan input beserta labelnya. Model kemudian diminta menghasilkan prediksi campuran yang sesuai. Ini bertindak sebagai regularizer karena membatasi bagaimana prediksi boleh berubah di antara contoh training.

Kecerdasan Buatan 07 Sep 2026 9 min read

Rata-ratakan Bobot Neural Network dengan Stochastic Weight Averaging

Sebuah neural network jarang mengakhiri pelatihan tepat di satu-satunya titik berguna dalam ruang parameter. Menjelang akhir pelatihan, stochastic gradient descent (SGD) dapat mengunjungi beberapa konfigurasi parameter yang berdekatan dan semuanya berkinerja cukup baik, sementara checkpoint terakhir hanya mewakili salah satunya. Stochastic weight averaging (SWA) mengubah pengamatan tersebut menjadi teknik pelatihan sederhana: kumpulkan parameter model dari beberapa titik pada bagian akhir trajektori SGD lalu hitung rata-rata aritmetikanya. Hasilnya adalah satu model dengan bobot yang dirata-ratakan, sehingga inference tidak perlu menjalankan ensemble dari semua checkpoint yang dikumpulkan.

Kecerdasan Buatan 07 Sep 2026 9 min read

Adaptasi Neural Network dengan Gradient Reversal

Sebuah classifier dapat bekerja baik saat evaluasi lalu melemah setelah deployment karena input berubah. Foto produk mungkin berasal dari kamera baru, pesan dukungan dapat memakai kosakata berbeda, atau pembacaan sensor datang dari hardware lain. Mengumpulkan label untuk lingkungan baru bisa mahal meskipun contoh tanpa label mudah diperoleh. Domain-adversarial training menangani salah satu bentuk masalah ini. Metode ini meminta feature extractor mendukung tugas prediksi sekaligus membuat domain source dan target sulit dibedakan. Sebuah gradient reversal layer membuat kedua tujuan yang berlawanan itu dapat dilatih dengan backpropagation biasa dengan membalik gradient dari domain classifier sebelum mencapai feature extractor.