Ukur Gradient Noise Sebelum Menaikkan Batch Size
Memperbesar batch training mengurangi variasi pada gradien minibatch, tetapi pengurangan tersebut tidak terus menghasilkan progres yang sebanding. Setelah batch cukup besar sehingga estimasi gradiennya sudah didominasi oleh sinyal gradien yang mendasarinya, memproses lebih banyak contoh sebelum parameter update berikutnya memberikan diminishing return secara algoritmik. Gradient noise scale membuat transisi ini dapat diukur. Besaran ini membandingkan variasi stokastik pada gradien per-example dengan besar mean gradient. Nilainya bukan pengaturan batch size universal, dan estimator tepatnya bergantung pada asumsi sampling serta agregasi gradien. Gradient noise scale berguna sebagai diagnostik untuk mengetahui seberapa banyak tambahan batch parallelism yang dapat diserap oleh state optimisasi saat ini.