Label Smoothing Mendistribusikan Ulang Probabilitas Target Sebelum Cross-Entropy
Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah. Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.