Langsung ke konten

Arsip

Softmax

8 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Temperature Scaling Mengkalibrasi Ulang Confidence Classifier Tanpa Mengubah Urutan Kelas

Sebuah classifier dapat menempatkan kelas yang benar di atas semua alternatif, tetapi menghasilkan probabilitas yang secara sistematis terlalu terkonsentrasi atau terlalu menyebar. Temperature scaling menangani ketidakselarasan itu setelah training dengan menerapkan satu skalar pada logit sebelum softmax. Confidence yang dilaporkan berubah tanpa mengubah parameter classifier utama. Batas mekanismenya sempit. Metode ini tidak memperbaiki urutan kelas yang keliru, tidak menambahkan informasi pada representasi, dan tidak membuat setiap probabilitas individual menjadi akurat. Sasaran utamanya adalah hubungan antara confidence dan hasil yang teramati pada data yang representatif terhadap deployment.

Kecerdasan Buatan 24 Sep 2026 5 min read

Tanh Logit Soft Capping Membatasi Skor Ekstrem Sebelum Softmax

Softmax dapat menerima logit dengan magnitudo hingga berapa pun selama nilainya finite, tetapi selisih skor yang besar membuat keluarannya semakin terkonsentrasi. Tanh logit soft capping menyisipkan transformasi nonlinear terbatas sebelum softmax sehingga logit hasil transformasi tidak melewati magnitudo yang ditentukan. Untuk cap positif c, bentuk yang umum adalah: softcap(z; c) = c * tanh(z / c) Operasi ini bukan hard clipping pada ambang tertentu. Di sekitar nol perilakunya hampir linear, lalu magnitudo yang lebih besar dikompresi secara bertahap saat mendekati -c atau c.

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 23 Sep 2026 4 min read

Temperature Scaling Mengubah Sampling Tanpa Mengubah Urutan Logit

Temperature sering tersedia sebagai satu parameter generasi, tetapi efeknya lebih sempit daripada kendali umum atas kualitas output. Untuk sebuah vektor logit finite yang tetap, temperature positif mengubah skala selisih sebelum softmax. Probabilitas hasilnya berubah tanpa mengubah relasi logit mana yang lebih besar. Perbedaan ini relevan ketika serving layer menggabungkan temperature dengan greedy selection, top-k filtering, top-p filtering, penalty, atau penanganan khusus untuk temperature nol. Nilai numerik yang sama dapat berada dalam pipeline decoding yang berbeda meski operasi scaling dasarnya sederhana.

Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Kecerdasan Buatan 23 Sep 2026 3 min read

Softmax Stabil Mengurangi Logit Maksimum Sebelum Eksponensiasi

Decoder dapat menerima logit yang cukup besar sehingga eksponensiasi langsung tidak aman secara numerik, padahal distribusi probabilitas yang dimaksud tetap biasa. Softmax tidak mengharuskan eksponensiasi terhadap nilai awal. Mengurangi semua logit dengan logit terbesar menghasilkan distribusi yang sama dalam aritmetika real eksak sekaligus memindahkan nilai eksponensial ke rentang numerik yang lebih aman. Pergeseran ini merupakan sifat softmax, bukan heuristik khusus model tertentu. Pergeseran bersama hilang saat normalisasi Untuk logit (z_1,\ldots,z_n), softmax menghasilkan

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 6 min read

Bias Logit Aditif Mengubah Odds Token Sebelum Sampling

Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya. Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.