Langsung ke konten

Arsip

Evaluasi Model

7 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Temperature Scaling Mengkalibrasi Ulang Confidence Classifier Tanpa Mengubah Urutan Kelas

Sebuah classifier dapat menempatkan kelas yang benar di atas semua alternatif, tetapi menghasilkan probabilitas yang secara sistematis terlalu terkonsentrasi atau terlalu menyebar. Temperature scaling menangani ketidakselarasan itu setelah training dengan menerapkan satu skalar pada logit sebelum softmax. Confidence yang dilaporkan berubah tanpa mengubah parameter classifier utama. Batas mekanismenya sempit. Metode ini tidak memperbaiki urutan kelas yang keliru, tidak menambahkan informasi pada representasi, dan tidak membuat setiap probabilitas individual menjadi akurat. Sasaran utamanya adalah hubungan antara confidence dan hasil yang teramati pada data yang representatif terhadap deployment.

Kecerdasan Buatan 23 Sep 2026 5 min read

Entropi Attention Mengukur Konsentrasi, Bukan Kepentingan Kausal

Sebuah attention head dapat menempatkan sebagian besar massa probabilitas pada satu posisi tanpa memberikan bukti kuat bahwa posisi tersebut mengendalikan output akhir model. Entropi bobot attention mengukur konsentrasi, bukan pengaruh kausal. Pemisahan ini relevan saat attention map dipakai sebagai diagnostik. Entropi dapat menunjukkan apakah sebuah head menyebarkan massa secara luas atau memusatkannya pada sedikit posisi untuk query tertentu. Nilai itu sendiri tidak menetapkan bahwa token dengan bobot tertinggi membawa fitur yang menentukan prediksi downstream.

Kecerdasan Buatan 17 Sep 2026 6 min read

Selective Classification Menukar Coverage dengan Tingkat Error

Classifier biasanya mengembalikan label untuk setiap input, bahkan ketika distribusi skornya hampir seimbang atau input berada jauh dari data yang familiar. Selective classification mengubah antarmuka tersebut: sistem dapat mengembalikan prediksi atau abstain. Aturan penerimaan kemudian menentukan berapa banyak input yang menerima prediksi dan seberapa sering prediksi yang diterima itu salah. Ini tidak sama dengan membuat classifier secara intrinsik lebih akurat. Abstention memindahkan sebagian kasus keluar dari himpunan keputusan otomatis. Nilainya bergantung pada kemampuan selection score mengurutkan kasus sulit dengan cukup baik sehingga input yang ditolak memuat porsi error yang lebih besar.

Kecerdasan Buatan 17 Sep 2026 5 min read

Evaluasi Klasifikator Probabilistik dengan Brier Score

Dua klasifikator dapat menghasilkan label prediksi dan akurasi yang sama, tetapi memberikan probabilitas yang sangat berbeda untuk label tersebut. Sistem yang selalu menghasilkan 0.51 untuk keputusan biner yang benar tidak membuat klaim probabilistik yang sama dengan sistem yang menghasilkan 0.99, meskipun akurasi berbasis threshold dapat memperlakukan keduanya secara identik. Brier score mempertahankan perbedaan itu. Metrik ini mengukur squared error antara probabilitas prediksi dan hasil yang benar-benar terjadi, sehingga kelas yang dipilih maupun besar probabilitas untuk setiap hasil ikut memengaruhi skor. Ini berguna ketika komponen downstream memakai probabilitas untuk ranking, threshold, abstention, atau keputusan berbasis expected cost.

Kecerdasan Buatan 11 Sep 2026 9 min read

Bangun Prediction Set dengan Conformal Prediction

Bangun Prediction Set dengan Conformal Prediction Classifier biasanya mengembalikan satu label bahkan ketika beberapa label sama-sama masuk akal. Ini nyaman untuk interface software, tetapi dapat menyembunyikan ketidakpastian tepat pada kondisi ketika kesalahan mahal. Document router mungkin ragu antara billing dan account, tetapi argmax tetap mengeluarkan salah satunya. Conformal prediction menawarkan interface lain: kembalikan sekumpulan label dengan ukuran yang menyesuaikan bukti. Input yang mudah dapat menghasilkan satu label. Input ambigu dapat menghasilkan beberapa label. Di bawah asumsi tertentu, prosedur ini juga memberikan finite-sample coverage guarantee.

Kecerdasan Buatan 08 Sep 2026 8 min read

Deteksi Input Out-of-Distribution dengan Energy Score

Classifier dapat sangat akurat pada test set tetapi tetap menghasilkan prediksi dengan confidence tinggi untuk input yang jauh berbeda dari data training. Classifier produk yang dilatih pada sepatu, tas, dan jam tangan dapat menerima foto sepeda tetapi tetap dipaksa memilih salah satu class yang dikenalnya. Ini menimbulkan masalah deployment: classification biasa menjawab class dikenal mana yang paling mungkin, sementara banyak sistem juga perlu menentukan apakah input cukup menyerupai data tempat classifier divalidasi.

Kecerdasan Buatan 05 Sep 2026 9 min read

Model Ensembling untuk Menggabungkan Prediksi

Sebuah model machine learning dapat gagal karena pola yang spesifik terhadap proses pelatihannya: initialization, batch yang tersampel, data pelatihan, arsitektur, atau hyperparameter. Model lain dapat menghasilkan kesalahan yang berbeda. Ensembling memanfaatkan perbedaan tersebut dengan menggabungkan prediksi beberapa model alih-alih bergantung pada satu model saja. Idenya sederhana, tetapi ensemble yang berguna membutuhkan lebih dari sekadar merata-ratakan semua model yang tersedia. Model yang membuat kesalahan hampir identik memberikan sedikit informasi pelengkap, sedangkan model yang beragam dapat memperbaiki prediksi dengan konsekuensi tambahan biaya pelatihan, memori, dan inference.