Classifier yang menghasilkan 0.93 untuk satu kelas tidak otomatis memberikan pernyataan statistik bahwa kelas tersebut benar dengan probabilitas 0.93. Conformal prediction mengambil pendekatan berbeda: metode ini menggunakan contoh berlabel yang ditahan untuk membentuk sekumpulan label kandidat dengan target marginal coverage tertentu.

Pada split conformal classification, base model dapat tetap tidak berubah. Jaminannya berasal dari peringkat skor conformity atau nonconformity sebuah contoh uji terhadap skor yang dihitung pada sampel kalibrasi yang exchangeable. Asumsi inilah yang menentukan cakupan pernyataan coverage tersebut.

Sebuah skor mengubah output model menjadi peringkat

Pertimbangkan classifier tetap dengan probabilitas kelas p(y | x). Skor nonconformity sederhana untuk contoh berlabel adalah

s(x, y) = 1 - p(y | x)

Probabilitas tinggi untuk label yang diamati menghasilkan skor kecil. Definisi skor lain juga dapat digunakan, termasuk skor yang memakai massa probabilitas kumulatif pada kelas yang diurutkan. Mekanisme konformal tidak mengharuskan skor tersebut berupa probabilitas yang sudah terkalibrasi.

Pada split conformal prediction, fitting model dan kalibrasi dipisahkan. Model sudah di-fit sebelum skor kalibrasi dihitung. Sebuah quantile dari skor yang ditahan tersebut kemudian menentukan threshold untuk input baru.

Untuk label kandidat y, sistem mengevaluasi s(x_new, y) dan memasukkan label itu jika skornya berada dalam threshold yang telah dikalibrasi. Output dapat berisi satu label, beberapa label, atau, bergantung pada skor dan threshold, seluruh label.

Ini adalah prediksi berbentuk set, bukan point classifier baru.

Coverage bersifat marginal terhadap contoh uji

Untuk contoh kalibrasi dan pengujian yang exchangeable, konstruksi konformal standar memberikan pernyataan finite-sample marginal coverage. Pada target error level alpha, prediction set memuat label yang benar dengan probabilitas setidaknya kira-kira 1 - alpha, dengan bentuk finite-sample yang tepat ditentukan oleh konvensi quantile konformal.

Kata marginal menetapkan batas penting. Jaminan tersebut dirata-ratakan atas contoh uji baru yang diambil dalam setup exchangeable yang sama. Jaminan itu tidak menyatakan bahwa setiap input individual memiliki conditional coverage sebesar 1 - alpha.

Input dari wilayah yang sulit dapat memiliki error rate berbeda dari input di wilayah yang mudah meskipun target marginal keseluruhan tetap terpenuhi. Hal yang sama dapat terjadi antar-kelas atau subgroup lain.

Karena itu, aggregate coverage diperlukan tetapi tidak cukup untuk mendiagnosis perilaku set. Per-class coverage, subgroup coverage, dan distribusi ukuran set dapat memperlihatkan struktur yang disembunyikan oleh satu angka coverage keseluruhan.

Exchangeability menopang jaminan

Exchangeability secara informal berarti joint distribution tidak berubah ketika contoh-contoh yang relevan diurutkan ulang. Contoh independent and identically distributed memenuhi kondisi ini, tetapi exchangeability adalah konsep yang lebih luas yang digunakan dalam argumen konformal standar.

Peringkat skor baru di antara skor kalibrasi dan pengujian memiliki simetri yang dibutuhkan hanya jika asumsi data tersebut berlaku. Jika data deployment mengalami shift setelah kalibrasi, simetri itu dapat gagal.

Perubahan class prevalence, kondisi sensor, sumber dokumen, geografi, atau proses pembentuk input lainnya dapat mengubah distribusi skor. Threshold konformal yang tersimpan tidak mendeteksi perubahan tersebut dengan sendirinya.

Ada varian konformal untuk bentuk shift tertentu, tetapi metode tersebut membutuhkan asumsi tambahan atau mekanisme weighting. Jaminan dari kondisi exchangeable tidak boleh dibawa begitu saja ke data yang telah bergeser tanpa memastikan kondisi metode baru memang terpenuhi.

Calibration split memiliki dua tugas

Data kalibrasi menentukan threshold skor, sehingga membutuhkan label dan tidak boleh digunakan kembali sembarangan.

Pertama, data tersebut menyediakan distribusi skor empiris yang digunakan untuk peringkat konformal. Kedua, pemisahannya dari fitting model menjaga scoring function tetap fixed terhadap contoh kalibrasi dalam konstruksi split conformal yang umum.

Jika parameter model disesuaikan setelah melihat hasil kalibrasi, skor kalibrasi awal tidak lagi menggambarkan scoring rule tetap dengan cara yang sama. Menggunakan calibration split baru merupakan pilihan yang bersih setelah perubahan model semacam itu.

Ukuran kalibrasi juga memengaruhi granularitas threshold. Dengan sedikit contoh kalibrasi, hanya ada sedikit kemungkinan peringkat empiris. Meminta error rate yang sangat kecil karena itu dapat menghasilkan set yang konservatif atau tidak informatif karena finite sample tidak mampu membedakan probabilitas tail secara arbitrer.

Target coverage nominal bukan pengganti data kalibrasi representatif dalam jumlah memadai.

Ukuran set mengukur kegunaan, bukan validitas

Prediction set yang berisi semua label yang mungkin dapat mencapai coverage tinggi tetapi hanya memberikan sedikit diskriminasi. Coverage saja karena itu tidak menjelaskan apakah set tersebut berguna.

Ukuran set merupakan metrik pendamping yang alami dalam klasifikasi. Untuk target coverage yang sama, base model yang lebih kuat atau skor yang lebih sesuai dengan task sering dapat menghasilkan candidate set yang lebih rapat. Itu adalah properti efisiensi prediction set, terpisah dari validitas pernyataan marginal coverage.

Perbandingan harus mempertahankan target coverage dan populasi evaluasi yang sama. Melaporkan set yang lebih kecil sambil diam-diam menerima empirical coverage yang lebih rendah mencampurkan dua efek berbeda.

Distribusi penuh ukuran set juga dapat penting. Rata-rata 1.4 label dapat berasal dari mayoritas singleton set dengan sedikit set besar, atau dari campuran lain. Pola-pola tersebut dapat menghasilkan perilaku berbeda bagi sistem downstream yang mengirim set besar untuk review.

Probability calibration dan conformal coverage adalah hal berbeda

Probability calibration menanyakan apakah probabilitas prediksi sesuai dengan frekuensi kejadian yang diamati. Conformal coverage menanyakan apakah set yang dibentuk memuat outcome yang benar pada marginal rate yang ditentukan di bawah asumsi yang berlaku.

Classifier dapat memiliki probability calibration yang tidak sempurna dan tetap menjadi scoring model di dalam prosedur split conformal yang valid. Sebaliknya, probabilitas kelas yang terkalibrasi tidak dengan sendirinya menghasilkan jaminan finite-sample set coverage yang terkait dengan conformal prediction.

Kedua konsep dapat berinteraksi. Estimasi probabilitas dapat menjadi input untuk skor konformal, dan kualitas kalibrasi dapat memengaruhi efisiensi set. Namun jaminannya tetap berbeda, sehingga evaluasi perlu mempertahankan istilah tersebut secara terpisah.

Perbedaan ini sangat berguna pada API. Field bernama confidence mengisyaratkan kuantitas skalar yang menyerupai probabilitas. Hasil konformal lebih tepat direpresentasikan sebagai set beserta metadata yang menjelaskan target coverage, versi kalibrasi, definisi skor, dan asumsi populasi.

Update model membuat skor tersimpan tidak lagi valid

Threshold konformal melekat pada scoring function dan sampel kalibrasi tertentu. Mengubah weight model dapat mengubah skor setiap contoh. Mengubah preprocessing, tokenization, definisi label, atau konstruksi skor dapat menghasilkan efek yang sama.

Menggunakan kembali threshold lama setelah perubahan tersebut memutus keterkaitannya dengan distribusi skor yang semula menghasilkan threshold itu.

Versioning base model dan conformal calibrator secara bersama membuat dependency ini eksplisit. Prinsip yang sama berlaku pada perubahan data: jika populasi operasional tidak lagi cukup menyerupai populasi kalibrasi untuk memenuhi asumsi yang dibutuhkan, menghitung ulang threshold menggunakan data representatif lebih bermakna daripada memperlakukan target coverage lama sebagai nilai permanen.

Conformal prediction menarik salah satunya karena dapat membungkus classifier yang sudah ada tanpa mengubah weight classifier tersebut. Namun wrapper itu tetap merupakan statistical state. Jaminannya melekat pada skor, data kalibrasi, dan kondisi exchangeability sebagai satu kesatuan; memisahkan threshold dari kondisi tersebut mengubah pernyataan coverage yang presisi menjadi angka tanpa dukungan.