Bandingkan Distribusi Input Model dengan Maximum Mean Discrepancy
Model dapat terus menghasilkan output yang valid sementara data yang masuk perlahan berubah. Layanan gambar dapat menerima foto dari kamera baru, classifier teks dapat melihat campuran topik baru, dan pipeline embedding dapat mulai memproses dokumen dari sumber berbeda. Akurasi dapat menurun walaupun binary model, API, dan kode serving tidak berubah.
Maximum mean discrepancy (MMD) memungkinkan dua sampel dibandingkan tanpa mereduksi masing-masing menjadi beberapa statistik seperti mean dan variance. MMD memakai kemiripan berpasangan untuk menghasilkan satu skor discrepancy. Karena itu, MMD berguna sebagai salah satu sinyal distribution shift, terutama ketika input atau representasi berbentuk vektor.
Perlakukan drift sebagai perbandingan dua sampel
Misalkan tersedia sampel referensi dari periode ketika model bekerja dengan baik:
[ X = {x_1, x_2, \ldots, x_n} ]
Kemudian dikumpulkan sampel saat ini:
[ Y = {y_1, y_2, \ldots, y_m} ]
Pertanyaannya bukan apakah setiap titik baru menyerupai titik lama, melainkan apakah kedua sampel tampak berasal dari distribusi dasar yang sama. Untuk vektor berdimensi tinggi, pemeriksaan setiap koordinat secara terpisah dapat melewatkan perubahan hubungan antar-koordinat.
MMD menggunakan kernel, yaitu fungsi k(a,b) yang memberi nilai kemiripan pada dua observasi. MMD membandingkan kemiripan pasangan dari sampel referensi, pasangan dari sampel saat ini, serta pasangan lintas kedua sampel. Jika kedua distribusi serupa menurut kernel yang dipilih, pola kemiripan di dalam dan antar-sampel juga seharusnya kompatibel.
Mulai dengan Gaussian kernel
Pilihan umum untuk vektor numerik adalah Gaussian radial basis function kernel:
[ k(a,b) = \exp\left(-\frac{|a-b|_2^2}{2\sigma^2}\right) ]
σ adalah bandwidth kernel. Kernel menghasilkan 1 ketika a=b; nilainya mendekati 0 ketika jarak Euclidean membesar. Bandwidth menentukan skala jarak yang dianggap berarti.
Untuk observasi satu dimensi dengan σ=1:
[ k(0,1)=\exp(-1/2)\approx 0.607 ]
sementara
[ k(0,3)=\exp(-9/2)\approx 0.011 ]
MMD kecil ketika pola kemiripan kernel pada sampel referensi dan sampel saat ini serupa, dan membesar ketika pola tersebut terpisah.
Kuantitas populasi di balik MMD
Misalkan P adalah distribusi referensi dan Q distribusi saat ini, dengan X,X'~P dan Y,Y'~Q independen. Squared MMD dapat ditulis:
[ \operatorname{MMD}^2(P,Q)
\mathbb{E}[k(X,X’)] + \mathbb{E}[k(Y,Y’)]
2\mathbb{E}[k(X,Y)] ]
Term pertama mengukur kemiripan yang diharapkan antara dua titik referensi, term kedua untuk dua titik saat ini, dan term ketiga untuk titik lintas distribusi. Untuk characteristic kernel yang sesuai, termasuk Gaussian kernel pada ruang Euclidean dalam kondisi standar, MMD populasi bernilai nol tepat ketika kedua distribusi sama.
Namun kernel tetap menentukan perbedaan yang ditekankan secara praktis. Kernel yang secara matematis diskriminatif tidak membuat sampel terbatas kebal terhadap bandwidth buruk, noise, atau ukuran sampel yang tidak memadai.
Estimasikan MMD dari sampel terbatas
Estimator squared MMD yang umum dan unbiased adalah:
[ \widehat{\operatorname{MMD}}_u^2
\frac{1}{n(n-1)} \sum_{i\ne j} k(x_i,x_j) + \frac{1}{m(m-1)} \sum_{i\ne j} k(y_i,y_j)
\frac{2}{nm} \sum_{i=1}^{n}\sum_{j=1}^{m} k(x_i,y_j) ]
Term diagonal k(x_i,x_i) dan k(y_j,y_j) dikeluarkan. Estimasi squared MMD yang unbiased dapat sedikit negatif pada sampel terbatas walaupun kuantitas populasi tidak negatif. Nilai negatif bukan bukti adanya jarak negatif.
Jika monitor membutuhkan skor deskriptif non-negatif, estimator empiris biased yang memasukkan pasangan diagonal dapat digunakan, atau nilai unbiased dapat di-clamp hanya untuk tampilan. Jangan mengganti estimator diam-diam lalu membandingkannya dengan threshold yang dikalibrasi untuk estimator lain.
Contoh numerik kecil
Ambil:
[ X={0,1},\qquad Y={0,1} ]
Dengan kernel dan bandwidth yang sama, empirical distribution identik dan estimasi MMD biased bernilai nol. Jika sampel saat ini dipindahkan menjadi:
[ Y={3,4} ]
kemiripan di dalam masing-masing sampel tetap relatif tinggi karena titik bertetangga masih berjarak satu, tetapi jarak lintas sampel membesar sehingga cross term mengecil. MMD meningkat walaupun spread kedua sampel sama.
Bandwidth menentukan apa yang terlihat oleh skor
Bandwidth Gaussian σ bukan parameter kosmetik. Jika terlalu kecil dibanding jarak tipikal, hampir semua pasangan berbeda menghasilkan kernel mendekati nol. Jika terlalu besar, hampir semua pasangan menghasilkan nilai mendekati satu. Keduanya mengurangi struktur yang berguna.
Median jarak berpasangan sering dipakai sebagai titik awal, tetapi bukan optimum universal. Hasilnya bergantung pada skala representasi, dimensi, komposisi sampel, dan jenis shift yang ingin dideteksi.
Untuk monitoring, pilih bandwidth memakai skenario historis yang representatif lalu pertahankan prosedurnya. Menghitung ulang bandwidth secara independen pada setiap window membuat skala pengukuran ikut berubah bersama data. Beberapa bandwidth dapat digunakan jika shift relevan terjadi pada skala geometris berbeda, tetapi threshold harus dikalibrasi untuk statistik yang benar-benar digunakan.
Pilihan representasi mendahului kernel
MMD hanya melihat nilai yang diberikan kepadanya. Raw tabular features dapat sesuai setelah scaling yang masuk akal. Untuk gambar, raw pixels mungkin lebih menonjolkan pencahayaan atau kompresi daripada konten semantik. Untuk teks, token ID tidak memiliki geometri Euclidean yang berguna.
Sistem monitoring AI sering menghitung MMD pada embedding atau intermediate feature vector. Ini dapat menyelaraskan perbandingan dengan representasi yang dipakai model, tetapi juga menambah dependency: jika embedding model berubah, ruang representasi ikut berubah. Tetapkan versi representasi selama perbandingan atau buat baseline baru setelah perubahan representasi yang disengaja.
Feature scaling juga penting. Terapkan preprocessing tetap yang sama pada sampel referensi dan sampel saat ini.
Skor MMD bukan threshold drift universal
Nilai seperti MMD² = 0.018 tidak banyak berarti tanpa konteks. Skalanya bergantung pada kernel, bandwidth, preprocessing, representasi, estimator, dan distribusi data.
Threshold sebaiknya berasal dari masalah monitoring. Buat banyak perbandingan reference-versus-reference dari periode yang dianggap stabil untuk melihat variasi normal, lalu evaluasi candidate threshold terhadap shift yang diketahui atau disimulasikan dan memang relevan.
Jika dibutuhkan formal two-sample hypothesis test, gunakan prosedur pengujian valid dengan null calibration yang sesuai, misalnya permutation-based method. Threshold arbitrer pada nilai MMD bukan otomatis statistical test. Monitoring berulang juga meningkatkan peluang false alarm sehingga kebijakan alert perlu memperhitungkan frekuensi pemeriksaan.
Biaya kuadratik dapat menjadi bottleneck
Estimator langsung membandingkan banyak pasangan:
[ O(n^2 + m^2 + nm) ]
Saat n dan m serupa, biaya bersifat kuadratik terhadap ukuran sampel. Untuk window besar atau embedding berdimensi tinggi, kernel matrix juga dapat memakan banyak memori.
Pilihan praktis mencakup menghitung kernel sum secara block tanpa menyimpan matrix lengkap, memakai subsample berukuran tetap ketika sensitivitasnya memadai, atau menggunakan linear-time MMD estimator maupun aproksimasi kernel. Semua alternatif menukar komputasi dengan estimator variance atau approximation error, sehingga perlu divalidasi pada shift yang menyerupai failure yang ingin dideteksi.
Kesalahan monitoring yang umum
Menganggap drift sebagai bukti kegagalan model
MMD mengukur discrepancy distribusi menurut representasi dan kernel tertentu; MMD tidak mengukur task accuracy. Shift besar dapat tidak berbahaya, sementara MMD kecil dapat menyertai degradasi serius pada subgroup langka namun kritis. Pasangkan drift monitoring dengan outcome metric ketika label tersedia.
Membandingkan skor dari pipeline berbeda
Perubahan normalization, embedding version, kernel, bandwidth, sample size, atau estimator dapat menggeser skor tanpa perubahan traffic. Versioning konfigurasi MMD lengkap diperlukan agar grafik monitoring tetap dapat dibandingkan.
Mengabaikan ketergantungan sampel
Formula two-sample standar paling mudah ditafsirkan ketika observasi berperilaku seperti sampel independen. Traffic nyata dapat berisi session, duplicate event, time-series dependence, atau record berulang dari user/device yang sama. Dependensi kuat mengubah sampling behavior statistik dan dapat membatalkan kalibrasi yang mengasumsikan independensi.
Menggunakan satu skor global untuk semua pertanyaan
Satu nilai MMD dapat menyembunyikan lokasi shift. Setelah alert, diagnostik tetap diperlukan, misalnya skor per region atau product segment, ringkasan feature individual, nearest-neighbor example dalam representation space, serta perbandingan beberapa time window.
Kapan MMD sesuai dan kapan pemeriksaan sederhana lebih baik
MMD cocok ketika perlu membandingkan sampel multivariat, tersedia kernel atau representasi vektor yang bermakna, dan dibutuhkan sensitivitas melebihi beberapa moment yang dipilih manual.
Untuk satu feature dengan interpretasi bisnis yang jelas, histogram atau quantile comparison sering lebih mudah dijelaskan dan di-debug. MMD juga bukan pengganti task evaluation. Jika label baru cepat tersedia, error rate, precision, recall, atau task-specific loss biasanya lebih langsung.
Bangun monitor di atas perbandingan yang stabil
Nilai MMD monitor tidak berasal dari formula saja, tetapi dari perbandingan terkontrol di sekelilingnya. Pilih representasi yang terkait dengan input atau internal feature model, tetapkan preprocessing dan kernel, ukur variasi skor normal pada data stabil, uji terhadap shift yang relevan, dan simpan konteks yang cukup untuk menyelidiki alert.
Dengan komponen tersebut, MMD menjawab pertanyaan yang spesifik: apakah geometri input model saat ini telah bergeser dari referensi tepercaya dengan cara yang dapat dideteksi oleh kernel ini?