Dua embedding vector dapat memiliki cosine similarity tinggi walaupun item yang diwakilinya tidak dekat dalam pengertian spesifik yang dibutuhkan sistem retrieval. Salah satu penyebab mismatch ini adalah anisotropi embedding: vector tersebar tidak merata di representation space, sering kali dengan sebagian besar massa terkonsentrasi di sekitar arah bersama.
Cosine similarity menghilangkan pengaruh magnitude vector dari perbandingan, tetapi tidak menghapus komponen arah yang sama. Jika banyak vector sebagian mengarah ke arah yang sama, pasangan yang tidak terkait dapat memiliki baseline cosine yang tinggi. Perbedaan berguna antara item relevan dan tidak relevan kemudian harus muncul dalam rentang skor yang lebih sempit.
Geometri ini penting setiap kali software memperlakukan skor cosine seolah memiliki skala semantik yang stabil.
Isotropi adalah sifat distribusi vector
Distribusi isotropik tidak memiliki arah yang sangat dominan. Dalam embedding space anisotropik, beberapa arah menjelaskan jauh lebih banyak distribusi vector dibanding arah lain.
Embedding yang sudah dinormalisasi ke unit length dapat ditulis secara skematis sebagai:
x = shared_component + item_specific_componentJika shared component besar dan mengarah kurang lebih sama untuk banyak item, dot product antarpasangan mewarisi sebagian alignment tersebut. Karena cosine similarity antara unit vector sama dengan dot product-nya, shared component memengaruhi skor walaupun hanya membawa sedikit informasi untuk tugas retrieval.
Ini berbeda dari masalah norm sederhana. Menormalisasi semua vector menjadi panjang satu mengendalikan magnitude, tetapi vector tetap dapat menempati cone yang sempit. Unit normalization mengubah radius; ia tidak memaksa arah tersebar merata pada sphere.
Gejala praktisnya sering berupa konsentrasi skor. Banyak pasangan kandidat menerima similarity dalam interval sempit, sementara sinyal ranking dikodekan oleh perbedaan kecil di dalam interval itu.
Baseline cosine tinggi mengubah semantik threshold
Misalkan satu koleksi embedding menghasilkan skor ilustratif berikut untuk sebuah query:
item relevan 0.91
item borderline 0.86
item tidak relevan 0.82Representasi kedua untuk item yang sama mungkin menghasilkan:
item relevan 0.72
item borderline 0.48
item tidak relevan 0.14Angka tersebut sendiri tidak membuktikan representasi kedua lebih baik. Contoh ini menunjukkan bahwa threshold absolut seperti 0.80 tidak memiliki makna yang independen dari representasi. Threshold terikat pada embedding model, preprocessing, similarity function, corpus, dan distribusi query yang menghasilkan distribusi skor tersebut.
Anisotropi membuat coupling ini mudah terlewat karena similarity tinggi terlihat intuitif sebagai sinyal kuat. Skor mendekati satu dapat mencerminkan alignment spesifik tugas sekaligus arah umum dalam embedding space.
Dalam retrieval, ranking dan acceptance adalah keputusan terpisah. Nearest-neighbor index masih dapat menempatkan item berguna di urutan pertama ketika semua kandidat memiliki skor tinggi. Namun aturan downstream yang menerima semua hasil di atas threshold cosine tetap dapat bekerja buruk jika threshold dipilih pada distribusi skor berbeda.
Mean centering menghapus satu jenis komponen bersama
Penyesuaian geometri langsung adalah memperkirakan mean embedding dari reference collection lalu menguranginya:
mu = mean(x_1, x_2, ..., x_n)
x_centered = x - muOperasi ini memindahkan reference mean ke origin. Jika sebagian besar arah bersama direpresentasikan oleh mean tersebut, centering dapat mengurangi kontribusinya pada perbandingan pasangan.
Centering bukan koreksi universal untuk anisotropi. Distribusi dapat tetap sangat terarah setelah mean dihapus. Beberapa dominant direction dapat tetap ada, dan geometri dapat berbeda antar-domain atau subset corpus.
Cosine similarity juga memerlukan keputusan lain setelah centering. Jika sistem mengharapkan unit vector, vector hasil centering perlu dinormalisasi sebelum dot product digunakan sebagai cosine similarity:
z = (x - mu) / norm(x - mu)Transformasi yang sama harus diterapkan secara konsisten pada dokumen yang di-index dan query yang masuk. Menerapkan transformasi berbasis corpus hanya pada satu sisi mengubah hubungan koordinat yang digunakan retrieval.
Reference set untuk memperkirakan mu juga penting. Mean dari satu corpus menggambarkan corpus tersebut. Perpindahan ke distribusi data yang sangat berbeda dapat mengubah komponen bersama, sehingga transformasi itu sendiri menjadi bagian dari state retrieval yang dideploy.
Menghapus dominant direction merupakan intervensi yang lebih kuat
Mean centering menangani translasi vector cloud. Pendekatan lain memproyeksikan vector menjauh dari dominant direction tertentu, yang sering diperkirakan dari principal component reference embedding set.
Untuk unit direction u, menghapus komponennya dari vector x dapat ditulis:
x_projected = x - (x dot u) * uBeberapa arah dapat dihapus secara berurutan atau melalui projection matrix. Teknik ini dapat memperlebar skor cosine ketika arah tersebut terutama mengkode struktur umum bersama dan bukan perbedaan yang berguna untuk tugas target.
Risikonya juga jelas: dominant direction dapat membawa informasi yang relevan. Projection menghapus informasi tersebut dari setiap vector yang ditransformasi. Variance saja tidak membuktikan sebuah komponen merupakan nuisance signal.
Karena itu component removal adalah pertanyaan evaluasi, bukan sekadar normalization kosmetik. Pengujian yang relevan bukan apakah vector cloud terlihat lebih seragam, melainkan apakah perilaku retrieval membaik pada query dan relevance judgment representatif tanpa merusak kasus yang bergantung pada struktur yang dihapus.
Geometri index dan policy aplikasi perlu dievaluasi terpisah
Approximate nearest-neighbor index bekerja pada geometri yang diberikan. Index tidak mengetahui apakah arah embedding bersama berguna secara semantik, insidental, atau berbahaya bagi aturan acceptance downstream.
Evaluasi yang baik memisahkan setidaknya dua efek. Ranking metric menguji apakah item relevan muncul sebelum item tidak relevan. Analisis distribusi skor menguji apakah threshold, margin, atau confidence rule aplikasi tetap bermakna.
Dua varian embedding dapat menghasilkan urutan top-k serupa tetapi gap skor yang sangat berbeda antara kandidat pertama dan berikutnya. Perbedaan itu memengaruhi sistem yang menolak match lemah, mengalihkan query ambigu, atau menggabungkan vector similarity dengan skor lain.
Threshold karena itu harus dikalibrasi pada pipeline representasi final. Mengubah embedding model, centering transform, projection, normalization rule, atau corpus dapat mengubah distribusi skor walaupun vector database dan similarity operator tetap sama.
Anisotropi dapat berbeda antar-slice dalam corpus yang sama
Histogram skor global dapat menyembunyikan geometri lokal. Code, prose, label pendek, template berulang, dan teks multilingual dapat menempati wilayah berbeda dalam embedding space. Komponen bersama yang diperkirakan dari seluruh koleksi dapat menggambarkan campuran tersebut, bukan satu bias seragam.
Hal ini penting untuk diagnosis maupun koreksi. Jika satu slice memiliki konsentrasi cosine jauh lebih rapat daripada slice lain, threshold global dapat menghasilkan perilaku acceptance berbeda. Transformasi yang diperkirakan dari seluruh corpus juga dapat membantu satu slice sambil mendistorsi slice lain.
Pemeriksaan per-slice tidak memerlukan model ruang yang rumit. Distribusi cosine berpasangan, gap skor nearest-neighbor, dan retrieval metric yang dikelompokkan berdasarkan jenis konten dapat menunjukkan apakah geometri cukup stabil untuk policy bersama.
Prinsip yang sama berlaku pada query embedding. Geometri dokumen saja tidak lengkap jika query berasal dari distribusi berbeda. Retrieval bergantung pada hubungan antara representasi query dan dokumen, sehingga evaluasi harus mencakup keduanya.
Geometri representasi adalah bagian dari kontrak retrieval
Cosine similarity adalah operasi geometri yang presisi, tetapi output numeriknya tidak memiliki kalibrasi semantik universal. Anisotropi embedding merupakan salah satu alasannya: arah bersama dapat menaikkan background similarity antar-vector dan memampatkan rentang tempat perbedaan berguna muncul.
Normalization, centering, dan projection masing-masing mengubah aspek geometri yang berbeda. Tidak satu pun dapat diasumsikan meningkatkan retrieval hanya karena vector terlihat lebih merata. Setiap transformasi harus mempertahankan informasi yang dibutuhkan aplikasi dan diterapkan secara konsisten pada indexing serta query time.
Batas yang tahan lama bagi developer adalah memperlakukan geometri embedding, similarity scoring, dan threshold aplikasi sebagai satu pipeline yang diberi versi. Perubahan pada salah satu bagian dapat mengubah arti skor yang dikonsumsi bagian lain.