Cosine similarity sering diperlakukan sebagai perbandingan lokal antara satu query embedding dan satu candidate. Interpretasi itu menjadi kurang informatif ketika sebagian besar vector menempati sekumpulan arah yang sempit. Item yang tidak berhubungan kemudian dapat memiliki komponen bersama yang cukup besar, sehingga range angle yang digunakan retrieval untuk membedakan candidate menjadi terkompresi.
Konsentrasi arah ini umum disebut embedding anisotropy. Ini adalah properti distribusi vector, bukan cacat yang dapat disimpulkan dari satu similarity score. Bagi developer, persoalan praktisnya adalah nilai cosine tetap tidak memiliki makna universal. Kegunaannya sebagian bergantung pada geometri populasi embedding tempat score tersebut dihasilkan.
Isotropy adalah properti distribusi
Pertimbangkan embedding x_1 ... x_n dalam d dimensi. Jika vector di-L2-normalize, setiap titik berada pada unit hypersphere. Normalization menetapkan magnitude, tetapi tidak membuat arah tersebar secara uniform.
Diagnostic sederhana dapat dimulai dari mean vector:
mu = (1 / n) * sum_i x_iJika normalized embedding mengarah secara seimbang, mean-nya dapat mendekati nol. Mean norm yang besar menunjukkan banyak vector memiliki komponen arah yang sama. Ini hanya salah satu diagnostic; mean yang kecil tidak membuktikan isotropy karena konsentrasi juga dapat muncul pada beberapa arah yang saling berlawanan atau pada struktur higher-order.
Covariance matrix memperlihatkan lebih banyak struktur:
C = (1 / n) * sum_i (x_i - mu)(x_i - mu)^TEigenvalue-nya menggambarkan variance di sepanjang principal axis. Jika sedikit eigenvalue mendominasi, sebagian besar variasi dataset berada di subspace yang terbatas. Spectrum yang diharapkan dari representasi yang berguna bergantung pada model, data, dan task, sehingga tidak ada satu rasio eigenvalue yang menjadi universal acceptance threshold.
Anisotropy mengubah distribusi background similarity
Retrieval score lebih mudah diinterpretasikan ketika dibandingkan dengan score dari pasangan tidak berhubungan dalam populasi embedding yang sama. Jika random pair sudah memiliki cosine similarity tinggi, score query-candidate yang tampak besar secara terpisah mungkin hanya memiliki sedikit separation dari background.
Untuk normalized vector a dan b:
cos(a, b) = a · bMisalkan keduanya memiliki shared component c ditambah residual khusus item:
a = c + r_a
b = c + r_bDot product mencakup c · c serta cross term dan r_a · r_b. Shared direction yang kuat karena itu dapat menaikkan similarity pada banyak pair walaupun residual component-nya berbeda. Menormalisasi vector akhir tidak menghilangkan directional component tersebut; normalization hanya menskalakan ulang setiap vector lengkap menjadi unit length.
Hal ini langsung memengaruhi sistem berbasis threshold. Cosine cutoff yang dikalibrasi pada satu embedding model atau corpus dapat menjadi tidak sesuai setelah distribution representation berubah. Threshold numerik yang sama dapat berhubungan dengan false-match rate yang berbeda ketika background score distribution bergeser.
Global concentration dan hubness saling terkait tetapi berbeda
Directional concentration dapat berkontribusi pada perilaku nearest-neighbor yang tidak merata, tetapi anisotropy dan hubness bukan diagnosis yang dapat dipertukarkan. Anisotropy menggambarkan bagaimana populasi vector menempati arah atau subspace. Hubness menggambarkan candidate yang muncul secara tidak biasa sering dalam nearest-neighbor list.
Dataset dapat memiliki dominant direction tanpa membuat sedikit candidate menjadi extreme hub. Dataset juga dapat menunjukkan hubness karena alasan yang tidak tertangkap oleh satu global anisotropy statistic. Corpus density, local geometry, duplicate content, query distribution, dan dimensional effect semuanya dapat mengubah neighbor frequency.
Perbedaan ini mengubah apa yang perlu diukur. Mean vector, covariance spectrum, dan random-pair cosine distribution menggambarkan global geometry. Neighbor occurrence count menggambarkan retrieval exposure. Menganggap salah satu pengukuran sebagai pengganti yang lain dapat menyembunyikan failure mode sebenarnya.
Centering mengubah setiap perbandingan cosine
Mengurangi dataset mean merupakan geometric transformation yang umum:
x'_i = x_i - muJika cosine similarity digunakan setelahnya, transformed vector biasanya dinormalisasi ulang sebelum dibandingkan. Ini dapat mengurangi shared mean direction, tetapi juga mengubah setiap pairwise angle. Karena itu, operasi ini bukan cleanup step yang netral.
Mean juga harus berasal dari reference population yang terdefinisi. Mean yang diperkirakan dari satu corpus dapat berbeda dari mean setelah komposisi corpus berubah. Menerapkan query transformation berdasarkan satu population sementara candidate vector menggunakan transformation state lain menghasilkan retrieval space yang tidak konsisten.
Centering dapat berguna ketika evaluation menunjukkan komponen yang dihilangkan bertindak sebagai nuisance variation untuk target task. Namun centering juga dapat membuang signal ketika global direction membawa informasi yang relevan untuk retrieval. Transformation sebaiknya diperlakukan sebagai bagian dari representation pipeline, diberi versi bersama embedding model, dan dievaluasi dengan relevance criteria yang sama seperti perubahan representation lainnya.
Menghapus principal direction adalah intervensi yang lebih kuat
Pendekatan lain memproyeksikan vector menjauh dari satu atau beberapa dominant principal component. Jika u adalah unit principal direction, menghapus komponennya dari vector x menghasilkan:
x' = x - (x · u)uMenghapus beberapa direction berarti mengulangi projection untuk sekumpulan selected component yang orthonormal. Ini secara langsung menekan variance pada axis tersebut dan dapat membuat distribusi yang tersisa kurang terkonsentrasi menurut statistic yang dipilih.
Biayanya juga langsung: informasi yang direpresentasikan sepanjang axis tersebut ikut dihapus. Dominant component tidak otomatis merupakan noise. Komponen itu dapat mengodekan frequency, style, domain, syntax, atau semantic structure yang penting bagi aplikasi. Besarnya variance saja tidak dapat mengidentifikasi nuisance information.
Jumlah direction yang dihapus juga tidak dapat dipilih hanya dari dimensionality. Itu adalah model choice yang bergantung pada task. Retrieval evaluation sebaiknya membandingkan representation asli dengan setiap candidate transformation sambil mempertahankan corpus, query set, similarity metric, dan relevance judgment yang sama.
Whitening mengubah scale sekaligus direction
Whitening melampaui centering atau penghapusan beberapa component. Dengan eigendecomposition covariance matrix,
C = U Lambda U^Twhitening transform dapat menskalakan ulang centered coordinate menggunakan inverse square root dari eigenvalue:
z = Lambda^(-1/2) U^T (x - mu)Dalam kasus full-rank yang ideal, ini menghasilkan identity covariance pada population yang digunakan untuk mengestimasi transform. Dalam praktiknya, eigenvalue yang sangat kecil membuat inverse scaling sensitif secara numerik, sehingga implementasi biasanya membutuhkan aturan regularization atau truncation.
Whitening mengubah relative distance karena low-variance direction mendapat scale lebih besar, sedangkan high-variance direction mendapat scale lebih kecil. Ini dapat menonjolkan perbedaan yang tertutup dominant axis, tetapi juga dapat memperkuat noise atau representation dimension yang sedikit nilainya bagi task. Identity covariance adalah geometric target, bukan retrieval objective.
Semua whitening parameter harus identik untuk indexed candidate dan incoming query. Mengubah fitted mean, eigenvector, penanganan eigenvalue, atau normalization procedure menciptakan representation space baru dan biasanya mengharuskan candidate vector ditransformasikan kembali.
Ukur geometri pada population yang benar-benar melayani query
Anisotropy statistic bergantung pada sample yang digunakan untuk menghitungnya. Mixed corpus yang mencakup beberapa domain dapat memiliki mean dan covariance spectrum berbeda dibandingkan setiap domain jika dilihat terpisah. Query embedding juga dapat menempati distribution yang berbeda dari stored document embedding, terutama pada sistem yang memakai asymmetric encoder atau prompt query dan document yang berbeda.
Diagnostic yang berguna karena itu harus menjaga population boundary tetap eksplisit. Corpus geometry menjawab bagaimana indexed vector tersusun. Query geometry menjawab bagaimana incoming request tersusun. Cross-similarity distribution menunjukkan bagaimana kedua population berinteraksi.
Sekumpulan pengukuran kecil dapat mengungkap aspek yang berbeda tanpa berpura-pura menghasilkan universal score: mean-vector norm, covariance eigenvalue spectrum, random-pair cosine distribution, serta relevant-versus-nonrelevant score distribution. Pasangan terakhir sangat penting karena kualitas retrieval bergantung pada separation yang terkait dengan definisi relevance milik aplikasi, bukan isotropy itu sendiri.
Anisotropy paling actionable ketika menjelaskan observation retrieval yang konkret, seperti cosine score yang terkompresi atau threshold yang tidak stabil. Geometry transformation dapat mengubah gejala tersebut, tetapi juga mendefinisikan ulang representation space. Boundary yang berguna karena itu bersifat empiris: ukur konsentrasinya, ubah satu representation assumption pada satu waktu, dan pertahankan perubahan hanya ketika evidence retrieval pada tingkat task mendukungnya.