Cosine similarity mengasumsikan bahwa arah vector membawa daya pembeda yang berguna. Asumsi ini menjadi kurang informatif ketika banyak embedding menempati wilayah ruang yang sempit. Dalam kondisi tersebut, item yang tidak berkaitan dapat berbagi komponen arah yang besar, skor cosine dapat berkumpul dalam rentang sempit, dan perbedaan residual kecil akhirnya menentukan ranking.

Pola geometris ini sering disebut anisotropi embedding. Pola tersebut sudah ada sebelum vector index memilih kandidat, sehingga tuning index saja tidak dapat memastikan apakah representasi memiliki pemisahan sudut yang cukup untuk tugas retrieval.

Isotropi berkaitan dengan sebaran arah

Distribusi isotropik tidak memiliki arah istimewa dalam ruang representasi yang relevan. Distribusi embedding nyata jarang memenuhi kondisi ideal ini secara persis. Pertanyaan praktisnya adalah seberapa kuat vector terkonsentrasi pada sejumlah kecil arah dan apakah konsentrasi itu mengganggu fungsi similarity yang dipakai untuk retrieval.

Diagnostik sederhana dapat dimulai dari mean corpus. Untuk embedding x_1 ... x_n, hitung:

mu = (1 / n) * sum(x_i)

Jika mu memiliki magnitudo yang besar dibanding norm vector pada umumnya, banyak vector berbagi komponen yang sama. Pengamatan ini belum cukup untuk menyatakan representasi bermasalah. Arah bersama dapat membawa struktur yang berguna, dan dampaknya bergantung pada normalisasi, distribusi query, serta objective retrieval.

Spektrum covariance memberi sudut pandang kedua. Setelah mean dikurangkan, beberapa eigenvalue besar menunjukkan bahwa variance terkonsentrasi pada sedikit arah. Spektrum yang lebih datar menunjukkan sebaran arah yang lebih luas. Tidak ada bentuk spektrum yang menyediakan threshold lulus universal; perbandingan yang berguna adalah antara pengukuran geometris dan perilaku retrieval pada data yang sama.

Normalisasi cosine tidak menghapus arah bersama

Normalisasi L2 menghilangkan magnitudo vector dari ranking cosine, tetapi tidak mengurangkan komponen bersama. Untuk vector nonzero a dan b, cosine similarity adalah:

cos(a, b) = (a dot b) / (||a|| * ||b||)

Setelah normalisasi, operasi ini menjadi dot product antara unit vector. Jika kedua unit vector masih sebagian mengarah ke arah dominan yang sama, kontribusi tersebut tetap masuk ke skor.

Perbedaan ini penting saat mendiagnosis distribusi skor yang sempit. Normalisasi dapat memudahkan komputasi cosine dan menyelaraskan ranking cosine dengan ranking Euclidean pada unit vector, tetapi tidak membuat distribusi embedding menjadi isotropik.

Pengukuran yang berguna adalah distribusi cosine similarity untuk pasangan yang diperkirakan tidak cocok. Jika skor tersebut berada pada pita tinggi dan sempit, periksa apakah arah bersama memberi kontribusi material sebelum memperlakukan nilai skor sebagai bukti semantic closeness yang terkalibrasi.

Centering mengubah setiap vector relatif terhadap corpus

Mean centering mengganti setiap vector dengan:

x_centered = x - mu

Transformasi ini menghapus mean empiris dari corpus yang digunakan untuk fitting. Centering dapat meningkatkan pemisahan sudut ketika arah mean merupakan komponen pengganggu, tetapi bukan operasi cleanup yang netral. Transformasi tersebut mengubah geometri query-candidate dan karena itu juga mengubah ranking.

Mean hasil fitting juga menjadi bagian dari kontrak representasi. Query harus ditransformasi menggunakan mean yang sama dengan yang dipakai untuk corpus di index. Menghitung ulang mu untuk setiap batch query atau diam-diam menggantinya setelah corpus berubah menciptakan mismatch antara vector tersimpan dan vector query.

Jika vector yang sudah di-center kemudian dinormalisasi L2, urutan operasi penting: mengurangkan mean lalu melakukan normalisasi tidak setara dengan melakukan normalisasi terlebih dahulu lalu mengurangkan mean yang dihitung di ruang lain. Pipeline index dan query membutuhkan satu urutan yang eksplisit.

Menghapus komponen dominan adalah intervensi yang lebih kuat

Transformasi yang lebih agresif dapat memproyeksikan vector menjauh dari satu atau beberapa arah dominan. Jika u adalah unit direction, penghapusan komponennya dari x menghasilkan:

x_projected = x - (x dot u) * u

Menerapkannya pada principal direction dapat mengurangi variance yang terkait dengan axis tersebut. Namun, transformasi ini juga dapat menghapus informasi yang relevan untuk tugas. Komponen dominan adalah properti statistik, bukan bukti bahwa komponen itu noise.

Karena itu, jumlah arah yang dihapus merupakan pilihan model, bukan detail formatting. Transformasi sebaiknya di-fit hanya pada reference data yang dimaksud, disimpan bersama versi embedding, dan dievaluasi terhadap relevance judgment. Spektrum yang terlihat lebih seragam setelah projection tidak membuktikan bahwa retrieval menjadi lebih berguna.

Whitening melangkah lebih jauh dengan mengubah skala principal component yang sudah di-center berdasarkan variance-nya. Operasi ini mengubah arah sekaligus skala relatif. Whitening dapat menghasilkan struktur covariance yang lebih merata pada data fitting, tetapi juga memperkuat arah dengan variance rendah, termasuk noise ketika arah tersebut hanya membawa sedikit signal yang stabil. Vector hasilnya mendefinisikan ruang retrieval baru dan perlu diperlakukan demikian.

Diagnostik geometri dan metrik retrieval menjawab pertanyaan berbeda

Pengukuran anisotropi menggambarkan bentuk distribusi embedding. Metrik retrieval menggambarkan apakah kandidat yang diranking memenuhi kriteria aplikasi. Perbaikan pada salah satunya tidak menjamin perbaikan pada yang lain.

Evaluasi yang dapat dipertanggungjawabkan memisahkan kedua peran tersebut. Ukur representasi asli, terapkan transformasi kandidat, bangun ulang atau encode ulang state index yang terdampak, transformasikan query melalui pipeline identik, lalu bandingkan kualitas retrieval menggunakan relevance judgment yang tetap. Periksa juga distribusi skor karena transformasi dapat mengubah threshold yang bergantung pada nilai raw similarity.

Recall approximate nearest-neighbor adalah variabel terpisah lainnya. Jika exact search dan approximate search berbeda, index menambahkan error di luar geometri representasi. Jika keduanya menghasilkan ranking serupa dengan pemisahan semantik yang lemah, mengubah search depth atau probe setting tidak dapat menciptakan informasi yang memang tidak diekspresikan oleh vector.

Transformasi hasil fitting menjadi bagian dari versi embedding

Parameter centering, projection, atau whitening yang diturunkan dari data merupakan bagian dari representasi vector. Mencampur vector yang dihasilkan dari transformasi fitting berbeda dapat membuat similarity score sulit ditafsirkan walaupun semua vector memiliki dimensionality yang sama.

Batas ini sangat relevan saat corpus diperbarui. Mean atau projection basis yang baru di-fit dapat memindahkan item lama dan baru secara berbeda. Melakukan re-encoding corpus dengan satu transformasi tetap menghindari perbandingan koordinat dari ruang yang tidak kompatibel.

Anisotropi embedding karena itu paling berguna sebagai diagnostik, bukan vonis. Konsentrasi arah dapat menyingkap constraint representasi yang disembunyikan oleh raw cosine score, tetapi koreksi geometris baru layak masuk pipeline retrieval jika ruang hasil transformasi meningkatkan kriteria ranking spesifik yang benar-benar penting bagi tugas.