Langsung ke konten

Arsip

Retrieval

5 artikel
Kecerdasan Buatan 22 Sep 2026 6 min read

Cosine Similarity Mengabaikan Magnitudo Embedding

Dua vektor embedding dapat mengarah ke arah yang sama meski memiliki norm yang sangat berbeda. Cosine similarity memberi keduanya skor arah yang sama. Raw dot product tidak demikian. Perbedaan ini menjadi batas implementasi ketika sistem retrieval mengganti metrik index, menormalisasi vektor saat ingestion, atau mencampur embedding dari pipeline yang berbeda. Persoalannya bukan menentukan satu metrik yang unggul untuk semua kasus. Yang perlu ditetapkan adalah apakah magnitudo vektor membawa informasi yang memang hendak dipertahankan oleh kontrak scoring. Setelah vektor dinormalisasi menjadi unit length, informasi magnitudo tersebut tidak lagi ikut dalam perhitungan similarity.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Anisotropi Embedding Sebelum Vector Search

Cosine similarity mengasumsikan bahwa arah vector membawa daya pembeda yang berguna. Asumsi ini menjadi kurang informatif ketika banyak embedding menempati wilayah ruang yang sempit. Dalam kondisi tersebut, item yang tidak berkaitan dapat berbagi komponen arah yang besar, skor cosine dapat berkumpul dalam rentang sempit, dan perbedaan residual kecil akhirnya menentukan ranking. Pola geometris ini sering disebut anisotropi embedding. Pola tersebut sudah ada sebelum vector index memilih kandidat, sehingga tuning index saja tidak dapat memastikan apakah representasi memiliki pemisahan sudut yang cukup untuk tugas retrieval.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kuantisasi Embedding Tanpa Menyamarkan Error Retrieval

Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan. Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kecerdasan Buatan 15 Sep 2026 4 min read

Memperhitungkan Hubness dalam Retrieval Embedding

Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness. Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.

Kecerdasan Buatan 12 Sep 2026 6 min read

Anisotropi Embedding Dapat Memampatkan Pemisahan Skor Cosine

Dua embedding vector dapat memiliki cosine similarity tinggi walaupun item yang diwakilinya tidak dekat dalam pengertian spesifik yang dibutuhkan sistem retrieval. Salah satu penyebab mismatch ini adalah anisotropi embedding: vector tersebar tidak merata di representation space, sering kali dengan sebagian besar massa terkonsentrasi di sekitar arah bersama. Cosine similarity menghilangkan pengaruh magnitude vector dari perbandingan, tetapi tidak menghapus komponen arah yang sama. Jika banyak vector sebagian mengarah ke arah yang sama, pasangan yang tidak terkait dapat memiliki baseline cosine yang tinggi. Perbedaan berguna antara item relevan dan tidak relevan kemudian harus muncul dalam rentang skor yang lebih sempit.