Langsung ke konten

Arsip

Embedding

9 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Anisotropi Embedding Memampatkan Rentang Cosine Similarity

Dua kandidat embedding dapat memiliki kecocokan semantik yang berbeda tetapi memperoleh skor cosine dalam interval yang sempit. Implementasi fungsi similarity belum tentu bermasalah. Pemampatan tersebut dapat berasal dari geometri ruang embedding: vektor cenderung menempati arah tertentu alih-alih tersebar merata pada dimensi yang tersedia. Konsentrasi arah ini umum disebut anisotropi. Anisotropi berpengaruh pada retrieval karena cosine similarity mengukur alignment sudut. Ketika banyak vektor memiliki komponen bersama yang cukup besar, pasangan yang tidak berkaitan dapat memiliki baseline alignment yang lebih tinggi. Pasangan relevan masih dapat memperoleh skor lebih tinggi, tetapi jarak skor yang tersedia antara kandidat relevan dan tidak relevan dapat menyempit.

Kecerdasan Buatan 23 Sep 2026 4 min read

Normalisasi L2 Mengubah Dot Product Embedding Menjadi Cosine Similarity

Dua vektor embedding dapat mengarah hampir sama tetapi memiliki magnitudo yang sangat berbeda. Dot product mentah merespons kedua sifat tersebut. Normalisasi L2 menghapus komponen magnitudo, sehingga operasi dot product yang sama berubah menjadi perbandingan arah. Perubahan ini bukan sekadar penyesuaian numerik. Objektif retrieval ikut berubah ketika norm vektor membawa informasi atau berbeda antar-item. Dot product memuat komponen magnitudo Untuk vektor nonzero (x) dan (y), [ x \cdot y = |x|_2 |y|_2 \cos(\theta), ]

Kecerdasan Buatan 22 Sep 2026 6 min read

Cosine Similarity Mengabaikan Magnitudo Embedding

Dua vektor embedding dapat mengarah ke arah yang sama meski memiliki norm yang sangat berbeda. Cosine similarity memberi keduanya skor arah yang sama. Raw dot product tidak demikian. Perbedaan ini menjadi batas implementasi ketika sistem retrieval mengganti metrik index, menormalisasi vektor saat ingestion, atau mencampur embedding dari pipeline yang berbeda. Persoalannya bukan menentukan satu metrik yang unggul untuk semua kasus. Yang perlu ditetapkan adalah apakah magnitudo vektor membawa informasi yang memang hendak dipertahankan oleh kontrak scoring. Setelah vektor dinormalisasi menjadi unit length, informasi magnitudo tersebut tidak lagi ikut dalam perhitungan similarity.

Kecerdasan Buatan 16 Sep 2026 5 min read

Ukur Anisotropi Embedding Sebelum Vector Search

Cosine similarity mengasumsikan bahwa arah vector membawa daya pembeda yang berguna. Asumsi ini menjadi kurang informatif ketika banyak embedding menempati wilayah ruang yang sempit. Dalam kondisi tersebut, item yang tidak berkaitan dapat berbagi komponen arah yang besar, skor cosine dapat berkumpul dalam rentang sempit, dan perbedaan residual kecil akhirnya menentukan ranking. Pola geometris ini sering disebut anisotropi embedding. Pola tersebut sudah ada sebelum vector index memilih kandidat, sehingga tuning index saja tidak dapat memastikan apakah representasi memiliki pemisahan sudut yang cukup untuk tugas retrieval.

Kecerdasan Buatan 16 Sep 2026 6 min read

Pertahankan Sinyal Tingkat Token dengan Late Interaction Retrieval

Satu embedding memadatkan seluruh query atau document menjadi satu vector sebelum similarity dihitung. Representasi ini praktis untuk approximate nearest-neighbor search, tetapi setiap sinyal tingkat token harus berhasil bertahan melewati tahap kompresi tersebut. Late interaction retrieval mempertahankan properti independent encoding sambil menunda sebagian perbandingan query-document hingga search time. Perubahan utamanya ada pada representasi. Alih-alih menyimpan satu vector per document, model late interaction dapat mempertahankan sekumpulan contextual token vector. Query juga direpresentasikan dengan beberapa vector. Relevance kemudian dihitung dari interaksi antara dua himpunan tersebut, bukan dari satu global dot product.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kuantisasi Embedding Tanpa Menyamarkan Error Retrieval

Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan. Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kecerdasan Buatan 15 Sep 2026 4 min read

Memperhitungkan Hubness dalam Retrieval Embedding

Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness. Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.

Kecerdasan Buatan 12 Sep 2026 6 min read

Anisotropi Embedding Dapat Memampatkan Pemisahan Skor Cosine

Dua embedding vector dapat memiliki cosine similarity tinggi walaupun item yang diwakilinya tidak dekat dalam pengertian spesifik yang dibutuhkan sistem retrieval. Salah satu penyebab mismatch ini adalah anisotropi embedding: vector tersebar tidak merata di representation space, sering kali dengan sebagian besar massa terkonsentrasi di sekitar arah bersama. Cosine similarity menghilangkan pengaruh magnitude vector dari perbandingan, tetapi tidak menghapus komponen arah yang sama. Jika banyak vector sebagian mengarah ke arah yang sama, pasangan yang tidak terkait dapat memiliki baseline cosine yang tinggi. Perbedaan berguna antara item relevan dan tidak relevan kemudian harus muncul dalam rentang skor yang lebih sempit.

Kecerdasan Buatan 08 Sep 2026 8 min read

Migrasikan Model Embedding Tanpa Merusak Retrieval

Mengganti model embedding dapat terlihat seperti upgrade dependency biasa: ganti identifier model, deploy service, lalu terus query vector index yang ada. Pendekatan tersebut dapat merusak retrieval secara diam-diam. Embedding memiliki makna relatif terhadap ruang representasi yang dihasilkan modelnya. Jika stored document vector dibuat oleh satu model sementara query vector baru dibuat oleh model lain, koordinat keduanya umumnya tidak memiliki makna bersama. Dimensi yang sama tidak cukup untuk membuat vektor kompatibel.