Langsung ke konten

Arsip

RAG

3 artikel
Kecerdasan Buatan 08 Sep 2026 8 min read

Migrasikan Model Embedding Tanpa Merusak Retrieval

Mengganti model embedding dapat terlihat seperti upgrade dependency biasa: ganti identifier model, deploy service, lalu terus query vector index yang ada. Pendekatan tersebut dapat merusak retrieval secara diam-diam. Embedding memiliki makna relatif terhadap ruang representasi yang dihasilkan modelnya. Jika stored document vector dibuat oleh satu model sementara query vector baru dibuat oleh model lain, koordinat keduanya umumnya tidak memiliki makna bersama. Dimensi yang sama tidak cukup untuk membuat vektor kompatibel.

Kecerdasan Buatan 08 Sep 2026 9 min read

Ambil Evidence Multi-Hop dengan Graph RAG

Retrieval-augmented generation (RAG) biasanya dimulai dari gagasan sederhana: cari chunk teks yang mirip dengan pertanyaan, masukkan chunk paling relevan ke context model, lalu minta model menjawab berdasarkan evidence tersebut. Pendekatan ini bekerja baik ketika jawaban terdapat dalam satu passage atau beberapa passage yang masing-masing mudah diambil. Sebagian pertanyaan lebih sulit karena evidence yang berguna terhubung oleh relasi, bukan sekadar kemiripan kata. Developer mungkin perlu menjawab, “Service mana yang bergantung pada library yang dikelola tim pemilik Payments API?” Tidak ada satu chunk yang harus memuat semua kata itu. Jawabannya dapat memerlukan penelusuran beberapa hubungan antara service, library, tim, dan API.

Kecerdasan Buatan 02 Sep 2026 5 min read

Atur Anggaran Context Window LLM Tanpa Kehilangan Instruksi Penting

Aplikasi large language model jarang gagal hanya karena prompt kelebihan satu token. Kegagalan biasanya terjadi karena pertumbuhan context ditangani tanpa prioritas. Riwayat chat membesar, retrieval mengembalikan lebih banyak passage, hasil tool menjadi panjang, dan pada akhirnya aplikasi memangkas teks mana pun yang paling mudah dipotong. Desain yang lebih aman memperlakukan context window sebagai anggaran dengan alokasi eksplisit. Tujuannya bukan mengisi setiap token yang tersedia, melainkan mempertahankan informasi yang mengendalikan perilaku sekaligus menyisakan ruang yang cukup untuk jawaban lengkap.