Langsung ke konten

Arsip

RoPE

7 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Rotary Position Embedding Mengubah Indeks Absolut Menjadi Fase Relatif pada Attention

Self-attention dapat membandingkan isi token tanpa memberi urutan pada posisi token. Rotary Position Embedding (RoPE) memasukkan posisi ke dalam perbandingan itu dengan merotasi pasangan koordinat pada query dan key. Setiap token menerima rotasi berdasarkan indeks absolut, tetapi inner product query-key mereduksi kedua sudut absolut tersebut menjadi selisih sudut. Pembatalan secara aljabar ini merupakan mekanisme utama RoPE. Tidak ada vektor posisi yang harus ditambahkan ke hidden state. Posisi mengubah orientasi komponen query dan key sebelum dot product dihitung.

Kecerdasan Buatan 24 Sep 2026 4 min read

RoPE Mengodekan Offset Relatif melalui Fase Query-Key yang Diputar

Rotary Position Embedding (RoPE) menerapkan rotasi berbasis posisi pada koordinat query dan key sebelum dot product attention dihitung. Skor yang dihasilkan membawa posisi relatif melalui selisih fase kedua rotasi tersebut, bukan melalui vektor posisi aditif yang ditempelkan pada representasi token. Perbedaan ini bersifat struktural. RoPE memakai indeks absolut untuk menentukan setiap rotasi, tetapi inner product antara query dan key dapat ditulis sebagai fungsi offset di antara kedua posisi. Pasangan koordinat membawa frekuensi sudut yang berbeda RoPE membagi query atau key berdimensi genap menjadi pasangan koordinat dua dimensi. Untuk satu pasangan, posisi m menerapkan rotasi

Kecerdasan Buatan 24 Sep 2026 5 min read

Position Interpolation Memampatkan Indeks RoPE ke Rentang Konteks Asli

Transformer berbasis RoPE mengaitkan posisi token dengan rotasi yang sudutnya bergantung pada indeks posisi dan frekuensi per dimensi. Saat sequence melewati rentang konteks yang dipakai dalam pelatihan, rotasi tersebut memakai indeks posisi di luar rezim yang pernah dihadapi model. Position Interpolation mengubah batas itu dengan menskalakan indeks yang diperpanjang kembali ke rentang asli sebelum transformasi rotary diterapkan. Untuk batas konteks asli L dan target konteks L' > L, pemetaan linear yang disederhanakan adalah:

Kecerdasan Buatan 24 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Indeks Sebelum Rotasi

Rotary position embeddings menerapkan rotasi yang bergantung pada posisi ke komponen query dan key sebelum dot product dihitung. Jika model dilatih dengan posisi sampai panjang acuan tertentu, memasukkan indeks yang jauh lebih besar langsung ke aturan rotasi yang sama dapat membawa attention ke rentang sudut yang tidak tercakup oleh rentang posisi saat training. Interpolasi posisi mengubah koordinat yang diberikan kepada RoPE. Untuk faktor ekstensi s > 1, bentuk sederhananya memetakan

Kecerdasan Buatan 23 Sep 2026 5 min read

Pergeseran Posisi RoPE Mempertahankan Fase Relatif tetapi Mengubah Rotasi Absolut

Rotary position embeddings, yang umum disebut RoPE, memasukkan posisi ke attention dengan merotasi pasangan channel query dan key memakai sudut yang ditentukan oleh posisi token. Rotasi dilakukan sebelum dot product query-key. Posisi karena itu tidak direpresentasikan dengan menambahkan satu vektor terpisah ke representasi setiap token. Perbedaan ini berdampak langsung pada inferensi. Key yang sudah berada di cache telah memuat rotasi untuk posisi yang diberikan kepadanya. Memakai ulang key tersebut pada koordinat sequence lain tanpa transformasi yang ekuivalen akan mengubah komputasi attention, meskipun konten token sama.

Kecerdasan Buatan 23 Sep 2026 4 min read

KV Cache RoPE Mempertahankan Posisi Token saat Decoding Inkremental

Pada decoder dengan rotary position embeddings, key yang masuk ke KV cache sudah membawa rotasi sesuai posisi tokennya. Decoding inkremental dapat memakai key tersebut secara langsung. Memberikan rotasi posisi token saat ini sekali lagi ke key lama justru mengubah geometri attention. Akibatnya, state posisi merupakan bagian dari kontrak cache meskipun API cache tampak hanya menyimpan tensor. Rotasi terjadi sebelum key dipakai oleh attention Untuk satu pasangan komponen dua dimensi, RoPE menerapkan rotasi yang bergantung pada posisi. Jika (R_m) menyatakan rotasi pada posisi (m), query dan key menjadi

Kecerdasan Buatan 23 Sep 2026 4 min read

Interpolasi Posisi RoPE Memampatkan Sudut Relatif pada Konteks Lebih Panjang

Rotary position embeddings mengodekan posisi dengan merotasi komponen query dan key memakai sudut yang diturunkan dari indeks token. Ketika model dijalankan melampaui rentang posisi yang dipakai saat optimisasi awal, sudut tersebut dapat masuk ke rezim yang tidak ditemui model sebelumnya. Position interpolation menangani batas ini dengan memetakan sequence yang lebih panjang ke rentang koordinat posisi yang lebih kecil sebelum sudut rotary dihitung. Mekanisme ini tidak menambahkan token ekstra ke state arsitektural model. Yang berubah adalah koordinat yang diberikan ke transformasi posisi. Perbedaan tersebut penting karena kemampuan runtime menerima input lebih panjang dan mutu perilaku model pada panjang itu merupakan dua hal terpisah.