Perluas Context RoPE dengan Positional Interpolation
Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization. Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.