Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization.

Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.

Perbedaan ini penting dalam implementasi karena context capacity bukan hanya setting tokenizer atau buffer. Pemetaan dari token index ke rotary phase adalah bagian dari perilaku model.

RoPE mengubah posisi menjadi rotation

Rotary position embeddings menerapkan rotation yang bergantung pada posisi terhadap komponen query dan key. Untuk satu pasangan komponen dua dimensi, rotation angle dapat direpresentasikan sebagai

angle = position * frequency

Pasangan komponen berbeda menggunakan frequency berbeda. Attention antara query dan key yang sudah dirotasi karena itu membawa informasi yang terkait dengan relative position melalui perbedaan phase.

Jika model ditraining pada posisi dari 0 hingga kira-kira L - 1, memperpanjang input ke range index yang jauh lebih besar meminta rotary mechanism dan model di sekitarnya bekerja pada phase pattern yang tidak pernah disajikan pada original context scale.

Mengubah application limit dari L ke 4L tidak mengubah fakta tersebut. Perubahan itu hanya mengizinkan index lebih besar masuk ke model.

Interpolation mengompresi position axis

Untuk original context scale L dan target scale L', dengan L' > L, linear positional interpolation memakai scale factor seperti

scale = L / L'
mapped_position = position * scale

Token pada target position L' dengan demikian dipetakan mendekati position L pada rotary position axis. Target position di antaranya dikompresi secara proporsional.

Dengan extension empat kali lipat, mapping secara konseptual adalah

target index:  0    1    2    3    4    ...    4L
mapped index:  0  0.25 0.50 0.75 1.00   ...     L

Physical sequence tetap berisi seluruh target token. Hanya position yang diberikan ke rotary calculation yang diskalakan ulang.

Pendekatan ini menghindari penggunaan langsung rotary position yang jauh melampaui original range, tetapi memperkenalkan pergeseran lain: token yang berdekatan kini memiliki phase separation lebih kecil daripada pada original mapping. Fine-tuning dapat mengadaptasikan model parameter ke positional geometry yang terkompresi tersebut.

Compression mengubah local dan distant spacing

Mental model yang umum menganggap context extension hanya memengaruhi token di luar batas lama. Linear interpolation lebih luas daripada itu. Setelah position axis diskalakan, setiap positional distance nonzero di dalam extended sequence direpresentasikan dalam scale yang terkompresi.

Dengan extension factor empat, physical separation 400 token dipetakan ke rotary separation yang setara dengan 100 posisi pada original scale. Separation empat token dipetakan menjadi satu posisi pada original scale.

Karena itu model tidak menerima original positional representation untuk jarak pendek sambil memperoleh representation terpisah untuk jarak panjang. Seluruh distance axis dikompresi pada basic linear interpolation.

Hal ini menciptakan implementation boundary: menerapkan interpolation saat inference pada model yang tidak pernah diadaptasi untuk mapping baru tidak sama dengan memakai model yang di-fine-tune dengan mapping tersebut. Position transformation-nya mungkin identik, tetapi parameter state telah melihat positional statistic berbeda.

Konvensi scale harus cocok dengan implementasi

Library mengekspos RoPE scaling melalui configuration field yang berbeda dan dapat mendefinisikan factor dari arah yang berlawanan. Satu interface dapat mendeskripsikan extension ratio L' / L; internal calculation lain dapat mengalikan position dengan reciprocal-nya L / L'.

Angka tersebut menggambarkan quantity yang saling berhubungan tetapi tidak dapat dipertukarkan tanpa memeriksa konvensinya.

Sebagai contoh, memperpanjang positional range 8.000 token menjadi 32.000 token menghasilkan

extension ratio = 32000 / 8000 = 4
position multiplier = 8000 / 32000 = 0.25

Memberikan 4 ke API yang mengharapkan direct position multiplier justru akan memperbesar posisi, bukan mengompresinya. Memberikan 0.25 ke API yang mengharapkan extension ratio juga dapat menghasilkan transformasi yang salah.

Objek yang dapat diandalkan untuk diperiksa adalah effective rotary angle calculation. Nama configuration field berada di bawah mapping yang benar-benar dihasilkannya.

Context length dan usable context adalah properti berbeda

Model configuration dapat mengiklankan maximum position lebih besar tetapi tetap gagal menggunakan distant information dengan andal. Memory allocation, attention kernel, dan cache indexing menentukan apakah sequence dapat dieksekusi. Positional adaptation menentukan bagian perilaku yang berbeda.

Evaluasi untuk extended model karena itu membutuhkan input yang menempatkan informasi relevan di seluruh distance range baru. Menguji hanya prompt pendek memastikan model yang dimodifikasi masih menangani short context; hal itu tidak membuktikan bahwa token di dekat batas baru memengaruhi output sebagaimana dimaksud.

Pemeriksaan sebaliknya juga penting. Karena interpolation mengubah positional spacing di seluruh sequence, long-context adaptation dapat mengubah perilaku pada input yang masih muat di original range. Evaluasi short-context tetap relevan walaupun tujuan engineering-nya adalah window lebih besar.

Tidak ada satu angka context length yang sekaligus menangkap execution support dan kemampuan efektif memakai distant token.

KV cache harus memakai positional mapping yang sama

Autoregressive generation biasanya menyimpan key dan value dari token sebelumnya. Dengan RoPE, cached key dibuat memakai rotation yang bergantung posisi. Continuation harus memakai position yang konsisten dengan mapping ketika cached entry tersebut dibuat.

Mengubah RoPE scale di tengah cached sequence membuat entry lama dan baru merepresentasikan posisi pada coordinate system berbeda. Cache dapat tetap valid secara struktural sementara positional semantics-nya tidak konsisten.

Hal ini juga memengaruhi cache reuse lintas request atau konfigurasi. Cache yang dibuat di bawah satu rotary scaling policy tidak boleh diasumsikan kompatibel dengan policy lain hanya karena model weight dan tensor shape sama.

Untuk sistem yang mengekspos runtime context setting, positional mapping termasuk bagian dari cache identity bersama model dan state lain yang mengubah key atau value computation.

Interpolation tidak menghilangkan biaya attention

Positional interpolation menangani position representation. Ia sendiri tidak mengubah computational complexity dari dense self-attention.

Jika sequence length bertambah empat kali, jumlah pasangan query-key dalam full attention matrix bertambah enam belas kali. Optimized attention kernel dapat menghindari materialisasi complete matrix dan mengubah perilaku memory secara praktis, tetapi jumlah pairwise attention work tetap meningkat tajam mengikuti sequence length pada dense attention.

Memory KV cache selama autoregressive decoding juga bertambah mengikuti jumlah cached token position kecuali cache strategy lain mengubah hubungan itu.

Metode positional dapat membuat index range yang lebih panjang menjadi bermakna tanpa membuat range tersebut murah diproses. Context extension dan context efficiency adalah design problem yang terpisah.

Positional interpolation paling tepat diperlakukan sebagai coordinate transformation dengan konsekuensi pada tingkat model. Ia menjaga rotary position tetap di numeric range yang familiar dengan mengompresi distance, lalu mengandalkan adaptation agar geometry yang lebih rapat tetap berguna. Implementasi hanya konsisten ketika training, inference, evaluation, dan cache handling menyepakati position mapping yang sama.