Langsung ke konten

Arsip

Interpretabilitas

4 artikel
Kecerdasan Buatan 18 Sep 2026 4 min read

Perlakukan Logit Lens sebagai Readout, Bukan Jejak Kausal

Sebuah transformer dapat menampilkan residual state intermediate yang sangat mendukung satu token saat diproyeksikan dengan proyeksi kosakata akhir model, lalu menghasilkan token lain setelah block berikutnya dijalankan. Logit lens membuat preferensi intermediate itu terlihat. Hasil tersebut tidak menetapkan bahwa preferensi itu menyebabkan output akhir. Batas ini relevan saat developer memakai peringkat token per layer untuk memeriksa perilaku model. Logit lens adalah readout: metode ini menanyakan apa yang akan dilaporkan output head model jika diterapkan pada representasi intermediate. Forward pass aktual mengajukan persoalan berbeda karena setiap block yang tersisa dapat mengubah representasi tersebut sebelum readout akhir.

Kecerdasan Buatan 16 Sep 2026 6 min read

Uji Mekanisme Transformer dengan Activation Patching

Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca State Intermediate Transformer dengan Logit Lens

Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model. Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Kecerdasan Buatan 16 Sep 2026 5 min read

Baca Prediksi Intermediate Transformer dengan Tuned Lens

Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman. Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.