Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention
Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.