Langsung ke konten

Arsip

Batching

2 artikel
Kecerdasan Buatan 22 Sep 2026 6 min read

Padding Mask Tidak Menghapus Komputasi Padding pada Dense Attention

Satu batch dapat memuat dua prompt dengan jumlah token yang sangat berbeda, tetapi keduanya direpresentasikan dalam tensor persegi panjang yang sama. Prompt yang lebih pendek diperpanjang dengan padding agar bentuk tensornya mengikuti sequence terpanjang dalam batch. Attention mask dapat mencegah posisi padding ikut membentuk probabilitas attention, tetapi pengecualian secara semantik itu tidak berarti kernel padat melewati setiap operasi pada baris dan kolom padding. Perbedaan ini relevan pada model serving karena mask mengatur posisi mana yang boleh berinteraksi, sedangkan bentuk tensor menentukan banyak bagian dari pekerjaan yang diberikan kepada operator padat. Batch dengan padding besar dapat menjalankan lebih banyak aritmetika dan memindahkan lebih banyak data dibanding perkiraan yang hanya memakai jumlah token valid.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.