Langsung ke konten

Arsip

Beam Search

3 artikel
Kecerdasan Buatan 24 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Sequence yang Terpilih

Beam search dapat memilih sequence pendek walaupun continuation yang lebih panjang berisi token-token yang secara lokal masuk akal. Efek ini berasal dari aturan skornya: log-probability token biasanya diakumulasi sepanjang sequence, dan setiap token tambahan menyumbangkan satu nilai non-positif lagi. Normalisasi panjang mengubah tekanan ranking tersebut, tetapi tidak mengubah probabilitas model yang menghasilkan token. Pemisahan itu penting pada sistem generasi. Skor decoding adalah objektif saat inferensi untuk membandingkan hipotesis. Skor tersebut tidak otomatis menjadi probabilitas terkalibrasi untuk output yang sudah selesai, dan mengubahnya dapat mengganti sequence terpilih tanpa mengubah parameter model.

Kecerdasan Buatan 23 Sep 2026 6 min read

Normalisasi Panjang pada Beam Search Mengubah Peringkat Sequence

Beam search memberi peringkat pada sequence parsial memakai skor yang terakumulasi sepanjang proses decoding. Jika skor tersebut berupa jumlah log-probability token, setiap token tambahan biasanya menyumbang nilai non-positif. Kandidat yang lebih panjang mendapat lebih banyak kesempatan untuk menurunkan skor mentahnya, bahkan ketika continuation-nya tetap masuk akal secara lokal. Sifat ini bukan cacat pada teori probabilitas. Efek tersebut muncul karena sequence lengkap dengan jumlah faktor kondisional berbeda sedang dibandingkan. Persoalannya menjadi relevan pada implementasi ketika decoder diharapkan menghasilkan completion yang berguna, bukan sekadar mengurutkan sequence berdasarkan probabilitas model tanpa penyesuaian.

Kecerdasan Buatan 13 Sep 2026 7 min read

Kendalikan Bias Panjang Sequence dalam Beam Search

Beam search dapat mengembalikan sequence yang lebih pendek meskipun kandidat yang lebih panjang berisi token yang masuk akal secara lokal pada setiap posisi. Perilaku ini mengikuti langsung dari scoring sequence: model autoregressive mengalikan conditional probability token, atau secara ekuivalen menjumlahkan log probability-nya. Karena probability token paling besar bernilai satu, setiap token tambahan menyumbangkan log term yang tidak positif. Aritmetika tersebut menjadikan panjang sequence bagian dari decoding. Beam width mengubah kandidat mana yang bertahan, tetapi tidak menghilangkan efek scoring. Karena itu, decoder memerlukan kebijakan yang disengaja untuk membandingkan hypothesis dengan panjang berbeda dan menentukan kapan hypothesis yang sudah lengkap cukup baik untuk menghentikan search.