Expert Parallelism Mengubah Routing MoE Menjadi Komunikasi All-to-All
Layer Mixture-of-Experts yang aktif secara sparse dapat menyimpan banyak parameter expert sambil mengirim setiap token hanya ke sebagian kecil expert. Ketika expert tersebut dipartisi ke beberapa perangkat, aktivasi sparse tidak berarti eksekusinya tetap lokal. Token yang memilih expert remote harus berpindah ke perangkat pemilik expert, lalu output expert harus kembali ke perangkat yang melanjutkan komputasi model. Perpindahan ini merupakan biaya sistem utama expert parallelism. Router membuat pilihan logis, sedangkan runtime terdistribusi harus mengubah pilihan itu menjadi komunikasi, batch expert lokal, komputasi expert, dan pertukaran balik.