Langsung ke konten

Arsip

Mixture of Experts

6 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert MoE Membatasi Routing Token

Layer Mixture-of-Experts yang sparse dapat memiliki banyak jaringan expert sambil hanya mengaktifkan sebagian kecil untuk setiap token. Conditional computation ini bergantung pada router, tetapi skor router saja tidak menentukan graph yang benar-benar dieksekusi. Pada implementasi dengan batch expert terbatas, setiap expert juga memiliki jumlah slot token yang terbatas. Kondisi ini menambahkan batas kedua setelah pemilihan expert: sebuah token dapat memilih expert yang sudah tidak memiliki kapasitas. Penanganan overflow tersebut merupakan keputusan implementasi dan arsitektur yang berdampak langsung pada training dan serving.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow

Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert. Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.

Kecerdasan Buatan 24 Sep 2026 5 min read

Expert Parallelism Mengubah Routing MoE Menjadi Komunikasi All-to-All

Layer Mixture-of-Experts yang aktif secara sparse dapat menyimpan banyak parameter expert sambil mengirim setiap token hanya ke sebagian kecil expert. Ketika expert tersebut dipartisi ke beberapa perangkat, aktivasi sparse tidak berarti eksekusinya tetap lokal. Token yang memilih expert remote harus berpindah ke perangkat pemilik expert, lalu output expert harus kembali ke perangkat yang melanjutkan komputasi model. Perpindahan ini merupakan biaya sistem utama expert parallelism. Router membuat pilihan logis, sedangkan runtime terdistribusi harus mengubah pilihan itu menjadi komunikasi, batch expert lokal, komputasi expert, dan pertukaran balik.

Kecerdasan Buatan 23 Sep 2026 5 min read

Kapasitas Switch Routing Mengubah Ketimpangan Expert Menjadi Token Overflow

Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch. Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.

Kecerdasan Buatan 17 Sep 2026 7 min read

Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts

Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih. Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.

Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.