Mixture of Experts (MoE) adalah arsitektur jaringan saraf yang membagi model besar menjadi beberapa sub-jaringan yang lebih kecil, disebut "expert" (ahli), beserta sebuah mekanisme "router" atau "gating network" yang menentukan expert mana yang paling relevan untuk memproses input tertentu. Alih-alih mengaktifkan seluruh parameter model untuk setiap permintaan, MoE hanya mengaktifkan sebagian kecil expert yang relevan.
Analogi sederhananya adalah sebuah rumah sakit besar dengan banyak dokter spesialis. Alih-alih setiap pasien diperiksa oleh semua dokter, resepsionis (router) mengarahkan pasien ke spesialis yang tepat sesuai keluhannya. Dengan cara ini, rumah sakit bisa menangani lebih banyak jenis kasus tanpa membuat setiap dokter harus menguasai semua bidang.
Keuntungan utama MoE adalah efisiensi komputasi. Model dengan total parameter sangat besar (misalnya ratusan miliar) dapat berjalan dengan biaya inferensi setara model yang jauh lebih kecil, karena hanya sebagian kecil parameter yang aktif dalam satu forward pass. Ini memungkinkan model mencapai kapasitas pengetahuan yang besar tanpa proporsional meningkatkan biaya komputasi setiap kali digunakan.
Sejumlah model AI populer generasi terbaru, seperti Mixtral dari Mistral AI dan sejumlah model dari Google serta model open-weight asal Tiongkok, menggunakan arsitektur MoE. Pendekatan ini menjadi salah satu tren arsitektur paling signifikan sejak 2023-2024 karena memungkinkan laboratorium AI melatih model yang lebih besar dan mampu tanpa biaya inferensi yang membengkak secara linear.
Tantangan MoE terletak pada kompleksitas pelatihan—memastikan setiap expert terlatih secara seimbang dan tidak ada expert yang "menganggur" atau justru terlalu dominan—serta kebutuhan memori yang tetap besar karena seluruh expert harus dimuat meski tidak semuanya aktif secara bersamaan.
