← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Mixture of Experts Dijelaskan: Parameter Total vs Aktif
Model mixture-of-experts memiliki jumlah parameter total yang sangat besar, tetapi hanya mengaktifkan sebagian kecil per token dengan menggunakan router untuk memilih beberapa sub-jaringan expert. Artikel ini menjelaskan cara kerja MoE, perbedaan krusial antara parameter total vs aktif, kenapa MoE murah secara komputasi tetapi boros memori, dan apa artinya saat menjalankan model seperti DeepSeek dan Mixtral.
Apa itu mixture of experts
LLM mixture-of-experts (MoE) adalah sparse transformer yang sebagian lapisan feed-forward-nya berisi beberapa sub-jaringan paralel yang disebut "expert", dan sebuah router terlatih hanya memilih sebagian kecil di antaranya untuk memproses setiap token. Hasilnya adalah model dengan jumlah parameter total yang besar, tetapi hanya mengaktifkan sebagian kecil parameter itu per token.
Bandingkan dengan model dense, di mana setiap token melewati jaringan feed-forward yang sama di setiap blok dan mengaktifkan semua parameter setiap kali. MoE mengganti lapisan dense tersebut dengan lapisan expert yang sparse, sehingga kapasitas (seberapa banyak yang diketahui model) terpisah dari biaya (seberapa banyak komputasi yang dibutuhkan tiap token).
Expert dan router
Sebuah lapisan MoE didefinisikan oleh dua komponen. Setiap expert adalah jaringan saraf kecil, biasanya berupa blok feed-forward. Router (atau gating network) memberi skor pada token yang masuk terhadap setiap expert, lalu merutekannya ke k expert dengan skor tertinggi — umumnya 2 teratas dari 8. Hanya expert-expert itulah yang berkontribusi pada output token tersebut; sisanya menganggur untuk token itu.
Sparsity top-k inilah seluruh triknya: inilah yang memangkas komputasi per token. Beberapa desain menambahkan "shared expert" yang selalu aktif bersama expert yang dirutekan, untuk menangkap pola umum yang dibutuhkan setiap token.
Parameter total vs aktif — gagasan kuncinya
Konsep paling penting — dan paling sering disalahpahami di internet — adalah perbedaan antara parameter total dan aktif. Parameter total adalah semua expert yang harus dimuat; parameter aktif hanyalah yang dipakai per token. Ukuran yang tertulis besar di judul bukanlah komputasi, jadi pertanyaan lanjutan untuk setiap angka parameter MoE selalu sama: berapa yang aktif per token?
Penamaan "8x7B" adalah jebakan klasik. Mixtral 8x7B bukan 8 × 7 = 56B parameter. Karena para expert berbagi lapisan attention dan embedding — hanya lapisan feed-forward yang dibagi menjadi expert — total sebenarnya sekitar 46,7B, dengan sekitar 12,9B aktif per token. Komputasinya menyerupai model dense ~13B meski menyimpan ~47B parameter.
Model nyata: Mixtral dan DeepSeek
Dua contoh konkret menguatkan gagasan ini. Mixtral 8x7B memiliki ~46,7B parameter total dan ~12,9B aktif per token lewat routing top-2-of-8. DeepSeek-V3 mendorong pola ini jauh lebih tinggi: 671B parameter total dengan hanya 37B aktif per token, memakai 256 expert yang dirutekan ditambah satu shared expert yang selalu aktif, dan router memilih 8 expert yang dirutekan per token. DeepSeek-R1, model reasoning-nya, dibangun di atas basis V3 — arsitektur yang sama, total 671B / 37B aktif yang sama, dengan reinforcement learning yang ditambahkan untuk matematika dan kode.
Pada 2025, MoE telah menjadi arsitektur frontier yang dominan, diadopsi oleh Llama 4, Qwen3, dan lainnya — justru karena memungkinkan lab menskalakan kapasitas total tanpa menskalakan komputasi per token.
Soal VRAM: komputasi cepat, memori besar
Inilah hal yang mengejutkan banyak orang: komputasi sparse tidak mengurangi memori. Setiap expert harus berada di VRAM (atau RAM) meski hanya beberapa yang aktif per token, karena router bisa saja mengirim token berikutnya ke salah satu dari mereka. Jadi Mixtral 8x7B butuh memori kira-kira setara model dense ~47B — sekitar 96 GB tanpa kuantisasi — meski jejak komputasinya seperti model 13B. Anda tidak bisa memuatnya di satu GPU konsumen hanya karena "yang aktif cuma 13B."
Ringkasan trade-off-nya: MoE memberi token-per-dolar yang lebih baik (FLOPs lebih sedikit per token) tetapi memori-per-dolar yang lebih buruk (semua expert harus tetap ada). Kuantisasi membantu di sisi memori, itulah sebabnya model MoE biasanya dijalankan secara lokal dalam bentuk terkuantisasi atau pada endpoint multi-GPU.
Menjalankan model MoE di osFoundry
osFoundry menjalankan model MoE seperti DeepSeek-V3/R1 dan Mixtral, baik secara lokal maupun pada endpoint cloud khusus, sehingga Anda mendapat efisiensi per token dari sparse activation tanpa perlu mengelola arsitekturnya sendiri. Karena bottleneck sesungguhnya adalah memori — setiap expert harus berada di VRAM — platform menjadikannya pilihan deployment: jalankan secara lokal saat hardware Anda mampu menampung semua expert (yang terkuantisasi), atau gunakan endpoint khusus saat model kelas 671B tidak muat di mesin Anda. Dan karena semua pemanggilan model bersifat BYOK, Anda bisa berpindah bebas antara model MoE untuk inferensi berkapasitas tinggi yang murah dan model dense untuk jejak memori yang lebih kecil, sesuai kebutuhan tiap tugas. Trade-off total vs aktif berubah menjadi sebuah pengaturan, bukan kerumitan hardware.
Frequently asked questions
- Apa itu model mixture-of-experts (MoE) secara sederhana?
- Ini model yang dibagi menjadi banyak sub-jaringan khusus yang disebut expert, dengan router yang mengirim setiap token hanya ke beberapa di antaranya. Jadi model bisa sangat besar secara total ukuran — menyimpan banyak pengetahuan — sambil hanya melakukan sedikit komputasi per token. Ini memisahkan seberapa banyak yang diketahui model dari biaya untuk menjalankannya.
- Apa perbedaan antara parameter total dan aktif?
- Parameter total adalah semua expert yang dimuat ke memori; parameter aktif adalah segelintir yang benar-benar dipakai untuk memproses suatu token. DeepSeek-V3, misalnya, total 671B tetapi hanya 37B aktif per token. Komputasi mengikuti jumlah aktif, sedangkan memori mengikuti total — itulah sebabnya kedua angka itu selalu perlu disebut bersamaan.
- Kenapa model MoE butuh begitu banyak VRAM padahal hanya memakai beberapa expert?
- Karena router bisa mengirim token mana pun ke expert mana pun, setiap expert harus berada di memori meski hanya beberapa yang aktif per token. Jadi model MoE butuh VRAM yang sebanding dengan jumlah parameter totalnya, bukan jumlah aktifnya — Mixtral 8x7B butuh memori kira-kira setara model dense 47B meski komputasinya setara 13B.
- Apakah model MoE lebih cepat daripada model dense dengan total ukuran yang sama?
- Ya, per token. Karena hanya sebagian kecil parameter yang aktif, MoE melakukan FLOPs per token yang jauh lebih sedikit dibanding model dense dengan jumlah parameter total yang sama, jadi lebih murah dan lebih cepat dijalankan — selama Anda bisa memuat semua expert ke memori. Ini menukar biaya memori dengan efisiensi komputasi.
- Bagaimana router menentukan expert mana yang dipakai?
- Router (gating network) menghitung skor untuk setiap expert berdasarkan token yang diberikan, biasanya lewat proyeksi kecil yang dipelajari diikuti softmax, lalu memilih k expert dengan skor tertinggi — sering kali 2 teratas. Hanya expert itulah yang memproses token tersebut. Selama pelatihan, teknik load-balancing mencegah token menumpuk pada beberapa expert favorit.
- Apakah "8x7B" berarti 56 miliar parameter?
- Tidak. Mixtral 8x7B totalnya sekitar 46,7B, bukan 56B, karena para expert berbagi lapisan attention dan embedding — hanya lapisan feed-forward yang dibagi menjadi delapan expert. Dan hanya ~12,9B yang aktif per token. Total tidak pernah sama dengan jumlah expert dikali ukuran-expert; itu konvensi penamaan, bukan aritmetika.
- Apakah model MoE lebih baik atau lebih buruk daripada model dense untuk reasoning?
- Hasilnya beragam. Pada kualitas pre-training yang setara, model MoE cenderung unggul pada tugas yang berat pengetahuan dan merespons baik terhadap instruction tuning, tetapi bisa tertinggal dari model dense pada sebagian benchmark yang berat reasoning. Model MoE yang berfokus pada reasoning seperti DeepSeek-R1 menutup kesenjangan itu dengan reinforcement learning, bukan semata-mata arsitektur.
Sources