← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Le mélange d'experts expliqué : paramètres totaux vs actifs
Un modèle à mélange d'experts possède un nombre total de paramètres énorme, mais n'en active qu'une fraction par token, en utilisant un routeur pour sélectionner quelques sous-réseaux experts. Cet article explique comment MoE fonctionne, la distinction cruciale entre paramètres totaux et actifs, pourquoi il est peu coûteux en calcul mais gourmand en mémoire, et ce que cela implique pour exécuter des modèles comme DeepSeek et Mixtral.
Qu'est-ce qu'un mélange d'experts
Un LLM à mélange d'experts (MoE) est un transformer épars dans lequel certaines couches feed-forward contiennent plusieurs sous-réseaux parallèles appelés « experts », et un routeur appris sélectionne seulement un petit sous-ensemble d'entre eux pour traiter chaque token. Le résultat est un modèle doté d'un grand nombre total de paramètres qui n'en active qu'une fraction par token.
Comparez cela à un modèle dense, où chaque token traverse le même réseau feed-forward dans chaque bloc, activant tous les paramètres à chaque fois. MoE remplace ces couches denses par des couches d'experts éparses, de sorte que la capacité (ce que le modèle sait) est découplée du coût (le calcul que chaque token requiert).
Les experts et le routeur
Deux composants définissent une couche MoE. Chaque expert est un petit réseau de neurones, typiquement un bloc feed-forward. Le routeur (ou réseau de gating) attribue un score au token entrant pour chaque expert et l'achemine vers les top-k aux scores les plus élevés — généralement les 2 meilleurs sur 8. Seuls ces experts contribuent à la sortie de ce token ; les autres restent inactifs pour ce token.
Cette parcimonie top-k est toute l'astuce : c'est elle qui réduit le calcul par token. Certaines architectures ajoutent un « expert partagé » toujours actif aux côtés des experts routés, afin de capturer les motifs communs dont chaque token a besoin.
Paramètres totaux vs actifs — l'idée clé
Le concept le plus important — et le plus mal compris sur internet — est la différence entre paramètres totaux et actifs. Les paramètres totaux sont tous les experts qui doivent être chargés ; les paramètres actifs sont uniquement ceux utilisés par token. La taille affichée n'est pas du calcul ; ainsi, la question qui suit tout nombre de paramètres MoE est toujours : combien sont actifs par token ?
La dénomination « 8x7B » est le piège classique. Mixtral 8x7B ne compte pas 8 × 7 = 56B paramètres. Parce que les experts partagent les couches d'attention et d'embedding — seules les couches feed-forward sont divisées en experts — le total réel est d'environ 46,7B, avec environ 12,9B actifs par token. Son calcul ressemble à celui d'un modèle dense de ~13B même s'il contient ~47B paramètres.
Modèles concrets : Mixtral et DeepSeek
Deux exemples concrets ancrent l'idée. Mixtral 8x7B dispose de ~46,7B paramètres totaux et ~12,9B actifs par token via un routage top-2-sur-8. DeepSeek-V3 pousse le motif bien plus loin : 671B paramètres totaux avec seulement 37B actifs par token, en utilisant 256 experts routés plus un expert partagé toujours actif, le routeur sélectionnant 8 experts routés par token. DeepSeek-R1, le modèle de raisonnement, est construit sur la base V3 — même architecture, mêmes 671B totaux / 37B actifs, avec de l'apprentissage par renforcement ajouté pour les maths et le code.
Dès 2025, MoE était devenu l'architecture de pointe dominante, Llama 4, Qwen3 et d'autres l'adoptant tous — précisément parce qu'il permet aux laboratoires d'augmenter la capacité totale sans augmenter le calcul par token.
La mise en garde sur la VRAM : calcul rapide, grande mémoire
Voici le piège qui surprend : le calcul épars ne réduit pas la mémoire. Chaque expert doit résider en VRAM (ou RAM) même si seulement quelques-uns s'activent par token, car le routeur pourrait envoyer le token suivant à n'importe lequel d'entre eux. Ainsi, Mixtral 8x7B a besoin d'environ la mémoire d'un modèle dense de ~47B — de l'ordre de 96 Go non quantifié — malgré une empreinte de calcul comparable à un modèle de 13B. Vous ne pouvez pas l'exécuter sur un seul GPU grand public simplement parce que « seuls 13B sont actifs ».
Résumé du compromis : MoE offre de meilleurs tokens par dollar (moins de FLOPs par token) mais une moins bonne mémoire par dollar (tous les experts résidents). La quantification aide du côté de la mémoire, c'est pourquoi les modèles MoE sont généralement exécutés quantifiés en local ou sur des endpoints multi-GPU.
Exécuter des modèles MoE dans osFoundry
osFoundry exécute des modèles MoE comme DeepSeek-V3/R1 et Mixtral en local ou sur un endpoint cloud dédié, pour que vous bénéficiiez de l'efficacité par token de l'activation éparse sans gérer l'architecture vous-même. Comme le véritable goulot d'étranglement est la mémoire — chaque expert doit se trouver en VRAM — la plateforme en fait un choix de déploiement : exécuter en local quand votre matériel peut héberger tous les experts (quantifiés), ou utiliser un endpoint dédié quand un modèle de classe 671B ne tient pas sur votre machine. Et comme tous les appels de modèle sont BYOK, vous pouvez passer librement d'un modèle MoE pour une inférence bon marché à haute capacité à un modèle dense pour une empreinte mémoire réduite, selon la tâche. Le compromis total vs actif devient un paramètre, et non un casse-tête matériel.
Frequently asked questions
- Qu'est-ce qu'un modèle à mélange d'experts (MoE) en termes simples ?
- C'est un modèle divisé en de nombreux sous-réseaux spécialisés appelés experts, avec un routeur qui envoie chaque token vers seulement quelques-uns d'entre eux. Le modèle peut ainsi être énorme en taille totale — stockant beaucoup de connaissances — tout en n'effectuant qu'une petite quantité de calcul par token. Il sépare ce que le modèle sait de ce que coûte son exécution.
- Quelle est la différence entre paramètres totaux et actifs ?
- Les paramètres totaux sont tous les experts chargés en mémoire ; les paramètres actifs sont les quelques-uns réellement utilisés pour traiter un token donné. DeepSeek-V3, par exemple, totalise 671B mais seulement 37B actifs par token. Le calcul suit le nombre actif, tandis que la mémoire suit le total — c'est pourquoi les deux chiffres doivent toujours être cités ensemble.
- Pourquoi un modèle MoE a-t-il besoin d'autant de VRAM s'il n'utilise que quelques experts ?
- Parce que le routeur peut envoyer n'importe quel token à n'importe quel expert, tous les experts doivent résider en mémoire même si seulement quelques-uns s'activent par token. Un modèle MoE a donc besoin d'une VRAM proportionnelle à son nombre total de paramètres, et non au nombre actif — Mixtral 8x7B a besoin d'environ la mémoire d'un modèle dense de 47B malgré un calcul équivalent à 13B.
- Un modèle MoE est-il plus rapide qu'un modèle dense de même taille totale ?
- Oui, par token. Comme seule une fraction des paramètres s'active, un MoE effectue beaucoup moins de FLOPs par token qu'un modèle dense ayant le même nombre total de paramètres, ce qui le rend moins coûteux et plus rapide à exécuter — à condition de pouvoir héberger tous les experts en mémoire. Il échange le coût mémoire contre l'efficacité de calcul.
- Comment le routeur décide-t-il quels experts utiliser ?
- Le routeur (réseau de gating) calcule un score pour chaque expert en fonction du token, généralement via une petite projection apprise suivie d'un softmax, puis sélectionne les top-k experts aux scores les plus élevés — souvent les 2 premiers. Seuls ces experts traitent le token. Pendant l'entraînement, des techniques d'équilibrage de charge empêchent les tokens de se concentrer sur quelques experts favoris.
- « 8x7B » signifie-t-il 56 milliards de paramètres ?
- Non. Mixtral 8x7B totalise environ 46,7B, pas 56B, parce que les experts partagent les couches d'attention et d'embedding — seules les couches feed-forward sont divisées en huit experts. Et seuls ~12,9B sont actifs par token. Le total n'est jamais égal au nombre d'experts multiplié par leur taille ; c'est une convention de nommage, pas de l'arithmétique.
- Les modèles MoE sont-ils meilleurs ou moins bons que les modèles denses pour le raisonnement ?
- C'est mitigé. À qualité de pré-entraînement équivalente, les modèles MoE tendent à bien performer sur les tâches intensives en connaissances et réagissent fortement au fine-tuning par instructions, mais peuvent être en retrait par rapport aux modèles denses sur certains benchmarks de raisonnement intensif. Les modèles MoE axés sur le raisonnement comme DeepSeek-R1 comblent cet écart grâce à l'apprentissage par renforcement plutôt qu'à la seule architecture.
Sources