← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Mezcla de expertos explicada: parámetros totales frente a activos
Un modelo de mezcla de expertos tiene un número total de parámetros enorme, pero activa solo una fracción por token, usando un enrutador para seleccionar unas pocas subredes expertas. Esto explica cómo funciona MoE, la importantísima distinción entre parámetros totales y activos, por qué es económico en cómputo pero exigente en memoria, y qué significa todo esto para ejecutar modelos como DeepSeek y Mixtral.
Qué es una mezcla de expertos
Un LLM de mezcla de expertos (MoE) es un transformer disperso en el que algunas capas feed-forward contienen varias subredes paralelas llamadas "expertos", y un enrutador aprendido selecciona solo un pequeño subconjunto de ellas para procesar cada token. El resultado es un modelo con un número total de parámetros grande que activa solo una fracción de ellos por token.
Comparémoslo con un modelo denso, donde cada token pasa por la misma red feed-forward en cada bloque, activando todos los parámetros en cada ocasión. MoE reemplaza esas capas densas por capas de expertos dispersas, de modo que la capacidad (cuánto sabe el modelo) queda desacoplada del coste (cuánto cómputo requiere cada token).
Los expertos y el enrutador
Dos componentes definen una capa MoE. Cada experto es una pequeña red neuronal, típicamente un bloque feed-forward. El enrutador (o red de compuerta) puntúa el token entrante frente a cada experto y lo dirige a los top-k de mayor puntuación — normalmente los 2 mejores de 8. Solo esos expertos contribuyen a la salida de ese token; el resto permanece inactivo para ese token.
Esta dispersión top-k es todo el truco: es lo que reduce el cómputo por token. Algunos diseños añaden un "experto compartido" que siempre está activo junto a los enrutados, para capturar patrones comunes que todo token necesita.
Parámetros totales frente a activos: la idea clave
El concepto más importante — y el peor entendido en internet — es la diferencia entre parámetros totales y activos. Los parámetros totales son todos los expertos que deben cargarse; los parámetros activos son solo los que se usan por token. El tamaño del titular no es cómputo, por lo que ante cualquier recuento de parámetros MoE la pregunta inmediata es siempre: ¿cuántos están activos por token?
El nombre "8x7B" es la trampa clásica. Mixtral 8x7B no tiene 8 × 7 = 56B parámetros. Como los expertos comparten las capas de atención y de embedding — solo las capas feed-forward se dividen en expertos — el total real ronda los 46,7B, con unos 12,9B activos por token. Su cómputo se asemeja al de un modelo denso de ~13B aunque contiene ~47B parámetros.
Modelos reales: Mixtral y DeepSeek
Dos ejemplos concretos anclan la idea. Mixtral 8x7B tiene ~46,7B parámetros totales y ~12,9B activos por token mediante enrutamiento top-2-de-8. DeepSeek-V3 escala el patrón mucho más: 671B parámetros totales con solo 37B activos por token, usando 256 expertos enrutados más un experto compartido siempre activo, y con el enrutador seleccionando 8 expertos enrutados por token. DeepSeek-R1, el modelo de razonamiento, se construye sobre la base de V3 — misma arquitectura, mismos 671B totales / 37B activos, con aprendizaje por refuerzo añadido para matemáticas y código.
Para 2025, MoE se había convertido en la arquitectura de frontera dominante, con Llama 4, Qwen3 y otros adoptándola — precisamente porque permite a los laboratorios escalar la capacidad total sin escalar el cómputo por token.
La advertencia sobre la VRAM: cómputo rápido, mucha memoria
Aquí está la trampa que sorprende a mucha gente: el cómputo disperso no reduce la memoria. Cada experto debe residir en VRAM (o RAM) aunque solo unos pocos se activen por token, porque el enrutador podría enviar el siguiente token a cualquiera de ellos. Así, Mixtral 8x7B necesita aproximadamente la memoria de un modelo denso de ~47B — del orden de 96 GB sin cuantizar — a pesar de tener la huella de cómputo de un modelo de 13B. No puedes ejecutarlo en una sola GPU de consumo solo porque "solo 13B están activos".
Resumen del compromiso: MoE ofrece mejores tokens por dólar (menos FLOPs por token) pero peor memoria por dólar (todos los expertos residentes). La cuantización ayuda en el lado de la memoria, razón por la que los modelos MoE suelen ejecutarse cuantizados en local o en endpoints multi-GPU.
Ejecutar modelos MoE en osFoundry
osFoundry ejecuta modelos MoE como DeepSeek-V3/R1 y Mixtral en local o en un endpoint cloud dedicado, para que obtengas la eficiencia por token de la activación dispersa sin gestionar la arquitectura tú mismo. Como el cuello de botella real es la memoria — todos los expertos deben estar en VRAM — la plataforma convierte eso en una decisión de despliegue: ejecutar en local cuando tu hardware puede alojar todos los expertos (cuantizados), o usar un endpoint dedicado cuando un modelo de clase 671B no cabe en tu máquina. Y como todas las llamadas al modelo son BYOK, puedes cambiar libremente entre un modelo MoE para inferencia económica de alta capacidad y un modelo denso para una huella de memoria menor, según la tarea. El compromiso entre totales y activos se convierte en una configuración, no en un dolor de cabeza de hardware.
Frequently asked questions
- ¿Qué es un modelo de mezcla de expertos (MoE) en términos sencillos?
- Es un modelo dividido en muchas subredes especializadas llamadas expertos, con un enrutador que envía cada token solo a unos pocos de ellos. Así, el modelo puede ser enorme en tamaño total — almacenando mucho conocimiento — mientras realiza solo una pequeña cantidad de cómputo por token. Separa cuánto sabe el modelo de cuánto cuesta ejecutarlo.
- ¿Cuál es la diferencia entre parámetros totales y activos?
- Los parámetros totales son todos los expertos cargados en memoria; los parámetros activos son los pocos que realmente se usan para procesar un token dado. DeepSeek-V3, por ejemplo, tiene 671B totales pero solo 37B activos por token. El cómputo sigue el recuento activo, mientras que la memoria sigue el total — por eso ambos números siempre deben citarse juntos.
- ¿Por qué un modelo MoE necesita tanta VRAM si solo usa unos pocos expertos?
- Porque el enrutador puede enviar cualquier token a cualquier experto, todos los expertos deben residir en memoria aunque solo unos pocos se activen por token. Así, un modelo MoE necesita VRAM proporcional a su recuento total de parámetros, no al activo — Mixtral 8x7B necesita aproximadamente la memoria de un modelo denso de 47B a pesar de tener un cómputo equivalente a 13B.
- ¿Es un modelo MoE más rápido que un modelo denso del mismo tamaño total?
- Sí, por token. Como solo se activa una fracción de los parámetros, un MoE realiza muchos menos FLOPs por token que un modelo denso con el mismo recuento total de parámetros, por lo que es más económico y rápido de ejecutar — siempre que puedas alojar todos los expertos en memoria. Intercambia coste de memoria por eficiencia de cómputo.
- ¿Cómo decide el enrutador qué expertos usar?
- El enrutador (red de compuerta) calcula una puntuación para cada experto dado el token, normalmente mediante una pequeña proyección aprendida seguida de un softmax, y luego selecciona los top-k expertos con mayor puntuación — a menudo los 2 mejores. Solo esos expertos procesan el token. Durante el entrenamiento, las técnicas de equilibrado de carga evitan que los tokens se concentren en unos pocos expertos favoritos.
- ¿"8x7B" significa 56 mil millones de parámetros?
- No. Mixtral 8x7B tiene aproximadamente 46,7B en total, no 56B, porque los expertos comparten las capas de atención y de embedding — solo las capas feed-forward se dividen en ocho expertos. Y solo ~12,9B están activos por token. El total nunca es igual a expertos por tamaño del experto; es una convención de nomenclatura, no aritmética.
- ¿Los modelos MoE son mejores o peores que los modelos densos para el razonamiento?
- Es variado. Con una calidad de preentrenamiento equivalente, los modelos MoE tienden a rendir bien en tareas intensivas en conocimiento y responden con fuerza al ajuste por instrucciones, pero pueden quedar por detrás de los modelos densos en algunos benchmarks de razonamiento intensivo. Los modelos MoE centrados en el razonamiento, como DeepSeek-R1, cierran esa brecha con aprendizaje por refuerzo en lugar de solo la arquitectura.
Sources