← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Mixture of Experts простыми словами: общие и активные параметры
Модель mixture of experts имеет огромное общее количество параметров, но активирует лишь небольшую их долю на каждый токен, используя маршрутизатор для выбора нескольких экспертных подсетей. Здесь объясняется, как работает MoE, ключевое различие между общими и активными параметрами, почему модель экономична в вычислениях, но требовательна к памяти, и что это означает для запуска моделей вроде DeepSeek и Mixtral.
Что такое mixture of experts
LLM типа mixture of experts (MoE) — это разреженный трансформер, в котором некоторые слои feed-forward содержат несколько параллельных подсетей, называемых «экспертами», а обученный маршрутизатор выбирает лишь небольшое подмножество из них для обработки каждого токена. В результате получается модель с большим общим числом параметров, активирующая лишь их долю на каждый токен.
Для сравнения: в плотной модели каждый токен проходит через одну и ту же сеть feed-forward в каждом блоке, активируя все параметры каждый раз. MoE заменяет эти плотные слои разреженными слоями экспертов, так что ёмкость (сколько знает модель) отделяется от стоимости (сколько вычислений требует каждый токен).
Эксперты и маршрутизатор
Слой MoE определяют два компонента. Каждый эксперт — это небольшая нейронная сеть, как правило, блок feed-forward. Маршрутизатор (или сеть gating) оценивает входящий токен по каждому эксперту и направляет его к k лучшим по оценке — обычно к 2 лучшим из 8. Только эти эксперты вносят вклад в выход данного токена; остальные для этого токена простаивают.
Именно эта разреженность top-k и есть весь трюк: она сокращает вычисления на токен. Некоторые архитектуры добавляют «общего эксперта», который всегда активен наряду с маршрутизируемыми, чтобы захватывать общие паттерны, нужные каждому токену.
Общие и активные параметры — ключевая идея
Самая важная концепция — и самая искажённая в интернете — это разница между общими и активными параметрами. Общие параметры — это все эксперты, которые должны быть загружены; активные параметры — только те, что используются на токен. Заявленный размер — это не вычисления, поэтому за любым числом параметров MoE всегда следует вопрос: сколько из них активно на токен?
Наименование «8x7B» — классическая ловушка. Mixtral 8x7B — это не 8 × 7 = 56B параметров. Поскольку эксперты разделяют слои внимания и эмбеддингов — только слои feed-forward делятся на экспертов — реальный общий показатель составляет около 46,7B, при примерно 12,9B активных на токен. По вычислениям модель напоминает плотную ~13B, хотя содержит ~47B параметров.
Реальные модели: Mixtral и DeepSeek
Два конкретных примера закрепляют идею. Mixtral 8x7B имеет ~46,7B общих параметров и ~12,9B активных на токен при маршрутизации top-2-из-8. DeepSeek-V3 масштабирует этот паттерн гораздо выше: 671B общих параметров при всего 37B активных на токен, используя 256 маршрутизируемых экспертов плюс одного всегда активного общего эксперта, причём маршрутизатор выбирает 8 маршрутизируемых экспертов на токен. DeepSeek-R1, модель для рассуждений, построена на базе V3 — та же архитектура, те же 671B общих / 37B активных, с добавленным обучением с подкреплением для математики и кода.
К 2025 году MoE стала доминирующей передовой архитектурой: Llama 4, Qwen3 и другие — все перешли на неё, именно потому что она позволяет лабораториям масштабировать общую ёмкость без увеличения вычислений на токен.
Оговорка о VRAM: быстрые вычисления, большая память
Вот что удивляет людей: разреженные вычисления не снижают потребность в памяти. Каждый эксперт должен находиться в VRAM (или RAM), даже если на токен активируется лишь несколько, потому что маршрутизатор может отправить следующий токен к любому из них. Поэтому Mixtral 8x7B требует примерно столько же памяти, сколько плотная ~47B-модель — порядка 96 ГБ без квантизации, — несмотря на вычислительный след 13B-модели. Нельзя запустить её на одной потребительской GPU только потому, что «активны лишь 13B».
Краткое резюме компромисса: MoE даёт лучшее соотношение токенов на доллар (меньше FLOPs на токен), но худшее соотношение памяти на доллар (все эксперты в памяти). Квантизация помогает со стороны памяти — именно поэтому MoE-модели обычно запускают в квантизованном виде локально или на многопроцессорных GPU-эндпоинтах.
Запуск MoE-моделей в osFoundry
osFoundry запускает MoE-модели, такие как DeepSeek-V3/R1 и Mixtral, локально или на выделенном облачном эндпоинте, чтобы вы получали эффективность разреженной активации на токен без самостоятельного управления архитектурой. Поскольку реальное узкое место — это память (все эксперты должны быть в VRAM), платформа превращает это в выбор при развёртывании: запускать локально, когда ваше оборудование может вместить всех экспертов (квантизованных), или использовать выделенный эндпоинт, когда модель класса 671B не помещается на вашей машине. А поскольку все вызовы моделей работают по принципу BYOK, вы можете свободно переключаться между MoE-моделью для дешёвого высокоёмкостного инференса и плотной моделью с меньшим объёмом памяти — в зависимости от задачи. Компромисс между общими и активными параметрами становится настройкой, а не головной болью с оборудованием.
Frequently asked questions
- Что такое модель mixture of experts (MoE) простыми словами?
- Это модель, разделённая на множество специализированных подсетей — экспертов, — с маршрутизатором, который отправляет каждый токен лишь к нескольким из них. Так модель может быть огромной по общему размеру — хранить много знаний, — выполняя при этом лишь небольшой объём вычислений на токен. Это разделяет то, что знает модель, и то, во сколько обходится её запуск.
- В чём разница между общими и активными параметрами?
- Общие параметры — это все эксперты, загруженные в память; активные параметры — те немногие, что реально используются для обработки конкретного токена. У DeepSeek-V3, например, 671B всего, но лишь 37B активных на токен. Вычисления отслеживают активное число, а память — общее, поэтому оба числа всегда нужно называть вместе.
- Почему MoE-моделям нужно так много VRAM, если используется лишь несколько экспертов?
- Поскольку маршрутизатор может отправить любой токен к любому эксперту, все эксперты должны постоянно находиться в памяти, даже если на токен активируется лишь несколько. Поэтому MoE-моделям нужна VRAM пропорционально общему числу параметров, а не активному — Mixtral 8x7B требует примерно столько памяти, сколько плотная 47B-модель, несмотря на вычислительный эквивалент 13B.
- MoE-модель быстрее плотной модели того же общего размера?
- Да, на токен. Поскольку активируется лишь доля параметров, MoE выполняет гораздо меньше FLOPs на токен, чем плотная модель с тем же общим числом параметров, поэтому она дешевле и быстрее в работе — при условии, что все эксперты помещаются в память. Она обменивает стоимость памяти на эффективность вычислений.
- Как маршрутизатор решает, каких экспертов использовать?
- Маршрутизатор (сеть gating) вычисляет оценку для каждого эксперта по данному токену — как правило, через небольшую обученную проекцию с последующим softmax, — а затем выбирает k экспертов с наибольшими оценками, нередко top-2. Только эти эксперты обрабатывают токен. Во время обучения техники балансировки нагрузки предотвращают концентрацию токенов на нескольких любимых экспертах.
- «8x7B» означает 56 миллиардов параметров?
- Нет. Mixtral 8x7B содержит около 46,7B всего, а не 56B, поскольку эксперты разделяют слои внимания и эмбеддингов — только слои feed-forward делятся на восемь экспертов. И лишь ~12,9B активны на токен. Общее число никогда не равно числу экспертов, умноженному на размер эксперта; это соглашение об именовании, а не арифметика.
- MoE-модели лучше или хуже плотных моделей в рассуждениях?
- Неоднозначно. При сопоставимом качестве предобучения MoE-модели, как правило, хорошо справляются с задачами, насыщенными знаниями, и хорошо реагируют на instruction tuning, но могут уступать плотным моделям на некоторых бенчмарках с интенсивными рассуждениями. MoE-модели, ориентированные на рассуждения, — такие как DeepSeek-R1 — закрывают этот разрыв с помощью обучения с подкреплением, а не только за счёт архитектуры.
Sources