← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Mixture of Experts 쉽게 이해하기: 전체 파라미터 vs 활성 파라미터
mixture-of-experts 모델은 전체 파라미터 수가 매우 많지만, 라우터가 몇 개의 전문가 서브네트워크를 골라 토큰마다 그 일부만 활성화합니다. 이 글에서는 MoE의 동작 원리, 무엇보다 중요한 전체 파라미터 수와 활성 파라미터 수의 차이, 연산은 저렴하지만 메모리는 많이 드는 이유, 그리고 DeepSeek나 Mixtral 같은 모델을 실행할 때 이것이 무엇을 의미하는지 설명합니다.
mixture of experts란
mixture-of-experts(MoE) LLM은 일부 피드포워드 레이어에 "전문가(expert)"라 불리는 여러 병렬 서브네트워크가 들어 있는 희소 트랜스포머로, 학습된 라우터가 각 토큰을 처리할 소수의 전문가만 선택합니다. 그 결과, 전체 파라미터 수는 크지만 토큰마다 활성화되는 파라미터는 그 일부에 불과한 모델이 됩니다.
이를 덴스 모델과 비교해 보면, 덴스 모델에서는 모든 토큰이 매 블록에서 동일한 피드포워드 네트워크를 거치며 매번 모든 파라미터를 활성화합니다. MoE는 이러한 밀집 레이어를 희소 전문가 레이어로 바꿔, 용량(모델이 얼마나 많이 아는지)과 비용(토큰마다 얼마나 많은 연산이 드는지)을 분리합니다.
전문가와 라우터
MoE 레이어는 두 가지 구성 요소로 정의됩니다. 각 전문가는 작은 신경망으로, 보통은 피드포워드 블록입니다. 라우터(또는 게이팅 네트워크)는 들어오는 토큰을 각 전문가에 대해 채점하고, 점수가 가장 높은 상위 k개 전문가로 라우팅합니다 — 보통 8개 중 상위 2개입니다. 그 토큰의 출력에는 해당 전문가들만 기여하며, 나머지는 그 토큰에 대해 유휴 상태로 남습니다.
바로 이 top-k 희소성이 핵심 트릭입니다. 토큰당 연산을 줄여 주는 것이 바로 이것입니다. 일부 설계에서는 모든 토큰이 필요로 하는 공통 패턴을 잡아내기 위해, 라우팅된 전문가와 함께 항상 활성화되는 "공유 전문가"를 추가하기도 합니다.
전체 파라미터 수 vs 활성 파라미터 수 — 핵심 개념
가장 중요한 개념이자 온라인에서 가장 자주 잘못 알려진 것이 바로 전체 파라미터 수와 활성 파라미터 수의 차이입니다. 전체 파라미터는 반드시 로드해야 하는 모든 전문가를 가리키고, 활성 파라미터는 토큰마다 실제로 쓰이는 것만을 가리킵니다. 헤드라인에 적힌 크기는 연산량이 아니므로, MoE 파라미터 수를 보면 늘 따라붙는 질문은 이것입니다. 토큰당 몇 개가 활성인가?
"8x7B"라는 명칭은 전형적인 함정입니다. Mixtral 8x7B는 8 × 7 = 56B 파라미터가 아닙니다. 전문가들이 어텐션 레이어와 임베딩 레이어를 공유하고 피드포워드 레이어만 전문가로 분할되기 때문에, 실제 전체 수는 약 46.7B이며 토큰당 약 12.9B가 활성화됩니다. ~47B 파라미터를 보유하고 있지만 연산량은 ~13B 덴스 모델과 비슷합니다.
실제 모델: Mixtral과 DeepSeek
구체적인 두 가지 예시로 이 개념을 짚어 보겠습니다. Mixtral 8x7B는 top-2-of-8 라우팅을 통해 전체 파라미터 수가 ~46.7B, 토큰당 활성 파라미터 수가 ~12.9B입니다. DeepSeek-V3는 이 패턴을 훨씬 더 큰 규모로 확장합니다. 256개의 라우팅 전문가와 항상 켜져 있는 공유 전문가 1개를 사용하고 라우터가 토큰당 8개의 라우팅 전문가를 선택하는 방식으로, 전체 파라미터 671B 중 토큰당 단 37B만 활성화합니다. 추론 모델인 DeepSeek-R1은 V3를 기반으로 구축되어 — 동일한 아키텍처, 동일한 671B 전체 / 37B 활성 — 수학과 코드를 위한 강화학습이 추가되었습니다.
2025년에 이르러 MoE는 Llama 4, Qwen3 등 거의 모두가 채택하는 지배적인 프런티어 아키텍처가 되었습니다 — 바로 토큰당 연산을 늘리지 않고도 전체 용량을 확장할 수 있기 때문입니다.
VRAM이라는 함정: 빠른 연산, 큰 메모리
여기 사람들을 놀라게 하는 반전이 있습니다. 희소 연산은 메모리를 줄여 주지 않습니다. 라우터가 다음 토큰을 어느 전문가에게든 보낼 수 있기 때문에, 토큰당 몇 개만 발화하더라도 모든 전문가가 VRAM(또는 RAM)에 상주해야 합니다. 따라서 Mixtral 8x7B는 연산 규모로는 13B 모델 수준임에도, 양자화하지 않은 상태에서 약 96 GB로 덴스 ~47B 모델에 가까운 메모리를 필요로 합니다. "활성은 13B뿐이니까"라는 이유만으로 단일 소비자용 GPU에 올릴 수는 없습니다.
트레이드오프를 요약하면, MoE는 토큰당 비용(토큰당 FLOPs가 적음)은 더 낫지만 메모리 비용(모든 전문가가 상주)은 더 나쁩니다. 양자화는 메모리 쪽에 도움이 되며, 그래서 MoE 모델은 보통 양자화한 채 로컬에서 실행하거나 멀티 GPU 엔드포인트에서 실행합니다.
osFoundry에서 MoE 모델 실행하기
osFoundry는 DeepSeek-V3/R1과 Mixtral 같은 MoE 모델을 로컬 또는 전용 클라우드 엔드포인트에서 실행해 주므로, 아키텍처를 직접 관리하지 않고도 희소 활성화의 토큰당 효율을 누릴 수 있습니다. 진짜 병목은 메모리 — 모든 전문가가 VRAM에 상주해야 함 — 이므로, 플랫폼은 이를 배포 시 선택 사항으로 만들어 줍니다. 하드웨어가 모든 전문가(양자화된)를 담을 수 있으면 로컬에서 실행하고, 671B급 모델이 내 컴퓨터에 들어가지 않으면 전용 엔드포인트를 사용하면 됩니다. 또한 모든 모델 호출이 BYOK이므로, 작업에 따라 저렴한 고용량 추론용 MoE 모델과 더 작은 메모리 풋프린트의 덴스 모델 사이를 자유롭게 오갈 수 있습니다. 전체 vs 활성의 트레이드오프가 하드웨어 골칫거리가 아니라 하나의 설정이 되는 셈입니다.
Frequently asked questions
- mixture-of-experts(MoE) 모델을 쉽게 설명하면?
- 전문가라 불리는 여러 전문 서브네트워크로 나뉜 모델로, 라우터가 각 토큰을 그중 일부에만 보냅니다. 그래서 모델은 전체 크기는 매우 크면서 — 많은 지식을 담으면서 — 토큰당 연산은 소량만 수행합니다. 모델이 얼마나 많이 아는지와 실행 비용을 분리하는 방식이죠.
- 전체 파라미터 수와 활성 파라미터 수의 차이는?
- 전체 파라미터 수는 메모리에 로드되는 모든 전문가이고, 활성 파라미터 수는 특정 토큰을 처리하는 데 실제로 쓰이는 소수입니다. 예를 들어 DeepSeek-V3는 전체 671B이지만 토큰당 37B만 활성화됩니다. 연산량은 활성 수를 따라가고 메모리는 전체 수를 따라가므로, 이 두 숫자는 항상 함께 언급해야 합니다.
- MoE 모델이 전문가를 몇 개만 쓴다면서 왜 그렇게 많은 VRAM이 필요한가요?
- 라우터가 어떤 토큰이든 어떤 전문가에게나 보낼 수 있기 때문에, 토큰당 몇 개만 발화하더라도 모든 전문가가 메모리에 상주해야 합니다. 그래서 MoE 모델이 필요로 하는 VRAM은 활성 파라미터 수가 아니라 전체 파라미터 수에 비례합니다 — Mixtral 8x7B는 13B 수준의 연산량에도 불구하고 덴스 47B 모델에 가까운 메모리가 필요합니다.
- MoE 모델은 전체 크기가 같은 덴스 모델보다 빠른가요?
- 네, 토큰당 기준으로는요. 파라미터의 일부만 활성화되므로, MoE는 전체 파라미터 수가 같은 덴스 모델보다 토큰당 훨씬 적은 FLOPs를 수행해 더 저렴하고 빠르게 실행됩니다 — 모든 전문가를 메모리에 담을 수 있다면요. 메모리 비용을 치르고 연산 효율을 얻는 셈입니다.
- 라우터는 어떤 전문가를 쓸지 어떻게 정하나요?
- 라우터(게이팅 네트워크)는 주어진 토큰에 대해 각 전문가의 점수를 계산합니다. 보통 작은 학습된 프로젝션을 거친 뒤 softmax를 적용해, 점수가 가장 높은 상위 k개 전문가를 선택합니다 — 흔히 상위 2개입니다. 그 전문가들만 토큰을 처리합니다. 학습 중에는 부하 분산 기법으로 토큰이 일부 선호 전문가에 쏠리는 것을 막습니다.
- "8x7B"는 560억 파라미터를 뜻하나요?
- 아닙니다. Mixtral 8x7B의 전체 수는 약 46.7B이며 56B가 아닙니다. 전문가들이 어텐션 레이어와 임베딩 레이어를 공유하고, 피드포워드 레이어만 8개의 전문가로 분할되기 때문입니다. 게다가 토큰당 활성화되는 것은 ~12.9B뿐입니다. 전체 수는 결코 전문가 수 × 전문가 크기와 같지 않습니다. 이것은 명명 규칙이지 산술이 아닙니다.
- 추론 작업에서 MoE 모델은 덴스 모델보다 좋은가요, 나쁜가요?
- 결과는 엇갈립니다. 사전 학습 품질이 같을 때 MoE 모델은 지식 집약적 작업에서 잘하고 인스트럭션 튜닝에 강하게 반응하지만, 일부 추론 집약적 벤치마크에서는 덴스 모델보다 뒤처질 수 있습니다. DeepSeek-R1처럼 추론에 특화된 MoE 모델은 아키텍처만이 아니라 강화학습으로 그 격차를 메웁니다.
Sources