← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
मिक्सचर ऑफ एक्सपर्ट्स की व्याख्या: कुल बनाम सक्रिय पैरामीटर
एक मिक्सचर ऑफ एक्सपर्ट्स मॉडल में पैरामीटर की कुल संख्या बहुत बड़ी होती है, लेकिन हर टोकन के लिए उसका सिर्फ़ एक छोटा हिस्सा सक्रिय होता है — एक राउटर कुछ एक्सपर्ट उप-नेटवर्क चुनता है। यह लेख बताता है कि MoE कैसे काम करता है, कुल बनाम सक्रिय पैरामीटर का सबसे अहम अंतर क्या है, यह कम्प्यूट के लिहाज़ से सस्ता पर मेमोरी के लिहाज़ से महंगा क्यों है, और DeepSeek तथा Mixtral जैसे मॉडल चलाने के लिए इसका क्या मतलब है।
मिक्सचर ऑफ एक्सपर्ट्स क्या होता है
एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) LLM एक स्पार्स ट्रांसफॉर्मर है, जिसमें कुछ फीड-फॉरवर्ड लेयर में "एक्सपर्ट्स" कहलाने वाले कई समानांतर उप-नेटवर्क होते हैं, और एक प्रशिक्षित राउटर हर टोकन को प्रोसेस करने के लिए उनमें से सिर्फ़ कुछ ही चुनता है। नतीजा यह होता है कि मॉडल में पैरामीटर की कुल संख्या तो बड़ी होती है, पर हर टोकन के लिए उनका सिर्फ़ एक अंश ही सक्रिय होता है।
इसकी तुलना एक डेंस मॉडल से करें, जहाँ हर टोकन हर ब्लॉक में उसी फीड-फॉरवर्ड नेटवर्क से गुज़रता है और हर बार सारे पैरामीटर सक्रिय करता है। MoE उन डेंस लेयर को स्पार्स एक्सपर्ट लेयर से बदल देता है, जिससे क्षमता (मॉडल कितना जानता है) और लागत (हर टोकन में कितना कम्प्यूट लगता है) एक-दूसरे से अलग हो जाती हैं।
एक्सपर्ट्स और राउटर
एक MoE लेयर को दो घटक परिभाषित करते हैं। हर एक्सपर्ट एक छोटा न्यूरल नेटवर्क होता है, आमतौर पर एक फीड-फॉरवर्ड ब्लॉक। राउटर (या गेटिंग नेटवर्क) आने वाले टोकन को हर एक्सपर्ट के विरुद्ध स्कोर करता है और उसे सबसे ज़्यादा स्कोर वाले शीर्ष-k एक्सपर्ट्स के पास भेजता है — आमतौर पर 8 में से शीर्ष 2। उस टोकन के आउटपुट में सिर्फ़ वही एक्सपर्ट योगदान देते हैं; बाकी उस टोकन के लिए निष्क्रिय रहते हैं।
यही top-k स्पार्सिटी पूरी तरकीब है: यही प्रति टोकन कम्प्यूट को घटाती है। कुछ डिज़ाइनों में एक "साझा एक्सपर्ट" भी होता है जो राउटेड एक्सपर्ट्स के साथ हमेशा सक्रिय रहता है, ताकि उन सामान्य पैटर्न को पकड़ा जा सके जिनकी ज़रूरत हर टोकन को होती है।
कुल बनाम सक्रिय पैरामीटर — मुख्य विचार
सबसे अहम विचार — और ऑनलाइन सबसे ज़्यादा तोड़-मरोड़ कर समझा जाने वाला — कुल और सक्रिय पैरामीटर के बीच का अंतर है। कुल पैरामीटर वे सभी एक्सपर्ट हैं जिन्हें लोड करना ज़रूरी है; सक्रिय पैरामीटर सिर्फ़ वे हैं जो प्रति टोकन इस्तेमाल होते हैं। हेडलाइन साइज़ कम्प्यूट नहीं होता, इसलिए किसी भी MoE पैरामीटर संख्या के साथ अगला सवाल हमेशा यही होता है: प्रति टोकन कितने सक्रिय हैं?
"8x7B" नामकरण एक क्लासिक जाल है। Mixtral 8x7B का मतलब 8 × 7 = 56B पैरामीटर नहीं है। चूँकि एक्सपर्ट्स अटेंशन और एम्बेडिंग लेयर साझा करते हैं — सिर्फ़ फीड-फॉरवर्ड लेयर ही एक्सपर्ट्स में बँटती हैं — असल कुल लगभग 46.7B है, जिसमें प्रति टोकन करीब 12.9B सक्रिय होते हैं। इसका कम्प्यूट ~13B डेंस मॉडल जैसा है, भले ही इसमें ~47B पैरामीटर हों।
असली मॉडल: Mixtral और DeepSeek
दो ठोस उदाहरण इस विचार को पुख़्ता करते हैं। Mixtral 8x7B में top-2-of-8 राउटिंग के ज़रिए ~46.7B कुल पैरामीटर और प्रति टोकन ~12.9B सक्रिय पैरामीटर होते हैं। DeepSeek-V3 इस पैटर्न को कहीं ऊँचे स्तर तक ले जाता है: 256 राउटेड एक्सपर्ट्स और एक हमेशा-ऑन साझा एक्सपर्ट का इस्तेमाल करते हुए, जहाँ राउटर प्रति टोकन 8 राउटेड एक्सपर्ट चुनता है, इसमें 671B कुल पैरामीटर पर प्रति टोकन सिर्फ़ 37B सक्रिय होते हैं। रीज़निंग मॉडल DeepSeek-R1 V3 बेस पर बना है — वही आर्किटेक्चर, वही 671B कुल / 37B सक्रिय — जिसमें गणित और कोड के लिए रिइन्फोर्समेंट लर्निंग जोड़ी गई है।
2025 तक MoE अग्रणी आर्किटेक्चर का प्रमुख रूप बन चुका था, और Llama 4, Qwen3 समेत बाकी सभी ने इसे अपनाया — ठीक इसलिए क्योंकि यह लैब्स को प्रति-टोकन कम्प्यूट बढ़ाए बिना कुल क्षमता बढ़ाने देता है।
VRAM की पेचीदगी: तेज़ कम्प्यूट, बड़ी मेमोरी
यहाँ वह बात है जो लोगों को चौंका देती है: स्पार्स कम्प्यूट मेमोरी को कम नहीं करता। हर एक्सपर्ट को VRAM (या RAM) में मौजूद रहना पड़ता है, भले ही प्रति टोकन कुछ ही फायर होते हों, क्योंकि राउटर अगला टोकन उनमें से किसी को भी भेज सकता है। इसलिए Mixtral 8x7B को एक डेंस ~47B मॉडल जितनी मेमोरी चाहिए — बिना क्वांटाइज़ेशन के करीब 96 GB — जबकि इसका कम्प्यूट फुटप्रिंट 13B मॉडल जैसा है। आप इसे सिर्फ़ इसलिए किसी एक कंज़्यूमर GPU पर नहीं चला सकते क्योंकि "सक्रिय तो सिर्फ़ 13B है।"
ट्रेड-ऑफ का सार: MoE आपको बेहतर टोकन-प्रति-डॉलर देता है (प्रति टोकन कम FLOPs) पर खराब मेमोरी-प्रति-डॉलर (सभी एक्सपर्ट रेज़िडेंट)। क्वांटाइज़ेशन मेमोरी पक्ष में मदद करता है, यही वजह है कि MoE मॉडल आमतौर पर लोकल रूप से क्वांटाइज़ करके या मल्टी-GPU एंडपॉइंट पर चलाए जाते हैं।
osFoundry में MoE मॉडल चलाना
osFoundry, DeepSeek-V3/R1 और Mixtral जैसे MoE मॉडल को लोकल या किसी डेडिकेटेड क्लाउड एंडपॉइंट पर चलाता है, ताकि आपको आर्किटेक्चर खुद संभाले बिना स्पार्स एक्टिवेशन की प्रति-टोकन दक्षता मिल सके। चूँकि असली अड़चन मेमोरी है — हर एक्सपर्ट को VRAM में रहना पड़ता है — प्लेटफ़ॉर्म इसे एक डिप्लॉयमेंट विकल्प बना देता है: जब आपका हार्डवेयर सभी एक्सपर्ट (क्वांटाइज़ किए हुए) रख सके तो लोकल चलाएँ, या जब 671B-क्लास मॉडल आपकी मशीन में न समाए तो डेडिकेटेड एंडपॉइंट इस्तेमाल करें। और चूँकि सभी मॉडल कॉल BYOK हैं, आप हर काम के हिसाब से सस्ती उच्च-क्षमता इन्फ़रेंस के लिए MoE मॉडल और छोटे मेमोरी फुटप्रिंट के लिए डेंस मॉडल के बीच आज़ादी से स्विच कर सकते हैं। कुल बनाम सक्रिय का ट्रेड-ऑफ अब एक सेटिंग बन जाता है, हार्डवेयर की सिरदर्दी नहीं।
Frequently asked questions
- आसान शब्दों में मिक्सचर ऑफ एक्सपर्ट्स (MoE) मॉडल क्या है?
- यह एक ऐसा मॉडल है जो एक्सपर्ट्स कहलाने वाले कई विशेष उप-नेटवर्क में बँटा होता है, और एक राउटर हर टोकन को उनमें से सिर्फ़ कुछ के पास भेजता है। इसलिए मॉडल कुल आकार में बहुत बड़ा हो सकता है — ढेर सारा ज्ञान रखते हुए — जबकि प्रति टोकन सिर्फ़ थोड़ा-सा कम्प्यूटेशन करता है। यह मॉडल कितना जानता है और उसे चलाने में कितना खर्च आता है, इन दोनों को अलग कर देता है।
- कुल और सक्रिय पैरामीटर में क्या अंतर है?
- कुल पैरामीटर वे सभी एक्सपर्ट हैं जो मेमोरी में लोड होते हैं; सक्रिय पैरामीटर वे कुछ हैं जो किसी एक टोकन को प्रोसेस करने में सचमुच इस्तेमाल होते हैं। मसलन, DeepSeek-V3 कुल 671B है पर प्रति टोकन सिर्फ़ 37B सक्रिय होता है। कम्प्यूट सक्रिय संख्या के साथ चलता है, जबकि मेमोरी कुल के साथ — इसीलिए इन दोनों संख्याओं को हमेशा साथ बताना ज़रूरी है।
- अगर MoE मॉडल सिर्फ़ कुछ एक्सपर्ट इस्तेमाल करता है तो उसे इतनी VRAM क्यों चाहिए?
- क्योंकि राउटर किसी भी टोकन को किसी भी एक्सपर्ट के पास भेज सकता है, इसलिए हर एक्सपर्ट को मेमोरी में रहना पड़ता है, भले ही प्रति टोकन कुछ ही फायर होते हों। इसलिए MoE मॉडल को VRAM उसकी सक्रिय पैरामीटर संख्या के नहीं, बल्कि कुल पैरामीटर संख्या के अनुपात में चाहिए — Mixtral 8x7B को 13B-समकक्ष कम्प्यूट के बावजूद एक डेंस 47B मॉडल जितनी मेमोरी चाहिए।
- क्या MoE मॉडल उतने ही कुल आकार के डेंस मॉडल से तेज़ है?
- हाँ, प्रति टोकन के लिहाज़ से। चूँकि पैरामीटर का सिर्फ़ एक हिस्सा सक्रिय होता है, MoE उतनी ही कुल पैरामीटर संख्या वाले डेंस मॉडल के मुकाबले प्रति टोकन कहीं कम FLOPs करता है, इसलिए चलाने में सस्ता और तेज़ रहता है — बशर्ते आप सभी एक्सपर्ट को मेमोरी में समा सकें। यह मेमोरी लागत के बदले कम्प्यूट दक्षता का सौदा करता है।
- राउटर कैसे तय करता है कि किन एक्सपर्ट का इस्तेमाल करना है?
- राउटर (गेटिंग नेटवर्क) दिए गए टोकन के लिए हर एक्सपर्ट का एक स्कोर निकालता है, आमतौर पर एक छोटे प्रशिक्षित प्रोजेक्शन के बाद softmax के ज़रिए, फिर सबसे ज़्यादा स्कोर वाले शीर्ष-k एक्सपर्ट्स चुनता है — अक्सर शीर्ष 2। टोकन को सिर्फ़ वही एक्सपर्ट प्रोसेस करते हैं। प्रशिक्षण के दौरान, लोड-बैलेंसिंग तकनीकें टोकन को कुछ पसंदीदा एक्सपर्ट पर सिमटने से रोकती हैं।
- क्या "8x7B" का मतलब 56 बिलियन पैरामीटर है?
- नहीं। Mixtral 8x7B कुल लगभग 46.7B है, 56B नहीं, क्योंकि एक्सपर्ट्स अटेंशन और एम्बेडिंग लेयर साझा करते हैं — सिर्फ़ फीड-फॉरवर्ड लेयर आठ एक्सपर्ट में बँटती है। और प्रति टोकन सिर्फ़ ~12.9B सक्रिय होते हैं। कुल कभी भी एक्सपर्ट्स गुणा एक्सपर्ट-साइज़ के बराबर नहीं होता; यह एक नामकरण परंपरा है, अंकगणित नहीं।
- क्या MoE मॉडल रीज़निंग के लिए डेंस मॉडल से बेहतर हैं या बदतर?
- नतीजे मिले-जुले हैं। समान प्री-ट्रेनिंग गुणवत्ता पर MoE मॉडल ज्ञान-भारी कार्यों में अच्छा प्रदर्शन करते हैं और इंस्ट्रक्शन ट्यूनिंग पर अच्छी प्रतिक्रिया देते हैं, पर कुछ रीज़निंग-भारी बेंचमार्क पर डेंस मॉडल से पीछे रह सकते हैं। DeepSeek-R1 जैसे रीज़निंग-केंद्रित MoE मॉडल इस अंतर को सिर्फ़ आर्किटेक्चर से नहीं, बल्कि रिइन्फोर्समेंट लर्निंग से भरते हैं।
Sources