← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
ओपन-वेट बनाम ओपन-सोर्स AI मॉडल: क्या अंतर है?
"ओपन सोर्स" कहे जाने वाले अधिकांश मॉडल असल में ओपन-वेट होते हैं — वेट्स तो डाउनलोड किए जा सकते हैं, लेकिन ट्रेनिंग डेटा और पूर्ण लाइसेंस स्वतंत्रताएं उपलब्ध नहीं होतीं। यह लेख दोनों के बीच का अंतर, OSI की ओपन सोर्स AI परिभाषा, लोकप्रिय मॉडल इस स्पेक्ट्रम पर कहाँ आते हैं, और व्यावसायिक उपयोग के लिए यह लेबल क्यों मायने रखता है — इन सब की व्याख्या करता है।
मूल अंतर
"ओपन-वेट" का अर्थ है कि प्रशिक्षित मॉडल पैरामीटर डाउनलोड किए जा सकते हैं, लेकिन ट्रेनिंग डेटा, ट्रेनिंग कोड, या पूर्ण लाइसेंस स्वतंत्रताएं रोकी जा सकती हैं। आधिकारिक परिभाषा के अनुसार "ओपन-सोर्स AI" इसके अतिरिक्त डेटा संबंधी जानकारी तथा ट्रेनिंग और इनफेरेंस कोड — सभी खुली शर्तों के तहत — की भी मांग करती है। ट्रेनिंग डेटा का खुलासा किए बिना, कोई रिलीज़ ओपन-वेट होती है, ओपन-सोर्स नहीं।
यह इसलिए महत्वपूर्ण है क्योंकि इन दोनों शब्दों को अक्सर आपस में मिला दिया जाता है। जिस मॉडल को आप डाउनलोड करके चला सकते हैं, वह अपने आप उस अर्थ में "ओपन सोर्स" नहीं हो जाता जिस अर्थ में सॉफ्टवेयर जगत इसे समझता है — और यह अंतर ठीक वहीं उभरकर सामने आता है जहाँ यह सबसे ज़्यादा मायने रखता है: व्यावसायिक अधिकार, पुनरुत्पादनीयता, और आप वास्तव में क्या करने के लिए अधिकृत हैं।
OSI ओपन सोर्स AI परिभाषा
अक्टूबर 2024 में ओपन सोर्स इनिशिएटिव ने पहली स्थिर ओपन सोर्स AI परिभाषा प्रकाशित की। यह चार स्वतंत्रताएं प्रदान करती है — बिना अनुमति के किसी भी उद्देश्य के लिए सिस्टम का उपयोग करना, यह अध्ययन करना कि यह कैसे काम करता है, किसी भी उद्देश्य के लिए इसे संशोधित करना, और बदलाव के साथ या बिना बदलाव के इसे साझा करना — और तीन घटकों की मांग करती है: डेटा जानकारी (किसी समकक्ष सिस्टम को बनाने के लिए पर्याप्त विवरण), पूर्ण ट्रेनिंग और इनफेरेंस कोड, और मॉडल पैरामीटर।
इसका सबसे विवादास्पद समझौता यह है कि यह कच्चे ट्रेनिंग डेटासेट को स्वयं जारी करना आवश्यक नहीं करती — बस उसके बारे में पर्याप्त विस्तृत जानकारी मांगती है। आलोचक इसे एक कमजोरी मानते हैं; वहीं समर्थकों का तर्क है कि कानूनी और गोपनीयता संबंधी बाधाएं अक्सर कच्चा डेटा जारी करना असंभव बना देती हैं। बहरहाल, यही वह मापदंड है जिस पर "ओपन सोर्स" के दावों को परखा जाना चाहिए।
लोकप्रिय मॉडल वास्तव में किस श्रेणी में आते हैं
अधिकांश प्रसिद्ध "ओपन" मॉडल ओपन-सोर्स नहीं, बल्कि ओपन-वेट हैं:
- Llama एक कम्युनिटी लाइसेंस के तहत ओपन-वेट है — Meta ट्रेनिंग डेटा जारी नहीं करता, और लाइसेंस में एक स्वीकार्य-उपयोग नीति, 70 करोड़ मासिक सक्रिय उपयोगकर्ताओं वाला खंड, और प्रतिस्पर्धी मॉडलों को ट्रेन करने हेतु आउटपुट के उपयोग पर प्रतिबंध शामिल हैं। यह "बिना अनुमति के किसी भी उद्देश्य के लिए उपयोग" की स्वतंत्रता को पूरा नहीं करता, इसलिए यह सोर्स-अवेलेबल है, ओपन सोर्स नहीं। (हमारा [Llama गाइड](/articles/run-llama-locally-hardware-guide) देखें।)
- Qwen और Mistral अपने कई मॉडल Apache-2.0 के तहत शिप करते हैं — वेट्स पर यह सही मायने में एक ओपन-सोर्स लाइसेंस है, इसलिए व्यावसायिक उपयोग खुला रहता है; हालाँकि पूर्ण डेटा और कोड के बिना वे OSAID-ओपन नहीं, बल्कि "अनुमतिमूलक लाइसेंस वाले ओपन-वेट" ही हैं। (हमारा [Qwen3 गाइड](/articles/run-qwen3-locally-guide) देखें।)
- OLMo (Ai2 द्वारा) सही मायने में खुलेपन का संदर्भ-मानक है: वेट्स के साथ-साथ पूरा ट्रेनिंग कॉर्पस, ट्रेनिंग कोड, लॉग्स और चेकपॉइंट्स भी।
- DeepSeek ओपन-वेट है — वेट्स जारी किए गए हैं, पर ट्रेनिंग डेटा का खुलासा नहीं किया गया।
लाइसेंस स्पेक्ट्रम
इसे सबसे खुले से लेकर सबसे कम खुले तक एक स्पेक्ट्रम के रूप में देखना मददगार होता है:
- पूरी तरह खुला / OSAID-संरेखित: वेट्स + डेटा + कोड (OLMo)।
- वेट्स पर अनुमतिमूलक OSI लाइसेंस: Apache-2.0 (Qwen, Mistral) — व्यावसायिक रूप से अप्रतिबंधित वेट्स, लेकिन पूर्ण डेटा/कोड का खुलासा नहीं।
- प्रतिबंधात्मक "कम्युनिटी" / सोर्स-अवेलेबल: Llama — व्यावसायिक रूप से उपयोग योग्य, परंतु सीमाओं, स्वीकार्य-उपयोग नियमों और प्रतिस्पर्धी-संबंधी प्रतिबंधों के साथ।
- गैर-व्यावसायिक / केवल शोध: कुछ मॉडल वेरिएंट केवल गैर-व्यावसायिक उपयोग तक सीमित हैं।
- केवल API / बंद: वेट्स कभी जारी नहीं किए जाते।
कोई मॉडल इस स्पेक्ट्रम पर कहाँ है, यह जानने से पता चलता है कि आप कानूनी रूप से इसके साथ क्या कर सकते हैं — और यह कहीं अधिक व्यावहारिक प्रश्न है, बनिस्बत इसके कि वह "ओपन सोर्स" का तमगा अर्जित करता है या नहीं।
यह क्यों मायने रखता है, और "ओपन-वाशिंग"
इस लेबल के वास्तविक परिणाम होते हैं। लाइसेंस की शर्तें — मासिक सक्रिय उपयोगकर्ता सीमाएं, उपयोग-क्षेत्र पर प्रतिबंध, नो-डिस्टिलेशन खंड — सीधे व्यावसायिक वैधता तय करती हैं। ओपन-सोर्स (सख्त अर्थ में) इसके अतिरिक्त किसी मॉडल को पुनः उत्पन्न करने और ऑडिट करने में सक्षम बनाता है, जो विश्वास और शोध के लिए मायने रखता है। और विनियमन इस दांव को और बढ़ा देता है: EU AI Act ओपन-सोर्स सिस्टमों को कुछ छूटें देता है, इसलिए किसी ओपन-वेट मॉडल को "ओपन सोर्स" कहना केवल लापरवाही भर नहीं है — इसके गंभीर परिणाम हो सकते हैं।
यही "ओपन-वाशिंग" की आलोचना का केंद्रबिंदु है: किसी ऐसे मॉडल को ओपन सोर्स के रूप में प्रचारित करना जो ज़्यादा से ज़्यादा ओपन-वेट है। जेनरेटिव AI सिस्टमों के अध्ययनों में पाया गया है कि कई "ओपन सोर्स" लेबल असल में ओपन-वेट हैं, और व्यापक रुझान भी इसकी पुष्टि करता है — ट्रेनिंग डेटा का खुलासा करने वाले मॉडल डाउनलोड की हिस्सेदारी तेज़ी से गिरी है, जिसका अर्थ है कि यह पारिस्थितिकी तंत्र ओपन-सोर्स की नहीं, बल्कि ओपन-वेट की ओर बढ़ रहा है।
osFoundry इसे कैसे संभालता है
osFoundry स्पेक्ट्रम पर चाहे जहाँ भी हों, ओपन-वेट मॉडल चलाता है — अनुमतिमूलक Apache-2.0 (Qwen, Mistral), प्रतिबंधात्मक कम्युनिटी-लाइसेंस वाले (Llama), और पूरी तरह खुले (OLMo), ये सभी BYOK या सेल्फ-होस्टिंग के माध्यम से एक ही तरह चलते हैं। चूँकि ओपन बनाम ओपन-वेट का प्रश्न मूलतः लाइसेंसिंग के बारे में है, osFoundry प्रत्येक मॉडल की वास्तविक लाइसेंस शर्तें — यूजर-कैप खंड, नो-डिस्टिलेशन नियम, और गैर-व्यावसायिक प्रतिबंध — सामने ला देता है, ताकि टीमें व्यावसायिक रूप से तैनात करने से पहले वैधता की पुष्टि कर सकें। BYOK और सेल्फ-होस्ट के साथ, आप वेट्स, डेटा और इनफेरेंस को किसी वेंडर API के पीछे रखने के बजाय अपने नियंत्रण में रखते हैं — और यही "खुलेपन" का व्यावहारिक लाभ है, चाहे कोई मॉडल सख्त ओपन-सोर्स मानदंड पर खरा उतरे या नहीं।
Frequently asked questions
- ओपन-वेट और ओपन-सोर्स AI मॉडल में क्या अंतर है?
- ओपन-वेट का अर्थ है कि मॉडल के प्रशिक्षित पैरामीटर डाउनलोड किए जा सकते हैं, लेकिन ट्रेनिंग डेटा, कोड, या लाइसेंस स्वतंत्रताएं रोकी जा सकती हैं। ओपन-सोर्स (OSI परिभाषा के अनुसार) इसके अतिरिक्त खुली शर्तों के तहत डेटा जानकारी और ट्रेनिंग/इनफेरेंस कोड की भी मांग करता है। यदि ट्रेनिंग डेटा का खुलासा नहीं किया जाता, तो मॉडल ओपन-वेट होता है, ओपन-सोर्स नहीं।
- क्या Llama ओपन सोर्स है?
- नहीं — Llama एक कम्युनिटी लाइसेंस के तहत ओपन-वेट है। Meta ट्रेनिंग डेटा जारी नहीं करता, और लाइसेंस में एक स्वीकार्य-उपयोग नीति, 70 करोड़ मासिक सक्रिय उपयोगकर्ताओं की सीमा, और प्रतिस्पर्धी मॉडलों को ट्रेन करने हेतु आउटपुट के उपयोग पर प्रतिबंध शामिल हैं। OSI और अन्य इसे सोर्स-अवेलेबल या ओपन-वेट के रूप में वर्गीकृत करते हैं, ओपन सोर्स के रूप में नहीं।
- OSI ओपन सोर्स AI परिभाषा क्या है?
- अक्टूबर 2024 में प्रकाशित, यह ओपन-सोर्स AI की पहली स्थिर परिभाषा है। यह चार स्वतंत्रताएं प्रदान करती है — उपयोग, अध्ययन, संशोधन, और साझाकरण — और तीन घटकों की मांग करती है: डेटा जानकारी, पूर्ण ट्रेनिंग और इनफेरेंस कोड, और मॉडल पैरामीटर। उल्लेखनीय है कि इसमें कच्चे डेटासेट के बजाय ट्रेनिंग डेटा के बारे में विस्तृत जानकारी की मांग की जाती है।
- क्या ओपन-सोर्स AI के लिए ट्रेनिंग डेटा जारी करना आवश्यक है?
- कच्चा डेटासेट नहीं — OSI परिभाषा पर्याप्त विस्तृत डेटा जानकारी की मांग करती है ताकि कोई कुशल व्यक्ति एक समकक्ष सिस्टम बना सके, और वास्तविक डेटा केवल तभी जब वह कानूनी रूप से संभव हो। यह समझौता परिभाषा का सबसे विवादित हिस्सा है, क्योंकि सही मायने में पुनरुत्पादनीयता के लिए तो डेटा स्वयं ही चाहिए होता है।
- क्या मैं बिना भुगतान किए ओपन-वेट मॉडलों का व्यावसायिक उपयोग कर सकता हूँ?
- अक्सर हाँ, लेकिन यह पूरी तरह लाइसेंस पर निर्भर करता है। Apache-2.0 मॉडल (कई Qwen और Mistral रिलीज़) असीमित व्यावसायिक उपयोग की अनुमति देते हैं। Llama का कम्युनिटी लाइसेंस व्यावसायिक उपयोग की अनुमति देता है, पर उपयोगकर्ता-गणना सीमा और अन्य प्रतिबंधों के साथ। कुछ वेरिएंट केवल गैर-व्यावसायिक होते हैं। व्यावसायिक रूप से तैनात करने से पहले हमेशा संबंधित मॉडल का लाइसेंस जाँच लें।
- कौन से AI मॉडल सही मायने में ओपन सोर्स हैं?
- वे मॉडल जो वेट्स के साथ-साथ ट्रेनिंग डेटा और पूर्ण ट्रेनिंग और इनफेरेंस कोड भी जारी करते हैं — Ai2 का OLMo प्रमुख उदाहरण है, जो अपना कॉर्पस, कोड, लॉग्स और चेकपॉइंट्स प्रकाशित करता है। अधिकांश लोकप्रिय "ओपन" मॉडल (Llama, Qwen, Mistral, DeepSeek) ओपन-वेट हैं और कम से कम ट्रेनिंग डेटा को रोक लेते हैं।
- क्या Apache-2.0 मॉडल ओपन सोर्स के समान है?
- Apache-2.0 एक वास्तविक ओपन-सोर्स लाइसेंस है, इसलिए Apache-2.0 वेट्स व्यावसायिक रूप से अप्रतिबंधित और अनुमतिमूलक होते हैं। लेकिन Apache-2.0 वेट्स वाला मॉडल भी OSI की AI परिभाषा के अनुसार तब तक पूरी तरह "ओपन सोर्स" नहीं होता जब तक ट्रेनिंग डेटा जानकारी और कोड भी जारी न किए जाएं — इसलिए इसे "अनुमतिमूलक लाइसेंस वाले ओपन-वेट" कहना सबसे सटीक है।
Sources