← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
LLM सेल्फ-होस्टिंग API से असल में कब सस्ती पड़ती है
LLM की सेल्फ-होस्टिंग API से तभी सस्ती पड़ती है जब टोकन वॉल्यूम एक खास सीमा से ऊपर हो — और यह सीमा पूरी तरह GPU यूटिलाइज़ेशन पर निर्भर करती है। कोई एक ब्रेक-ईवन आंकड़ा नहीं होता। यह गाइड असली गणित, बैचिंग और क्वांटाइज़ेशन की निर्णायक भूमिका, छुपी ऑपरेशन लागत, और हाइब्रिड दृष्टिकोण आमतौर पर सही क्यों होता है — इन सब को कवर करती है।
कोई एक ब्रेक-ईवन आंकड़ा नहीं होता
"सेल्फ-होस्टिंग कब सस्ती होती है?" का ईमानदार जवाब कोई एक संख्या नहीं, बल्कि यूटिलाइज़ेशन से तय होने वाली एक रेंज है — और इसीलिए प्रकाशित अनुमान कई गुना अंतर के साथ भिन्न होते हैं। हर अनुमान अलग-अलग GPU कीमतें, यूटिलाइज़ेशन दरें और तुलना के लिए अलग-अलग API मानकर चलता है।
काम का मोटा खाका: GPU का अच्छा इस्तेमाल हो रहा हो तो सेल्फ-होस्टिंग अपेक्षाकृत मामूली निरंतर वॉल्यूम (महीने में कुछ मिलियन टोकन) पर ही प्रीमियम APIs को मात देने लगती है, लेकिन सस्ते बजट APIs को मात देने के लिए कहीं ज़्यादा (महीने में दसियों से सैकड़ों मिलियन) चाहिए। एक मोटा बीच का अंगूठा-नियम है — प्रति दिन कुछ मिलियन टोकन, लगातार। इससे नीचे, API लगभग हमेशा जीतती है।
GPU का गणित
सेल्फ-होस्टिंग का मतलब है GPU किराए पर लेना या खरीदना, और यही फिक्स्ड लागत आपके टोकन वॉल्यूम को "भरनी" होती है। स्पेशलाइज़्ड क्लाउड पर ऑन-डिमांड H100 लगभग $1.50–3.00/घंटा पड़ता है (हाइपरस्केलर पर इससे ज़्यादा), यानी 24/7 चलने वाला डेडिकेटेड H100 प्रोवाइडर टियर के हिसाब से करीब $1,000–5,000 प्रति माह बैठता है।
यह मासिक खर्च तय है, चाहे आप GPU का इस्तेमाल करें या न करें — इसीलिए प्रति मिलियन टोकन लागत सिर्फ़ ऊंचे यूटिलाइज़ेशन पर ही सस्ती होती है। अच्छा इस्तेमाल हो तो मध्यम आकार का मॉडल प्रति मिलियन टोकन एक डॉलर से काफ़ी नीचे पहुंच सकता है; 10% लोड पर असली प्रति-टोकन लागत करीब दस गुना बढ़ जाती है, इतनी कि सेल्फ-होस्टिंग प्रीमियम API से भी महंगी पड़ जाए। बेकार पड़ा GPU लागत की बहस हारने का सबसे तेज़ तरीका है।
फ़ैसला बैचिंग और क्वांटाइज़ेशन करते हैं
ब्रेक-ईवन को बाकी किसी भी चीज़ से ज़्यादा हिलाने वाले दो लीवर हैं। कंटीन्यूअस बैचिंग (आधुनिक इन्फ़ेरेंस सर्वर के ज़रिए) असली आर्थिक इंजन है: एक ही GPU पर कई रिक्वेस्ट एक साथ सर्व करने से प्रति-टोकन लागत नाटकीय रूप से गिर सकती है — एक-एक रिक्वेस्ट से बड़े बैच पर जाने भर से थ्रूपुट कई गुना बढ़ सकता है। स्पाइकी, कम-कन्करेंसी वाला ट्रैफ़िक बैच अधूरे भरता है और पीक के मुकाबले कई गुना खराब चलता है — यही वजह है कि बर्स्टी वर्कलोड सेल्फ-होस्टिंग के लिए ठीक नहीं बैठते।
[क्वांटाइज़ेशन](/articles/llm-quantization-explained-gguf) दूसरा लीवर है: FP8 बेहद मामूली क्वालिटी नुकसान पर थ्रूपुट लगभग दोगुना कर देता है, और INT4 इसे करीब तिगुना कर सकता है, साथ ही मॉडल को इतना छोटा कर देता है कि वह किसी छोटे, सस्ते GPU में समा जाए। मिलकर, बैचिंग और क्वांटाइज़ेशन प्रति-टोकन लागत को कई गुना तक बदल सकते हैं।
छुपी लागत: ऑपरेशन
GPU का बिल पूरा बिल नहीं है। ऑपरेशन आम तौर पर असल हार्डवेयर लागत में उससे कई गुना जोड़ देते हैं: एक MLOps इंजीनियर की सैलरी छह अंकों में होती है, और हर मॉडल अपडेट साइकल — री-क्वांटाइज़ करना, टेस्टिंग, री-डिप्लॉय — हफ़्तों का काम है। "मुफ़्त" ओपन-वेट मॉडल भी इन्फ़ेरेंस सर्वर, ड्राइवर व CUDA मैनेजमेंट, ऑटोस्केलिंग और मॉनिटरिंग को जोड़ने पर सालाना लाखों डॉलर की इंजीनियरिंग लागत छुपा सकते हैं।
यही वह लाइन-आइटम है जो भोली सेल्फ-होस्टिंग गणित को डुबो देता है। स्पेक-शीट की प्रति-टोकन लागत मानकर चलती है कि GPU अपने-आप चलता है; हकीकत में किसी को उसे चलाते रहना पड़ता है, और वह शख्स मुफ़्त नहीं होता।
जब API साफ़ तौर पर जीतती है (और लागत से परे के कारक)
कम या स्पाइकी वॉल्यूम, अनिश्चित ट्रैफ़िक, इन-हाउस MLOps न रखने वाली टीमों, और ऐसे किसी भी फ़्रंटियर-क्वालिटी मॉडल की ज़रूरत के लिए — जिसे आप खुद नहीं चला सकते — API सही चुनाव है। एक अनुमान के मुताबिक ज़्यादातर इस्तेमाल के मामलों में API ही बेहतर विकल्प है — और API की कीमतें लगातार गिर रही हैं, जो समय के साथ सेल्फ-होस्टिंग का ब्रेक-ईवन और ऊपर धकेलती हैं।
दो कारक लागत के गणित से पूरी तरह बाहर हैं: लेटेंसी और प्राइवेसी। डेटा रेज़िडेंसी, रेगुलेटेड वर्कलोड, और टोकन के अर्थशास्त्र से बेपरवाह अनुमानित इन-रीजन लेटेंसी के लिए सेल्फ-होस्टिंग जीतती है — हमारी [ऑन-प्रिमाइस गाइड](/articles/on-premise-ai-for-enterprise) देखें। ये कारक तब भी सेल्फ-होस्टिंग को जायज़ ठहरा सकते हैं जब शुद्ध लागत गणित इसके पक्ष में न हो।
osFoundry के साथ अर्थशास्त्र के हिसाब से रूट करें
व्यावहारिक जवाब हाइब्रिड है: विचारधारा से नहीं, अर्थशास्त्र से रूट करें। ऊंचा, स्थिर वॉल्यूम लोकल या अपने मालिकाने इन्फ़ेरेंस पर होना चाहिए, जहां GPU के बैच भरने से प्रति-टोकन लागत नीचे आती है। मध्यम वॉल्यूम वाले, अनुमानित वर्कलोड के लिए डेडिकेटेड GPU एंडपॉइंट सही बैठता है — हार्डवेयर का मालिक बने बिना और पूरा ऑपरेशन मल्टीप्लायर ढोए बिना यूटिलाइज़ेशन-फ़्रेंडली थ्रूपुट। स्पाइकी, कम या अनिश्चित ट्रैफ़िक, और फ़्रंटियर क्वालिटी मांगने वाली हर चीज़ पे-पर-टोकन BYOK APIs पर ही रहती है।
osFoundry उन्हीं लीवरों को संभालता है जो असल में ब्रेक-ईवन को हिलाते हैं — क्वांटाइज़ेशन, बैचिंग और टियर रूटिंग — अपने-आप, और एक ही वर्कलोड को लोकल, डेडिकेटेड एंडपॉइंट पर, या BYOK API के ज़रिए चलने देता है। इस तरह आप जहां सेल्फ-होस्टिंग जीतती है वहां बचत हासिल करते हैं, बिना खुद CUDA, ऑटोस्केलिंग या ड्यूटी-साइकल गणित संभाले। (हमारा [BYOK लागत विश्लेषण](/articles/byok-vs-managed-ai-cost-breakdown) इस समीकरण के API पक्ष को कवर करता है।)
Frequently asked questions
- किस टोकन वॉल्यूम पर सेल्फ-होस्टिंग API से सस्ती हो जाती है?
- यह यूटिलाइज़ेशन पर निर्भर है, इसलिए कोई एक संख्या नहीं है। मोटे तौर पर, GPU का अच्छा इस्तेमाल हो तो सेल्फ-होस्टिंग महीने में कुछ मिलियन टोकन पर ही प्रीमियम APIs को मात दे सकती है, लेकिन सस्ते बजट APIs को मात देने के लिए महीने में दसियों से सैकड़ों मिलियन चाहिए। एक आम अंगूठा-नियम सीमा है — प्रति दिन कुछ मिलियन टोकन, लगातार; इससे नीचे आमतौर पर API जीतती है।
- H100 चलाने में हर महीने कितना खर्च आता है?
- स्पेशलाइज़्ड GPU क्लाउड पर ऑन-डिमांड H100 लगभग $1.50–3.00/घंटा पड़ता है (हाइपरस्केलर पर ज़्यादा), यानी 24/7 चलने वाला डेडिकेटेड इंस्टेंस प्रोवाइडर टियर के हिसाब से करीब $1,000–5,000 प्रति माह बैठता है। यही फिक्स्ड लागत आपके टोकन वॉल्यूम को भरनी होती है, तभी सेल्फ-होस्टिंग फ़ायदे का सौदा बनती है।
- GPU यूटिलाइज़ेशन सेल्फ-होस्टिंग की अर्थव्यवस्था को क्यों बनाता या बिगाड़ता है?
- क्योंकि GPU व्यस्त हो या बेकार, खर्च बराबर ही होता है। अच्छा इस्तेमाल हो तो प्रति मिलियन टोकन लागत एक डॉलर से नीचे जा सकती है; कम लोड (मान लें 10%) पर असली प्रति-टोकन लागत करीब दस गुना बढ़ जाती है, जो अक्सर सेल्फ-होस्टिंग को प्रीमियम API से भी महंगी बना देती है। बेकार पड़ा GPU शुद्ध बर्बादी है — यूटिलाइज़ेशन सबसे बड़ा अकेला चर है।
- क्या सेल्फ-होस्टिंग किसी बजट API (जैसे होस्टेड छोटे मॉडल) से सस्ती है?
- आमतौर पर सिर्फ़ बहुत ऊंचे वॉल्यूम पर। बजट APIs की कीमतें आक्रामक रूप से कम होती हैं, इसलिए सेल्फ-होस्टिंग से उन्हें मात देने के लिए अमूमन अच्छे यूटिलाइज़ेशन पर महीने में दसियों से सैकड़ों मिलियन टोकन चाहिए। प्रीमियम APIs के मुकाबले क्रॉसओवर बहुत जल्दी आ जाता है। किसी सामान्य दर के बजाय उसी खास API से तुलना करें जिसे आप वरना इस्तेमाल करते।
- क्वांटाइज़ेशन सेल्फ-होस्टिंग लागत कितनी घटाता है?
- काफ़ी हद तक। FP8 बेहद मामूली क्वालिटी नुकसान पर थ्रूपुट लगभग दोगुना करता है, और INT4 इसे करीब तिगुना कर सकता है, साथ ही मॉडल को इतना छोटा कर देता है कि वह छोटे, सस्ते GPU में समा जाए। बड़े मॉडल पर यह प्रति मिलियन टोकन लागत आधी या उससे ज़्यादा घटा सकता है — क्वांटाइज़ेशन सेल्फ-होस्टिंग के सबसे ऊंचे-लीवरेज वाले लागत-लीवरों में से एक है।
- LLM सेल्फ-होस्ट करने के साथ कौन-सी छुपी लागतें आती हैं?
- ऑपरेशन। GPU बिल से परे आप MLOps इंजीनियरिंग (छह-अंकीय सैलरी), मॉडल अपडेट साइकल (हर बार हफ़्तों का काम), और इन्फ़ेरेंस सर्वर, ड्राइवर मैनेजमेंट, ऑटोस्केलिंग व मॉनिटरिंग की कीमत चुकाते हैं। ये आम तौर पर असल हार्डवेयर लागत में कई गुना जोड़ देते हैं और यही वह चीज़ है जिसे ज़्यादातर भोली ब्रेक-ईवन गणनाएं छोड़ देती हैं।
- क्या मैं लागत घटाने के लिए सेल्फ-होस्टिंग और APIs को मिला सकता हूं?
- हां — हाइब्रिड आमतौर पर सबसे समझदार तरीका है। ऊंचा, स्थिर वॉल्यूम लोकल या अपने मालिकाने इन्फ़ेरेंस पर चलाएं, मध्यम-वॉल्यूम वाले अनुमानित वर्कलोड डेडिकेटेड एंडपॉइंट पर, और स्पाइकी या कम-वॉल्यूम ट्रैफ़िक (साथ ही फ़्रंटियर क्वालिटी मांगने वाली हर चीज़) पे-पर-टोकन API पर। अर्थशास्त्र के हिसाब से रूट करने पर बर्स्टी काम के लिए बेकार GPU की कीमत चुकाए बिना सेल्फ-होस्टिंग की बचत मिल जाती है।
Sources