← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
Когда собственный хостинг LLM действительно дешевле API
Хостить LLM самостоятельно дешевле API только выше определённого объёма токенов, который целиком зависит от утилизации GPU: единой точки безубыточности не существует. Это руководство разбирает реальные расчёты, объясняет, почему всё решают батчинг и квантизация, какие скрытые операционные затраты возникают и почему гибридный подход обычно оказывается правильным ответом.
Единой точки безубыточности не существует
Честный ответ на вопрос «когда self-hosting дешевле?» — это диапазон, обусловленный утилизацией, а не число. Именно поэтому опубликованные оценки расходятся на порядки: они исходят из разных цен на GPU, уровней утилизации и сравниваемых API.
Полезная закономерность: self-hosting, как правило, обходит премиум-API уже при относительно скромном устойчивом объёме (несколько миллионов токенов в месяц на хорошо загруженной GPU), однако чтобы обойти дешёвые бюджетные API, нужно гораздо больше (десятки и сотни миллионов в месяц). Грубый ориентир — пара миллионов токенов в день на устойчивой основе. Ниже этого порога API почти всегда выигрывает.
Расчёты по GPU
Self-hosting означает аренду или покупку GPU, и эта постоянная стоимость — то, что должен «заполнить» ваш объём токенов. H100 по запросу обходится примерно в 1,50–3,00 $/час в специализированных облаках (дороже у гиперскейлеров), так что выделенная H100 в режиме 24/7 стоит порядка 1 000–5 000 $ в месяц в зависимости от уровня провайдера.
Эта ежемесячная фиксированная плата начисляется независимо от того, используете вы GPU или нет, — именно поэтому стоимость миллиона токенов невелика лишь при высокой утилизации. При хорошей загрузке модель среднего размера может выйти значительно ниже доллара за миллион токенов; при 10%-й нагрузке реальная стоимость токена возрастает примерно в десять раз — достаточно, чтобы self-hosting оказался дороже премиум-API. Простаивающая GPU — самый быстрый способ проиграть в споре о стоимости.
Всё решают батчинг и квантизация
Два рычага двигают точку безубыточности сильнее всего остального. Непрерывный батчинг (благодаря современным серверам инференса) — это экономический двигатель: обслуживание множества запросов одновременно на одной GPU способно резко снизить стоимость токена; переход от одного запроса за раз к крупным батчам может повысить пропускную способность на порядки. Нестабильный трафик с низким параллелизмом не заполняет батчи и работает в несколько раз хуже пика, поэтому всплесковые нагрузки плохо поддаются self-hosting.
[Квантизация](/articles/llm-quantization-explained-gguf) — второй рычаг: FP8 примерно удваивает пропускную способность при минимальной потере качества, а INT4 может примерно утроить её, уменьшая модель настолько, чтобы она поместилась на меньшую и более дешёвую GPU. Вместе батчинг и квантизация способны изменить стоимость токена в несколько раз.
Скрытые затраты: операции
Счёт за GPU — это не весь счёт. Операционные расходы регулярно добавляют сумму, в несколько раз превышающую чистую стоимость оборудования: зарплата инженера MLOps — шестизначная, а каждый цикл обновления модели — повторная квантизация, тестирование, повторное развёртывание — занимает недели. «Бесплатные» open-weight-модели могут скрывать сотни тысяч долларов инженерных расходов в год, если учесть сервер инференса, управление драйверами и CUDA, автомасштабирование и мониторинг.
Именно эта статья расходов обрушивает наивные расчёты self-hosting. Стоимость токена по спецификации предполагает, что GPU работает сама по себе; на деле кто-то должен её обслуживать, и этот человек не бесплатен.
Когда API явно выигрывает (и факторы, не связанные с ценой)
API — правильный выбор при малом или нестабильном объёме, непредсказуемом трафике, в командах без собственных MLOps-компетенций и при любой потребности в моделях frontier-качества, которые нельзя запустить самостоятельно. По одной из оценок, API является лучшим выбором для подавляющего большинства сценариев, а цены на API продолжают снижаться, что со временем поднимает точку безубыточности self-hosting всё выше.
Два фактора полностью выходят за рамки ценовых расчётов: задержка и конфиденциальность. Self-hosting выигрывает в вопросах резидентности данных, регулируемых нагрузок и предсказуемой задержки внутри региона — независимо от экономики токенов; см. наше [руководство по on-premise](/articles/on-premise-ai-for-enterprise). Эти факторы могут оправдать self-hosting даже тогда, когда чистые ценовые расчёты этого не делают.
Маршрутизация по экономике с osFoundry
Прагматичный ответ — гибридный: маршрутизировать по экономическим критериям, а не по идеологии. Высокий, стабильный объём принадлежит локальному или собственному инференсу, где заполнение батчей GPU снижает стоимость токена. Нагрузки среднего объёма и предсказуемого характера подходят для выделенного GPU-эндпоинта: пропускная способность, дружественная к утилизации, без владения оборудованием и без полного операционного мультипликатора. Нестабильный, малый или непредсказуемый трафик, а также всё, что требует frontier-качества, остаётся на pay-per-token BYOK API.
osFoundry автоматически управляет рычагами, которые действительно двигают точку безубыточности, — квантизацией, батчингом и tier-маршрутизацией — и позволяет одной и той же нагрузке работать локально, на выделенном эндпоинте или через BYOK API. Так вы получаете экономию там, где self-hosting выигрывает, не занимаясь самостоятельно CUDA, автомасштабированием или расчётами цикла загрузки. (Наш [разбор затрат BYOK](/articles/byok-vs-managed-ai-cost-breakdown) охватывает сторону API в этом уравнении.)
Frequently asked questions
- При каком объёме токенов self-hosting становится дешевле API?
- Это зависит от утилизации, поэтому единого числа не существует. Примерно так: self-hosting может превзойти премиум-API при нескольких миллионах токенов в месяц на хорошо загруженной GPU, однако чтобы обойти дешёвые бюджетные API, нужны десятки и сотни миллионов в месяц. Распространённый ориентировочный порог — пара миллионов токенов в день на устойчивой основе. Ниже этого порога API обычно выигрывает.
- Сколько стоит работа H100 в месяц?
- H100 по запросу стоит примерно 1,50–3,00 $/час в специализированных GPU-облаках (дороже у гиперскейлеров), так что выделенный экземпляр в режиме 24/7 обходится примерно в 1 000–5 000 $ в месяц в зависимости от уровня провайдера. Эти постоянные расходы — то, что должен перекрыть объём токенов, чтобы self-hosting окупился.
- Почему утилизация GPU решает судьбу экономики self-hosting?
- Потому что GPU стоит одинаково — занята она или простаивает. При хорошей загрузке стоимость миллиона токенов может опуститься ниже доллара; при малой нагрузке (скажем, 10%) реальная стоимость токена возрастает примерно в десять раз, нередко делая self-hosting дороже премиум-API. Простаивающая GPU — чистые потери; утилизация — самая важная переменная.
- Дешевле ли self-hosting, чем бюджетная API вроде хостируемой небольшой модели?
- Как правило, только при очень высоком объёме. У бюджетных API агрессивное ценообразование, поэтому, чтобы превзойти их с помощью self-hosting, обычно требуются десятки и сотни миллионов токенов в месяц при хорошей утилизации. По сравнению с премиум-API пересечение наступает значительно раньше. Сравнивайте с конкретной API, которую вы бы использовали в ином случае, а не с абстрактным тарифом.
- Насколько квантизация снижает затраты на self-hosting?
- Существенно. FP8 примерно удваивает пропускную способность при минимальной потере качества, а INT4 может примерно утроить её, уменьшая модель настолько, чтобы она поместилась на меньшую и более дешёвую GPU. На большой модели это может снизить стоимость миллиона токенов вдвое и более — квантизация является одним из самых действенных рычагов снижения затрат при self-hosting.
- Какие скрытые расходы возникают при собственном хостинге LLM?
- Операционные. Помимо счёта за GPU вы платите за MLOps-инженерию (шестизначная зарплата), циклы обновления модели (каждый занимает недели), а также за сервер инференса, управление драйверами, автомасштабирование и мониторинг. Эти статьи регулярно добавляют сумму, в несколько раз превышающую чистую стоимость оборудования, и именно их упускает большинство наивных расчётов точки безубыточности.
- Можно ли совмещать self-hosting и API для оптимизации затрат?
- Да — гибридный подход обычно самый разумный. Запускайте высокий, стабильный объём на локальном или собственном инференсе, нагрузки среднего объёма и предсказуемого характера — на выделенном эндпоинте, а нестабильный или малый трафик (плюс всё, что требует frontier-качества) — на pay-per-token API. Маршрутизация по экономике даёт экономию self-hosting без оплаты простаивающих GPU при всплесковой нагрузке.
Sources