← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
Quando hospedar LLMs por conta própria sai mais barato do que uma API
Hospedar um LLM por conta própria sai mais barato do que uma API apenas acima de um volume de tokens que depende inteiramente da utilização da GPU: não existe um único ponto de equilíbrio. Este guia cobre as contas reais, por que o batching e a quantização decidem tudo, o custo operacional oculto e por que o híbrido costuma ser a resposta certa.
Não existe um único ponto de equilíbrio
A resposta honesta para «quando a auto-hospedagem sai mais barata?» é um intervalo condicionado pela utilização, não um número. É por isso que as estimativas publicadas divergem em ordens de grandeza: elas partem de preços de GPU, taxas de utilização e APIs de comparação diferentes.
O padrão útil: a auto-hospedagem tende a vencer as APIs premium com um volume sustentado relativamente modesto (poucos milhões de tokens por mês em uma GPU bem aproveitada), mas vencer as APIs econômicas exige muito mais (dezenas a centenas de milhões por mês). Uma regra geral aproximada situa-se em alguns milhões de tokens por dia, de forma sustentada. Abaixo disso, uma API quase sempre vence.
As contas da GPU
Auto-hospedar significa alugar ou ter uma GPU, e esse custo fixo é o que o volume de tokens precisa «preencher». Uma H100 sob demanda custa cerca de US$ 1,50–3,00/hora em nuvens especializadas (mais nos hyperscalers), portanto uma H100 dedicada 24/7 fica na ordem de US$ 1.000–5.000 por mês conforme o nível do provedor.
Essa mensalidade é fixa, use você ou não, e por isso o custo por milhão de tokens só é baixo com alta utilização. Bem aproveitado, um modelo de médio porte pode ficar bem abaixo de um dólar por milhão de tokens; com 10% de carga, o custo real por token sobe cerca de dez vezes, o suficiente para tornar a auto-hospedagem mais cara do que uma API premium. Uma GPU ociosa é a forma mais rápida de perder o argumento do custo.
O batching e a quantização decidem tudo
Duas alavancas movem o ponto de equilíbrio mais do que qualquer outra coisa. O batching contínuo (graças aos servidores de inferência modernos) é o motor econômico: atender muitas requisições ao mesmo tempo na mesma GPU pode reduzir drasticamente o custo por token; passar de uma requisição por vez para grandes lotes pode melhorar o throughput em ordens de grandeza. O tráfego irregular e de baixa concorrência não preenche os lotes e tem desempenho várias vezes pior do que no pico, razão pela qual cargas de trabalho com picos se auto-hospedam mal.
[A quantização](/articles/llm-quantization-explained-gguf) é a outra alavanca: FP8 praticamente dobra o throughput com perda mínima de qualidade, e INT4 pode quase triplicá-lo, reduzindo o modelo o suficiente para caber em uma GPU menor e mais barata. Juntos, batching e quantização podem multiplicar por várias vezes o custo por token em um ou outro sentido.
O custo oculto: as operações
A conta da GPU não é a conta toda. As operações costumam adicionar várias vezes o custo bruto do hardware: um engenheiro de MLOps tem um salário de seis dígitos, e cada ciclo de atualização do modelo — requantizar, testar, reimplantar — representa semanas de trabalho. Modelos de pesos abertos «gratuitos» podem esconder centenas de milhares de dólares por ano em engenharia quando você leva em conta o servidor de inferência, o gerenciamento de drivers e CUDA, o autoescalonamento e o monitoramento.
É a rubrica que afunda as contas ingênuas da auto-hospedagem. O custo por token da ficha técnica pressupõe que a GPU se gerencia sozinha; na realidade, alguém precisa mantê-la funcionando, e essa pessoa não é de graça.
Quando a API vence com clareza (e os fatores além do custo)
Uma API é a escolha certa para volume baixo ou irregular, tráfego imprevisível, equipes sem MLOps interno e qualquer necessidade de modelos de qualidade frontier que você não consiga executar por conta própria. Segundo uma estimativa, uma API é a melhor escolha para a grande maioria dos casos de uso, e os preços das APIs continuam caindo, o que eleva o ponto de equilíbrio da auto-hospedagem cada vez mais ao longo do tempo.
Dois fatores ficam totalmente fora das contas: latência e privacidade. A auto-hospedagem vence em residência de dados, cargas de trabalho reguladas e latência previsível dentro da região, independentemente da economia dos tokens; veja o nosso [guia sobre on-premise](/articles/on-premise-ai-for-enterprise). Esses fatores podem justificar a auto-hospedagem mesmo quando as contas puras não justificam.
Roteie por economia com osFoundry
A resposta pragmática é híbrida: rotear por critérios econômicos, não por ideologia. Volume alto e constante pertence à inferência local ou própria, onde preencher os lotes de uma GPU reduz o custo por token. Cargas de volume médio e previsíveis se encaixam em um endpoint de GPU dedicado: throughput que aproveita bem a utilização sem precisar ter hardware nem carregar o multiplicador operacional completo. Tráfego irregular, baixo ou imprevisível, e tudo que exija qualidade frontier, permanece em APIs BYOK de pagamento por token.
O osFoundry gerencia automaticamente as alavancas que de fato movem o ponto de equilíbrio — quantização, batching e roteamento por camada — e permite que a mesma carga de trabalho rode em local, em um endpoint dedicado ou via uma API BYOK. Assim você captura a economia onde a auto-hospedagem vence sem ter que gerenciar você mesmo CUDA, autoescalonamento ou as contas do ciclo de uso. (Nossa [análise de custos BYOK](/articles/byok-vs-managed-ai-cost-breakdown) cobre o lado da API da equação.)
Frequently asked questions
- Em que volume de tokens a auto-hospedagem sai mais barata do que uma API?
- Depende da utilização, portanto não há um único número. Em linhas gerais, a auto-hospedagem pode vencer as APIs premium com poucos milhões de tokens por mês em uma GPU bem aproveitada, mas vencer as APIs econômicas exige dezenas a centenas de milhões por mês. Um limite orientativo comum é alguns milhões de tokens por dia, de forma sustentada; abaixo disso, uma API normalmente vence.
- Quanto custa manter uma H100 por mês?
- Uma H100 sob demanda custa cerca de US$ 1,50–3,00/hora em nuvens de GPU especializadas (mais nos hyperscalers), portanto uma instância dedicada 24/7 fica em torno de US$ 1.000–5.000 por mês conforme o nível do provedor. Esse custo fixo é o que o volume de tokens precisa cobrir para a auto-hospedagem valer a pena.
- Por que a utilização da GPU determina a viabilidade econômica da auto-hospedagem?
- Porque a GPU custa o mesmo esteja ela ocupada ou ociosa. Bem aproveitada, o custo por milhão de tokens pode cair abaixo de um dólar; com carga baixa (digamos 10%), o custo real por token sobe cerca de dez vezes, muitas vezes tornando a auto-hospedagem mais cara do que uma API premium. Uma GPU ociosa é puro desperdício: a utilização é a variável mais decisiva.
- A auto-hospedagem sai mais barata do que uma API econômica, como um modelo pequeno hospedado?
- Em geral, apenas com volumes muito altos. As APIs econômicas têm preços bastante agressivos, então vencê-las por meio da auto-hospedagem costuma exigir dezenas a centenas de milhões de tokens por mês com boa utilização. Diante das APIs premium, o cruzamento acontece muito antes. Compare com a API específica que você usaria, não com uma tarifa genérica.
- Quanto a quantização reduz o custo da auto-hospedagem?
- Substancialmente. FP8 praticamente dobra o throughput com perda mínima de qualidade, e INT4 pode quase triplicá-lo, reduzindo o modelo para caber em uma GPU menor e mais barata. Em um modelo grande, isso pode cortar o custo por milhão de tokens pela metade ou mais; a quantização é uma das alavancas de custo de maior impacto para a auto-hospedagem.
- Que custos ocultos acompanham a auto-hospedagem de um LLM?
- As operações. Além da conta da GPU, você paga pela engenharia de MLOps (um salário de seis dígitos), pelos ciclos de atualização do modelo (semanas de trabalho cada um) e pelo servidor de inferência, gerenciamento de drivers, autoescalonamento e monitoramento. Essas rubricas costumam adicionar várias vezes o custo bruto do hardware e são justamente o que a maioria dos cálculos de ponto de equilíbrio ingênuos deixa de fora.
- Posso combinar auto-hospedagem e APIs para otimizar o custo?
- Sim: o híbrido costuma ser a abordagem mais inteligente. Rode volume alto e constante em inferência local ou própria, cargas de volume médio e previsíveis em um endpoint dedicado, e tráfego irregular ou de baixo volume (mais tudo que exija qualidade frontier) em uma API de pagamento por token. Rotear por critérios econômicos captura a economia da auto-hospedagem sem pagar por GPUs ociosas em trabalhos com picos.
Sources