← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
LLM 자체 호스팅이 API보다 실제로 더 저렴한 경우
LLM 자체 호스팅이 API보다 저렴해지는 것은 전적으로 GPU 활용률에 좌우되는 토큰 볼륨을 넘어설 때뿐입니다. 단일 손익분기점 숫자란 존재하지 않습니다. 이 가이드는 실제 계산 방식, 배치 처리와 양자화가 결정적인 이유, 숨은 운영 비용, 그리고 하이브리드가 대체로 정답인 이유를 다룹니다.
단일 손익분기점 숫자는 존재하지 않는다
"자체 호스팅이 더 저렴해지는 때는 언제인가?"라는 물음에 대한 솔직한 답은 특정 숫자가 아니라 활용률로 결정되는 범위입니다. 그렇기 때문에 공개된 추정치들이 자릿수가 달라질 만큼 제각각인 것입니다. 저마다 서로 다른 GPU 가격, 활용률, 그리고 비교 대상 API를 전제하기 때문입니다.
쓸 만한 큰 그림은 이렇습니다. GPU를 잘 채워 쓰고 있다면 자체 호스팅은 비교적 적당한 지속 볼륨(월 수백만 토큰)에서 이미 프리미엄 API를 능가하는 경향이 있습니다. 하지만 저렴한 예산형 API를 이기려면 훨씬 더 많은 볼륨(월 수천만~수억 토큰)이 필요합니다. 대략적인 중간 기준점은 하루 수백만 토큰을 꾸준히 쓰는 경우입니다. 그 아래라면 거의 항상 API가 유리합니다.
GPU 비용 계산
자체 호스팅이란 GPU를 임대하거나 구매하는 것이며, 그 고정 비용을 토큰 볼륨으로 "채워야" 합니다. 전문 GPU 클라우드에서 온디맨드 H100은 시간당 약 $1.50–3.00 수준이며(하이퍼스케일러는 더 비쌈), 24시간 연중무휴로 돌리는 전용 H100은 공급업체 등급에 따라 월 약 $1,000–5,000에 이릅니다.
이 월 고정 비용은 쓰든 안 쓰든 발생합니다. 그래서 백만 토큰당 비용은 활용률이 높을 때만 저렴해집니다. 잘 채워 쓰면 중간 크기 모델은 백만 토큰당 1달러를 훨씬 밑돌 수 있지만, 부하 10%에서는 실제 토큰당 비용이 약 10배로 치솟아 프리미엄 API보다 비싸질 수 있습니다. 놀고 있는 GPU는 비용 싸움에서 가장 빨리 지는 길입니다.
승부는 배치 처리와 양자화가 가른다
손익분기점을 무엇보다 크게 움직이는 두 가지 레버가 있습니다. 연속 배치 처리(최신 추론 서버를 통한)는 경제적 엔진입니다. 같은 GPU에서 여러 요청을 동시에 처리하면 토큰당 비용을 극적으로 낮출 수 있습니다. 한 번에 한 요청씩 처리하던 것에서 대규모 배치로 전환하기만 해도 처리량이 자릿수 단위로 향상될 수 있습니다. 급격히 출렁이고 동시성이 낮은 트래픽은 배치를 다 채우지 못해 피크 대비 몇 배나 나쁜 성능을 내며, 이것이 버스티 워크로드가 자체 호스팅에 잘 맞지 않는 이유입니다.
[양자화](/articles/llm-quantization-explained-gguf)는 또 다른 레버입니다. FP8은 최소한의 품질 손실로 처리량을 약 2배 높이고, INT4는 모델을 더 작고 저렴한 GPU에 맞게 줄이면서 약 3배까지 높일 수 있습니다. 배치 처리와 양자화를 함께 쓰면 토큰당 비용을 몇 배로 움직일 수 있습니다.
숨은 비용: 운영
GPU 요금이 비용의 전부가 아닙니다. 운영 비용은 흔히 순수 하드웨어 비용의 몇 배에 달합니다. MLOps 엔지니어의 연봉은 여섯 자릿수이고, 모델 업데이트 주기(재양자화, 테스트, 재배포)마다 몇 주의 작업이 듭니다. "무료" 오픈 웨이트 모델조차 추론 서버, 드라이버와 CUDA 관리, 오토스케일링, 모니터링까지 따지고 나면 연간 수십만 달러의 엔지니어링 비용이 숨어 있을 수 있습니다.
이것이 안이한 자체 호스팅 계산을 침몰시키는 비용 항목입니다. 스펙 시트의 토큰당 비용은 GPU가 알아서 돌아간다고 가정하지만, 실제로는 누군가가 계속 굴려야 하고 그 사람은 공짜가 아닙니다.
API가 명확히 유리한 경우(와 비용 외의 요소)
낮거나 급변하는 볼륨, 예측하기 어려운 트래픽, 사내에 MLOps가 없는 팀, 그리고 직접 돌릴 수 없는 최첨단 품질 모델이 필요한 경우에는 API가 옳은 선택입니다. 한 추정에 따르면 대다수 사용 사례에서는 API가 더 나은 선택이며, API 가격은 계속 떨어지고 있어 시간이 갈수록 자체 호스팅의 손익분기점은 점점 높아집니다.
비용 계산의 완전히 바깥에 있는 두 가지 요소가 있습니다. 바로 레이턴시와 프라이버시입니다. 데이터 레지던시, 규제 대상 워크로드, 그리고 토큰 경제성과 무관하게 예측 가능한 리전 내 레이턴시에서는 자체 호스팅이 유리합니다 — 저희 [온프레미스 가이드](/articles/on-premise-ai-for-enterprise)를 참고하세요. 이런 요소들은 순수 비용 계산이 뒷받침하지 않을 때도 자체 호스팅을 정당화할 수 있습니다.
osFoundry로 경제성에 따라 라우팅하기
현실적인 답은 하이브리드입니다. 이념이 아니라 경제성에 따라 라우팅하세요. 높고 안정적인 볼륨은 로컬 또는 자체 보유 추론에 배치해야 하며, GPU 배치를 채움으로써 토큰당 비용을 낮출 수 있습니다. 중간 볼륨의 예측 가능한 워크로드는 전용 GPU 엔드포인트에 적합합니다. 하드웨어를 소유하거나 운영 비용 배수를 통째로 떠안지 않고도 활용률 친화적인 처리량을 얻을 수 있습니다. 급변하거나 낮거나 예측 불가능한 트래픽, 그리고 최첨단 품질이 필요한 모든 것은 토큰당 과금 BYOK API에 남겨 둡니다.
osFoundry는 손익분기점을 실제로 움직이는 레버들 — 양자화, 배치 처리, 티어 라우팅 — 을 자동으로 처리하며, 동일한 워크로드를 로컬, 전용 엔드포인트, 또는 BYOK API를 통해 실행할 수 있게 합니다. 덕분에 CUDA, 오토스케일링, 듀티 사이클 계산을 직접 떠안지 않고도 자체 호스팅이 유리한 곳에서 비용 절감을 챙길 수 있습니다. ([BYOK 비용 분석](/articles/byok-vs-managed-ai-cost-breakdown)에서는 이 방정식의 API 쪽을 다룹니다.)
Frequently asked questions
- 토큰 볼륨이 얼마면 자체 호스팅이 API보다 저렴해지나요?
- 활용률에 따라 다르므로 단일 숫자는 없습니다. 대략적으로, GPU를 잘 채워 쓰면 월 수백만 토큰에서 프리미엄 API를 능가할 수 있지만, 저렴한 예산형 API를 이기려면 월 수천만~수억 토큰이 필요합니다. 일반적인 기준점은 하루 수백만 토큰을 꾸준히 쓰는 경우이며, 그 아래라면 보통 API가 유리합니다.
- H100을 한 달 운영하는 데 비용이 얼마나 드나요?
- 전문 GPU 클라우드에서 온디맨드 H100은 시간당 약 $1.50–3.00입니다(하이퍼스케일러는 더 비쌈). 따라서 24시간 연중무휴 전용 인스턴스는 공급업체 등급에 따라 월 약 $1,000–5,000이 됩니다. 이 고정 비용을 토큰 볼륨으로 채워야 자체 호스팅이 경제적으로 의미가 있습니다.
- GPU 활용률이 자체 호스팅 경제성을 결정적으로 좌우하는 이유는 무엇인가요?
- GPU는 바쁘든 놀고 있든 같은 비용이 들기 때문입니다. 잘 채워 쓰면 백만 토큰당 비용이 1달러 아래로 떨어질 수 있지만, 저부하(예: 10%)에서는 실제 토큰당 비용이 약 10배로 올라 프리미엄 API보다 비싸지는 경우가 많습니다. 놀고 있는 GPU는 순수한 낭비이며, 활용률이 가장 큰 단일 변수입니다.
- 자체 호스팅이 예산형 API(호스팅된 소형 모델 등)보다 저렴한가요?
- 보통은 아주 높은 볼륨에서만 그렇습니다. 예산형 API는 공격적으로 가격이 책정되어 있어, 자체 호스팅으로 이를 넘어서려면 대개 좋은 활용률에서 월 수천만~수억 토큰이 필요합니다. 프리미엄 API와의 교차점은 훨씬 일찍 찾아옵니다. 일반 요율이 아니라, 실제로 쓸 그 특정 API와 비교하세요.
- 양자화는 자체 호스팅 비용을 얼마나 줄여 주나요?
- 상당히 줄여 줍니다. FP8은 최소한의 품질 손실로 처리량을 약 2배 높이고, INT4는 모델을 더 작고 저렴한 GPU에 맞게 줄이면서 약 3배까지 높일 수 있습니다. 대형 모델이라면 백만 토큰당 비용을 절반 이상 줄일 수 있습니다. 양자화는 자체 호스팅에서 가장 레버리지가 큰 비용 수단 중 하나입니다.
- LLM을 자체 호스팅할 때 숨은 비용은 무엇인가요?
- 운영입니다. GPU 요금 외에도 MLOps 엔지니어링(여섯 자릿수 연봉), 모델 업데이트 주기(매번 몇 주의 작업), 그리고 추론 서버, 드라이버 관리, 오토스케일링, 모니터링 비용이 듭니다. 이런 비용은 흔히 순수 하드웨어 비용의 몇 배에 달하며, 대부분의 안이한 손익분기점 계산이 빠뜨리는 부분입니다.
- 비용 최적화를 위해 자체 호스팅과 API를 결합할 수 있나요?
- 네 — 하이브리드가 보통 가장 현명한 접근법입니다. 높고 안정적인 볼륨은 로컬 또는 자체 보유 추론에서, 중간 볼륨의 예측 가능한 워크로드는 전용 엔드포인트에서, 급변하거나 낮은 볼륨의 트래픽(최첨단 품질이 필요한 것 포함)은 토큰당 과금 API에서 처리하세요. 경제성에 따라 라우팅하면 버스티 작업에서 놀고 있는 GPU에 돈을 쓰지 않으면서 자체 호스팅의 절감을 챙길 수 있습니다.
Sources