← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
LLMのセルフホスティングがAPIより実際に安くなる条件
LLMのセルフホスティングがAPIより安くなるのは、GPU稼働率に完全に左右されるトークン量を超えた場合に限られます。単一の損益分岐点という数字は存在しません。本ガイドでは、実際の計算、バッチングと量子化が決め手になる理由、隠れた運用コスト、そしてハイブリッドがたいてい正解である理由を解説します。
単一の損益分岐点という数字は存在しない
「セルフホスティングが安くなるのはいつか」という問いへの正直な答えは、数字ではなく稼働率で決まる範囲です。だからこそ、公開されている試算は桁違いに食い違うのです。それぞれが異なるGPU価格、稼働率、そして比較対象のAPIを前提にしています。
大まかな傾向はこうです。GPUをうまく使い込めていれば、セルフホスティングは比較的控えめな継続ボリューム(月間数百万トークン程度)でプレミアムAPIに勝る傾向があります。しかし、安価なバジェットAPIに勝つにははるかに多くのボリューム(月間数千万〜数億トークン)が必要です。目安となる中間点は、継続的に1日あたり数百万トークン程度。それを下回るなら、ほぼ常にAPIが有利です。
GPUのコスト計算
セルフホスティングとは、GPUをレンタルまたは購入することであり、その固定費をトークン量で「埋める」必要があります。専門GPUクラウドのオンデマンドH100は概ね1時間あたり$1.50〜3.00で(ハイパースケーラーではさらに高額)、24時間365日稼働の専用H100はプロバイダーのティアによって月額おおよそ$1,000〜5,000になります。
この月額固定費は、使っても使わなくても発生します。だからこそ、トークンあたりのコストは高稼働率のときだけ安くなるのです。うまく使い込めていれば、中規模モデルはトークン100万あたり1ドルを大きく下回ることもできます。しかし稼働率10%では、実際のトークンあたりコストはおよそ10倍に跳ね上がり、プレミアムAPIより高くつきかねません。遊んでいるGPUは、コスト論争で最も手早く負ける方法です。
決め手はバッチングと量子化
損益分岐点を何よりも大きく動かすレバーが2つあります。コンティニュアスバッチング(最新の推論サーバーによる)は経済的なエンジンです。同じGPU上で多数のリクエストを同時にさばくことで、トークンあたりのコストを劇的に削減できます。1リクエストずつから大規模バッチへ移行するだけで、スループットは桁違いに向上します。スパイク状で同時実行数の低いトラフィックはバッチを埋めきれず、ピーク時より数倍悪い結果になります。だからこそ、バースト的なワークロードはセルフホスティングに向かないのです。
[量子化](/articles/llm-quantization-explained-gguf)はもう1つのレバーです。FP8は最小限の品質低下でスループットをおよそ2倍にし、INT4はおよそ3倍にしつつ、モデルを縮小して小型で安価なGPUに収めます。バッチングと量子化を組み合わせれば、トークンあたりのコストを数倍動かすことができます。
隠れたコスト:運用
GPU代だけが全費用ではありません。運用コストは、生のハードウェアコストの数倍に達することが日常的にあります。MLOpsエンジニアの年収は6桁に上り、モデルの更新サイクル(再量子化、テスト、再デプロイ)はそのたびに数週間の作業です。「無料」のオープンウェイトモデルでさえ、推論サーバー、ドライバーとCUDAの管理、オートスケーリング、モニタリングを勘定に入れると、年間数十万ドルのエンジニアリングコストが隠れている場合があります。
これが、素朴なセルフホスティングの計算を破綻させる費用項目です。スペックシートのトークンあたりコストはGPUが勝手に動くことを前提にしていますが、実際には誰かが動かし続ける必要があり、その人はタダではありません。
APIが明らかに有利な場合(とコスト以外の要因)
低い量やスパイク状の量、予測できないトラフィック、社内にMLOpsを持たないチーム、そして自前では動かせないフロンティア品質のモデルが必要な場合は、APIが正解です。ある試算によれば、大多数のユースケースではAPIのほうが有利です。しかもAPIの価格は下がり続けており、セルフホスティングの損益分岐点は時間とともに押し上げられています。
コスト計算の完全に外側にある要素が2つあります。レイテンシとプライバシーです。データレジデンシー、規制対象のワークロード、そしてトークンの経済性に関わらず予測可能なリージョン内レイテンシでは、セルフホスティングに分があります——[オンプレミスガイド](/articles/on-premise-ai-for-enterprise)をご覧ください。これらは、純粋なコスト計算が支持しない場合でもセルフホスティングを正当化しえます。
osFoundryで経済性に基づいてルーティングする
現実的な答えはハイブリッドです。イデオロギーではなく経済性に基づいてルーティングしましょう。高く安定したボリュームはローカルまたは自社所有の推論に振り向けるべきで、GPUのバッチを埋めることでトークンあたりのコストが下がります。中規模で予測可能なワークロードには専用GPUエンドポイントが適しています。ハードウェアを所有せず、運用コストの倍率を丸ごと背負うこともなく、稼働率にやさしいスループットが得られます。スパイク状、低量、または予測できないトラフィック、そしてフロンティア品質が必要なものは、トークン従量課金のBYOK APIに残します。
osFoundryは、損益分岐点を実際に動かすレバー——量子化、バッチング、ティアルーティング——を自動で処理し、同じワークロードをローカル、専用エンドポイント、またはBYOK API経由で実行できます。これにより、CUDAやオートスケーリング、デューティサイクルの計算を自分で抱えることなく、セルフホスティングが有利な場面で確実にコスト削減を取り込めます。([BYOKコスト内訳](/articles/byok-vs-managed-ai-cost-breakdown)では、この方程式のAPI側を取り上げています。)
Frequently asked questions
- どれくらいのトークン量でセルフホスティングがAPIより安くなりますか?
- 稼働率しだいなので、単一の数字はありません。おおよそ、GPUをうまく使い込めていれば月間数百万トークンでプレミアムAPIに勝てる可能性がありますが、安価なバジェットAPIに勝つには月間数千万〜数億トークンが必要です。一般的な目安は継続的に1日あたり数百万トークンで、それを下回る場合は通常APIのほうが有利です。
- H100の運用は月額いくらかかりますか?
- 専門GPUクラウドのオンデマンドH100は1時間あたり概ね$1.50〜3.00です(ハイパースケーラーではさらに高額)。したがって、24時間365日稼働の専用インスタンスはプロバイダーのティアによって月額約$1,000〜5,000になります。この固定費をトークン量で埋めることが、セルフホスティングを成立させる条件です。
- なぜGPU稼働率がセルフホスティングの経済性を左右するのですか?
- GPUは稼働中でも遊休中でも同じコストがかかるからです。うまく使い込めていれば、100万トークンあたりのコストが1ドルを下回ることもあります。低稼働率(例えば10%)では、実際のトークンあたりコストがおよそ10倍になり、プレミアムAPIより高くつくことが多くなります。遊んでいるGPUは純粋な無駄であり、稼働率こそが最大の単一変数です。
- セルフホスティングはバジェットAPI(ホスト型の小型モデルなど)より安いですか?
- 通常は、非常に高いボリュームの場合に限られます。バジェットAPIは攻めた価格設定がされているため、セルフホスティングで上回るには、たいてい良好な稼働率で月間数千万〜数億トークンが必要です。プレミアムAPIとの比較なら、損益が逆転する点はずっと早く訪れます。一般的なレートではなく、実際に使うはずのAPIと比較してください。
- 量子化でセルフホスティングのコストはどれくらい下がりますか?
- 大幅に下がります。FP8は最小限の品質低下でスループットをおよそ2倍にし、INT4はおよそ3倍にしつつ、モデルを縮小して小型で安価なGPUに収めます。大規模モデルでは、100万トークンあたりのコストを半分以上削減できることもあります。量子化は、セルフホスティングにおいて最もレバレッジの高いコスト手段の一つです。
- LLMのセルフホスティングにはどんな隠れたコストがありますか?
- 運用コストです。GPU代のほかに、MLOpsのエンジニアリング(6桁の年収)、モデル更新サイクル(そのたびに数週間の作業)、そして推論サーバー、ドライバー管理、オートスケーリング、モニタリングの費用がかかります。これらは生のハードウェアコストの数倍に達することが多く、素朴な損益分岐点の計算がたいてい見落とす部分です。
- コストを最適化するためにセルフホスティングとAPIを組み合わせられますか?
- はい。ハイブリッドが通常もっとも賢い進め方です。高く安定したボリュームはローカルまたは自社所有の推論で、中規模で予測可能なワークロードは専用エンドポイントで、スパイク状や低ボリュームのトラフィック(フロンティア品質が必要なものを含む)はトークン従量課金のAPIで処理します。経済性に基づいてルーティングすれば、バースト的な作業で遊休GPUに支払うことなく、セルフホスティングの節約を取り込めます。
Sources