1日1億トークンの利用では、クラウドAPIは月$180,000を消費する一方、セルフホスティングのコストは約$22,000——88%もの差があり、決断は明白に見えます。しかし1日1,000万トークンでは、フルロードしたセルフホスティングTCO——夜間の谷間でアイドル状態の予約GPU、0.3〜0.5 FTEのMLOpsオーバーヘッド、モデル導入のたびに発生する2〜6週間の遅延——がクラウドAPIを上回るのが常です。ほとんどのチームはこの両極の間に位置し、計算を誤ると本来支払うべき額の2〜3倍のコストがかかります。以下が完全なTCOフレームワークです。自分の数値を代入して損益分岐点を見つけましょう——誰かの経験則ではなく。
「クラウドは高い」「セルフホスティングは無料」がどちらも間違いな理由
クラウドコストの罠
GPT-4oの価格で1日1億トークンなら、月間API請求額は約$18,750に達します。その数字は衝撃的に見えますが——ゼロ最適化を前提にしています。実際には、その規模で運用するほとんどのチームは、階層化モデルルーティング、プロンプトキャッシュ、バッチAPI利用を実装していないため、30〜50%多く支払っています。クラウド支出の最適化——12のコスト最適化ガイドで網羅的に解説——は通常、GPU予約の1か月分以下で済み、同じ請求サイクル内で節約を実現します。セルフホスティングを検討する前に、まずクラウド最適化を使い切りましょう。
セルフホスティングの隠れコストの罠
2基の予約H100インスタンスは月約$4,200です。その$18,750のクラウド請求額と比べると、78%の節約に見えます。しかしハードウェアは実際のコストの約30〜40%にすぎません。MLOpsエンジニア0.5〜1.0 FTE(月$6,000〜12,000)、GPU utilizationリスク(トラフィックの谷間で70%のアイドル時間=使わないcomputeにお金を払っていることになる)、モデル更新メンテナンス(アップグレードサイクルごとに2〜6週間)、そして新しいフロンティアモデルに即時アクセスできない機会費用を加えてください。1日5,000万トークン未満では、フルロードしたセルフホスティングTCOはクラウドAPIコストを上回ることが多く——時には大幅に。
根本的な洞察
クラウドAPIはトークンあたりのマークアップを請求します。セルフホスティングは固定インフラとエンジニアリングのオーバーヘッドを負います。どちらが安いかは、使用量がコストカーブのどこに位置するかに完全に依存します。クラウドは低〜中量のボリュームとスパイキーなワークロードで勝ちます。セルフホスティングは高く安定したボリュームで勝ちます。ハイブリッドはその中間のほぼすべてのチームで勝ちます。
財務モデル:TCOに実際に入るもの
Computeコスト
| GPU | 時間単価(予約) | トークン/秒(8Bモデル) | 最適な用途 |
|---|---|---|---|
| H100 | ~$2.10 | 2,500+ | 70B以上のモデル、高スループット(価格はArtificial Analysisと照合済み) |
| A100 | ~$1.20 | 1,500+ | 8〜70Bモデル、中程度のスループット |
| RTX 4090 | ~$0.10(自己保有相当) | 100+ | 8Bモデル、低トラフィックの推論提供 |
量子化——4-bit GPTQまたはAWQ——はVRAM要件を60〜75%削減し、品質のトレードオフは1〜3ポイントです。Qwen3-8Bなら、A100が必要になるか、RTX 4090で快適に動作するかの違いになります。量子化レベルを確定する前に、特定のワークロードで品質への影響をテストしましょう。
エンジニアリング工数
ここでほとんどのTCOモデルが崩壊します。セルフホスティングは「一度設定すれば動き続ける」ものではありません。継続的な本番パイプラインです:GPU調達とドライバ互換性管理、フレームワーク選定とバージョンアップグレード(vLLM、SGLang、またはTGI)、オートスケーリングとキュー管理、モニタリングとオンコールローテーション、A/Bテストを伴うモデルアップグレードサイクル、セキュリティパッチとサプライチェーンリスクの軽減。2026年3月のLiteLLMマルウェア事件は一回限りではありません——自己管理インフラの新しい標準です。本番トラフィックを処理するセルフホスティングデプロイメントには0.5〜1.0 FTEを予算化しましょう。
Utilizationリスク
午前1時から午前5時の間、トラフィックはピークの10%まで落ち込みます。それでもH100は動き続け、電力を消費し続け、それぞれ1時間あたり$2.10を請求し続けます。予約インスタンスは可用性を保証しますが、正確なキャパシティ予測を要求します。スポットインスタンスは60〜80%節約できますが、30秒の通知で回収される可能性があり——本番ワークロードには受け入れられません。クラウドAPIはアイドル時間に課金しません。セルフホスティングは24時間365日フルプライスです。
モデルの新しさの機会費用
新しいフラッグシップモデルが登場します。クラウドAPIユーザーはmodel文字列を変更して数分でデプロイします。セルフホスティングユーザーは2〜6週間の評価と移行サイクルを開始します:重みのダウンロード、現行モデルとのベンチマーク、プロンプトの再最適化、A/Bテスト、本番ロールアウト。競争上の差別化がモデル品質に依存する製品では、この遅延は実際のビジネスコストを持ち——インフラ節約を上回る可能性があります。
上のモデルに自分の数値を代入してください。分析を実際の価格で裏付けるため、代表的な3つの規模でのTCO内訳を示します——今日のほとんどのチームが運用する範囲をカバーします。
3つの規模での損益分岐分析
小規模:1日1,000万トークン(月約3億)
クラウドAPI: 階層化ルーティングでブレンドレート約$2/Mトークン——約$600/日、約$18K/月。
セルフホスティング: 1×H100予約($1,512/月)+ MLOps 0.3 FTE($3,600/月)+ インフラオーバーヘッド($500/月)——約$5,612/月。
書面上では、セルフホスティングは69%節約します。しかしこれは>85%のGPU utilizationと、実際に存在し、あなたのリードバックエンドエンジニアを兼任していない0.3 FTEを前提にしています。utilization 50%(スパイキーなトラフィック)では、セルフホスティングコストは月約$7,500に上昇——節約は58%に縮小します。utilization 30%(初期段階の製品によくある)では、節約は40%未満に低下——そしてGPUドライバの事故1回で、エンジニアリング時間で数か月分の節約が消し飛びます。
判定: コスト最適化を伴うクラウド。まず階層化ルーティングとプロンプトキャッシュを実装しましょう。1日5,000万トークンで再評価します。
中規模:1日5,000万トークン(月約15億)
クラウドAPI: ブレンドレート約$90K/月。
セルフホスティング: 2×H100($3,024)+ MLOps 0.5 FTE($6,000)+ 専用インフラ($1,000)——約$10,024/月。
セルフホスティングはここでは明確に安くなります——40%のutilizationリスクとフルエンジニアリングオーバーヘッドを考慮しても60〜70%の節約。ここがクロスオーバーゾーンで、セルフホスティングがその運用上の複雑さを正当化します。
判定: セルフホスティング、またはハイブリッド。クラウドコストが月$75Kに達するまでに運用可能になるよう、1日3,000万トークンでGPU調達の計画を始めましょう。
大規模:1日1億トークン以上(月約30億)
クラウドAPI: 月$180K以上。
セルフホスティング: 4〜8×H100クラスター($6〜12K)+ MLOps 1.0 FTE($10K)+ 専用インフラ($2K)——月$18〜24K。
セルフホスティングの優位は80%以上に拡大します。この規模では、おそらくすでに専任のインフラチームを持っています——TCO計算には減価償却、データセンタースペース、ネットワーク帯域幅、冗長性を含めるべきです。
判定: セルフホスティングが明確な経済的勝者です。しかしこの規模では、セルフホスティングとクラウドのどちらかを選ぶのではありません——セルフホスティングがベースラインを処理し、クラウドがオーバーフローとフロンティアモデルアクセスを提供するハイブリッドアーキテクチャを運用しているのです。
ハイブリッドの行
日常トラフィックの70%——セルフホスティングまたは安価なAPI(DeepSeek V3.2、入力$0.27/M)。複雑なトラフィックの30%——クラウドフロンティアモデル(Claude Sonnet 4、GPT-5.5)。1日5,000万トークンでのハイブリッド合計:月約$32K vs 純クラウド月$90K——最高のモデルへのアクセスを維持しながら64%の節約。
各階層に適切なモデルを選ぶには最新の価格データが必要です。私たちの2026 LLM API価格比較は、タスクタイプ別のコストと能力で主要モデルすべてをランク付けしています——ルーティングの判断が先四半期ではなく今月の価格を反映するように。
ハイブリッドアーキテクチャ:「両方の長所」が実際にどう見えるか
このセクションでは、各ハイブリッドパターンのアーキテクチャ概要とコスト根拠を説明します。ルーティングコード、インフラ連携、PII分類器アーキテクチャを含む完全なPython実装は、S10:ハイブリッドLLMアーキテクチャ——実装ガイドをご覧ください。
パターン1:階層化モデルルーティング
すべてのトラフィックは統合APIゲートウェイを通過します。軽量分類器が複雑さを判定します。単純なタスク(分類、抽出、簡単なQ&A)は安価なモデルへ——セルフホスティングのQwen3-8BまたはAPI経由のDeepSeek V3.2。中程度のタスクはミッドティアのクラウドモデルへ。複雑なタスク——多段階推論、エージェント型コーディング、機密性の高い顧客インタラクション——はフロンティアクラウドモデルへ。
重要なインフラ:1つのベースURL、1つのAPIキー、ゲートウェイ層のルーティングロジック。アプリケーションコードは、リクエストが最終的にどこで実行されるかを知る必要も気にする必要もありません。実装はマルチモデルアーキテクチャガイドをご覧ください。
パターン2:セルフホスティングベースライン+クラウドオーバーフロー
セルフホスティングの推論がベースライン負荷を処理します——予測可能で安定した状態のトラフィック。そうでなければクラウドマークアップを払うことになるものです。需要がキャパシティを超えて急増すると、オーバーフローは自動的にクラウドAPIエンドポイントにルーティングされます。セルフホスティングスタックは高いutilizationを維持します。クラウドは過剰プロビジョニングなしに弾力性を提供します。重要なインフラ部品:ゲートウェイでのキューの深さモニタリングと、セルフホスティングのレイテンシがしきい値を超えたときにクラウドルーティングを起動するオートスケールトリガー。
パターン3:ローカル機密+クラウド一般
PII、PHI、またはその他の規制データ——セルフホスティングの推論。データは決してネットワークの外に出ません。コンプライアンスチェックリストはグリーンのまま。一般的なクエリ、公開データ、非機密ワークロード——最新のフロンティアモデルへのアクセスのためクラウドAPI。同じアプリケーション。同じコードベース。同じAPI形式。ルーティングルールだけが異なります——PII分類器がリクエストにタグ付けし、ゲートウェイがそれに応じてルーティングします。
反論と正直な限界
「オープンウェイトモデルは差を縮めている——すぐにクラウドAPIに金を払う理由はなくなる」
広範なベンチマークでは、その通りです:DeepSeek V3.2はMMLUでGPT-4oを5ポイント未満差で追っています。特定のハイステークスタスク——複雑な多段階エージェント型コーディング(SWE-bench verified)、フロンティアレベルの推論(GPQA Diamond)、マルチモーダルビデオ理解——では、プロプライエタリモデルが依然として8〜15ポイントリードしています。あなたの製品の競争差別化がこうしたフロンティア能力に依存するなら、純粋なセルフホスティングはまだ現実的ではありません。また:オープンウェイトモデルではマルチモーダル(ビデオ、オーディオ)能力は依然として大幅に弱いです。タスクカテゴリ別の能力差——単なる総合ベンチマークスコアではなく——を並べて見るには、サポートされる全モデルの現在の価格と能力タグを持つTokSpanモデルディレクトリをご覧ください。
「vLLMとOllamaはセルフホスティングを簡単にする」
それらはモデルを実行することを簡単にします——数日の設定から数分へ。モデルを実行することは、本番サービスを運用することではありません。複数GPUにわたるオートスケーリング、モデル更新中のグレースフルデグラデーション、フェアキューイング付きマルチモデルサービス、可観測性統合、A/Bテストインフラ——vLLMとOllamaはこれらを解決しません。最高のツーリングがあっても、本番対応には依然として0.3〜0.5 FTEが必要です。
「当チームはデータ主権が必要です——セルフホスティングが唯一の選択肢です」
コンプライアンス要件がデータがネットワークを離れないことを義務付けるなら、機密ワークロードのセルフホスティングの推論は交渉の余地がありません。しかしそれは100%セルフホスティングを意味しません。ハイブリッドパターン3——機密データはローカル、それ以外はすべてクラウド——は最も厳格なコンプライアンス要件を満たしながらフロンティアモデルアクセスを維持します。
FAQ
どのボリュームでセルフホスティングが安くなりますか?
クロスオーバーは、ほとんどのシナリオで1日約5,000万トークン(月15億)あたりに位置します。1,000万〜5,000万の間では、答えはutilization率、エンジニアリング能力、ワークロード特性に依存します。1,000万未満では、クラウドAPIがほぼ常に経済的です。最も実用的なアドバイス:クラウドで運用し、すべてを計測し、3か月分の実使用データを集め、それから自分の損益分岐点をモデル化しましょう。予測ボリュームでセルフホストせず、計測ボリュームでセルフホストしましょう。
セルフホスティングの代わりに安いモデルを単に使えますか?
DeepSeek V3.2の入力$0.27/Mは、セルフホスティングのトークンあたり限界コストに近づきます。多くのシナリオでは、安価なクラウドモデルでの階層化ルーティングが、セルフホスティングのコスト削減の大部分を、運用オーバーヘッドなしに達成します。セルフホスティングを検討する前に、各複雑度階層に適切なモデルを使うルーティング最適化を使い切りましょう。それはインフラ変更ゼロで50〜70%のコスト削減を実現します。定期的に更新される最安のLLM APIプロバイダーランキングは、入力100万トークンあたり$0.15未満の価格を提供するモデルを毎月追跡しています——下位階層にモデルを割り当てる際のクイックリファレンスです。
セルフホスティングモデルはどのくらいの頻度でアップグレードが必要ですか?
主要なオープンウェイトモデルファミリー(Llama、Qwen、DeepSeek、Gemma)は4〜6か月ごとに重要な新バージョンをリリースします。各アップグレードには評価、プロンプト再最適化、A/Bテスト、本番ロールアウトに2〜6週間必要です。これはたまの中断ではありません——チームのキャパシティ計画に組み込むべき継続的なエンジニアリングコミットメントです。
ハイブリッドアーキテクチャはシンプルですか、それとも単に複雑さを増すだけですか?
ハイブリッドはルーティングロジックとマルチ環境管理を導入します——実際の追加の複雑さです。しかし統合APIプラットフォームをゲートウェイとして使えば、ルーティングの複雑さのほとんどはインフラ層で吸収されます。アプリケーションコードは1つのエンドポイントを見ます。ゲートウェイが発行するスパン(可観測性ガイドをご覧ください)は、セルフホストとクラウドのすべてのエンドポイントを1つのダッシュボードに表示します。ハイブリッドの運用上の利点は、全か無かの決定を強いられないことです。まずクラウドのみで開始。データが裏付ける特定の階層にセルフホスティングを追加します。
TokSpanやOpenRouterを使うのと、直接接続するのとではどう違いますか?
API集約プラットフォームは、直接小売APIレートより15〜35%低い卸売価格を提供します——クラウドAPIユーザーにとって最初の、そして最も簡単なコストレバーです。また、単一エンドポイントを通じて、階層化ルーティング、一元化された可観測性、プロバイダー間の統一請求も提供します。コスト削減のためにセルフホスティングを検討しているなら、まず集約プラットフォームの価格を試しましょう。節約が十分なら、インフラ変更ゼロでクラウドに留まれるかもしれません。これらの節約を生む階層化ルーティングロジックはカスタムルーティングドキュメントで説明されています——単一APIエンドポイントからのルールベースルーティング、セマンティックルーティング、自動モデルフォールバック。
「セルフホスト vs クラウド」は哲学ではなく数学の問題です。数学は言います:クラウドは1日1,000万トークン未満で勝ち、ハイブリッドは1,000万〜1億で勝ち、セルフホスティングの優位は1億超で決定的になります——しかしその場合でも、フロンティアモデルアクセスのためのクラウドオーバーフローを伴うハイブリッドが、ほとんどのチームにとって実用的な勝者です。
クラウドから始めましょう。すべてを計測しましょう。実データを集めましょう。損益分岐点をモデル化しましょう。GPU予約は待つことができます。コスト最適化——階層化ルーティング、プロンプトキャッシュ、バッチAPI利用——は待てません。
TokSpanの価格があなたの規模での直接プロバイダーレートやセルフホスティングコストとどう比較されるか知りたいですか? TokSpanの価格を探索——卸売レートが直接小売より15〜35%低い、200以上のモデルへの統合APIアクセス。