LLM API PricingAI Model ComparisonAPI Cost Optimization

2026年 LLM API 価格比較:コスト・速度・性能で全モデルをランキング

約1分

出力トークン100万個のコストは、DeepSeek-V3で$0.15、GPT-5.5で$30、o1-Proで$45です。実に300倍の価格差——しかも、本番ワークロードの多くでは、これらのモデルが生み出す結果に差はほとんどありません。間違ったモデルを選んだまま見直さなければ、あなたのAPI請求額が今まさにその代償を語っています。

この差は現実であり、拡大しています。この18か月、推論能力の拡張とともにフロンティアモデルの価格は上昇する一方、DeepSeek・Gemini Flash・Llama 4といった高効率モデルの波が下限をほぼゼロまで押し下げました。結果として、似たようなワークロードを動かす2つのチームが、月$300か月$9,000かを支払い、しかも安い方が応答が速く、より良いユーザー体験を提供している——そんな市場になっています。

この差を埋めるのに、インフラの全面刷新は不要です。あるチームは「こんにちは」や「ありがとう」を推論モデルではなく軽量な分類器にルーティングし、月$9,700の請求を$7,500削減——78%減——しかもレイテンシは改善しました。別のチームは反復的なシステムプロンプトにプロンプトキャッシュを有効化し、コード変更なしで入力トークンコストを50%削減。本番環境の集計データによれば、体系的なモデル階層ルーティングとキャッシュを組み合わせれば、通常LLM API支出の60〜80%を取り戻せます。

この記事で得られるもの:2026年7月時点で重要な全モデルを網羅した4層の価格表、支払いに対して実際に価値をもたらすモデルを示す「1ドルあたりの品質」ランキング、3つの読者別おすすめ(型通りの予算階層ではありません)、そして「どのモデルを何に使うか」を一文で答えられる判断フレームワークです。

2026年 LLM API 完全価格表

2026年半ば時点で、主要API経由で利用できるモデルは180以上。その大半を使うことはないでしょう。重要なのは価格の構造を理解すること——すべての数字を暗記することではありません。モデルは能力とコストに基づいて4つの層に分類できます。それぞれの要点は以下のとおりです。

層1:フロンティアモデル(100万トークンあたり$2〜$30)

これらは旗艦モデルです。最大の推論深度が求められるタスクで使います:複雑なデバッグ、マルチステップのエージェントワークフロー、幻覚のコストがAPI呼び出しより高い法務文書分析など。

モデルプロバイダーInput ($/1M tok)Output ($/1M tok)Context WindowSWE-bench Verified
GPT-5.5OpenAI$5.00$30.001M88.7%
GPT-5.5 ProOpenAI$30.00$180.00
Claude Opus 4.8Anthropic$5.00$25.001M88.6%
Claude Sonnet 4.6Anthropic$3.00$15.001M~85%
Gemini 3.1 ProGoogle$2.00 ($4 >200K)$12.00 ($18 >200K)1M (2M preview)80.6%

GPT-5.5とClaude Opus 4.8はSWE-bench Verifiedのリーダーボードで統計的に同率トップです。実際には、決め手となるのは能力ではなくエコシステムです。GPT-5.5は最大のプラグイン・SDKエコシステムを持ちます。Claude Opusは最強のネイティブツール使用プロトコルと拡張思考を備えます。Gemini 3.1 Proはこの層のコスパ重視の選択肢:出力価格がGPT-5.5の2.5分の1、最良の無料枠(Google AI Studio経由で1日1,500リクエスト)、そして動画・音声・画像を1回のAPI呼び出しで処理するネイティブマルチモーダル対応を唯一持つモデルです。

GPT-5.5 Proの$30/$180(100万トークンあたり)は、最大の推論深度が必須のワークロード向けです:創薬シミュレーション、安全重視システムの形式検証、フロンティア研究など。99.7%のユースケースでは、基本のGPT-5.5が正しい選択です。

層2:バリューフロンティア(100万トークンあたり$0.50〜$2)

ここが2026年の価格性能革命が起きた場所です。この層のモデルはSWE-bench Verifiedで80%以上——18か月前のフロンティアモデルに匹敵——を、5〜20倍安いコストで達成します。

モデルプロバイダーInput ($/1M tok)Output ($/1M tok)ContextSWE-bench
DeepSeek V4 ProDeepSeek$0.435$0.871M~85%
Qwen3.7 MaxAlibaba$1.25$3.751M80.4%
MiniMax M3MiniMax$0.60$2.401M80.5%
Kimi K2.6Moonshot$0.95$4.00256K80.2%
GLM-5.2Z.AI$1.40$4.401M
Mistral Large 3Mistral$0.50$1.50262K

この層で際立っているのはMiniMax M3:SWE-bench 1ポイントあたり$0.03——市場のどのモデルよりも1ドルあたりのコーディング能力が高い。DeepSeek V4 Proは総合的なコスパ王者:出力コストがGPT-5.5の34分の1でありながら、実世界のタスクの約85%ではフロンティアモデルと区別がつかないコーディング品質を提供します。

Mistral Large 3はEUのチームにとって特に言及に値するモデルです:GDPR準拠、EUホスティング、無料枠あり、そしてこの層で明確なデータ居住性を備えた唯一のモデルです。

層3:低価格ワークホース(100万トークンあたり$0.10〜$0.50)

大量・コスト重視で、絶対的なフロンティア能力が不要なワークロード向け:

モデルプロバイダーInput ($/1M tok)Output ($/1M tok)Context最適な用途
DeepSeek V4 FlashDeepSeek$0.14$0.281Mテキスト生成、分類、簡単なコーディング
GPT-5.4 NanoOpenAI$0.20$1.25128KOpenAIエコシステム、中程度の品質ニーズ
GPT-4.1 NanoOpenAI$0.10$0.401M長文コンテキスト、OpenAI最安価格
Gemini 3.1 FlashGoogle$0.50$3.001Mマルチモーダル大量処理
Qwen3-32BAlibaba$0.18$0.2832K多言語対応(アラビア語、日本語、韓国語)
Llama 4 ScoutMeta (hosted)$0.11$0.3410Mこの層で最長のコンテキストウィンドウ

$0.14/$0.28のDeepSeek V4 Flashがこの層のアンカーです。 HumanEval(コーディング)で92%——GPT-4oよりわずか0.5ポイント低い——を、出力価格が40分の1で達成。テキスト分類、要約、簡単なQ&A、定型的なコード生成では、これより高いものを使う理由はありません。

層4:永久無料モデル

これらはトライアルではありません。永久的に無料——ただし、その上に構築する前に理解すべきレート制限と注意点があります。

モデルプロバイダーレート制限Context注意点
GLM-4.7 FlashZ.AI~1,000 req/day128K完全無料、中国語優先のドキュメント
Gemini 2.5 FlashGoogle1,500 req/day1Mデータが学習に使用される可能性あり(無料枠)
Groq の無料モデルGroq30 RPM / 14,400 RPDVarious最速の推論(300–500 tok/s)
Cerebras freeCerebras30 RPM / 1M tok/dayVarious最速のバッチスループット(2,500+ tok/s)
OpenRouter freeOpenRouter20 RPM / 200 RPDVarious35以上の無料モデル、単一キー

無料枠はプロトタイプと個人ツール向けです。信頼性・SLA・データプライバシー保証が必要になった瞬間に、有料プラン——あるいは、APIエンドポイントを変えずに無料のプロトタイプから有料の本番運用へスケールできる集約プラットフォーム——に切り替えましょう。

無料枠の能力の完全な内訳($0で実際に何を作れるか)は、このシリーズ第3弾「最安LLM APIプロバイダーガイド」をご覧ください。

300倍の価格差

この表で最安のモデルは入力100万トークンあたり$0.10(GPT-4.1 Nano)。最高は$30(GPT-5.5 Pro)——入力だけで300倍の開きです。出力ではさらに広がります:$0.01/M(絶対下限のQwen3-8B、GLM-4-9B)から$180/M(GPT-5.5 Pro)まで——最安と最高の出力トークンでは最大18,000倍の差です。

この差を生むものは3つ:モデル能力(推論深度、コーディング精度、マルチモーダル対応)、推論コスト(大きなモデルはより多くのGPU時間が必要)、そして市場での位置づけ(OpenAIとAnthropicはエコシステムの堀——すべてのチュートリアル、SDK、ツールが最初に彼らをサポートする——によりプレミアム価格を設定しています)。

実際に問うべきは「どのモデルが最安か」ではなく、「どのモデルが自分のタスクに十分か、そして必要のない能力にいくら多く払っているか」です。

プロンプトキャッシュは実効価格を劇的に変えます。 Anthropicはキャッシュ済み入力で90%オフ、DeepSeekのキャッシュヒットは$0.0036/M、キャッシュカバレッジ80%なら実効入力コストは約72%下がります。プロバイダー横断のキャッシュ戦略と実装ガイドの全容は、キャッシュ実装ガイドをご覧ください。

どのモデルを誰が使うべきか:読者別

文脈のない「$50/$500/$5,000予算枠」は役に立ちません。あなたが誰か、そして何を使うべきかを示します。

個人開発者

サイドプロジェクト、プロトタイプ、小規模SaaSを開発中。制約:予算(APIに月$20〜50)、時間(開発者はあなただけ)、摩擦(5つのプロバイダーアカウントは作りたくない)。必要なもの:タスクの90%をこなせる安いモデル1台+残り10%用のプレミアムフォールバック1台。

構成:毎日の主力にDeepSeek V4 Flash($0.14/$0.28)。より深い推論が必要な約10%のリクエストは、Claude Sonnet 4.6($3/$15)かGPT-5.4 Mini($0.75/$4.50)にルーティング。想定コスト:出力トークン約200万で月$25〜50。すべて単一の集約エンドポイントで利用可能——個別のプロバイダーアカウントは不要です。

成長経路:サイドプロジェクトが1日10,000リクエストに達したら、無料枠は卒業済みですが企業インフラはまだ不要です。集約プラットフォームなら同じコード、同じエンドポイントのまま、プリペイド残高を増やすだけ。移行不要です。完全なマルチモデルルーティングの設定はマルチモデルルーティングガイドをご覧ください。

スタートアップのCTO

3〜8人のチームを率いています。本番アプリは月50,000〜200,000回のAPI呼び出し。制約:信頼性(ダウンタイムはユーザー喪失)、コスト予測可能性(暴走する請求は資金を枯渇させる)、開発速度(チームがプロバイダーアカウント管理に時間を割くべきではない)。

構成:主要コーディングモデルにDeepSeek V4 Pro($0.44/$0.87)——フロンティアに近い品質でリクエストの70%を処理。複雑なデバッグとPRレビューにClaude Sonnet 4.6($3/$15)。エージェントワークフローにGPT-5.4 Mini($0.75/$4.50)。マルチモーダルタスクにGemini 3 Flash($0.50/$3)。想定コスト:月$400〜$1,200。

モデル選択より重要な2つのアーキテクチャ決定:(1)モデルフォールバックの実装——アプリは1つのプロバイダーがダウンしても「モデル利用不可」をユーザーに返すべきではありません。429や5xxエラーでClaudeからGPT-5.5に切り替える2行のtry/exceptが、「インシデント」と「誰も気づかなかった」の分かれ目です。(2)リクエストごとのコスト上限を設定——月次予算ではなく、リクエスト単位の上限です。暴走するエージェントループは、月次アラートが発火する前に$50分のトークンを燃やし得ます。

集約プラットフォームはフォールバックとコストルーティングをインフラレベルで処理します。チームがプロバイダーダッシュボードの管理に月2時間以上費やしているなら、直接API価格には見えない隠れコストを支払っています。コスト比較の詳細は開発者が集約プラットフォームに切り替える理由をご覧ください。

エンタープライズアーキテクト

50人以上の開発者チーム、または大規模な顧客向け製品のLLMインフラを評価中。制約:コンプライアンス(SOC 2、HIPAA、EU AI法、データ居住性)、ガバナンス(誰がどのモデルをいついくらで使ったか)、ベンダー管理(四半期ごとに5つのプロバイダーと契約交渉はできない)。

構成:モデル構成はワークロード次第——しかしあなたのインフラはモデル選択よりも重要です。エンタープライズ規模では、総コストを決める3つの要素があります:プロンプトキャッシュのヒット率(入力コストを半減するには>60%を目標)、バッチAPIの活用(非リアルタイムのワークロードはすべて50%割引のバッチを使うべき)、マルチモデルルーティングの効率(「全リクエストをGPT-5.5へ」と「スマートルーティング」の差は通常60〜80%のコスト削減)。

LiteLLMのようなゲートウェイをセルフホストすれば、データ居住性、キー管理、監査ログを完全に制御できます——ただしDevOps投資が必要です。マネージド集約プラットフォームは、インフラの手間なしに同じガバナンス層(チーム別予算とモデル許可リスト付き仮想キー、統合監査トレイル、データ居住性オプション)を提供します。

すべてのエンタープライズLLMデプロイに必要なセキュリティ基盤は、APIキー管理ガイドから始めましょう。その上に、業界固有のコンプライアンス要件を重ねます。しかしセキュリティとコンプライアンスはエンタープライズコスト方程式の半分に過ぎません——残りの半分は、チームが方針転換を迫られたときに何が起きるかです。

誰も追跡しない隠れコスト:移行。 モデルを切り替えるたびにプロンプトを再ベンチマークする必要があります。5人のエンジニアチームが移行に2日、$500/日なら、モデル切り替え1回で$5,000が燃えます。ルーティング層の背後で3モデルを運用するチームは、設定値を1つ変えるだけで本番のモデルを切り替え、5%ロールアウトで実トラフィックの結果を測定します。同じ結果、移行コストゼロ。上の価格表はトークンあたりのコストを示しています。しかし表に載っていないのは、単一モデルとマルチモデル構成の本当のコスト差はトークン価格ではなく、変化に対応する組織の摩擦だということです。モデル価格が四半期ごとに変動し、新たな競合が毎月現れる時代、エンジニアリングコストなしでモデルを変更できる能力は、どんなトークン割引よりも価値があります。

1ドルあたりの品質:唯一意味のある価値ランキング(2026年7月時点)

価格なしのベンチマークスコアはマーケティングです。ベンチマークスコアなしの価格は目隠しショッピング——Artificial Analysisのような独立系プラットフォームが主要プロバイダー横断で両方を追跡しています。重要な指標は1ドルあたりに得られる品質です。

SWE-bench Verified 1ドルあたり(コーディング価値)

このランキングは各モデルのSWE-bench Verifiedスコアを出力価格(100万トークンあたり)で割ったものです。高いほど良い——1ドルあたりのコーディング能力が高いことを意味します。

モデルSWE-benchOutput $/M1ドルあたりのスコア
DeepSeek V4 Flash~78%$0.28279
DeepSeek V4 Pro~85%$0.8798
MiniMax M380.5%$2.4034
Qwen3.7 Max80.4%$3.7521
Kimi K2.680.2%$4.0020
Gemini 3.1 Pro80.6%$12.007
Claude Opus 4.888.6%$25.003.5
GPT-5.588.7%$30.003.0

計算式:SWE-bench率 ÷ 100万トークンあたりの出力ドル。高いほど1ドルあたりのコーディング能力が高い。

DeepSeek V4 Flashは1ドルあたり279コーディングポイント——GPT-5.5(3.0)の93倍の価値です。フロンティアに近いDeepSeek V4 Proでさえ、1ドルあたり28倍のコーディング価値。この「低価格」というレッテルは実際の状況を過小評価しています:これらのモデルは、オールフロンティア構成が後から見て無駄に思えるほどの価格で、フロンティアに匹敵するコーディングを提供しています。

意味のある解釈:コーディングタスクにGPT-5.5へ月$1,000使っているなら、DeepSeek V4 Flashに切り替えれば、同程度の品質の出力が月約$11で得られます。DeepSeek V4 Proなら約$30。支払っている金額と支払うべき金額の差は、ほとんどのチームが認識しているよりも大きいのです。

この指標は、素の価格表が見せないものを暴きます。GPT-5.5はSWE-benchで88.7%——この比較で最高。しかしベンチマーク1ポイントあたりのコストはDeepSeek V4 Flashの93倍。月$5,000をコーディングAPIに使うチームにとって、この93倍は$5,000の請求と、同等のベンチマーク性能に対する$54の請求の差です。品質差——SWE-benchで3ポイント——は、コーディングタスク33件あたり約1件の正解増に相当します。それが月$4,946の価値があるかは、技術的決定ではなく経営判断です。数字を計算したほとんどのチームは、実際のワークロードの約5%にしかフロンティアモデルが必要ないと気づきます。

MMLU-Pro 1ドルあたり(汎用推論価値)

モデルMMLU-ProOutput $/M1ドルあたりのスコア
DeepSeek V4 Flash85.5$0.28305
DeepSeek V4 Pro~87$0.87100
Qwen3.7 Max~86$3.7523
Claude Opus 4.8~89$25.003.6
GPT-5.5~89$30.003.0

汎用知識・推論タスクでは、価値の差はコーディングよりさらに広がります。DeepSeek V4 FlashはMMLU-ProでGPT-5.5と3.5ポイント差——推論1ポイントあたりの価格は100分の1です。

バリュースイートスポット

すべてのモデルを散布図にプロットすると——X軸にSWE-benchスコア、Y軸に出力価格——3つのクラスターが見えます:

  • プレミアムコーナー(右上):GPT-5.5とClaude Opus 4.8。最高スコア、最高価格。最適:間違った回答のコストがAPI呼び出しより高いタスク。
  • バリュースイートスポット(上中・遠左):DeepSeek V4 Pro、MiniMax M3、Qwen3.7 Max。$0.87〜3.75でSWE-bench 80%以上。最適:本番ワークロードの90%。
  • 低価格ゾーン(中央・遠左):DeepSeek V4 Flash、GPT-4.1 Nano、Qwen3-32B。ほぼゼロコストで十分な品質。最適:分類、抽出、要約、定型生成。

このグラフで意味をなさないモデル:出力$5/M超でSWE-bench 75%未満のもの。フロンティア価格を払ってフロンティア品質未満を得ています。モデルバージョンを確認してください——6か月前に安くて優れた版に置き換えられた非推奨モデルを動かしているかもしれません。

集約プラットフォームが価値方程式をどう変えるか。 大規模ユーザーベースの集約需要は、単独チームが直接交渉できる水準を下回るトークン価格を実現します——この記事の「1ドルあたりの品質」表を実効化するのと同じ経済原理です。各リクエストを処理可能な最安モデルに送るコストベースルーティングを加えれば、ブレンド構成(トラフィックの70%をDeepSeek V4 Flash、20%をClaude Sonnet、10%をGPT-5.5)はオールフロンティア基準より30〜50%安く運用できます。各リクエストが複雑度に合ったモデルに着地するため、エンドユーザーは品質差を感じません。

クイック判断フレームワーク

コード生成が必要なら——DeepSeek V4 Pro(最良のコスパ)、Claude Opus 4.8(最高品質)。フォールバック:GPT-5.5。

長文文書分析(100Kトークン超)が必要なら——Gemini 3.1 Pro(2Mコンテキスト、長文文書ではトークンあたり最安)。フォールバック:GPT-4.1 Nano(1Mコンテキスト、入力$0.10/M)。

多言語(非英語)が必要なら——Qwen3.7 MaxまたはDeepSeek V4 Pro(どちらもC-Eval、日本語、韓国語、アラビア語のベンチマークでGPT-5.5を上回る)。フォールバック:Claude Opus 4.8。

ビジョン・マルチモーダルが必要なら——Gemini 3.1 Pro(ネイティブな動画+音声+画像)。フォールバック:GPT-5.5。

エージェントワークフロー(ツール呼び出し)が必要なら——GPT-5.5(最も信頼できるfunction calling、最良の並列ツール実行)。フォールバック:Claude Opus 4.8(最良の複雑なマルチステップ推論)。

とにかく最安がいいなら——DeepSeek V4 Flash($0.14/$0.28)。無料:GLM-4.7 Flash(永久無料、128Kコンテキスト)。

グローバルな可用性が必要なら——1つのエンドポイントから全モデルへアクセスを提供する集約プラットフォームを使いましょう。プロバイダーごとの支払い障壁なし、APIキー1本です。

FAQ

2026年で総合最安のモデルは?

DeepSeek V4 Flash、100万トークンあたり入力$0.14・出力$0.28。永久無料なら:GLM-4.7 Flash(クレジットカード不要、128Kコンテキスト、OpenAI互換)。

Claude OpusはDeepSeek V4 Proの5倍の価格に見合いますか?

Anthropicネイティブのプロトコル機能(拡張思考、computer use)や、複雑なデバッグに必要なSWE-bench能力の最後の約3ポイントが必要な場合のみ。コーディングタスクの95%では、DeepSeek V4 Proが出力コスト29分の1で区別できない品質を提供します。詳細な比較はOpenAI vs Anthropic vs Google vs DeepSeek比較をご覧ください。

集約プラットフォームは直接APIより本当に安いですか?

「1ドルあたりの品質」セクションのベンチマークポイントあたりコストのロジックを月次請求書に当てはめれば答えは明らかです。3つのメカニズムが複合します:(1)集約購買力が個別アカウントの条件を下回るトークン価格を実現、(2)プロバイダーダッシュボードに眠る$50〜200の最低入金を止められる、(3)コストベースルーティングがこの記事の階層ロジックを適用——単純なクエリは$0.14/M、複雑な推論は$3/M、フロンティア級の作業だけ$30/Mに。3モデル以上を運用するチームは通常、そのルーティング層のない直接アカウントと比べて総LLM支出が30〜50%減ります。

これらの価格はどのくらいの頻度で変わりますか?

中国系プロバイダー(DeepSeek、Qwen、MiniMax、Kimi、GLM)は2026年上半期だけで6回値下げしました。米国系(OpenAI、Anthropic)は四半期ごと。Googleは2〜3か月ごと。60日以上前の価格データを使っているなら、おそらく払いすぎています。

バッチAPI価格はどうですか?

OpenAI、Anthropic、Googleは非同期バッチ処理(24時間ターンアラウンド)に約50%割引を提供。DeepSeekのバッチ価格はリアルタイムと同じ——割引なし、ただし遅延ペナルティもなし。前後データ付きのコスト最適化戦略は請求削減戦術ガイドで詳しく解説しています。

無料枠APIを本番で使えますか?

いいえ。無料枠は毎分15〜30リクエストに制限され、SLAはなく、一部(Googleの無料枠)は学習にデータを使う可能性があります。プロトタイプと個人プロジェクト用です。本番の準備ができたら、集約プラットフォームならAPIエンドポイントを変えずに無料プロトタイプから有料本番へ切り替えられます。

価格表は、それに基づいて行動して初めて役に立ちます。多くのチームが使うデフォルト構成——全リクエストをGPT-5.5へ——から、スマートルーティング付きの最適化マルチモデル構成に切り替えれば、通常、品質ゼロロスで80%のコスト削減になります。数字はこの記事の中にあります。

次の一手:上の表の層2か層3から1モデル選び、今週中にトラフィックの20%をそこへルーティングしてください。品質を測定します。十分なら——そしてワークロードの85%では十分でしょう——請求額が80%削減されます。これは願望の数字ではありません。「1ドルあたりの品質」セクションの計算そのものです。

価格を定期チェックとして扱うチーム——「モデル価格は来四半期に見よう」——が、6か月間80%も払いすぎていたことに気づくチームです。価格は四半期レビューには速すぎます。毎月1日のカレンダーリマインダーを設定してください。価格表を確認し、ルーティングルールを調整します。5分です。それが$1,000の請求と$200の請求の差——より良いモデルでも、より賢いエンジニアでもなく、ただの定期的なカレンダーイベントです。

上の表の価格データは2026年7月にプロバイダーダッシュボードとAPIレスポンスで検証済みです。同じモデル、同じパラメータでトークンあたりコストを比較し、ご自身のプロンプトで数字を確認してください——TokSpanのプレイグラウンドは、プロバイダーアカウント不要でモデル間の価格を並べて表示します。$5のプリペイド残高で、層2と層3の全モデルをベンチマークするのに十分です。