$0.14。100万トークンあたり。それが今のAIの本番コストです。誤字ではありません。トライアル枠でもありません。
しかし、あなたはおそらく$30払っています。100万トークンあたり。GPT-5.5に。レスポンス1件あたり3セント。1日1,000レスポンス:$30。1か月:$900。ローンチする前から。推論トークンが静かに請求額をさらに2–5x膨らませているのに気づく前に。
やめてください。そんなふうに生きる必要はありません。
2026年には、OpenAIの価格の40分の1で、実世界のタスクの85%で同等の品質を実現するモデルが存在します。ギャップは能力ではなく——認識にあります。
この記事は全体像を描きます:実際の品質ベンチマークでランキングした最安15モデル、「安い」APIを高くつく失敗に変える隠れ料金、実際に本番機能を構築できる無料枠、そして1行のコードも変えずにゼロからスケールする道筋です。
2026年 最安LLM API:ランキング(2026年7月時点)
品質の下限がなければ「安い」は無意味です。このランキングの全モデルは、許容品質を提供する検証済みユースケースを持っています。安いが使い物にならないモデルは載せていません。
超低価格層(100万トークンあたり$0.01–$0.15)
一貫した有用な出力を生む最安のモデル群。分類、抽出、簡単なQ&A、定型生成を確実に処理します。複雑な推論向けではありません。
| モデル | Input $/M | Output $/M | Context | 品質下限 | 最適な用途 |
|---|---|---|---|---|---|
| GLM-4.7 Flash | Free | Free | 128K | GPT-4o-miniの約85% | プロトタイピング、簡単なチャットボット |
| GLM-4-9B | $0.01 | $0.01 | 32K | 基本的なテキスト処理 | 超低コスト分類 |
| Qwen3-8B | $0.01 | $0.01 | 32K | 基本的なテキストとコード | 最小コストの抽出 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1M | 確かな推論能力 | 長文コンテキストの低コストタスク |
| Llama 4 Scout | $0.11 | $0.34 | 10M | その価格帯では良好 | 超長文コンテキスト (10M) |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M | 92% HumanEval | テキスト生成、分類、簡単なコーディング |
DeepSeek V4 Flashがこの層の基準です。 HumanEval 92%——GPT-4oのコーディングベンチマークに0.5ポイント差——は「この価格にしては良い」ではありません。単純に良いのです。入力$0.14・出力$0.28(DeepSeek公式価格)で、$1で出力トークン350万個を処理できます。生成テキスト約2,600ページ分。これをGPT-5.5でやると:同じ出力が$105になります。
GLM-4.7 Flashは特筆に値します:128KコンテキストとOpenAI互換APIで完全無料。クレジットカード不要、トライアル期限なし、利用上限なし(フェアユースの範囲内)。プロトタイプ、個人プロジェクト、学習には、他に何かを払う理由がありません。注意点:ドキュメントが中国語優先、中国のビジネス時間帯にAPIが不安定になることがある、データ利用ポリシーが不明瞭。機密データは送らないでください。
低価格層(100万トークンあたり$0.15–$0.50)
特定タスクでフロンティアに近い品質を、「全部GPT-5.5で」が月$500の失敗になる価格で実現するモデル群。
| モデル | Input $/M | Output $/M | SWE-bench | 最適な用途 |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0.435 | $0.87 | ~85% | 主要なコーディングモデル、一般的な推論 |
| Qwen3-32B | $0.18 | $0.28 | ~75% | 多言語(日本語、韓国語、アラビア語) |
| GPT-5.4 Nano | $0.20 | $1.25 | — | OpenAIエコシステム、中程度の品質 |
| Llama 3.3 70B | $0.10 | $0.40 | — | セルフホスティング、プライバシー重視 |
DeepSeek V4 Proは、存在する中で最良のコスパを誇るコーディングモデルです。 出力$0.87/M・SWE-bench約85%で、実際のタスクの約85%では区別できないコーディング品質を、Claude Opus 4.8の29分の1のコストで提供します。差が出るのは複雑なアーキテクチャ決定とコーナーケースのデバッグ——「CSVファイルをパースする関数を書いて」ではありません。
Qwen3-32Bは$0.18/$0.28で、多言語アプリケーションに最良のコスパ。C-Eval(中国語)、日本語、韓国語、アラビア語のベンチマークでGPT-5.5を上回ります。ユーザーベースが主に非英語なら、価格に関係なくこれが最良のモデルでしょう。
価値層(100万トークンあたり$0.50–$1.50)
18か月前は$15–30/Mのモデルに限られていた能力閾値「SWE-bench 80%+クラブ」を突破した、フロンティアに近いモデル群。
| モデル | Input $/M | Output $/M | SWE-bench | Context |
|---|---|---|---|---|
| MiniMax M3 | $0.60 | $2.40 | 80.5% | 1M |
| Qwen3.7 Max | $1.25 | $3.75 | 80.4% | 1M |
| Kimi K2.6 | $0.95 | $4.00 | 80.2% | 256K |
| GLM-5 | $1.00 | $3.20 | — | 200K |
| Mistral Large 3 | $0.50 | $1.50 | — | 262K |
MiniMax M3はSWE-bench 80%+クラブ最安のモデル——出力$2.40/M——で、1ドルあたりのコーディング価値が全モデル最高(1ドルあたりSWE-bench 0.034ポイント;GPT-5.5は0.003)。コーディング品質の保証が必要だが、出力$25–50/Mを正当化できないチームには、このモデルです。
請求額を膨らませる隠れコスト
表示価格は嘘をつきます。価格ページが見せないものを以下に示します。
推論トークンは見えず、高価です。 GPT-5.5やClaude Opusが応答前に「考える」とき、その内部の思考連鎖トークンは出力レートで課金されます。応答には見えません——しかし支払います。500の可視出力トークンを生むリクエストが、裏で1,500の推論トークンを消費しているかもしれません。あなたの実効$30/Mは、そのリクエストでは$120/Mになります。OpenAIは最近これを追跡するreasoning_tokensフィールドを追加しました。監視してください。
プロンプトの長さの肥大は静かです。 「単純な分類」プロンプトは、例2つで200トークンから始まります。6か月後、例を5つ追加し、詳細な出力形式仕様を加え、「あなたは親切なアシスタントです」という前置きを付けました。プロンプトは今2,500トークン。リクエストあたり12.5倍支払っています——そしてコスト増が段階的だったため気づきませんでした。四半期ごとにプロンプトの長さを監査しましょう。
「無料枠の罠」には牙があります。 Googleの無料Gemini枠は学習にあなたのデータを使う場合があります。DeepSeekのプライバシーポリシーはデータ利用について曖昧。多くの無料枠は低量子化版のモデルを提供します(有料より明らかに品質が悪い)。そして無料枠のレート制限(15–30 RPM)は最悪のタイミングで本番アプリを壊します。無料枠はプロトタイプ用です。実ユーザーができた瞬間、有料に切り替えましょう。
レート制限の無駄が15–20%のオーバーヘッドを加えます。 429で固定1秒間隔のリトライをするなら、より多くの429を保証する群集雪崩を作っています。指数バックオフ+ジッターが修正策です——Pythonではtenacity、Node.jsではllm-retry-kit。しかしより大きな修正策は予測的スロットリング:x-ratelimit-remaining-*ヘッダーを読んで、制限に当たる前に減速すること。完全なレート制限実装は、本番レート制限処理ガイドをご覧ください。
前後データ付きの全12戦略コスト最適化プレイブックは、API支出削減ガイドをご覧ください。
無料LLM API:$0で実際に何を作れるか
2026年には、業界史上最多の真に無料で永久利用可能なLLM APIがあります。実際に使えるものと、それぞれが処理できることを示します。
| プロバイダー | モデル | Limit | 最適な用途 | データ学習は? |
|---|---|---|---|---|
| Google AI Studio | Gemini 2.5 Flash | 1,500 req/day | プロトタイピング、長文コンテキスト、マルチモーダル | はい(無料枠) |
| Groq | Llama 3.3 70B, Qwen3 32B | 30 RPM / 14,400 RPD | リアルタイムチャット(300–500 tok/s) | いいえ |
| Cerebras | Llama 3.3 70B, Qwen3 235B | 30 RPM / 1M tok/day | バッチ処理(2,500+ tok/s) | いいえ |
| OpenRouter | 35+ free models | 20 RPM / 200 RPD | モデル実験 | モデルによる |
| Z.AI (Zhipu) | GLM-4.7 Flash | ~1,000 RPD | 簡単なタスクの無料本番運用 | 不明瞭 |
| GitHub Models | GPT-4o, Claude 3.5 Sonnet, 45+ | 10–15 RPM / 50–150 RPD | フロンティアモデルに無料アクセス | いいえ |
GitHub Modelsは2026年7月30日に廃止されます。 使っているなら、それまでに移行してください。OpenRouterの無料枠か低コストの集約プラットフォームが、同等のモデルアクセスを持つ最も簡単な代替です。
実際に作れるもの:1日約200件の会話を処理するカスタマーサポートチャットボット(Gemini Flash無料枠)。小規模チームのPRをレビューするコードレビューボット(Groq無料枠、Llama 3.3 70B)。個人用ライティングアシスタント(Cerebras無料枠)。1日約500件の文書を処理する自動データ抽出パイプライン(GLM-4.7 Flash)。
作れないもの:SLAのあるもの。学習オプトアウトが必要な機密ユーザーデータを処理するもの。50の並列リクエストを超えてスパイクするもの。無料枠は検証——「この製品を本当に誰か欲しがっているか」——に優れています。本番向けではありません。
$0から有料への橋。 無料プロトタイプから有料本番へ切り替える摩擦は、通常、新アカウント作成、支払い方法追加、APIエンドポイント変更を伴います。集約プラットフォームはこの摩擦を取り除きます:無料枠モデルでプロトタイプし、準備ができたら$5–20をプリペイド残高に追加し、同じエンドポイント、同じSDKコード、同じモデル名を維持。移行ゼロ。これは「アイデアがある」から「本番アプリがある」への最速の道であり、始めるのにランチ代未満です。
安いAPIが失敗するとき:品質の境界
安いモデルには実際の限界があります。どこで失敗するかを知ることは、どこで成功するかを知ることより重要です。
安いモデルが苦手なタスク:3つ以上の制約を同時に保持する複雑な多段階推論(例:「この契約を分析し、カリフォルニア州法と抵触する条項を特定し、代替文言を起草してください」)。特定の声やトーンを持つ繊細な創作。変更のアーキテクチャ的影響を理解するコードレビュー(「この行が正しいか」だけではない)。
スマートなエスカレーションパターン。 リクエストの80%を安いモデルにルーティング(DeepSeek V4 Flash、$0.14/$0.28)。より多くの能力が必要な15%は中級モデルへエスカレーション(DeepSeek V4 Pro、$0.44/$0.87、またはClaude Sonnet、$3/$15)。最大の深さが必要な5%はフロンティアモデルへ(Claude Opus、$5/$25、またはGPT-5.5、$5/$30)。加重平均コスト:出力約$0.55/M——オールフロンティアより98%安い。品質:どのモデルが処理したか区別できないエンドユーザーには同一。コード付きの完全なルーティング実装は、カスタムルーティング設定をご覧ください。
安いモデルを規模で実用的にするもの。 帳簿上$0.14/Mのモデルでも、使うにはアカウント、支払い方法、レート制限ダッシュボードが必要です。5つ積み重ねれば、5つのプロバイダー関係の管理に戻ります——プロバイダーごとのオーバーヘッドが節約を食い潰します。集約プラットフォームは単一プリペイド残高にアクセスを集約してこれを解決します:$10を一度預け、この記事の全モデルを同じエンドポイントからルーティング。数千ユーザーにわたるボリュームプーリングにより、実効トークン価格は公式小売価格を下回り、通常10–20%。実際の結果:DeepSeek Flashを実効入力$0.10/Mで、Claude Opusを出力$22/Mで、1つのアカウント、1つの請求書で使えます。安いが本当に安くなるのはこのときです。
FAQ
DeepSeek V4 Flashは本当にGPT-4o並みですか?
コーディングベンチマーク:HumanEval 92% vs 92.5%(GPT-4o)。汎用推論:MMLU 85.5% vs 88.7%(GPT-4o)。テキストタスクの90%——分類、抽出、要約、簡単なコーディング——では、機能的に同等です。ビジョン、マルチモーダル、複雑な多段階推論では:いいえ。差は測定可能ですが、本番ワークロードの大半には無関係です。詳細なベンチマークデータは完全な4者比較をご覧ください。
クレジットカード不要で絶対最安のLLM APIは?
Zhipu AIのGLM-4.7 Flash——完全無料、128Kコンテキスト、OpenAI互換エンドポイント。Google Gemini Flash——無料枠、1日1,500リクエスト、クレジットカード不要。有料なら:DeepSeek V4 Flashの$0.14/$0.28(100万トークンあたり)、代替支払いを受け付ける集約プラットフォーム経由でクレジットカード不要で利用可能。
中国製AI APIは本番に使えますか?
DeepSeekとQwenは有料プランで99.5%以上の稼働率を維持しています。国際開発者にとっての主な摩擦は、中国語のドキュメント、直接登録に必要な中国の電話番号、英語コミュニティサポートの少なさ。集約プラットフォームは3つすべてを解決します:英語ドキュメント、電話番号不要、あなたの言語のコミュニティサポート。接続後は、APIの信頼性は欧米プロバイダーと同等です。
安いAPIは私のデータで学習しますか?
場合によります。Googleの無料枠は学習にデータを使う場合があります(明示しています)。DeepSeekのポリシーは曖昧——利用規約はAPIデータが学習に使われるかを明確に述べていません。Zhipu(GLM)も同様に不明瞭。有料プランは一般的に学習オプトアウトを提供します。エンタープライズプランは契約上の保証があります。機密データを扱うなら、明確なデータ利用規約を持つプロバイダーか、契約上のデータ処理契約を提供する集約プラットフォームを使いましょう。
$0から始めて本番にスケールするには?
無料枠(Google AI Studio、Groq、GLM-4.7 Flash)で構築・検証します。より多くのスループットが必要になったら、集約プラットフォームのプリペイド残高に$5追加します。コードは変わりません——同じエンドポイント、同じSDK、同じモデル名。高いレート制限、有料品質(非量子化モデル)、必要なときのプレミアムモデルアクセスを得られるだけです。「無料プロトタイプ」から「有料本番」への移行は60秒、コード変更ゼロ。詳細な設定はクイックスタートガイドをご覧ください。
あなたの具体的な次の一歩はこれです。直近1,000件のAPI呼び出しを監査してください。出力100万トークンあたり$5超のモデルに送った件数を数えます。その中の分類、抽出、簡単なQ&Aをすべて、出力$0.28/MのDeepSeek V4 Flashへ再ルーティング。コーディングと推論の呼び出しをすべて、$0.87のDeepSeek V4 Proへ。フロンティアモデルは、本当に必要な5%——複雑なデバッグ、法務分析、多段階エージェント——のために待機させておきます。今週中に再ルーティングしてください。請求額は80~90%下がり、ユーザーは違いに気づかず、もう価格記事を読む必要もありません。
ルーティング変更は10分でできます。1分にしたいなら——価格表の全モデルが同じエンドポイント、プロバイダーごとの登録なし、単一プリペイド残高——TokSpanの集約エンドポイントなら、モデル文字列を変えるだけでDeepSeek V4 FlashとClaude Opusを切り替えられます。無料枠はプロトタイプをカバー。有料は$5から。