Cheap LLM APIFree AI APIAPI Cost Comparison

2026年 最安LLM APIプロバイダー:$0.10/Mから

約1分

$0.14。100万トークンあたり。それが今のAIの本番コストです。誤字ではありません。トライアル枠でもありません。

しかし、あなたはおそらく$30払っています。100万トークンあたり。GPT-5.5に。レスポンス1件あたり3セント。1日1,000レスポンス:$30。1か月:$900。ローンチする前から。推論トークンが静かに請求額をさらに2–5x膨らませているのに気づく前に。

やめてください。そんなふうに生きる必要はありません。

2026年には、OpenAIの価格の40分の1で、実世界のタスクの85%で同等の品質を実現するモデルが存在します。ギャップは能力ではなく——認識にあります。

この記事は全体像を描きます:実際の品質ベンチマークでランキングした最安15モデル、「安い」APIを高くつく失敗に変える隠れ料金、実際に本番機能を構築できる無料枠、そして1行のコードも変えずにゼロからスケールする道筋です。

2026年 最安LLM API:ランキング(2026年7月時点)

品質の下限がなければ「安い」は無意味です。このランキングの全モデルは、許容品質を提供する検証済みユースケースを持っています。安いが使い物にならないモデルは載せていません。

超低価格層(100万トークンあたり$0.01–$0.15)

一貫した有用な出力を生む最安のモデル群。分類、抽出、簡単なQ&A、定型生成を確実に処理します。複雑な推論向けではありません。

モデルInput $/MOutput $/MContext品質下限最適な用途
GLM-4.7 FlashFreeFree128KGPT-4o-miniの約85%プロトタイピング、簡単なチャットボット
GLM-4-9B$0.01$0.0132K基本的なテキスト処理超低コスト分類
Qwen3-8B$0.01$0.0132K基本的なテキストとコード最小コストの抽出
GPT-4.1 Nano$0.10$0.401M確かな推論能力長文コンテキストの低コストタスク
Llama 4 Scout$0.11$0.3410Mその価格帯では良好超長文コンテキスト (10M)
DeepSeek V4 Flash$0.14$0.281M92% HumanEvalテキスト生成、分類、簡単なコーディング

DeepSeek V4 Flashがこの層の基準です。 HumanEval 92%——GPT-4oのコーディングベンチマークに0.5ポイント差——は「この価格にしては良い」ではありません。単純に良いのです。入力$0.14・出力$0.28(DeepSeek公式価格)で、$1で出力トークン350万個を処理できます。生成テキスト約2,600ページ分。これをGPT-5.5でやると:同じ出力が$105になります。

GLM-4.7 Flashは特筆に値します:128KコンテキストとOpenAI互換APIで完全無料。クレジットカード不要、トライアル期限なし、利用上限なし(フェアユースの範囲内)。プロトタイプ、個人プロジェクト、学習には、他に何かを払う理由がありません。注意点:ドキュメントが中国語優先、中国のビジネス時間帯にAPIが不安定になることがある、データ利用ポリシーが不明瞭。機密データは送らないでください。

低価格層(100万トークンあたり$0.15–$0.50)

特定タスクでフロンティアに近い品質を、「全部GPT-5.5で」が月$500の失敗になる価格で実現するモデル群。

モデルInput $/MOutput $/MSWE-bench最適な用途
DeepSeek V4 Pro$0.435$0.87~85%主要なコーディングモデル、一般的な推論
Qwen3-32B$0.18$0.28~75%多言語(日本語、韓国語、アラビア語)
GPT-5.4 Nano$0.20$1.25OpenAIエコシステム、中程度の品質
Llama 3.3 70B$0.10$0.40セルフホスティング、プライバシー重視

DeepSeek V4 Proは、存在する中で最良のコスパを誇るコーディングモデルです。 出力$0.87/M・SWE-bench約85%で、実際のタスクの約85%では区別できないコーディング品質を、Claude Opus 4.8の29分の1のコストで提供します。差が出るのは複雑なアーキテクチャ決定とコーナーケースのデバッグ——「CSVファイルをパースする関数を書いて」ではありません。

Qwen3-32Bは$0.18/$0.28で、多言語アプリケーションに最良のコスパ。C-Eval(中国語)、日本語、韓国語、アラビア語のベンチマークでGPT-5.5を上回ります。ユーザーベースが主に非英語なら、価格に関係なくこれが最良のモデルでしょう。

価値層(100万トークンあたり$0.50–$1.50)

18か月前は$15–30/Mのモデルに限られていた能力閾値「SWE-bench 80%+クラブ」を突破した、フロンティアに近いモデル群。

モデルInput $/MOutput $/MSWE-benchContext
MiniMax M3$0.60$2.4080.5%1M
Qwen3.7 Max$1.25$3.7580.4%1M
Kimi K2.6$0.95$4.0080.2%256K
GLM-5$1.00$3.20200K
Mistral Large 3$0.50$1.50262K

MiniMax M3はSWE-bench 80%+クラブ最安のモデル——出力$2.40/M——で、1ドルあたりのコーディング価値が全モデル最高(1ドルあたりSWE-bench 0.034ポイント;GPT-5.5は0.003)。コーディング品質の保証が必要だが、出力$25–50/Mを正当化できないチームには、このモデルです。

請求額を膨らませる隠れコスト

表示価格は嘘をつきます。価格ページが見せないものを以下に示します。

推論トークンは見えず、高価です。 GPT-5.5やClaude Opusが応答前に「考える」とき、その内部の思考連鎖トークンは出力レートで課金されます。応答には見えません——しかし支払います。500の可視出力トークンを生むリクエストが、裏で1,500の推論トークンを消費しているかもしれません。あなたの実効$30/Mは、そのリクエストでは$120/Mになります。OpenAIは最近これを追跡するreasoning_tokensフィールドを追加しました。監視してください。

プロンプトの長さの肥大は静かです。 「単純な分類」プロンプトは、例2つで200トークンから始まります。6か月後、例を5つ追加し、詳細な出力形式仕様を加え、「あなたは親切なアシスタントです」という前置きを付けました。プロンプトは今2,500トークン。リクエストあたり12.5倍支払っています——そしてコスト増が段階的だったため気づきませんでした。四半期ごとにプロンプトの長さを監査しましょう。

「無料枠の罠」には牙があります。 Googleの無料Gemini枠は学習にあなたのデータを使う場合があります。DeepSeekのプライバシーポリシーはデータ利用について曖昧。多くの無料枠は低量子化版のモデルを提供します(有料より明らかに品質が悪い)。そして無料枠のレート制限(15–30 RPM)は最悪のタイミングで本番アプリを壊します。無料枠はプロトタイプ用です。実ユーザーができた瞬間、有料に切り替えましょう。

レート制限の無駄が15–20%のオーバーヘッドを加えます。 429で固定1秒間隔のリトライをするなら、より多くの429を保証する群集雪崩を作っています。指数バックオフ+ジッターが修正策です——Pythonではtenacity、Node.jsではllm-retry-kit。しかしより大きな修正策は予測的スロットリング:x-ratelimit-remaining-*ヘッダーを読んで、制限に当たる前に減速すること。完全なレート制限実装は、本番レート制限処理ガイドをご覧ください。

前後データ付きの全12戦略コスト最適化プレイブックは、API支出削減ガイドをご覧ください。

無料LLM API:$0で実際に何を作れるか

2026年には、業界史上最多の真に無料で永久利用可能なLLM APIがあります。実際に使えるものと、それぞれが処理できることを示します。

プロバイダーモデルLimit最適な用途データ学習は?
Google AI StudioGemini 2.5 Flash1,500 req/dayプロトタイピング、長文コンテキスト、マルチモーダルはい(無料枠)
GroqLlama 3.3 70B, Qwen3 32B30 RPM / 14,400 RPDリアルタイムチャット(300–500 tok/s)いいえ
CerebrasLlama 3.3 70B, Qwen3 235B30 RPM / 1M tok/dayバッチ処理(2,500+ tok/s)いいえ
OpenRouter35+ free models20 RPM / 200 RPDモデル実験モデルによる
Z.AI (Zhipu)GLM-4.7 Flash~1,000 RPD簡単なタスクの無料本番運用不明瞭
GitHub ModelsGPT-4o, Claude 3.5 Sonnet, 45+10–15 RPM / 50–150 RPDフロンティアモデルに無料アクセスいいえ

GitHub Modelsは2026年7月30日に廃止されます。 使っているなら、それまでに移行してください。OpenRouterの無料枠か低コストの集約プラットフォームが、同等のモデルアクセスを持つ最も簡単な代替です。

実際に作れるもの:1日約200件の会話を処理するカスタマーサポートチャットボット(Gemini Flash無料枠)。小規模チームのPRをレビューするコードレビューボット(Groq無料枠、Llama 3.3 70B)。個人用ライティングアシスタント(Cerebras無料枠)。1日約500件の文書を処理する自動データ抽出パイプライン(GLM-4.7 Flash)。

作れないもの:SLAのあるもの。学習オプトアウトが必要な機密ユーザーデータを処理するもの。50の並列リクエストを超えてスパイクするもの。無料枠は検証——「この製品を本当に誰か欲しがっているか」——に優れています。本番向けではありません。

$0から有料への橋。 無料プロトタイプから有料本番へ切り替える摩擦は、通常、新アカウント作成、支払い方法追加、APIエンドポイント変更を伴います。集約プラットフォームはこの摩擦を取り除きます:無料枠モデルでプロトタイプし、準備ができたら$5–20をプリペイド残高に追加し、同じエンドポイント、同じSDKコード、同じモデル名を維持。移行ゼロ。これは「アイデアがある」から「本番アプリがある」への最速の道であり、始めるのにランチ代未満です。

安いAPIが失敗するとき:品質の境界

安いモデルには実際の限界があります。どこで失敗するかを知ることは、どこで成功するかを知ることより重要です。

安いモデルが苦手なタスク:3つ以上の制約を同時に保持する複雑な多段階推論(例:「この契約を分析し、カリフォルニア州法と抵触する条項を特定し、代替文言を起草してください」)。特定の声やトーンを持つ繊細な創作。変更のアーキテクチャ的影響を理解するコードレビュー(「この行が正しいか」だけではない)。

スマートなエスカレーションパターン。 リクエストの80%を安いモデルにルーティング(DeepSeek V4 Flash、$0.14/$0.28)。より多くの能力が必要な15%は中級モデルへエスカレーション(DeepSeek V4 Pro、$0.44/$0.87、またはClaude Sonnet、$3/$15)。最大の深さが必要な5%はフロンティアモデルへ(Claude Opus、$5/$25、またはGPT-5.5、$5/$30)。加重平均コスト:出力約$0.55/M——オールフロンティアより98%安い。品質:どのモデルが処理したか区別できないエンドユーザーには同一。コード付きの完全なルーティング実装は、カスタムルーティング設定をご覧ください。

安いモデルを規模で実用的にするもの。 帳簿上$0.14/Mのモデルでも、使うにはアカウント、支払い方法、レート制限ダッシュボードが必要です。5つ積み重ねれば、5つのプロバイダー関係の管理に戻ります——プロバイダーごとのオーバーヘッドが節約を食い潰します。集約プラットフォームは単一プリペイド残高にアクセスを集約してこれを解決します:$10を一度預け、この記事の全モデルを同じエンドポイントからルーティング。数千ユーザーにわたるボリュームプーリングにより、実効トークン価格は公式小売価格を下回り、通常10–20%。実際の結果:DeepSeek Flashを実効入力$0.10/Mで、Claude Opusを出力$22/Mで、1つのアカウント、1つの請求書で使えます。安いが本当に安くなるのはこのときです。

FAQ

DeepSeek V4 Flashは本当にGPT-4o並みですか?

コーディングベンチマーク:HumanEval 92% vs 92.5%(GPT-4o)。汎用推論:MMLU 85.5% vs 88.7%(GPT-4o)。テキストタスクの90%——分類、抽出、要約、簡単なコーディング——では、機能的に同等です。ビジョン、マルチモーダル、複雑な多段階推論では:いいえ。差は測定可能ですが、本番ワークロードの大半には無関係です。詳細なベンチマークデータは完全な4者比較をご覧ください。

クレジットカード不要で絶対最安のLLM APIは?

Zhipu AIのGLM-4.7 Flash——完全無料、128Kコンテキスト、OpenAI互換エンドポイント。Google Gemini Flash——無料枠、1日1,500リクエスト、クレジットカード不要。有料なら:DeepSeek V4 Flashの$0.14/$0.28(100万トークンあたり)、代替支払いを受け付ける集約プラットフォーム経由でクレジットカード不要で利用可能。

中国製AI APIは本番に使えますか?

DeepSeekとQwenは有料プランで99.5%以上の稼働率を維持しています。国際開発者にとっての主な摩擦は、中国語のドキュメント、直接登録に必要な中国の電話番号、英語コミュニティサポートの少なさ。集約プラットフォームは3つすべてを解決します:英語ドキュメント、電話番号不要、あなたの言語のコミュニティサポート。接続後は、APIの信頼性は欧米プロバイダーと同等です。

安いAPIは私のデータで学習しますか?

場合によります。Googleの無料枠は学習にデータを使う場合があります(明示しています)。DeepSeekのポリシーは曖昧——利用規約はAPIデータが学習に使われるかを明確に述べていません。Zhipu(GLM)も同様に不明瞭。有料プランは一般的に学習オプトアウトを提供します。エンタープライズプランは契約上の保証があります。機密データを扱うなら、明確なデータ利用規約を持つプロバイダーか、契約上のデータ処理契約を提供する集約プラットフォームを使いましょう。

$0から始めて本番にスケールするには?

無料枠(Google AI Studio、Groq、GLM-4.7 Flash)で構築・検証します。より多くのスループットが必要になったら、集約プラットフォームのプリペイド残高に$5追加します。コードは変わりません——同じエンドポイント、同じSDK、同じモデル名。高いレート制限、有料品質(非量子化モデル)、必要なときのプレミアムモデルアクセスを得られるだけです。「無料プロトタイプ」から「有料本番」への移行は60秒、コード変更ゼロ。詳細な設定はクイックスタートガイドをご覧ください。

あなたの具体的な次の一歩はこれです。直近1,000件のAPI呼び出しを監査してください。出力100万トークンあたり$5超のモデルに送った件数を数えます。その中の分類、抽出、簡単なQ&Aをすべて、出力$0.28/MのDeepSeek V4 Flashへ再ルーティング。コーディングと推論の呼び出しをすべて、$0.87のDeepSeek V4 Proへ。フロンティアモデルは、本当に必要な5%——複雑なデバッグ、法務分析、多段階エージェント——のために待機させておきます。今週中に再ルーティングしてください。請求額は80~90%下がり、ユーザーは違いに気づかず、もう価格記事を読む必要もありません。

ルーティング変更は10分でできます。1分にしたいなら——価格表の全モデルが同じエンドポイント、プロバイダーごとの登録なし、単一プリペイド残高——TokSpanの集約エンドポイントなら、モデル文字列を変えるだけでDeepSeek V4 FlashとClaude Opusを切り替えられます。無料枠はプロトタイプをカバー。有料は$5から。