一百萬個輸出 Token 的成本:DeepSeek-V3 只要 $0.15,GPT-5.5 要 $30,o1-Pro 要 $45。這是 300 倍的價差——而對大多數生產環境的工作負載來說,這些模型產生的結果幾乎沒有差別。如果你選錯了模型就一直沒回頭看,你的 API 帳單現在正在訴說這個故事。
這個差距真實存在,而且還在擴大。過去 18 個月,旗艦模型的價格隨推理能力擴張而攀升,同時一波高效率模型——DeepSeek、Gemini Flash、Llama 4——把價格下限壓到幾乎歸零。結果是一個讓兩支跑著類似工作負載的團隊,一個月付 $300、另一個付 $9,000 的市場——而且便宜的往往因為回應更快,反而提供更好的使用者體驗。
拉近這個差距不需要重整基礎設施。一支團隊把「你好」「謝謝」這類訊息改走輕量分類器而非推理模型,就從月費 $9,700 的帳單砍掉 $7,500——降幅 78%——延遲還更好了。另一支團隊在重複的系統提示詞上啟用提示詞快取,一行程式都不用改就省下 50% 的輸入 Token 成本。生產環境的彙總資料顯示:系統化的模型分層路由加上快取,通常能找回 60–80% 的 LLM API 支出。
這篇文章你會帶走的東西:涵蓋 2026 年 7 月所有重要模型的四層價格表、告訴你「花出去的每一塊錢實際買到什麼」的每美元品質排名、三套讀者類型推薦(不是那種籠統的預算分級)、以及用一句話回答「哪個模型該用在哪」的決策框架。
2026 年 LLM API 完整價格表
截至 2026 年中,主要 API 可用的模型超過 180 個。其中大部分你永遠不會用到。重點是理解價格的結構——而不是背下每個數字。模型依能力與成本分為四層。以下是每層你需要知道的。
第 1 層:旗艦模型(每百萬 Token $2–30)
這些是各家的頂級型號。當任務需要最深的推理深度時使用:複雜的除錯、多步驟的 Agent 工作流程、幻覺代價高過 API 呼叫的法律文件分析。
| 模型 | 供應商 | Input ($/1M tok) | Output ($/1M tok) | Context Window | SWE-bench Verified |
|---|---|---|---|---|---|
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 1M | 88.7% |
| GPT-5.5 Pro | OpenAI | $30.00 | $180.00 | — | — |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 1M | 88.6% |
| Claude Sonnet 4.6 | Anthropic | $3.00 | $15.00 | 1M | ~85% |
| Gemini 3.1 Pro | $2.00 ($4 >200K) | $12.00 ($18 >200K) | 1M (2M preview) | 80.6% |
GPT-5.5 和 Claude Opus 4.8 在 SWE-bench Verified 排行榜上統計上並列第一。實際上,決定性因素不是能力,而是生態系。GPT-5.5 有最大的外掛與 SDK 生態系;Claude Opus 有最強的原生工具使用協定與擴展思考;Gemini 3.1 Pro 是這層的 CP 值之選:輸出價格只有 GPT-5.5 的 2.5 分之一,有最好的免費方案(透過 Google AI Studio 每天 1,500 次請求),而且是唯一支援原生多模態的模型——影片、音訊、圖片一次 API 呼叫處理。
GPT-5.5 Pro 的每百萬 Token $30/$180 是為那些「最大推理深度不容妥協」的工作負載存在:藥物發現模擬、安全關鍵系統的形式驗證、前沿研究。對 99.7% 的使用情境,基本款 GPT-5.5 才是正確選擇。
第 2 層:價值前沿(每百萬 Token $0.50–$2)
2026 年的價格效能革命就發生在這裡。這一層的模型在 SWE-bench Verified 拿到 80% 以上——與 18 個月前的旗艦相當——成本卻只要 5–20 分之一。
| 模型 | 供應商 | Input ($/1M tok) | Output ($/1M tok) | Context | SWE-bench |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek | $0.435 | $0.87 | 1M | ~85% |
| Qwen3.7 Max | Alibaba | $1.25 | $3.75 | 1M | 80.4% |
| MiniMax M3 | MiniMax | $0.60 | $2.40 | 1M | 80.5% |
| Kimi K2.6 | Moonshot | $0.95 | $4.00 | 256K | 80.2% |
| GLM-5.2 | Z.AI | $1.40 | $4.40 | 1M | — |
| Mistral Large 3 | Mistral | $0.50 | $1.50 | 262K | — |
這一層的明星是 MiniMax M3:每個 SWE-bench 分數點只要 $0.03——市場上每一塊錢能買到最多程式能力的模型。DeepSeek V4 Pro 是整體價值王:輸出成本只有 GPT-5.5 的 34 分之一,卻能在約 85% 的實際任務中提供與旗艦無異的程式品質。
Mistral Large 3 對 EU 團隊值得特別一提:符合 GDPR、託管於歐盟、有免費方案,而且是這一層唯一有明確資料落地故事的模型。
第 3 層:低價主力(每百萬 Token $0.10–$0.50)
給高流量、對成本敏感、不需要絕對旗艦能力的工作負載:
| 模型 | 供應商 | Input ($/1M tok) | Output ($/1M tok) | Context | 最適合 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | 1M | 文字生成、分類、簡單程式撰寫 |
| GPT-5.4 Nano | OpenAI | $0.20 | $1.25 | 128K | OpenAI 生態系、中等品質需求 |
| GPT-4.1 Nano | OpenAI | $0.10 | $0.40 | 1M | 長上下文、OpenAI 最低價 |
| Gemini 3.1 Flash | $0.50 | $3.00 | 1M | 多模態大量工作負載 | |
| Qwen3-32B | Alibaba | $0.18 | $0.28 | 32K | 多語支援(阿拉伯語、日語、韓語) |
| Llama 4 Scout | Meta (hosted) | $0.11 | $0.34 | 10M | 本層最長的上下文視窗 |
$0.14/$0.28 的 DeepSeek V4 Flash 是這一層的錨點。 它在 HumanEval(程式)拿到 92%——只比 GPT-4o 低 0.5 分——輸出價格卻只有 40 分之一。文字分類、摘要、簡單問答、範本程式碼生成,這些工作沒有理由用更貴的。
第 4 層:永久免費模型
這些不是試用。它們永久免費——但在你基於它們建構之前,必須先搞懂限速與注意事項。
| 模型 | 供應商 | 速率限制 | Context | 注意事項 |
|---|---|---|---|---|
| GLM-4.7 Flash | Z.AI | ~1,000 req/day | 128K | 完全免費、以中文為主的文件 |
| Gemini 2.5 Flash | 1,500 req/day | 1M | 可能使用資料進行訓練(免費方案) | |
| Groq 免費模型 | Groq | 30 RPM / 14,400 RPD | Various | 最快的推論速度(300–500 tok/s) |
| Cerebras free | Cerebras | 30 RPM / 1M tok/day | Various | 最快的批次吞吐量(2,500+ tok/s) |
| OpenRouter free | OpenRouter | 20 RPM / 200 RPD | Various | 35+ 個免費模型、單一金鑰 |
免費方案是給原型與個人工具用的。一旦你需要可靠度、SLA 或資料隱私保證,就切到付費方案——或更好的做法,改用一個讓你能從免費原型一路擴展到付費生產、API 端點完全不用換的聚合平台。
免費方案的完整能力拆解——包括用 $0 到底能做出什麼——請見本系列第三篇「最便宜的 LLM API 供應商指南」。
300 倍價差
這張表最便宜的模型是每百萬輸入 Token $0.10(GPT-4.1 Nano)。最貴的是每百萬 $30(GPT-5.5 Pro)——光輸入就是 300 倍差距。輸出差距更大:從 $0.01/M(底部的 Qwen3-8B、GLM-4-9B)到 $180/M(GPT-5.5 Pro)——最便宜與最貴的輸出 Token 差到 18,000 倍。
是什麼造成這個差距?三件事:模型能力(推理深度、程式準確度、多模態支援)、推理成本(更大的模型需要更多 GPU 時數)、以及市場定位(OpenAI 和 Anthropic 因為生態系護城河——所有教學、SDK、工具都優先支援它們——而享有溢價定價)。
務實的問題不是「哪個模型最便宜」,而是「哪個模型對我的任務夠用,我又為不需要的能力多付了多少?」
提示詞快取會戲劇性地改變有效價格。 Anthropic 對快取輸入提供 90% 折扣、DeepSeek 的快取命中只要 $0.0036/M、當快取覆蓋率到 80% 時你的有效輸入成本會下降約 72%。完整的跨供應商快取策略與實作指南,請見我們的快取實作指南。
誰該用哪個模型:依讀者類型
沒有脈絡的「$50/$500/$5,000 預算分級」沒什麼用。這裡直接告訴你,你是誰、該用什麼。
獨立開發者
你正在做副業專案、原型或小型 SaaS。你的限制:預算(API 每月 $20–50)、時間(開發者只有你一個)、摩擦(你不想開五個供應商帳號)。你需要的:一台能處理 90% 任務的便宜模型+一台處理另外 10% 的進階備援。
組合:日常主力 DeepSeek V4 Flash($0.14/$0.28)。那約 10% 需要更深推理的請求,導到 Claude Sonnet 4.6($3/$15)或 GPT-5.4 Mini($0.75/$4.50)。預期成本:每月輸出約 200 萬 Token、花費 $25–50。全部透過單一聚合端點存取——不需要個別供應商帳號。
成長路徑:當你的副業專案達到每天 10,000 次請求,你已經超脫免費方案,但還不需要企業級基礎設施。聚合平台讓你在不換程式、不換端點的情況下,直接加值預付餘額。零遷移。完整的設定請見多模型路由指南。
新創 CTO
你帶領一支 3–8 人的團隊。你的生產 App 每月發出 50,000–200,000 次 API 呼叫。你的限制:可靠度(停機就是流失使用者)、成本可預測(失控帳單會吃掉營運資金)、開發速度(團隊不該花時間管理供應商帳號)。
組合:主要程式模型用 DeepSeek V4 Pro($0.44/$0.87)——以接近旗艦的品質處理 70% 的請求。Claude Sonnet 4.6 處理複雜除錯與 PR 審查($3/$15)。GPT-5.4 Mini 處理 Agent 工作流程($0.75/$4.50)。Gemini 3 Flash 處理多模態任務($0.50/$3)。預期成本:每月 $400–$1,200。
兩個比選模型更重要的架構決定:(1) 實作模型備援——你的 App 不該因為某家供應商掛掉,就跟使用者說「模型不可用」。兩行 try/except 在 429 或 5xx 錯誤時從 Claude 切到 GPT-5.5,就是「出事了」和「沒人注意到」的差別。(2) 設定單次請求的成本上限——不是月預算,是逐請求的限額。一個失控的 Agent 迴圈能在月報警觸發之前燒掉 $50 的 Token。
聚合平台在基礎設施層處理備援與成本路由。如果你的團隊每個月花超過 2 小時管理供應商儀表板,你就在支付直連 API 價格看不到的隱藏稅。成本比較的數學,請讀開發者為什麼改用聚合平台。
企業架構師
你正在為 50 人以上的開發團隊或大規模客戶產品評估 LLM 基礎設施。你的限制:合規(SOC 2、HIPAA、EU AI Act、資料落地)、治理(誰在何時、以多少成本用了哪個模型)、供應商管理(你不可能每季跟五家供應商重新議約)。
組合:你的模型配置取決於工作負載——但你的基礎設施比選模型更重要。在企業規模,決定總成本的是三件事:提示詞快取命中率(要砍半輸入成本,目標 >60%)、批次 API 的運用(所有非即時工作負載都該用打 5 折的批次)、以及多模型路由的效率(「全部請求都送 GPT-5.5」和「聰明路由」的差別通常是 60–80% 的成本削減)。
自架 LiteLLM 這類 gateway 能讓你完全掌控資料落地、金鑰管理與稽核日誌——但需要 DevOps 投入。託管式聚合平台則提供同樣的治理層(帶每團隊預算與模型白名單的虛擬金鑰、統一的稽核軌跡、資料落地選項),不用扛基礎設施包袱。
任何企業 LLM 部署的安全基線,請從API 金鑰管理指南開始,再疊上你產業特有的合規要求。但安全與合規只佔企業成本方程式的一半——另一半是當你的團隊需要轉向時會發生什麼。
沒有人在追蹤的隱藏成本:遷移。 每次換模型,你都得重新基準化提示詞。一支五人工程團隊每次遷移花兩天、每人每天 $500,等於每換一次模型燒掉 $5,000。而那些把三台模型放在路由層後面的團隊,改一行設定就能在生產換模型,再用 5% 的流量分批驗證結果。同樣的結果,零遷移成本。上面的價格表顯示的是每個 Token 的成本;它沒顯示的是,單模型與多模型配置的真正成本差距不在 Token 價格,而在於面對變革的組織摩擦。當模型價格每季變動、新競爭者每個月冒出,能不動工程就換模型的能力,比任何單價折扣都值錢。
每美元品質:唯一值得看的價值排名(截至 2026 年 7 月)
沒有價格的基準分數是行銷;沒有基準分數的價格是閉眼瞎買——像 Artificial Analysis 這類獨立平台會跨所有主要供應商追蹤兩者。真正重要的指標是每花一美元買到的品質。
每美元 SWE-bench Verified(程式價值)
這個排名把每台模型的 SWE-bench Verified 分數除以它的輸出價格(每百萬 Token)。越高越好——代表每一塊錢買到更多程式能力。
| 模型 | SWE-bench | Output $/M | 每美元分數 |
|---|---|---|---|
| DeepSeek V4 Flash | ~78% | $0.28 | 279 |
| DeepSeek V4 Pro | ~85% | $0.87 | 98 |
| MiniMax M3 | 80.5% | $2.40 | 34 |
| Qwen3.7 Max | 80.4% | $3.75 | 21 |
| Kimi K2.6 | 80.2% | $4.00 | 20 |
| Gemini 3.1 Pro | 80.6% | $12.00 | 7 |
| Claude Opus 4.8 | 88.6% | $25.00 | 3.5 |
| GPT-5.5 | 88.7% | $30.00 | 3.0 |
公式:SWE-bench 百分比 ÷ 每百萬 Token 輸出美元。越高代表每一塊錢買到更多程式能力。
DeepSeek V4 Flash 每一塊錢買到 279 個程式分數點——是 GPT-5.5(3.0)的 93 倍價值。即使是接近旗艦的 DeepSeek V4 Pro,每一塊錢也有 28 倍的程式價值。「便宜」這個標籤嚴重低估了實際情況:這些模型用讓「全旗艦組合」回過頭看像是浪費的價格,交出與旗艦並駕齊驅的程式能力。
真正重要的解讀:如果你每個月花 $1,000 在 GPT-5.5 上做程式任務,改用 DeepSeek V4 Flash 大約每月 $11 就能得到相似品質的輸出;改用 DeepSeek V4 Pro 大約 $30。多數團隊沒意識到,「你正在付的」和「你其實該付的」差距有多大。
這個指標暴露了裸價格表看不出來的東西。GPT-5.5 在 SWE-bench 拿 88.7%——本次比較最高。但它的每個基準分數點比 DeepSeek V4 Flash 貴 93 倍。對每月花 $5,000 在程式 API 的團隊,這個 93 倍就是把 $5,000 的帳單變成等價基準效能 $54 帳單的差別。品質差距——SWE-bench 3 個百分點——換算下來是每 33 個程式任務多解對約 1 個。這值不值每月 $4,946,是商業決策,不是技術決策。多數團隊實際算過之後會發現,旗艦模型只需要用在真實工作負載的約 5%。
每美元 MMLU-Pro(通用推理價值)
| 模型 | MMLU-Pro | Output $/M | 每美元分數 |
|---|---|---|---|
| DeepSeek V4 Flash | 85.5 | $0.28 | 305 |
| DeepSeek V4 Pro | ~87 | $0.87 | 100 |
| Qwen3.7 Max | ~86 | $3.75 | 23 |
| Claude Opus 4.8 | ~89 | $25.00 | 3.6 |
| GPT-5.5 | ~89 | $30.00 | 3.0 |
在通用知識與推理任務上,價值差距比程式還大。DeepSeek V4 Flash 在 MMLU-Pro 只落後 GPT-5.5 3.5 分——每個推理分數點的價格卻只要 100 分之一。
價值甜蜜點
如果把所有模型畫成散點圖——X 軸是 SWE-bench 分數、Y 軸是輸出價格——你會看到三個叢集:
- 高價區(右上):GPT-5.5 與 Claude Opus 4.8。最高分、最高價。最適合:答錯的代價高過 API 呼叫的任務。
- 價值甜蜜點(中上、最左):DeepSeek V4 Pro、MiniMax M3、Qwen3.7 Max。$0.87–3.75 就有 SWE-bench 80% 以上。最適合:90% 的生產工作負載。
- 低價區(中、最左):DeepSeek V4 Flash、GPT-4.1 Nano、Qwen3-32B。接近零成本就有夠用的品質。最適合:分類、抽取、摘要、範本生成。
在這張圖上沒道理的模型:SWE-bench 低於 75% 卻要價輸出 $5/M 以上的。你正用旗艦價格買非旗艦品質。檢查一下你的模型版本——你可能在跑一台半年前就被更便宜、更好的版本取代的過時模型。
聚合平台如何改變價值方程式。 大用戶基的聚合需求能解鎖任何單一團隊直接談判不來的單價——讓這篇文章的「每美元品質」表變得可執行的,正是同一套經濟原理。再加上把每個請求送去「能處理它的最便宜模型」的成本路由,一套混合組合(70% 流量走 DeepSeek V4 Flash + 20% 走 Claude Sonnet + 10% 走 GPT-5.5)的營運成本比「全旗艦」基準低 30–50%。因為每個請求還是落在符合它複雜度的模型上,終端使用者感受不到品質差異。
快速決策框架
需要程式生成——DeepSeek V4 Pro(最佳價值)、Claude Opus 4.8(最佳品質)。備援:GPT-5.5。
需要長文件分析(>100K Token)——Gemini 3.1 Pro(2M 上下文,長文件每 Token 最便宜)。備援:GPT-4.1 Nano(1M 上下文,輸入 $0.10/M)。
需要多語(非英文)——Qwen3.7 Max 或 DeepSeek V4 Pro(兩者在 C-Eval、日語、韓語、阿拉伯語基準上都勝過 GPT-5.5)。備援:Claude Opus 4.8。
需要視覺/多模態——Gemini 3.1 Pro(原生影片+音訊+圖片)。備援:GPT-5.5。
需要 Agent 工作流程(工具呼叫)——GPT-5.5(最可靠的 function calling、最佳平行工具執行)。備援:Claude Opus 4.8(最佳複雜多步驟推理)。
需要絕對最低成本——DeepSeek V4 Flash($0.14/$0.28)。免費:GLM-4.7 Flash(永久免費、128K 上下文)。
如果你所在地區的直接存取受限——用一個能從單一端點對所有模型提供存取的聚合平台。沒有供應商逐家的付款障礙、一把 API Key 搞定。
常見問題
2026 年整體最便宜的模型是哪個?
DeepSeek V4 Flash,每百萬 Token 輸入 $0.14 / 輸出 $0.28。要永久免費:GLM-4.7 Flash(免信用卡、128K 上下文、OpenAI 相容)。
Claude Opus 值得 DeepSeek V4 Pro 的 5 倍價格嗎?
只有當你需要 Anthropic 原生協定功能(擴展思考、computer use)或複雜除錯需要的 SWE-bench 最後約 3 個百分點時。對 95% 的程式任務,DeepSeek V4 Pro 以 29 分之一的輸出成本交出無法區分的品質。詳細對照:見OpenAI vs Anthropic vs Google vs DeepSeek 比較。
聚合平台真的比直連 API 省錢嗎?
把「每美元品質」那一節的每基準分數成本邏輯套到你的月帳單,答案就清楚了。三個機制疊加:(1) 聚合採購力把單價壓到個人帳號拿不到的水準;(2) 你不用再在供應商儀表板裡停放 $50–200 的最低入金;(3) 成本路由套用這篇文章的同一套分層邏輯——簡單查詢送 $0.14/M、複雜推理送 $3/M、旗艦深度只送 $30/M。跑三台以上模型的團隊,總 LLM 支出通常比沒有路由層的直連帳號少 30–50%。
這些價格多久變一次?
中國供應商(DeepSeek、Qwen、MiniMax、Kimi、GLM)光 2026 上半年就降價六次。美國供應商(OpenAI、Anthropic)每季調整。Google 每 2–3 個月。如果你用的價格資料超過 60 天,你很可能正在多付。
批次 API 價格呢?
OpenAI、Anthropic、Google 對非同步批次處理(24 小時內回)提供約 50% 折扣。DeepSeek 的批次價格與即時相同——沒折扣,但也沒有延遲懲罰。帶前後資料的成本優化策略,省錢 12 招指南有詳細說明。
免費方案 API 能用在生產嗎?
不能。免費方案限制每分鐘 15–30 次請求、沒有 SLA,有些(Google 的免費方案)可能用你的資料做訓練。它們是給原型與個人專案的。準備好進生產時,聚合平台讓你能從免費原型切到付費生產,API 端點完全不用換。
價格表只有在你付諸行動時才有用。從多數團隊的預設組合——所有請求都送 GPT-5.5——換到帶聰明路由的最佳化多模型組合,通常能在品質零損失下省下 80% 成本。數字都在這篇文章裡。
接下來這樣做:從上面表格的第 2 層或第 3 層挑一台模型,這週把 20% 流量導過去,量一下品質。如果夠好——對 85% 的工作負載來說都會夠好——你剛剛把帳單砍了 80%。這不是喊口號的數字,而是「每美元品質」那一節的數學。
把價格當定期檢查來對待的團隊——「下季再看模型價格」——正是那些發現自己半年來多付 80% 的團隊。價格變動太快,不適合每季檢視。在行事曆上設每月 1 日的提醒,看一下價格表,調整路由規則。五分鐘。這就是 $1,000 帳單和 $200 帳單的差別——不是更好的模型、不是更聰明的工程師,只是個固定行程。
上面表格的價格資料已於 2026 年 7 月與供應商儀表板及 API 回應交叉驗證。用你自己的提示詞、同一台模型、同一組參數,比對每 Token 成本來確認數字——TokSpan 的 Playground 免供應商帳號就能並排顯示各模型的價格。$5 的預付餘額就足以為第 2 層和第 3 層的每一台模型做基準測試。