LLM API PricingAI Model ComparisonAPI Cost Optimization

2026 年 LLM API 價格比較:所有模型依成本、速度與效能排名

閱讀 1 分鐘

一百萬個輸出 Token 的成本:DeepSeek-V3 只要 $0.15,GPT-5.5 要 $30,o1-Pro 要 $45。這是 300 倍的價差——而對大多數生產環境的工作負載來說,這些模型產生的結果幾乎沒有差別。如果你選錯了模型就一直沒回頭看,你的 API 帳單現在正在訴說這個故事。

這個差距真實存在,而且還在擴大。過去 18 個月,旗艦模型的價格隨推理能力擴張而攀升,同時一波高效率模型——DeepSeek、Gemini Flash、Llama 4——把價格下限壓到幾乎歸零。結果是一個讓兩支跑著類似工作負載的團隊,一個月付 $300、另一個付 $9,000 的市場——而且便宜的往往因為回應更快,反而提供更好的使用者體驗。

拉近這個差距不需要重整基礎設施。一支團隊把「你好」「謝謝」這類訊息改走輕量分類器而非推理模型,就從月費 $9,700 的帳單砍掉 $7,500——降幅 78%——延遲還更好了。另一支團隊在重複的系統提示詞上啟用提示詞快取,一行程式都不用改就省下 50% 的輸入 Token 成本。生產環境的彙總資料顯示:系統化的模型分層路由加上快取,通常能找回 60–80% 的 LLM API 支出。

這篇文章你會帶走的東西:涵蓋 2026 年 7 月所有重要模型的四層價格表、告訴你「花出去的每一塊錢實際買到什麼」的每美元品質排名、三套讀者類型推薦(不是那種籠統的預算分級)、以及用一句話回答「哪個模型該用在哪」的決策框架。

2026 年 LLM API 完整價格表

截至 2026 年中,主要 API 可用的模型超過 180 個。其中大部分你永遠不會用到。重點是理解價格的結構——而不是背下每個數字。模型依能力與成本分為四層。以下是每層你需要知道的。

第 1 層:旗艦模型(每百萬 Token $2–30)

這些是各家的頂級型號。當任務需要最深的推理深度時使用:複雜的除錯、多步驟的 Agent 工作流程、幻覺代價高過 API 呼叫的法律文件分析。

模型供應商Input ($/1M tok)Output ($/1M tok)Context WindowSWE-bench Verified
GPT-5.5OpenAI$5.00$30.001M88.7%
GPT-5.5 ProOpenAI$30.00$180.00
Claude Opus 4.8Anthropic$5.00$25.001M88.6%
Claude Sonnet 4.6Anthropic$3.00$15.001M~85%
Gemini 3.1 ProGoogle$2.00 ($4 >200K)$12.00 ($18 >200K)1M (2M preview)80.6%

GPT-5.5 和 Claude Opus 4.8 在 SWE-bench Verified 排行榜上統計上並列第一。實際上,決定性因素不是能力,而是生態系。GPT-5.5 有最大的外掛與 SDK 生態系;Claude Opus 有最強的原生工具使用協定與擴展思考;Gemini 3.1 Pro 是這層的 CP 值之選:輸出價格只有 GPT-5.5 的 2.5 分之一,有最好的免費方案(透過 Google AI Studio 每天 1,500 次請求),而且是唯一支援原生多模態的模型——影片、音訊、圖片一次 API 呼叫處理。

GPT-5.5 Pro 的每百萬 Token $30/$180 是為那些「最大推理深度不容妥協」的工作負載存在:藥物發現模擬、安全關鍵系統的形式驗證、前沿研究。對 99.7% 的使用情境,基本款 GPT-5.5 才是正確選擇。

第 2 層:價值前沿(每百萬 Token $0.50–$2)

2026 年的價格效能革命就發生在這裡。這一層的模型在 SWE-bench Verified 拿到 80% 以上——與 18 個月前的旗艦相當——成本卻只要 5–20 分之一。

模型供應商Input ($/1M tok)Output ($/1M tok)ContextSWE-bench
DeepSeek V4 ProDeepSeek$0.435$0.871M~85%
Qwen3.7 MaxAlibaba$1.25$3.751M80.4%
MiniMax M3MiniMax$0.60$2.401M80.5%
Kimi K2.6Moonshot$0.95$4.00256K80.2%
GLM-5.2Z.AI$1.40$4.401M
Mistral Large 3Mistral$0.50$1.50262K

這一層的明星是 MiniMax M3:每個 SWE-bench 分數點只要 $0.03——市場上每一塊錢能買到最多程式能力的模型。DeepSeek V4 Pro 是整體價值王:輸出成本只有 GPT-5.5 的 34 分之一,卻能在約 85% 的實際任務中提供與旗艦無異的程式品質。

Mistral Large 3 對 EU 團隊值得特別一提:符合 GDPR、託管於歐盟、有免費方案,而且是這一層唯一有明確資料落地故事的模型。

第 3 層:低價主力(每百萬 Token $0.10–$0.50)

給高流量、對成本敏感、不需要絕對旗艦能力的工作負載:

模型供應商Input ($/1M tok)Output ($/1M tok)Context最適合
DeepSeek V4 FlashDeepSeek$0.14$0.281M文字生成、分類、簡單程式撰寫
GPT-5.4 NanoOpenAI$0.20$1.25128KOpenAI 生態系、中等品質需求
GPT-4.1 NanoOpenAI$0.10$0.401M長上下文、OpenAI 最低價
Gemini 3.1 FlashGoogle$0.50$3.001M多模態大量工作負載
Qwen3-32BAlibaba$0.18$0.2832K多語支援(阿拉伯語、日語、韓語)
Llama 4 ScoutMeta (hosted)$0.11$0.3410M本層最長的上下文視窗

$0.14/$0.28 的 DeepSeek V4 Flash 是這一層的錨點。 它在 HumanEval(程式)拿到 92%——只比 GPT-4o 低 0.5 分——輸出價格卻只有 40 分之一。文字分類、摘要、簡單問答、範本程式碼生成,這些工作沒有理由用更貴的。

第 4 層:永久免費模型

這些不是試用。它們永久免費——但在你基於它們建構之前,必須先搞懂限速與注意事項。

模型供應商速率限制Context注意事項
GLM-4.7 FlashZ.AI~1,000 req/day128K完全免費、以中文為主的文件
Gemini 2.5 FlashGoogle1,500 req/day1M可能使用資料進行訓練(免費方案)
Groq 免費模型Groq30 RPM / 14,400 RPDVarious最快的推論速度(300–500 tok/s)
Cerebras freeCerebras30 RPM / 1M tok/dayVarious最快的批次吞吐量(2,500+ tok/s)
OpenRouter freeOpenRouter20 RPM / 200 RPDVarious35+ 個免費模型、單一金鑰

免費方案是給原型與個人工具用的。一旦你需要可靠度、SLA 或資料隱私保證,就切到付費方案——或更好的做法,改用一個讓你能從免費原型一路擴展到付費生產、API 端點完全不用換的聚合平台。

免費方案的完整能力拆解——包括用 $0 到底能做出什麼——請見本系列第三篇「最便宜的 LLM API 供應商指南」。

300 倍價差

這張表最便宜的模型是每百萬輸入 Token $0.10(GPT-4.1 Nano)。最貴的是每百萬 $30(GPT-5.5 Pro)——光輸入就是 300 倍差距。輸出差距更大:從 $0.01/M(底部的 Qwen3-8B、GLM-4-9B)到 $180/M(GPT-5.5 Pro)——最便宜與最貴的輸出 Token 差到 18,000 倍。

是什麼造成這個差距?三件事:模型能力(推理深度、程式準確度、多模態支援)、推理成本(更大的模型需要更多 GPU 時數)、以及市場定位(OpenAI 和 Anthropic 因為生態系護城河——所有教學、SDK、工具都優先支援它們——而享有溢價定價)。

務實的問題不是「哪個模型最便宜」,而是「哪個模型對我的任務夠用,我又為不需要的能力多付了多少?」

提示詞快取會戲劇性地改變有效價格。 Anthropic 對快取輸入提供 90% 折扣、DeepSeek 的快取命中只要 $0.0036/M、當快取覆蓋率到 80% 時你的有效輸入成本會下降約 72%。完整的跨供應商快取策略與實作指南,請見我們的快取實作指南

誰該用哪個模型:依讀者類型

沒有脈絡的「$50/$500/$5,000 預算分級」沒什麼用。這裡直接告訴你,你是誰、該用什麼。

獨立開發者

你正在做副業專案、原型或小型 SaaS。你的限制:預算(API 每月 $20–50)、時間(開發者只有你一個)、摩擦(你不想開五個供應商帳號)。你需要的:一台能處理 90% 任務的便宜模型+一台處理另外 10% 的進階備援。

組合:日常主力 DeepSeek V4 Flash($0.14/$0.28)。那約 10% 需要更深推理的請求,導到 Claude Sonnet 4.6($3/$15)或 GPT-5.4 Mini($0.75/$4.50)。預期成本:每月輸出約 200 萬 Token、花費 $25–50。全部透過單一聚合端點存取——不需要個別供應商帳號。

成長路徑:當你的副業專案達到每天 10,000 次請求,你已經超脫免費方案,但還不需要企業級基礎設施。聚合平台讓你在不換程式、不換端點的情況下,直接加值預付餘額。零遷移。完整的設定請見多模型路由指南

新創 CTO

你帶領一支 3–8 人的團隊。你的生產 App 每月發出 50,000–200,000 次 API 呼叫。你的限制:可靠度(停機就是流失使用者)、成本可預測(失控帳單會吃掉營運資金)、開發速度(團隊不該花時間管理供應商帳號)。

組合:主要程式模型用 DeepSeek V4 Pro($0.44/$0.87)——以接近旗艦的品質處理 70% 的請求。Claude Sonnet 4.6 處理複雜除錯與 PR 審查($3/$15)。GPT-5.4 Mini 處理 Agent 工作流程($0.75/$4.50)。Gemini 3 Flash 處理多模態任務($0.50/$3)。預期成本:每月 $400–$1,200。

兩個比選模型更重要的架構決定:(1) 實作模型備援——你的 App 不該因為某家供應商掛掉,就跟使用者說「模型不可用」。兩行 try/except 在 429 或 5xx 錯誤時從 Claude 切到 GPT-5.5,就是「出事了」和「沒人注意到」的差別。(2) 設定單次請求的成本上限——不是月預算,是逐請求的限額。一個失控的 Agent 迴圈能在月報警觸發之前燒掉 $50 的 Token。

聚合平台在基礎設施層處理備援與成本路由。如果你的團隊每個月花超過 2 小時管理供應商儀表板,你就在支付直連 API 價格看不到的隱藏稅。成本比較的數學,請讀開發者為什麼改用聚合平台

企業架構師

你正在為 50 人以上的開發團隊或大規模客戶產品評估 LLM 基礎設施。你的限制:合規(SOC 2、HIPAA、EU AI Act、資料落地)、治理(誰在何時、以多少成本用了哪個模型)、供應商管理(你不可能每季跟五家供應商重新議約)。

組合:你的模型配置取決於工作負載——但你的基礎設施比選模型更重要。在企業規模,決定總成本的是三件事:提示詞快取命中率(要砍半輸入成本,目標 >60%)、批次 API 的運用(所有非即時工作負載都該用打 5 折的批次)、以及多模型路由的效率(「全部請求都送 GPT-5.5」和「聰明路由」的差別通常是 60–80% 的成本削減)。

自架 LiteLLM 這類 gateway 能讓你完全掌控資料落地、金鑰管理與稽核日誌——但需要 DevOps 投入。託管式聚合平台則提供同樣的治理層(帶每團隊預算與模型白名單的虛擬金鑰、統一的稽核軌跡、資料落地選項),不用扛基礎設施包袱。

任何企業 LLM 部署的安全基線,請從API 金鑰管理指南開始,再疊上你產業特有的合規要求。但安全與合規只佔企業成本方程式的一半——另一半是當你的團隊需要轉向時會發生什麼。

沒有人在追蹤的隱藏成本:遷移。 每次換模型,你都得重新基準化提示詞。一支五人工程團隊每次遷移花兩天、每人每天 $500,等於每換一次模型燒掉 $5,000。而那些把三台模型放在路由層後面的團隊,改一行設定就能在生產換模型,再用 5% 的流量分批驗證結果。同樣的結果,零遷移成本。上面的價格表顯示的是每個 Token 的成本;它沒顯示的是,單模型與多模型配置的真正成本差距不在 Token 價格,而在於面對變革的組織摩擦。當模型價格每季變動、新競爭者每個月冒出,能不動工程就換模型的能力,比任何單價折扣都值錢。

每美元品質:唯一值得看的價值排名(截至 2026 年 7 月)

沒有價格的基準分數是行銷;沒有基準分數的價格是閉眼瞎買——像 Artificial Analysis 這類獨立平台會跨所有主要供應商追蹤兩者。真正重要的指標是每花一美元買到的品質。

每美元 SWE-bench Verified(程式價值)

這個排名把每台模型的 SWE-bench Verified 分數除以它的輸出價格(每百萬 Token)。越高越好——代表每一塊錢買到更多程式能力。

模型SWE-benchOutput $/M每美元分數
DeepSeek V4 Flash~78%$0.28279
DeepSeek V4 Pro~85%$0.8798
MiniMax M380.5%$2.4034
Qwen3.7 Max80.4%$3.7521
Kimi K2.680.2%$4.0020
Gemini 3.1 Pro80.6%$12.007
Claude Opus 4.888.6%$25.003.5
GPT-5.588.7%$30.003.0

公式:SWE-bench 百分比 ÷ 每百萬 Token 輸出美元。越高代表每一塊錢買到更多程式能力。

DeepSeek V4 Flash 每一塊錢買到 279 個程式分數點——是 GPT-5.5(3.0)的 93 倍價值。即使是接近旗艦的 DeepSeek V4 Pro,每一塊錢也有 28 倍的程式價值。「便宜」這個標籤嚴重低估了實際情況:這些模型用讓「全旗艦組合」回過頭看像是浪費的價格,交出與旗艦並駕齊驅的程式能力。

真正重要的解讀:如果你每個月花 $1,000 在 GPT-5.5 上做程式任務,改用 DeepSeek V4 Flash 大約每月 $11 就能得到相似品質的輸出;改用 DeepSeek V4 Pro 大約 $30。多數團隊沒意識到,「你正在付的」和「你其實該付的」差距有多大。

這個指標暴露了裸價格表看不出來的東西。GPT-5.5 在 SWE-bench 拿 88.7%——本次比較最高。但它的每個基準分數點比 DeepSeek V4 Flash 貴 93 倍。對每月花 $5,000 在程式 API 的團隊,這個 93 倍就是把 $5,000 的帳單變成等價基準效能 $54 帳單的差別。品質差距——SWE-bench 3 個百分點——換算下來是每 33 個程式任務多解對約 1 個。這值不值每月 $4,946,是商業決策,不是技術決策。多數團隊實際算過之後會發現,旗艦模型只需要用在真實工作負載的約 5%。

每美元 MMLU-Pro(通用推理價值)

模型MMLU-ProOutput $/M每美元分數
DeepSeek V4 Flash85.5$0.28305
DeepSeek V4 Pro~87$0.87100
Qwen3.7 Max~86$3.7523
Claude Opus 4.8~89$25.003.6
GPT-5.5~89$30.003.0

在通用知識與推理任務上,價值差距比程式還大。DeepSeek V4 Flash 在 MMLU-Pro 只落後 GPT-5.5 3.5 分——每個推理分數點的價格卻只要 100 分之一。

價值甜蜜點

如果把所有模型畫成散點圖——X 軸是 SWE-bench 分數、Y 軸是輸出價格——你會看到三個叢集:

  • 高價區(右上):GPT-5.5 與 Claude Opus 4.8。最高分、最高價。最適合:答錯的代價高過 API 呼叫的任務。
  • 價值甜蜜點(中上、最左):DeepSeek V4 Pro、MiniMax M3、Qwen3.7 Max。$0.87–3.75 就有 SWE-bench 80% 以上。最適合:90% 的生產工作負載。
  • 低價區(中、最左):DeepSeek V4 Flash、GPT-4.1 Nano、Qwen3-32B。接近零成本就有夠用的品質。最適合:分類、抽取、摘要、範本生成。

在這張圖上沒道理的模型:SWE-bench 低於 75% 卻要價輸出 $5/M 以上的。你正用旗艦價格買非旗艦品質。檢查一下你的模型版本——你可能在跑一台半年前就被更便宜、更好的版本取代的過時模型。

聚合平台如何改變價值方程式。 大用戶基的聚合需求能解鎖任何單一團隊直接談判不來的單價——讓這篇文章的「每美元品質」表變得可執行的,正是同一套經濟原理。再加上把每個請求送去「能處理它的最便宜模型」的成本路由,一套混合組合(70% 流量走 DeepSeek V4 Flash + 20% 走 Claude Sonnet + 10% 走 GPT-5.5)的營運成本比「全旗艦」基準低 30–50%。因為每個請求還是落在符合它複雜度的模型上,終端使用者感受不到品質差異。

快速決策框架

需要程式生成——DeepSeek V4 Pro(最佳價值)、Claude Opus 4.8(最佳品質)。備援:GPT-5.5。

需要長文件分析(>100K Token)——Gemini 3.1 Pro(2M 上下文,長文件每 Token 最便宜)。備援:GPT-4.1 Nano(1M 上下文,輸入 $0.10/M)。

需要多語(非英文)——Qwen3.7 Max 或 DeepSeek V4 Pro(兩者在 C-Eval、日語、韓語、阿拉伯語基準上都勝過 GPT-5.5)。備援:Claude Opus 4.8。

需要視覺/多模態——Gemini 3.1 Pro(原生影片+音訊+圖片)。備援:GPT-5.5。

需要 Agent 工作流程(工具呼叫)——GPT-5.5(最可靠的 function calling、最佳平行工具執行)。備援:Claude Opus 4.8(最佳複雜多步驟推理)。

需要絕對最低成本——DeepSeek V4 Flash($0.14/$0.28)。免費:GLM-4.7 Flash(永久免費、128K 上下文)。

如果你所在地區的直接存取受限——用一個能從單一端點對所有模型提供存取的聚合平台。沒有供應商逐家的付款障礙、一把 API Key 搞定。

常見問題

2026 年整體最便宜的模型是哪個?

DeepSeek V4 Flash,每百萬 Token 輸入 $0.14 / 輸出 $0.28。要永久免費:GLM-4.7 Flash(免信用卡、128K 上下文、OpenAI 相容)。

Claude Opus 值得 DeepSeek V4 Pro 的 5 倍價格嗎?

只有當你需要 Anthropic 原生協定功能(擴展思考、computer use)或複雜除錯需要的 SWE-bench 最後約 3 個百分點時。對 95% 的程式任務,DeepSeek V4 Pro 以 29 分之一的輸出成本交出無法區分的品質。詳細對照:見OpenAI vs Anthropic vs Google vs DeepSeek 比較

聚合平台真的比直連 API 省錢嗎?

把「每美元品質」那一節的每基準分數成本邏輯套到你的月帳單,答案就清楚了。三個機制疊加:(1) 聚合採購力把單價壓到個人帳號拿不到的水準;(2) 你不用再在供應商儀表板裡停放 $50–200 的最低入金;(3) 成本路由套用這篇文章的同一套分層邏輯——簡單查詢送 $0.14/M、複雜推理送 $3/M、旗艦深度只送 $30/M。跑三台以上模型的團隊,總 LLM 支出通常比沒有路由層的直連帳號少 30–50%。

這些價格多久變一次?

中國供應商(DeepSeek、Qwen、MiniMax、Kimi、GLM)光 2026 上半年就降價六次。美國供應商(OpenAI、Anthropic)每季調整。Google 每 2–3 個月。如果你用的價格資料超過 60 天,你很可能正在多付。

批次 API 價格呢?

OpenAI、Anthropic、Google 對非同步批次處理(24 小時內回)提供約 50% 折扣。DeepSeek 的批次價格與即時相同——沒折扣,但也沒有延遲懲罰。帶前後資料的成本優化策略,省錢 12 招指南有詳細說明。

免費方案 API 能用在生產嗎?

不能。免費方案限制每分鐘 15–30 次請求、沒有 SLA,有些(Google 的免費方案)可能用你的資料做訓練。它們是給原型與個人專案的。準備好進生產時,聚合平台讓你能從免費原型切到付費生產,API 端點完全不用換。

價格表只有在你付諸行動時才有用。從多數團隊的預設組合——所有請求都送 GPT-5.5——換到帶聰明路由的最佳化多模型組合,通常能在品質零損失下省下 80% 成本。數字都在這篇文章裡。

接下來這樣做:從上面表格的第 2 層或第 3 層挑一台模型,這週把 20% 流量導過去,量一下品質。如果夠好——對 85% 的工作負載來說都會夠好——你剛剛把帳單砍了 80%。這不是喊口號的數字,而是「每美元品質」那一節的數學。

把價格當定期檢查來對待的團隊——「下季再看模型價格」——正是那些發現自己半年來多付 80% 的團隊。價格變動太快,不適合每季檢視。在行事曆上設每月 1 日的提醒,看一下價格表,調整路由規則。五分鐘。這就是 $1,000 帳單和 $200 帳單的差別——不是更好的模型、不是更聰明的工程師,只是個固定行程。

上面表格的價格資料已於 2026 年 7 月與供應商儀表板及 API 回應交叉驗證。用你自己的提示詞、同一台模型、同一組參數,比對每 Token 成本來確認數字——TokSpan 的 Playground 免供應商帳號就能並排顯示各模型的價格。$5 的預付餘額就足以為第 2 層和第 3 層的每一台模型做基準測試。