Cheap LLM APIFree AI APIAPI Cost Comparison

2026 年最便宜的 LLM API 供應商:從 $0.10/M 起

閱讀 1 分鐘

$0.14。每一百萬個 token。這就是現在 AI 的生產成本。不是筆誤。不是試用方案。

但你可能在付 $30。每一百萬個 token。為了 GPT-5.5。也就是每個回應 3 美分。每天一千個回應:$30。一個月:$900。在你上線之前。在你還沒注意到推理 token 正悄悄再吃掉你 2–5x 的帳單之前。

停下來。你不需要過這樣的生活。

在 2026 年,存在價格只要 OpenAI 四十分之一的模型。在 85% 的真實世界任務上品質相同。差距不在能力——而在於認知。

這篇文章描繪了整個版圖:15 個最便宜模型的排名與真實品質基準、把「便宜」API 變成昂貴錯誤的隱藏費用、你能真正打造生產功能的免費方案,以及一條不需要改任何一行程式碼、從零到規模化的路徑。

2026 年最便宜的 LLM API:排名(截至 2026 年 7 月)

沒有品質下限,「便宜」就毫無意義。這個排名中的每個模型都有經過驗證、能提供可接受品質的使用案例。便宜但不可用的模型不會列入。

超低價位(每百萬 token $0.01–0.15)

這些是仍能產生連貫、有用輸出的最便宜模型。它們能可靠地處理分類、抽取、簡單問答和樣板生成。它們不適合複雜推理。

模型Input $/MOutput $/MContext品質下限最佳用途
GLM-4.7 FlashFreeFree128KGPT-4o-mini 的約 85%原型開發、簡單聊天機器人
GLM-4-9B$0.01$0.0132K基本文字任務超低成本分類
Qwen3-8B$0.01$0.0132K基本文字+程式碼最低成本抽取
GPT-4.1 Nano$0.10$0.401M紮實的推理能力長上下文預算任務
Llama 4 Scout$0.11$0.3410M以這個價位來說很好超長上下文 (10M)
DeepSeek V4 Flash$0.14$0.281M92% HumanEval文字生成、分類、簡單程式設計

DeepSeek V4 Flash 為這個價位立下標竿。 以 92% HumanEval——與 GPT-4o 的程式設計基準差距在 0.5 分以內——它不是「以這個價位來說很好」。它就是很好。以 $0.14 輸入、$0.28 輸出(DeepSeek 官方定價),你花 $1 就能處理 350 萬個輸出 token。那大約是 2,600 頁的生成文字。試試用 GPT-5.5:同樣的輸出要花 $105。

GLM-4.7 Flash 值得特別一提:它有 128K 上下文、OpenAI 相容的 API,而且完全免費。不需要信用卡、沒有試用到期、沒有使用上限(在合理使用範圍內)。對原型開發、個人專案和學習來說,沒有任何理由為其他東西付費。缺點是:文件以中文優先、API 在中國的營業時間內可能不穩定、資料使用政策不清楚。不要透過它傳送機密資料。

低價位(每百萬 token $0.15–0.50)

這些模型在特定任務上提供接近一線的品質,而價格讓「全部用 GPT-5.5」變成每個月 $500 的錯誤。

模型Input $/MOutput $/MSWE-bench最適合
DeepSeek V4 Pro$0.435$0.87~85%主要程式設計模型、一般推理
Qwen3-32B$0.18$0.28~75%多語言(日文、韓文、阿拉伯文)
GPT-5.4 Nano$0.20$1.25OpenAI 生態系、中等品質
Llama 3.3 70B$0.10$0.40自架、重視隱私

DeepSeek V4 Pro 是現存 CP 值最高的程式設計模型。 以 $0.87/M 輸出和約 85% SWE-bench,它只要 Claude Opus 4.8 的 1/29 成本,就能提供約 85% 的真實任務中無法區分的程式品質。差異出現在複雜的架構決策和邊緣案例除錯——而不是「寫一個解析 CSV 檔的函式」。

Qwen3-32B 以 $0.18/$0.28 的價格,是多語言應用的最佳選擇。它在 C-Eval(中文)、日文、韓文和阿拉伯文基準上都勝過 GPT-5.5。如果你的使用者主要是非英語人士,無論價格如何,這很可能是你最好的模型。

價值價位(每百萬 token $0.50–1.50)

這些是接近一線的模型,已經突破「SWE-bench 80%+ 俱樂部」——這是 18 個月前只有 $15–30/M 的模型才有的能力門檻。

模型Input $/MOutput $/MSWE-benchContext
MiniMax M3$0.60$2.4080.5%1M
Qwen3.7 Max$1.25$3.7580.4%1M
Kimi K2.6$0.95$4.0080.2%256K
GLM-5$1.00$3.20200K
Mistral Large 3$0.50$1.50262K

MiniMax M3 是 SWE-bench 80%+ 俱樂部裡最便宜的模型——輸出 $2.40/M——而且每美元提供的程式設計價值是所有模型中最高的(每美元 0.034 個 SWE-bench 分數;GPT-5.5 只有 0.003)。對於需要保證程式品質、但又無法負擔 $25–50/M 輸出的團隊來說,就是這個模型。

讓帳單膨脹的隱藏成本

標價會騙人。以下是定價頁面不會告訴你的事。

推理 token 看不見又昂貴。 當 GPT-5.5 或 Claude Opus 在回應前「思考」時,那些內部的思維鏈 token 會以輸出費率計費。你在回應中看不到它們——但你還是要付錢。一個產生 500 個可見輸出 token 的請求,可能在幕後消耗了 1,500 個推理 token。對那個請求而言,你的有效 $30/M 變成 $120/M。OpenAI 最近新增了 reasoning_tokens 欄位來追蹤這件事;請監控它。

提示詞長度會悄悄膨脹。 你的「簡單分類」提示詞從 200 個 token、兩個範例開始。六個月後,你加了五個範例、一份詳細的輸出格式規格,還有一段「你是一位樂於助人的助手」的開場。現在提示詞變成 2,500 個 token。每個請求你多付了 12.5 倍——而你沒發現,因為成本增加是漸進的。請每季審核你的提示詞長度。

「免費方案的陷阱」是有牙的。 Google 的免費 Gemini 方案可能會用你的資料進行訓練。DeepSeek 的隱私權政策對資料使用語焉不詳。許多免費方案提供的是低量化版本的模型(品質明顯比付費的差)。而且免費方案的速率限制(15–30 RPM)會在最重要的時刻弄壞你的生產應用程式。免費方案是給原型開發用的。一旦你有了真正的使用者,就切換到付費方案。

速率限制的浪費會增加 15–20% 的額外負擔。 如果你的用戶端在遇到 429 時以固定 1 秒間隔重試,你就製造了一個保證會有更多 429 的驚群效應。解決辦法是指數退避加上抖動——Python 用 tenacity、Node.js 用 llm-retry-kit。但更根本的解決辦法是預測性節流:讀取 x-ratelimit-remaining-* 標頭,在碰到限制之前就放慢速度。完整的速率限制實作,請看我們的生產速率限制處理指南

完整的 12 策略成本優化手冊,含前後節省資料,請看我們的降低 API 支出指南

免費 LLM API:用 $0 能真正做出什麼

2026 年,真正免費且永久可用的 LLM API,比這個產業史上任何時刻都更多。以下才是實際可用的——以及每一種能處理什麼。

供應商模型Limit最適合會用資料訓練嗎?
Google AI StudioGemini 2.5 Flash1,500 req/day原型開發、長上下文、多模態會(免費方案)
GroqLlama 3.3 70B, Qwen3 32B30 RPM / 14,400 RPD即時聊天(300–500 tok/s)不會
CerebrasLlama 3.3 70B, Qwen3 235B30 RPM / 1M tok/day批次處理(2,500+ tok/s)不會
OpenRouter35+ free models20 RPM / 200 RPD模型實驗視模型而定
Z.AI (Zhipu)GLM-4.7 Flash~1,000 RPD簡單任務的免費生產使用不清楚
GitHub ModelsGPT-4o, Claude 3.5 Sonnet, 45+10–15 RPM / 50–150 RPD免費使用一線模型不會

GitHub Models 將於 2026 年 7 月 30 日停用。 如果你在用,請在此之前遷移。OpenRouter 的免費方案或低成本彙總平台,是模型存取範圍相當的最直接替代方案。

你真正能做出的東西:每天處理約 200 組對話的客服聊天機器人(Gemini Flash 免費方案)。為小型團隊的 PR 做程式碼審查的機器人(Groq 免費方案、Llama 3.3 70B)。個人寫作助理(Cerebras 免費方案)。每天約 500 份文件的自動化資料抽取管線(GLM-4.7 Flash)。

你無法做出的東西:任何有 SLA 的東西。任何需要訓練選擇退出、處理敏感使用者資料的東西。任何會暴衝超過 50 個並行請求的東西。免費方案非常適合驗證——「真的有人想要這個產品嗎?」它們不是給生產用的。

$0 通往付費的橋樑。 從免費原型切換到付費生產的摩擦,通常涉及建立新帳戶、加入付款方式、以及更換 API 端點。彙總平台消除了這種摩擦:你在免費方案模型上做原型,準備好之後往預付餘額加上 $5–20,然後保持相同的端點、相同的 SDK 程式碼、相同的模型名稱。零遷移。這是從「我有個點子」到「我有個生產應用程式」最快的路徑,而且起步成本比一頓午餐還便宜。

便宜的 API 何時失效:品質的邊界

便宜模型有真實的限制。知道它們在哪裡會失敗,比知道它們在哪裡會成功更重要。

讓便宜模型處理吃力的任務:需要同時掌握 3 個以上限制條件的複雜多步驟推理(例如「分析這份合約、找出與加州法律牴觸的條款,並草擬替代文字」)。需要特定口吻或語氣的精細創意寫作。需要理解變更對架構影響的程式碼審查(不只是「這一行對不對」)。

聰明的升級模式。 把 80% 的請求路由到便宜模型(DeepSeek V4 Flash、$0.14/$0.28)。需要更多能力的 15%,升級到中階模型(DeepSeek V4 Pro、$0.44/$0.87,或 Claude Sonnet、$3/$15)。需要最大深度的 5%,升級到一線模型(Claude Opus、$5/$25,或 GPT-5.5、$5/$30)。加權平均成本:約 $0.55/M 輸出——比全部用一線模型便宜 98%。品質:對無法分辨是哪個模型處理請求的終端使用者來說,完全相同。附程式碼的完整路由實作,請看我們的自訂路由設定

讓便宜模型在規模下可行的關鍵。 帳面上成本 $0.14/M 的模型,實際使用仍然需要帳戶、付款方式和速率限制儀表板。疊加五個這種模型,你就回到要管理五個供應商關係的狀態——每個供應商的額外負擔吃掉省下來的錢。彙總平台把存取收斂到單一預付餘額來解決這個問題:一次存入 $10,把這篇文章中每個模型都透過同一個端點路由。跨數千使用者的用量彙總,意味著有效每 token 費率會低於官方零售價——通常便宜 10–20%。實際結果:你可以用 DeepSeek Flash 的有效輸入 $0.10/M,搭配 Claude Opus 的輸出 $22/M,一個帳戶、一張帳單搞定。這才是「便宜」真正便宜的時候。

FAQ

DeepSeek V4 Flash 真的和 GPT-4o 一樣好嗎?

在程式設計基準上:92% HumanEval 對比 92.5%(GPT-4o)。在一般推理上:85.5% MMLU 對比 88.7%(GPT-4o)。對 90% 的文字任務——分類、抽取、摘要、簡單程式設計——是的,功能上等效。對視覺、多模態和複雜多步驟推理:不是。差距可以測量,但對大多數生產工作負載來說無關緊要。詳細基準資料請看我們的完整四方比較

不用信用卡、絕對最便宜的 LLM API 是什麼?

智譜 AI 的 GLM-4.7 Flash——完全免費、128K 上下文、OpenAI 相容端點。Google Gemini Flash——免費方案、每天 1,500 個請求、不用信用卡。付費的話:DeepSeek V4 Flash 每百萬 token $0.14/$0.28,可透過接受替代付款的彙總平台取得,不需要信用卡。

中國的 AI API 適合生產使用嗎?

DeepSeek 和 Qwen 在付費方案上維持 99.5% 以上的正常運作時間。國際開發者主要的痛點是中文文件、直接註冊需要中國手機號碼,以及有限的英文社群支援。彙總平台解決這三點:英文文件、不需要手機號碼、以你的語言提供社群支援。一旦連上,API 的可靠度與西方供應商相當。

便宜的 API 會用我的資料訓練嗎?

要看情況。Google 的免費方案可能會用資料訓練(他們對此很明確)。DeepSeek 的政策語焉不詳——條款沒有清楚說明 API 資料是否用於訓練。智譜(GLM)的政策同樣不清楚。付費方案通常提供訓練選擇退出。企業方案有契約保證。如果你處理的是敏感資料,請使用資料使用條款清楚的供應商,或提供契約式資料處理協議的彙總平台。

我要怎麼從 $0 開始、一路擴展到生產?

先用免費方案(Google AI Studio、Groq、GLM-4.7 Flash)來建構和驗證。需要更高吞吐量時,往彙總平台的預付餘額加上 $5。你的程式碼不用改——相同的端點、相同的 SDK、相同的模型名稱。你只是得到更高的速率限制、付費方案的品質(非量化模型),以及需要時的進階模型存取。從「免費原型」到「付費生產」的轉換只要 60 秒、零程式碼變更。我們的入門指南會帶你走過完整設定。

這是你具體的下一步。審核你最近 1,000 次 API 呼叫。算算有多少次送給了輸出每百萬 token 高於 $5 的模型。把那批所有分類、抽取和簡單問答的呼叫,改路由到輸出 $0.28/M 的 DeepSeek V4 Flash。把所有程式設計和推理的呼叫,改路由到 $0.87 的 DeepSeek V4 Pro。讓一線模型保持待命,留給真正需要的 5% 請求——複雜除錯、法律分析、多步驟代理。這週就做改路由。你的帳單會下降 80 到 90%,使用者不會注意到差別,而且你再也用不著讀另一篇定價文章。

改路由只要十分鐘。如果你想把它變成一分鐘——定價表上每個模型都用同一個端點、不需要逐家供應商註冊、單一預付餘額——TokSpan 的彙總端點讓你只需更改模型字串,就能在 DeepSeek V4 Flash 和 Claude Opus 之間切換。免費方案涵蓋原型開發。付費方案從 $5 起。