API Cost OptimizationLLM Cost ReductionToken Optimization

LLM API 成本優化:12 招砍掉 90% 帳單

閱讀 1 分鐘

柏林一個團隊每個月為 LLM API 付 $4,200。同一個應用程式。同樣的使用者量。實作這篇文章的策略之後:每個月 $340。輸出的品質——用使用者滿意度分數與任務完成率衡量——完全沒變。變的只有一件事:哪個請求交給哪個模型處理。

從「月付 $4,200 的焦慮」到「月付 $340 的安心」,大約花了四個小時的實作。這篇文章涵蓋創造這些省錢的 12 個策略,依影響力與投入排序。每個策略都附真實的前後成本資料。挑適合你工作負載的,把它們疊起來換取複利式的省錢。

第一層:高影響、低投入(策略 1–4)

這四個策略貢獻了省錢的大半——通常合計 70–85%——而且沒有一個需要超過一小時實作。

策略 1:挑選合適大小的模型。

單一最大的成本槓桿。你用輸出 $30/M 的 GPT-5.5,把支援工單分類成「緊急」或「不緊急」。DeepSeek V4 Flash 用 $0.28/M 就做到這件事——便宜 107 倍——而且在這個任務上的分類準確度完全相同。

實作就是一個簡單的分類器,把任務路由到適當的模型層。一個 50 行的 Python 函式。前:每月 $875(所有請求都給 GPT-5.5)。後:每月 $150(簡單任務給 DeepSeek Flash、複雜任務給 GPT-5.5)。省下:83%。

最簡單的起點:審計你最近 1,000 筆 API 請求。按任務複雜度分類——簡單(分類、抽取、簡單 Q&A)、中等(寫程式、分析、摘要)、複雜(多步推理、除錯、法律分析)。檢查每一筆是哪個模型處理的。數數看有多少「簡單」和「中等」請求送去了 $25–30/M 的模型。那些就是你的省錢候選。

一家 40 人的 SaaS 公司的支援工程團隊,正好跑了這樣一次審計。他們前三大成本驅動因素說出了一個清楚的故事。

工單分類吃掉 32% 的花費,而且需要在三標籤任務上達到 94%+ 的準確度。DeepSeek V4 Flash 在測試中打出 96%——跟 GPT-5.5 持平。文件 Q&A(花費的 18%)取自固定的知識庫,便宜模型處理得一模一樣。

回應起草才是關鍵的 28%。團隊測試了 DeepSeek Flash 起草回應,發現語氣不對、需要人工重寫。那些留在 GPT-5.5。

結果:每月 $3,100 降到 $380。兩個模型層涵蓋 70% 的請求。全部任務的準確度回落:零。

留在 GPT-5.5 的 30%,消耗了新預算的 68%——團隊很清楚每一塊錢去了哪裡。實作花了一小時。

關於「哪個任務該用哪個模型」的詳細拆解——包括 benchmark 分數與定價——在跨供應商成本比較裡。Token 定價的基礎,我們在入門指南裡有完整說明——輸入/輸出/快取/脈絡視窗定價怎麼運作的權威參考。

策略 2:所有靜態內容都做提示詞快取。

提示詞快取大幅砍掉跨請求重複內容的輸入成本——Anthropic 給 90% 折扣、OpenAI 給 50%、DeepSeek 快取命中只要 $0.0036/M。完整的快取機制、TTL 行為、以及逐供應商實作指南,請看提示詞快取怎麼運作

前:每天 500 次請求、10,000 Token 的系統提示詞,輸入 Token 每月 $500(GPT-5.5)。後:每月 $95(快取的系統提示詞+有 90% 快取折扣的 Claude Opus)。省下:81%。實作:在系統提示詞加一個 cache_control 區塊——3 行程式。

策略 3:非即時任務用批次 API。

每一次評測跑批。每一條資料處理管線。每一次夜間報表生成。每一份資料集標註工作。這些都不需要次秒級的回應。它們可以等幾個小時。OpenAI、Anthropic、Google 對接受 24 小時內回覆的批次請求,給約 50% 折扣。

前:每月 $200(評測跑批與資料處理用即時 API)。後:每月 $100(符合條件的任務用批次 API)。省下:50%。實作:把 client.chat.completions.create() 換成批次版——OpenAI 的批次 API用 JSONL 檔收請求、24 小時內回結果。根據我們的分析,團隊審計自己的負載後,通常會發現 30–50% 的 LLM 用量可以走批次。

策略 4:設硬性預算上限。

這不會省錢——它防止讓成本優化變得沒有意義的災難性超支。一家公司因為一把沒有花費上限的 API key,一個月虧掉 $500M。在三個層級設硬上限:供應商後台(最後防線)、平台/應用程式層(營運管控)、逐 key(使用者/功能歸屬)。80% 就告警。100% 就硬拒。五分鐘設定完成。在防患於未然上無價。

第二層:中等影響、中等投入(策略 5–8)

這些需要更多實作工作量,但會與第一層的策略疊加出額外的省錢。

策略 5:多供應商成本路由。

不同模型在不同價格點各有所長。DeepSeek V4 Flash:$0.14/$0.28——大量文字任務的最佳選擇。DeepSeek V4 Pro:$0.44/$0.87——寫程式最有價值。Claude Sonnet:$3/$15——預算內最強的推理。Claude Opus:$5/$25——需要時能給的最大深度。

成本型路由器分類每一筆請求,把它送去最便宜、又能勝任的模型。前:每月 $500(全部 Claude Sonnet)。後:每月 $120(60% 請求給 DeepSeek Flash、25% 給 DeepSeek V4 Pro、15% 給 Claude Sonnet)。省下:76%。實作:50 行 Python——複雜度分類器+路由表。多模型路由設定有完整程式碼。

策略 6:Token 優化。

你的提示詞比需要的長。審計你的系統提示詞——能不能用 2,000 Token 講完,而不是 5,000?你的 few-shot 範例——需要五個嗎,還是三個就有同樣的輸出品質?你的輸出長度——平均有用的回應只有 800 Token,你卻把 max_tokens 大方地設成 4,000?

所有請求合計減少 20–40% 的 Token,直接換成 20–40% 的成本下降。前:每筆請求平均 2,500 Token。後:1,600 Token(提示詞調校+收緊 max_tokens)。省下:Token 36%、成本等比例。實作:審計、刪減、測試、部署。一個下午。

策略 7:串流+提早停止。

串流不會降低每 Token 成本,但會減少浪費的 Token。當使用者在回應途中放棄對話——他已經從前兩句拿到需要的答案——非串流模式早已生成(而且計費)了完整回應。串流讓你在使用者斷線時停止串流。對 15–25% 放棄率的聊天機器人應用,這會省下 15–25% 的輸出 Token。實作:stream=True+追蹤用戶端斷線。

策略 8:應用程式層的回應快取。

快取相同或幾乎相同的回應。客戶問「你們的退貨政策是什麼?」——答案昨天以來都沒變。從快取回,而不是呼叫 LLM。FAQ 聊天機器人:30–80% 快取命中率。簡單的 Redis 實作:對使用者查詢做雜湊、查快取、命中就回、沒命中就呼叫 LLM。快取 TTL:依底層資訊多久變一次,1–4 小時。

第三層:影響較小、但值得做(策略 9–12)

這些單獨的省錢較小,但會累積,而且投入最少。

策略 9:縮短脈絡視窗。 有些供應商對長脈絡使用收更高費用——Google 的 Gemini 定價在 200K Token 以上加收附加費。如果你例行送出 300K Token 的提示詞,審計一下你到底需不需要完整脈絡,還是可以摘要/刪減。在 Gemini 上從 300K 砍到 150K,那些請求的輸入成本大概省 20%。

策略 10:模型專屬優化。 每個供應商都有一個被低估的成本節省功能。Anthropic:快取系統提示詞+工具定義,省 90%(大多團隊沒做)。Google:重複文件查詢用脈絡快取(大多團隊沒做)。OpenAI:較短的提示詞減少推理 Token 消耗(推理 Token 隨提示詞複雜度等比放大)。每家供應商各做一個優化。複利效果。

策略 11:談量價折扣。 直接 API:每個月花超過 $5,000 後,去要求承諾用量折扣。聚合平台:量價內建——平台把成千上萬使用者的需求匯總,把低於官方零售價的費率回饋給你。不用談判。沒有最低消費。

策略 12:清掉閒置存款。 每個直接供應商帳戶都有最低存款——通常 $10–20——它閒置在那、不生利息、卡住營運資金。五個供應商等於有 $50–150 凍結在各個後台。這不是每 Token 成本;這是直接 API 定價頁面刻意隱藏的資產負債表低效。聚合平台把五個閒置餘額併成一個可用餘額。存 $20。路由到每一種模型。快用完就補。對盯現金流的創業公司來說,救回 $150 凍結存款很有意義。對更大的團隊,只是財務每個月少對一項帳。

累積省錢:策略怎麼疊

策略的效果會複利放大。從策略 1(縮放模型,省 83%)開始。加上策略 2(提示詞快取,再省剩餘成本的 50%)。加上策略 5(多供應商路由,再省 20%)。算給你看:以 $1,000 為基準——策略 1 之後剩 $170、策略 2 之後剩 $85、策略 5 之後剩 $68。總計:減少 93.2%。

三個真實情境:

  • 個人開發者(每月 $50 基準):策略 1+2+8——約每月 $8。四小時實作。兩個換模型決定。
  • 新創(每月 $500 基準):策略 1+2+3+5——約每月 $65。一天實作。分層模型策略+提示詞快取設定。
  • 成長公司(每月 $5,000 基準):策略 1–5+10——約每月 $580。兩天實作。自訂路由+批次管線+供應商專屬優化。

實作優先序。 從投入—影響矩陣的左上角開始。策略 1(縮放模型)花 10 分鐘、省 83%。今天就做。策略 4(預算上限)花 5 分鐘、防止災難。現在就做。剩下的你有時間就按影響度依序實作。每個策略都在第一個月內回本它的實作時間。

FAQ

哪個策略最快省最多錢?

策略 1——挑選合適大小的模型。把簡單任務從 GPT-5.5(輸出 $30/M)換到 DeepSeek V4 Flash($0.28/M),是 10 分鐘的程式變更,通常省下 70–80% 的總 API 花費。審計你最近 1,000 筆請求。數出那些根本不需要頂尖能力的。把它們搬走。

提示詞快取真的省 90% 嗎?

對,在快取的輸入 Token 上——Anthropic 的話。如果你的輸入 Token 有 80% 被快取(系統提示詞、few-shot 範例、文件脈絡),你的有效輸入成本會掉約 72%。OpenAI 給 50%(有效約省 40%)。DeepSeek 快取讀取 $0.0036/M 在絕對金額上甚至更便宜。完整快取策略請見「提示詞快取完全解析」。

批次 API 值那個 24 小時延遲嗎?

對評測跑批、資料處理管線、報表生成、以及任何輸出是非同步消費的任務:值得。接受 24 小時回覆時間,換 50% 省錢。團隊審計自己的負載後,通常會發現 30–50% 的 LLM 用量可以走批次。

這些策略會影響輸出品質嗎?

策略 1 和 5 有可能——如果你把複雜任務路由到處理不了的模型。緩解方法:設一個品質下限。策略 1 的複雜度分類器要保守——拿不定主意時,往上路由、不要往下。其他所有策略(快取、批次、Token 優化、預算上限)對品質零影響。

聚合平台怎麼幫上成本優化?

策略 1、4、5、11、12 要不是平台內建,就是大幅簡化。模型分層與成本路由是設定項。預算上限是每把 key 的參數。量價自動套用。跨供應商沒有閒置存款。平台處理基礎設施;你專注應用程式。直接 vs 聚合的總成本詳細比較,請見我們的開發者為什麼轉移分析

$4,200 的 API 帳單和 $340 的 API 帳單之間的差別,不是不同的應用程式、不同的使用者、也不是不同的模型——只是不同的路由決定。這篇文章裡的策略就是那些路由決定。每一項都能在一小時內實作。大部分不到十分鐘。今天就把這份工作做完的團隊,省下了一場有人要問「為什麼 LLM 是公司裡成長最快的成本項目」的會議。

照優先序實作——你的財務團隊在第一個帳單週期內就會看到差別。

但更深的問題是:價格地板在哪裡?DeepSeek V4 Flash 已經用 $0.14 每百萬輸入 Token 交出 GPT-4 級的輸出。Meta 和 Mistral 的開源模型每個月都在進步。推理優化公司正從每一代硬體再擠出 30-50% 的效率。如果趨勢延續,到了 2027 年底,運行一個生產聊天機器人的成本會跌破每月 $1。真正的問題不是「我今天怎麼砍帳單?」而是「帳單幾乎歸零時,我要蓋什麼?」

這篇文章的策略是在真實生產負載上量出來的——柏林團隊從 $4,200 到 $340 的省錢,發生在一個下午之內。看到最大降幅的團隊有一個共同點:他們整合到單一終端,在那裡模型分層與成本路由是設定、而不是自訂基礎設施。TokSpan 的定價頁顯示聚合量下的逐模型費率——值得拿來跟你現在直接付的比一比,尤其是那些扛了大部分生產流量的第二層、第三層模型。