LLM 工具的版圖擴張速度快到沒人跟得上——每個月都有幾十個新的 API gateway 產品上線。你無法評估每一項選擇——但你也經不起選錯之後,在六個月內把整個 AI 基礎設施重蓋一遍。
這篇文章是一張地圖。LLM API 技術棧的每一層。每一層的每個主要選項。根據團隊規模、合規需求和預算給出的簡潔建議。讀到最後,你會確切知道哪些工具你需要、哪些可以跳過。
六層 LLM API 技術棧
Layer 1: Model Providers (OpenAI, Anthropic, Google, DeepSeek, Qwen...)
—
Layer 2: API Gateway / Router (OpenRouter, LiteLLM, Portkey, TokSpan)
—
Layer 3: Observability & Cost (Langfuse, Helicone, W&B, platform-built-in)
—
Layer 4: Caching & Performance (Prompt caching, semantic caching, Redis)
—
Layer 5: Guardrails & Security (PII redaction, prompt injection detection, content filters)
—
Layer 6: Agent & Orchestration (LangGraph, CrewAI, AutoGen, raw code)
每一層都是獨立的決定。你可以換 gateway 而不動模型。加 caching 而不碰 agent。從第 1 層開始,隨著需求成長逐步加上其他層。模組化正是重點——面向未來,代表你在任何一層都不會被單一廠商的技術棧綁死。
第 1 層:模型供應商
核心五家。 OpenAI——生態系之王,所有 SDK 都最先支援,function calling 最可靠。Anthropic——程式深度(SWE-bench 88.6%)、最佳 extended thinking、最強的指令遵循。Google——原生多模態、最好的免費額度、2M 上下文。DeepSeek——成本領袖($0.14/$0.28)、HumanEval 92%、中文強項。Qwen——多語言領袖,非英語部署的最佳選擇。
專業五家。 MiniMax——每一美元換到的程式價值最高(每一美元 0.034 個 SWE-bench 分數點)。Kimi——強勁的長上下文推理。GLM——開源領袖,Flash 模型永久免費。Mistral——歐盟資料落地、GDPR 合規。Meta/Llama——自架部署、重視隱私的部署。
Artificial Analysis 的獨立基準測試追蹤所有主要模型在品質、速度與價格上的表現——在下定決心前,用它來驗證供應商的說法。
選型矩陣:
| 供應商 | 效能 | 成本 | 存取 | 合規 | 最適合 |
|---|---|---|---|---|---|
| OpenAI | ★★★★★ | ★★ | ★★★ | ★★★ | Agent、生態系 |
| Anthropic | ★★★★★ | ★★ | ★★ | ★★★ | 寫程式、推理 |
| ★★★★ | ★★★★ | ★★★★★ | ★★★ | 多模態、長上下文 | |
| DeepSeek | ★★★★ | ★★★★★ | ★★ | ★★ | 成本高效的寫程式 |
| Qwen | ★★★★ | ★★★★ | ★★★ | ★★ | 多語言 |
要在所有維度上最佳化,你至少需要三家供應商。一家旗艦(OpenAI 或 Anthropic)。一家成本高效(DeepSeek)。一家專業型(多模態選 Google、多語言選 Qwen、歐盟合規選 Mistral)。這就是 2026 年生產環境應用的最低可行供應商組合。
是實價,不是牌價。 OpenAI GPT-4.1 每百萬輸入/輸出 token 要 $2.00/$8.00。Anthropic Claude 4 Sonnet 收 $3.00/$15.00。DeepSeek V4 只要 $0.14/$0.28——最便宜與最貴的旗艦模型之間有 50 倍的差距。你的供應商組合應該貼合請求特性:如果 80% 的查詢是簡單分類或摘要任務,把它們路由到 DeepSeek,每天 1,000 萬 token 的量,每月大約省下 $1,500。把 Anthropic 或 OpenAI 留給真正需要旗艦推理的那 20%。這一個 routing 決定,是整個技術棧中槓桿最大的成本優化——但多數團隊從沒做過,因為預設全部都走 GPT-4.1,比想每個請求怎麼路由來得安心。
各家主要供應商的模型定價、速率限制與每 token 成本比較,請見我們的 2026 LLM 定價比較。
第 2 層:API Gateway / Router
候選。 OpenRouter——到首次呼叫最快、400+ 模型、5.5% 手續費。LiteLLM——MIT 開源、可自架、零每 token 加價。Portkey——最廣的模型目錄(1,600+)、最強的治理功能。TokSpan——原生多協定、全球網路、彈性付款。
決策框架。 獨立開發者——OpenRouter(最快上手)或 TokSpan(需要全球存取時)。有 DevOps 的 Python 團隊——LiteLLM(完全掌控、零加價)。合規導向——Portkey(SSO、RBAC、稽核)或 TokSpan(原生協定+全球存取)。全球/受限地區——TokSpan(為任何地方存取而生)。
自架的數學。 OpenRouter 的 5.5% 加價聽起來微不足道,直到你把它年化:每月 API 花費 $5,000 時,gateway 一年拿走 $3,300。月費 $40 的 Hetzner VM 上跑 LiteLLM 完全消掉這筆加價,卻引進新的成本——一旦你管理三家以上的供應商,每週要花 2–4 小時的 DevOps 心力。速率限制處理、prompt-caching 標頭傳遞、跨供應商不同錯誤格式的 retry 邏輯——每家供應商講的 OpenAI API 規格方言都略有不同,你的自架 gateway 就是那個翻譯。團隊一貫地把這個維護負擔低估 3 倍。規劃週說「我們自己架 LiteLLM 就好,它就是個 proxy」的開發者,正是六週後凌晨兩點在除錯「為什麼 DeepSeek 的串流回應弄壞我的 retry 邏輯」的那群人。
六維評分、TCO 計算與延遲基準測試的完整比較,請見我們的 API gateway 完整比較。
第 3–4 層:Observability 與 Caching
Observability。 Langfuse——開源、成長快速、tracing 良好。Helicone——採用前先看他們的公開 changelog 和 GitHub commit 紀錄,確認目前的維護狀態。Weights & Biases——企業級,大型團隊最佳。平台內建——零設定,多數團隊夠用。
Observability 的陷阱。 團隊慣性地過度儀表化:Langfuse 裡塞 15 個自訂 span、把 chain-of-thought 的每個中間步驟都灌進 dashboard,結果是每月 API 花費 $300,observability 帳單卻要 $200。你真正需要的只有四個指標:(1) 各模型延遲 p50/p95、(2) 各模型依 endpoint 的成本、(3) 各供應商錯誤率、(4) cache hit 率。在月 API 花費超過 $5,000 之前,其他都是雜訊。只有在某個具體的使用者抱怨(「dashboard 感覺很慢」)對應到一個這四個指標量不到的 span 時,才加自訂 tracing。
Caching。 供應商層級:prompt caching(Anthropic 省 90%、OpenAI 省 50%、DeepSeek $0.0036/M)。gateway 層級:LiteLLM、Portkey、TokSpan 的 semantic caching——不只快取完全相同的查詢,也快取相似的。應用層級:FAQ 回應的完全比對快取用 Redis。
Caching 實務。 prompt caching 聽起來像白送的錢——但它只在你的 system prompt 完全相同或幾乎相同時才會命中。如果你的 system prompt 隨使用者 session 改變(使用者名稱、上下文視窗、動態指令),cache hit 率會掉到零。Anthropic 的快取下限隨模型不同(依模型世代在 1,024–4,096 token 之間)——短的 prompt 可能完全沒好處。gateway 層的 semantic caching 用 embedding 相似度比對查詢,解決「不是完全一樣」的問題,代價是每個請求多一次 embedding API 呼叫。對多租戶負載的生產部署中的 FAQ 型應用,semantic caching 在每天 10,000 個請求時,通常能把延遲降 60%、成本降 40%。在宣布 caching 成功之前,先量你實際的 cache hit 率——很多團隊回報「我們啟用了 caching」,卻沒檢查它對自己的特定負載到底有沒有用。
整合式做法。 多數團隊不需要分開的 observability 和 caching 工具。把 gateway+observability+caching 整合進一個 dashboard 的聚合平台,能減少工具碎片化,讓你用單一視窗看遍所有供應商的成本、延遲與錯誤。
第 5–6 層:Guardrails 與 Agent Frameworks
Guardrails。 供應商內建:OpenAI moderation、Anthropic 安全篩選。gateway 層級:Portkey 的 20+ 個 guardrails、LiteLLM middleware、自訂 PII redaction。專用工具:複雜驗證管線用 Guardrails AI、企業用 NVIDIA NeMo。
三個決定你需要什麼 guardrail 的問題。 (1) 你處理使用者的 PII 嗎? 是——在 prompt 到達供應商之前,就在 gateway 層做 PII redaction。姓名、email、電話號碼、地址在你的基礎設施內就被剝掉——模型永遠看不到。(2) 你把模型輸出顯示給終端使用者嗎? 是——輸出內容篩選:毒性偵測、幻覺評分、離題分類。(3) 你在醫療、金融或法律領域嗎? 是——每個請求都帶稽核軌跡的專用 guardrails。三個都答「否」的話,供應商內建的篩選就夠了——那個階段加專用 guardrail 工具是過早的工程化,花了錢、加了延遲,卻沒降低風險。
從 gateway 層級開始。當你有具體的合規或內容安全需求時,再加上專用工具。
Agent framework——誠實的評價。 LangChain/LangGraph:最受歡迎、最複雜、也最可能讓你把除錯 framework 的時間花得比建 agent 還多。CrewAI:更簡單的多 agent,適合快速原型。AutoGen:微軟出品、企業級、強大但笨重。Raw code:永遠是個選項——agent loop 就是 50 行 Python。
沒人做基準測試的 overhead。 在社群基準測試和真實測試中,LangGraph 每次工具呼叫比 raw loop 多出約 200–300ms 的 framework overhead。每次 agent 呼叫 5 次工具呼叫,使用者就會感受到 1–2 秒跟模型速度無關的多餘延遲。CrewAI 的多 agent 協調大概再把 overhead 加倍。採納任何 agent framework 之前,先在實際負載上量它的每呼叫延遲——framework 的 README 不會提這個數字,而這正是團隊採用六個月後把 LangGraph 拆掉最常見的原因。留在 raw 的開發者,永遠不用排那場遷移。
多數團隊不需要 framework。先用 raw。只有在遇到某個它比 50 行自訂程式碼解決得更好的具體問題時才加——而真的加了,先量延遲成本再定案。
三種團隊輪廓的推薦技術棧
獨立開發者(月 $20–100)。 DeepSeek V4 Flash(主力)+ Gemini Flash 免費額度(overflow)+ TokSpan 或 OpenRouter(內建 observability 的 gateway)+ raw agent loop。約 50 行程式。週末上線。
小團隊/新創(月 $200–1,000)。 用聚合平台做多模型+內建 observability 與 caching+帶記憶體的 raw agent loop+回應快取用 Redis。一把 API key。一個 dashboard。一週上線。
企業(月 $5,000–50,000)。 用聚合平台或自架 LiteLLM 做多模型+ W&B 或 Langfuse(observability)+ Guardrails AI 或 gateway 層級 guardrails+ LangGraph(多 agent 複雜度值得的話)。專職 ML 基礎設施團隊。含合規審查,一個月內上線。
技術棧遷移指南:從個人到企業
你不會永遠待在同一個層級。週末把 MVP 送上線的技術棧,會在每天 50,000 個請求下崩掉。以下是怎麼演化——用具體的觸發點,而不是含糊的「感到痛再說」。
個人 → 新創。觸發點:月 API 花費 $200,或你這季唯一一家供應商出過 45 分鐘的服務中斷。 你已經超過免費額度了。現在單一供應商中斷代表你的產品掛了,而不只是週末專案掛了。遷移:加第二家模型供應商、採用聚合平台。TokSpan 和 OpenRouter 都能在零應用程式碼改動下處理多供應商 failover。這是個一個下午就能完成的遷移。在 gateway 加一把 API key、設一條 fallback 規則,你的應用從此撐得住任何單一供應商中斷。估計成本:gateway 手續費每月 $0–50。時間:4 小時。
新創 → 成長。觸發點:月 API 花費 $5,000,或財務要求按團隊拆成本。 gateway 的加價現在超過自架的成本。團隊需要按團隊歸屬成本、給 chargeback 用的部門預算。遷移:評估在專用 VM 上自架 LiteLLM。加 Langfuse 做按使用者、按 endpoint 的 tracing。在 gateway 層實作 semantic caching——在這種花費規模,就算 30% 的 cache hit 率,每月也省 $1,500。遷移預留 2 週,gateway 持續維護每週 2–4 小時。這一層,LLM 基礎設施由兼職 DevOps 或一個有幹勁的後端工程師接手。
成長 → 企業。觸發點:月 API 花費 $20,000 以上,或行事曆上排了合規稽核。 SSO、稽核日誌、資料落地保證、SLA 承諾。遷移:Portkey(託管治理)或自架 LiteLLM 搭配專用基礎設施。加 Guardrails AI 做帶每請求稽核軌跡的合規驗證管線。實作 prompt 版本控管與 A/B 測試基礎設施——這個規模下,最常被呼叫的 endpoint 延遲改善 5%,每個月就能省下數千美元。含專職 ML 基礎設施工程師,預留 1–2 個月。如果你的 12 個月路線圖裡有 SOC 2 或 ISO 27001,至少提前稽核 6 個月開始企業遷移——guardrail 和稽核日誌的實作永遠比估計的久。
2026 的過度宣傳 vs 現實
什麼是真的。 多模型 routing——單一最大的成本與可靠度槓桿。Agentic 工作流程——限定在特定任務時,是真的有變革性。prompt caching——90% 的節省是真的。工具標準化的 MCP——正在贏下協定戰爭。
什麼是過度宣傳。 「全自主 agent」——在邊緣案例上仍然會在生產環境掛掉。「一個模型統治一切」——沒有任何模型在所有維度都領先。「No-code AI 建置工具」——demo 和簡單內部工具很好用,但在複雜生產工作流程上容易壞。「AI 驅動 observability」號稱能自動偵測 LLM 流量異常——生產環境的誤報率高到團隊第一週就把 alert 關掉。對 LLM 指標做異常偵測是還沒解決的難題:延遲飆高可能是供應商劣化、新模型版本上線,或使用者上傳 50 頁 PDF。沒有你沒給它的應用層級脈絡,工具無法區分這些情況。
2027 年要來的。 跨供應商的 reasoning-as-a-service 標準化。內建認證與計費的 MCP 2.0。中國模型市場整併——六家打價格戰的競爭者不會全數存活。EU AI Act 上路,形塑企業的技術棧選擇。
沒人吹捧的安靜贏家。 結構化輸出模式——OpenAI 的 response_format 配 "type": "json_schema"、Anthropic 的 tool use strict mode 配 extended thinking、Google 的 controlled generation。2025 年,開發者花好幾週寫 regex parser 和 retry loop 應付模型吐出的壞 JSON。2026 年,你切一個參數,每次呼叫都拿到合法 JSON。這單一功能在生產環境消掉的 bug,比今年任何一個 agent framework 都多。如果你還沒切到結構化輸出,這週就做——大概 5 分鐘的設定變更,就除掉最常見的生產 LLM 失敗模式:悄悄壞掉的輸出,你的 JSON parser 抓得到、卻無法優雅復原。
TokSpan 實際在用的技術棧
這篇文章不是理論。這是截至 2026 年 7 月我們在生產環境跑的技術棧。
第 1–4 層(供應商、gateway、observability、caching):TokSpan 自己的平台。一把 API key。一個 dashboard。Python 寫的 raw agent loop——沒有 LangChain、沒有 CrewAI、沒有 AutoGen。高頻 endpoint 的完全比對回應快取用 Redis。請求日誌與按客戶成本歸屬用 PostgreSQL。
哪些運作得很好。 一把 API key 打通五家供應商、200+ 模型。供應商劣化時自動 failover——2026 年 3 月 OpenAI 中斷期間,我們的流量在 30 秒內轉到 Anthropic 和 Google,零程式碼改動。一個 dashboard 顯示各模型成本、延遲 p95 與錯誤率——我們前面推薦的四個指標,正是首頁 dashboard 上的四張圖。
我們誠實面對的。 我們的內建 observability 在自訂 tracing 上沒有 Langfuse 深。如果你需要 15 個自訂 span 的逐 agent 步驟延遲拆解,在那個使用情境下把 Langfuse 跟 TokSpan 並跑。我們的 semantic caching 對多租戶 SaaS 應用表現最好——那些跨使用者的查詢共享語意模式;而每 session 用獨特 prompt 的單一使用者應用,cache hit 率就低,通常 10–15%,對比多租戶負載的 40–60%。
我們 2026 年 7 月的數字。 五家供應商每月約 2 億輸入 token、4,000 萬輸出 token。每月成本:純 API 花費約 $1,200,semantic caching 省下 $80。gateway 延遲 overhead:p95 低於 50ms。這不是廠商基準測試——這是我們真實的生產資料。
常見問題
這個技術棧的每一層我都要嗎?
不用。獨立開發者可以跳過第 4–6 層。小團隊可以把第 2–4 層併進一個聚合平台。只有有合規需求、又有專職 ML 基礎設施團隊的企業,才需要完整的六層技術棧。從第 1 層開始。當你感受到沒有它們的痛時,再一層層加。
生產環境還能運作的技術棧,最簡單的是什麼?
一個聚合平台(合併第 1–4 層:模型存取、routing、observability、caching)+你程式裡一個簡單的 retry/fallback loop。約 30 行 Python。處理每天 10,000 個請求以下的絕大多數應用。當你超出 all-in-one 做法時,再針對特定層升級到專用工具。所有供應商的完整支援模型目錄,見 TokSpan 模型目錄。
我的 API gateway 該自建還是買?
前 6–12 個月買。摸清你的流量模式、成本結構與合規需求。然後,如果平台加價在你的規模下超過自架的營運成本,再評估自架 LiteLLM。損益平衡點通常在每月 API 花費約 $5,000–50,000。
我該學哪個 agent framework?
都不用。先學 raw agent loop——50 行 Python,對發生什麼事有完整理解。然後拿你真的有的問題去評估 framework。一頭跳進 LangChain 的開發者,除錯 framework 的時間比寫功能還多。從 raw 起步的開發者,等真的採用 framework 時,確切知道它在做什麼。
這個技術棧多久會變一次?
第 1 層(供應商)每季變——新模型、降價、停用。第 2 層(gateway)每年變。第 3–6 層每 6–12 個月變。你能做的最重要架構決定,就是使用一個把應用程式碼跟第 1 層變動隔離的 gateway。當 DeepSeek 降價或 OpenAI 停用某個模型時,變的是 gateway 設定。你的應用程式碼不會變。
不重蓋應用,怎麼應付供應商中斷?
用帶自動 failover routing 的 gateway。按能力(推理、程式、多模態)設主要與 fallback 供應商,而不是按特定模型名稱。當 OpenAI 中斷 30 分鐘時,你的 gateway 自動路由到 Anthropic 或 Google——應用程式碼原封不動。一個關鍵做法:每季測試一次 failover 路徑。設好 failover 卻從沒測過的團隊,會在使用者狂刷頁面的星期二下午三點、第一次真實中斷時,發現 fallback 鏈是壞的。每季預留 2 小時給 LLM 技術棧的混沌工程。手動停掉一家供應商,驗證請求在你的 p95 延遲目標內路由到 fallback。
基礎跑起來之後,單一 ROI 最高的改動是什麼?
prompt caching。cache hit 時延遲降 50–90%。快取的 token 成本降 50–90%。供應商層級只要約 10 行程式——在 system prompt 設一個 cache_control 中斷點,後續請求傳 cache ID。gateway 層級有 semantic caching 的話,應用程式碼零改動。如果你的 system prompt 每小時出現超過 10 次,不快取就是把看得見的錢留在桌上。這週就做——不要等下個 sprint、不要等「之後再做效能最佳化」。這是個星期五下午的任務,週一早上就回本。
中國的模型供應商夠可靠到上生產嗎?
可以,有一個條件:永遠透過帶自動 fallback 的 gateway 跑。DeepSeek 和 Qwen 用 10–50 倍低的成本交出旗艦級品質,但他們的 API 基礎設施沒有 OpenAI 或 Anthropic 成熟。根據我們的監控資料,偶發的 5–30 分鐘可用性波動大概每月 2–3 次。帶自動 failover 的 gateway 讓這些波動對使用者完全無感。不要讓你的應用直接對準單一中國供應商的 API endpoint——那才是錯誤。透過 gateway 路由、設定自動 fallback 到 Anthropic 或 Google,你就同時拿到成本節省與可靠度。
這裡的六層——供應商、gateway、observability、caching、guardrails、編排——給你一套 2026 年的決策框架。但更深的洞察是結構性的:LLM API 技術棧已經成熟到「模型選擇是最重大決定」的階段過去了。現在,架構才是持久的競爭優勢。模型會進步、價格會下降、供應商會起落——但一個設計良好的技術棧能吸收這些變動,不必逼你重蓋。謹慎選擇你的架構。放心地換你的模型。
建置你的技術棧 →——TokSpan 涵蓋第 1–4 層:供應商、gateway、observability 與 caching。一把 API key、一個 dashboard、面向未來的架構。