每天 1 億 Token 的用量下,雲端 API 每個月燒掉 $180,000,self-hosting 則只要約 $22,000——88% 的差距讓決策看起來一目了然。但在每天 1,000 萬 Token 時,把 self-hosting 的完整 TCO 算進去——深夜低谷裡閒置的預約 GPU、0.3–0.5 FTE 的 MLOps 人力、每次上線新模型背後的 2–6 週延遲——通常會超過雲端 API。大多數團隊落在這兩個極端之間,而算錯的代價是原本該付金額的兩到三倍。下面是完整的 TCO 框架。代入你自己的數字,找出你的損益平衡點——而不是別人的粗略估算。
為什麼「雲端很貴」和「Self-Hosting 免費」兩個說法都錯
雲端成本的陷阱
以 GPT-4o 定價、每天 1 億 Token 計算,你的月 API 帳單會衝到約 $18,750。這個數字看起來嚇人——但它假設了零優化。實際上,在這種規模運作的團隊大多多付了 30–50%,因為他們沒有實作分層模型路由、提示詞快取或批次 API 用量。優化你的雲端支出——我們的12 招成本優化指南有完整解說——通常花不到一個月的 GPU 預約費,而且在同一個帳單週期內就省回來。在考慮 self-hosting 之前,先把雲端優化榨乾。
Self-Hosting 隱藏成本的陷阱
兩台預約 H100 實例每個月約 $4,200。跟那張 $18,750 的雲端帳單比起來,看起來省了 78%。但硬體只佔真實成本的 30–40%。再加上 0.5–1.0 FTE 的 MLOps 工程師(月 $6,000–12,000)、GPU utilization 風險(流量低谷時 70% 閒置 = 你其實在為用不到的 compute 付錢)、模型更新維護(每次升級週期 2–6 週)、以及無法即時取得最新前沿模型的機會成本。在每天 5,000 萬 Token 以下,把 self-hosting 完整 TCO 算進去,常常超過雲端 API 的成本——有時還多不少。
根本洞察
雲端 API 對每個 Token 收加價。Self-hosting 扛的是固定基礎設施和工程人力。哪個便宜,完全取決於你的用量落在成本曲線的哪一段。低到中等用量、工作負載尖峰型的,雲端贏。高且穩定的用量,self-hosting 贏。中間的幾乎所有人,混合架構贏。
財務模型:TCO 裡到底裝了什麼
Compute 成本
| GPU | 每小時(預留) | Token/秒(8B 模型) | 最適合 |
|---|---|---|---|
| H100 | ~$2.10 | 2,500+ | 70B+ 模型、高吞吐量(價格已與Artificial Analysis交叉比對) |
| A100 | ~$1.20 | 1,500+ | 8–70B 模型、中等吞吐量 |
| RTX 4090 | ~$0.10(自有設備折算) | 100+ | 8B 模型、低流量推論 |
量化——4-bit GPTQ 或 AWQ——砍掉 60–75% 的 VRAM 需求,品質代價只有 1–3 分。以 Qwen3-8B 來說,這就決定了你需要 A100,還是 RTX 4090 就能順跑。在定下量化等級之前,先在你自己的工作負載上測一下品質影響。
工程人力
這裡是大多數 TCO 模型崩掉的地方。Self-hosting 不是「設定一次就自動跑」。它是一條持續的生產管線:GPU 採購與驅動相容性管理、框架選定與版本升級(vLLM、SGLang 或 TGI)、自動擴展與佇列管理、監控與 on-call 輪值、帶 A/B 測試的模型升級週期、安全修補與供應鏈風險緩解。2026 年 3 月的 LiteLLM 惡意軟體事件不是單一案例——它就是自管基礎設施的新常態。任何處理生產流量的 self-hosted 部署,都要編列 0.5–1.0 FTE。
Utilization 風險
凌晨 1 點到 5 點之間,你的流量掉到尖峰的 10%。那些 H100 還在跑、還在耗電、每台每小時照樣燒 $2.10。預約實例保證可用性,但要求準確的容量預測。Spot 實例省 60–80%,但可能只提前 30 秒通知就被回收——生產工作負載不能接受。雲端 API 對閒置時間收費零。Self-hosting 24/7 全價。
模型新鮮度的機會成本
新的旗艦模型登場。雲端 API 用戶改一行 model 字串、幾分鐘內部署完。Self-hosted 用戶則展開 2–6 週的評估與遷移循環:下載權重、跟現行模型跑基準、重新最佳化提示詞、A/B 測試、上生產線。對競爭優勢建立在模型品質上的產品,這個延遲有真實的商業成本——可能超過基礎設施省下的錢。
把你自己數字代入上面的模型。為了用真實定價落地分析,這是三個代表性規模下的 TCO 拆解——涵蓋今天大多數團隊運作的範圍。
三個規模的損益平衡分析
小型:每天 1,000 萬 Token(月約 3 億)
雲端 API: 分層路由下的混合費率約 $2/M Token——約 $600/天、$18K/月。
Self-hosted: 1×H100 預約($1,512/月)+ 0.3 FTE MLOps($3,600/月)+ 基礎設施雜支($500/月)——約 $5,612/月。
帳面上,self-hosting 省 69%。但這假設 GPU utilization 超過 85%、而且那個 0.3 FTE 是真的存在、不是你的首席後端工程師兼差。utilization 50%(尖峰流量)時,self-hosted 成本升到約 $7,500/月——省下來的縮到 58%。utilization 30%(早期產品常見)時,省下來的掉到 40% 以下——而且一次 GPU 驅動事件就把幾個月的省錢在工程時間上抹平。
判決: 雲端,加上成本優化。先實作分層路由和提示詞快取。到每天 5,000 萬 Token 再重新評估。
中型:每天 5,000 萬 Token(月約 15 億)
雲端 API: 混合費率約 $90K/月。
Self-hosted: 2×H100($3,024)+ 0.5 FTE MLOps($6,000)+ 專用基礎設施($1,000)——約 $10,024/月。
Self-hosting 現在明確便宜——省 60–70%——就算把 40% 的 utilization 風險和全部工程人力都算進去。這就是 crossover 地帶,self-hosting 在這裡賺回它營運上的複雜度。
判決: Self-hosting,或混合架構。在每天 3,000 萬 Token 時就開始規劃 GPU 採購,等雲端成本衝到 $75K/月時你已經能上線。
大型:每天 1 億+ Token(月約 30 億)
雲端 API: 每月 $180K 以上。
Self-hosted: 4–8×H100 叢集($6–12K)+ 1.0 FTE MLOps($10K)+ 專用基礎設施($2K)——每月 $18–24K。
Self-hosting 的優勢拉大到 80% 以上。這個規模下,你大概已經有專職的基礎設施團隊——TCO 計算該把折舊、資料中心空間、網路頻寬、冗餘都算進去。
判決: Self-hosting 是明確的經濟贏家。但在這個規模,你選的不是 self-hosting 還是雲端——你跑的是混合架構:self-hosted 扛基線,雲端做溢流和前沿模型通道。
混合的那一行
70% 的例行流量——self-hosted 或便宜的 API(DeepSeek V3.2,輸入 $0.27/M)。30% 的複雜流量——雲端前沿模型(Claude Sonnet 4、GPT-5.5)。每天 5,000 萬 Token 的混合總計:約 $32K/月 vs 純雲端 $90K/月——保留最好模型的存取,還省 64%。
每個階層該配哪台模型,需要最新的定價資料。我們的2026 LLM API 定價比較把所有主要模型依成本與任務類別能力排名——讓你的路由決定反映這個月的價格,而不是上一季的。
混合架構:「兩邊的長處」實際長什麼樣
這個章節給出每個混合模式的架構總覽與成本理由。包含路由程式碼、基礎設施黏合與 PII 分類器架構的完整 Python 實作,請見S10:混合 LLM 架構——實作指南。
模式 1:分層模型路由
所有流量都流經一個統一 API 閘道。一個輕量分類器判斷複雜度。簡單任務(分類、抽取、簡單問答)路由到便宜模型——self-hosted Qwen3-8B 或走 API 的 DeepSeek V3.2。中等任務路由到中階雲端模型。複雜任務——多步驟推理、agentic 寫程式、敏感的客戶互動——路由到前沿雲端模型。
關鍵基礎設施:一個 base URL、一把 API key、路由邏輯放在閘道層。應用程式碼不知道也不在乎請求最後在哪執行。實作請見我們的多模型架構指南。
模式 2:Self-Hosted 基線+雲端溢流
Self-hosted inference 扛基線負載——那部分可預測、穩定的流量,不然你原本要為它付雲端加價。當需求衝過容量,溢流自動路由到雲端 API 端點。Self-hosted 堆疊維持高 utilization。雲端提供彈性,不用過度佈建。關鍵基礎設施:閘道的佇列深度監控,配上一個自動擴展觸發器,self-hosted 延遲超過門檻時就把路由切到雲端。
模式 3:本地機密+雲端一般
PII、PHI 或其他受監管資料——self-hosted inference。資料永遠不離開你的網路。合規檢查清單維持綠燈。一般查詢、公開資料、非機密工作負載——走雲端 API,換取最新前沿模型。同一個應用程式。同一份程式碼庫。同一種 API 格式。只有路由規則不同——PII 分類器幫請求貼標籤,閘道照著路由。
反方論點與誠實的限制
「開放權重模型正在拉近差距——很快就不用付錢給雲端 API 了」
以廣義基準來說,是的:DeepSeek V3.2 在 MMLU 上落後 GPT-4o 不到 5 分。但對特定的高風險任務——複雜的多步驟 agentic 寫程式(SWE-bench verified)、前沿等級的推理(GPQA Diamond)、多模態影片理解——封閉模型仍然領先 8–15 分。如果你的產品競爭優勢靠這些前沿能力,純 self-hosting 目前還行不通。另外:開放權重模型的多模態(影片、音訊)能力仍然明顯較弱。要依任務類別並排比較能力差距——而不只是總體基準分數——請見TokSpan 模型目錄,每個支援的模型都有現行定價和能力標籤。
「vLLM 和 Ollama 讓 self-hosting 變得很簡單」
它們讓跑一個模型變簡單——從幾天的設定變成幾分鐘。但跑一個模型不等於營運一個生產服務。跨多張 GPU 自動擴展、模型更新期間的優雅降級、帶公平佇列的多模型服務、可觀測性整合、A/B 測試基礎設施——vLLM 和 Ollama 都不解決這些。就算用上最好的工具,你還是需要 0.3–0.5 FTE 來做生產就緒。
「我們團隊需要資料主權——self-hosting 是我們唯一的選項」
如果你的合規要求規定資料永遠不能離開你的網路,敏感工作負載走 self-hosted inference 沒得商量。但那不代表 100% self-hosting。混合模式 3——機密資料在本地、其他全部走雲端——在滿足最嚴格合規要求的同時,保留了前沿模型的通道。
常見問題
到多少用量 self-hosting 才開始變便宜?
多數情境下,交叉點落在每天 5,000 萬 Token(月 15 億)左右。10–50M 之間,答案取決於 utilization 率、工程容量和工作負載特性。低於 10M,雲端 API 幾乎永遠更經濟。最實用的建議:先在雲端跑、把一切都計測起來、收集三個月的真實用量資料、再建模你自己的損益平衡。不要用預估的用量決定 self-host——用量出來的數字決定。
我能不能直接改用便宜的模型就好,不用 self-hosting?
DeepSeek V3.2 輸入 $0.27/M,已經逼近 self-hosting 的每 Token 邊際成本。很多情境下,用便宜的雲端模型做分層路由,就能拿到 self-hosting 大部分的成本降幅,而且完全沒有營運雜費。在考慮 self-hosting 之前,先把路由優化榨乾——每個複雜度階層都用對的模型。它能做到 50–70% 的成本降幅,基礎設施零變動。我們定期更新的最便宜 LLM API 供應商排名每個月追蹤哪些模型提供每百萬輸入 Token 低於 $0.15 的定價——幫你指派下層階層時快速參考。
Self-Hosted 模型多久要升級一次?
主要的開放權重模型家族(Llama、Qwen、DeepSeek、Gemma)每 4–6 個月就釋出一次重大新版本。每次升級都要花 2–6 週做評估、提示詞重新最佳化、A/B 測試、上生產線。這不是偶爾的干擾——它是持續的工程承諾,該納入團隊容量規劃。
混合架構是比較簡單,還是我只是在加複雜度?
混合架構引入了路由邏輯和多環境管理——這是真的額外複雜度。但如果你用統一的 API 平台當閘道,大部分路由複雜度都被基礎設施層吸收掉。你的應用程式碼看到的是單一端點。閘道產出的 span(見我們的可觀測性指南)把 self-hosted 和雲端的所有端點收進同一個儀表板。混合架構的營運好處是:你不用被迫做全有或全無的決定。先純雲端開始。資料支持了,再為特定階層加入 self-hosted。
用 TokSpan 或 OpenRouter 跟直接連供應商差在哪?
API 聚合平台提供的批發價比直接零售 API 費率低 15–35%——這是雲端 API 使用者第一個、也最容易拉的成本槓桿。它們還提供分層路由、集中式可觀測性、跨供應商的統一計費,全走單一端點。如果你在考慮用 self-hosting 省成本,先試試聚合平台的定價。省下來的可能夠你留在雲端——基礎設施零變動。帶動這些省錢的分層路由邏輯,詳見自訂路由文件——從單一 API 端點做規則式路由、語意路由、自動模型降級。
「Self-host 還是雲端」是一道數學題,不是哲學。數學說:雲端在每天 1,000 萬 Token 以下贏,混合架構在 1,000 萬到 1 億之間贏,self-hosting 的優勢在 1 億以上變成決定性的——但就算在那個規模,帶雲端溢流換取前沿模型通道的混合架構,對大多數團隊還是更實用的贏家。
先從雲端開始。把所有東西計測起來。收集真實資料。建模你的損益平衡。GPU 預約可以等。成本優化——分層路由、提示詞快取、批次 API 用量——不能等。
想看 TokSpan 的定價在你那個規模下,跟直連供應商費率與 self-hosting 成本怎麼比?探索 TokSpan 定價——200+ 個模型的統一 API 存取,批發費率比直接零售低 15–35%。