TCO AnalysisSelf-HostingCloud APILLM InfrastructureCost Optimization

Cloud API vs Tự lưu trữ LLM: Phân tích TCO hoàn chỉnh 2026

1 phút đọc

Ở 100 triệu token mỗi ngày, cloud API đốt $180,000/tháng trong khi tự lưu trữ chỉ khoảng $22,000 —khoảng cách 88% khiến quyết định trông rõ ràng. Ở 10 triệu, TCO tự lưu trữ tính đủ —GPU dự trữ nằm không qua các giờ đêm thấp điểm, 0.3–0.5 FTE chi phí MLOps, độ trễ 2–6 tuần sau mỗi lần ra mắt model— thường vượt qua cloud API. Hầu hết đội nằm giữa hai thái cực này, và tính sai sẽ tốn gấp hai đến ba lần số họ lẽ ra phải trả. Dưới đây là khung TCO hoàn chỉnh. Hãy điền số của bạn vào để tìm điểm hòa vốn —chứ không phải quy tắc ước lượng của người khác.

Vì sao cả “Cloud đắt” và “Tự lưu trữ miễn phí” đều sai

Cái bẫy chi phí cloud

Ở 100 triệu token mỗi ngày với giá GPT-4o, hóa đơn API hàng tháng của bạn chạm khoảng $18,750. Con số đó trông đáng báo động —nhưng nó giả định mức tối ưu bằng không. Trên thực tế, hầu hết đội vận hành ở quy mô đó đang trả thêm 30–50% vì họ chưa triển khai định tuyến model phân tầng, prompt caching hay dùng batch API. Tối ưu chi tiêu cloud —trình bày đầy đủ trong hướng dẫn 12 cách tối ưu của chúng tôi— thường tốn ít hơn một tháng dự trữ GPU và mang lại tiết kiệm ngay trong cùng chu kỳ thanh toán. Dùng hết các phương án tối ưu cloud trước khi cân nhắc tự lưu trữ.

Cái bẫy chi phí ẩn của tự lưu trữ

Hai instance H100 dự trữ tốn khoảng $4,200 mỗi tháng. So với hóa đơn cloud $18,750 kia, trông như tiết kiệm 78%. Nhưng phần cứng chỉ chiếm 30–40% chi phí thực. Thêm kỹ sư MLOps 0.5–1.0 FTE ($6,000–12,000/tháng), rủi ro utilization GPU (70% thời gian rảnh trong giờ thấp điểm = thực chất trả tiền cho compute bạn không dùng), bảo trì cập nhật model (2–6 tuần mỗi chu kỳ nâng cấp), và chi phí cơ hội của việc không truy cập tức thì các model frontier mới. Dưới 50 triệu token mỗi ngày, TCO tự lưu trữ tính đủ thường vượt chi phí cloud API —đôi khi đáng kể.

Hiểu biết nền tảng

Cloud API tính phí cộng thêm mỗi token. Tự lưu trữ gánh chi phí cố định hạ tầng và kỹ thuật. Cái nào rẻ hơn hoàn toàn phụ thuộc nơi mức sử dụng của bạn rơi trên đường cong chi phí. Cloud thắng ở khối lượng thấp-vừa và workload nhấp nhô. Tự lưu trữ thắng ở khối lượng cao, ổn định. Hybrid thắng cho gần như mọi đội ở giữa.

Mô hình tài chính: Thứ thực sự đi vào TCO

Chi phí Compute

GPUTheo giờ (dự trữ)Token/giây (mô hình 8B)Phù hợp nhất cho
H100~$2.102,500+Mô hình 70B+, thông lượng cao (giá được đối chiếu với Artificial Analysis)
A100~$1.201,500+Mô hình 8–70B, thông lượng trung bình
RTX 4090~$0.10 (tương đương khi tự sở hữu)100+Mô hình 8B, phục vụ lưu lượng thấp

Lượng tử hóa —4-bit GPTQ hoặc AWQ— cắt yêu cầu VRAM 60–75% với đánh đổi chất lượng 1–3 điểm. Với Qwen3-8B, đó là khác biệt giữa cần A100 và chạy thoải mái trên RTX 4090. Hãy kiểm tra tác động chất lượng trên workload cụ thể của bạn trước khi chọn mức lượng tử hóa.

Nhân lực kỹ thuật

Đây là nơi hầu hết mô hình TCO sụp đổ. Tự lưu trữ không phải “cài một lần là chạy mãi”. Nó là pipeline sản xuất liên tục: thu mua GPU và quản lý tương thích driver, chọn framework và nâng cấp phiên bản (vLLM, SGLang hoặc TGI), tự động mở rộng và quản lý hàng đợi, giám sát và luân phiên on-call, chu kỳ nâng cấp model kèm A/B testing, vá bảo mật và giảm thiểu rủi ro chuỗi cung ứng. Sự cố malware LiteLLM tháng 3/2026 không phải một lần —đó là chuẩn mới cho hạ tầng tự quản lý. Dự trù 0.5–1.0 FTE cho mọi triển khai tự lưu trữ xử lý lưu lượng sản xuất.

Rủi ro utilization

Lưu lượng của bạn giảm còn 10% đỉnh giữa 1 giờ sáng và 5 giờ sáng. Những chiếc H100 vẫn chạy, vẫn tiêu điện, vẫn tốn bạn $2.10/giờ mỗi chiếc. Instance dự trữ đảm bảo khả dụng nhưng đòi dự báo năng lực chính xác. Spot instance tiết kiệm 60–80% nhưng có thể bị thu hồi với 30 giây thông báo —không thể chấp nhận cho workload sản xuất. Cloud API tính phí bằng không cho thời gian rảnh. Tự lưu trữ tính giá đầy đủ 24/7.

Chi phí cơ hội độ tươi của model

Một model chủ lực mới ra mắt. Người dùng cloud API đổi chuỗi model và triển khai trong vài phút. Người dùng tự lưu trữ bắt đầu chu kỳ đánh giá và di chuyển hai-tới-sáu tuần: tải trọng số, benchmark với model hiện tại, tối ưu lại prompt, A/B test, ra mắt sản xuất. Với sản phẩm nơi khác biệt cạnh tranh phụ thuộc chất lượng model, độ trễ này có chi phí kinh doanh thực —có thể vượt cả khoản tiết kiệm hạ tầng.

Hãy điền số của bạn vào mô hình trên. Để neo phân tích vào giá thực, đây là cách TCO tách ra ở ba quy mô đại diện —bao phủ dải nơi hầu hết đội vận hành hôm nay.

Phân tích hòa vốn ở ba quy mô

Nhỏ: 10M token/ngày (~300M/tháng)

Cloud API: Mức trộn $2/M token qua định tuyến phân tầng —$600/ngày, ~$18K/tháng.

Tự lưu trữ: 1×H100 dự trữ ($1,512/tháng) + 0.3 FTE MLOps ($3,600/tháng) + chi phí hạ tầng ($500/tháng) —~$5,612/tháng.

Trên giấy, tự lưu trữ tiết kiệm 69%. Nhưng điều này giả định utilization GPU >85% và một 0.3 FTE thực sự tồn tại chứ không phải kỹ sư backend trụ cột của bạn kiêm luôn. Ở utilization 50% (lưu lượng nhấp nhô), chi phí tự lưu trữ tăng lên ~$7,500/tháng —tiết kiệm co lại còn 58%. Ở utilization 30% (thường gặp cho sản phẩm giai đoạn đầu), tiết kiệm rơi dưới 40% —và một sự cố driver GPU xóa sạch nhiều tháng tiết kiệm theo thời gian kỹ thuật.

Phán quyết: Cloud, kèm tối ưu chi phí. Triển khai định tuyến phân tầng và prompt caching trước. Đánh giá lại ở 50M token/ngày.

Trung bình: 50M token/ngày (~1.5B/tháng)

Cloud API: ~$90K/tháng mức trộn.

Tự lưu trữ: 2×H100 ($3,024) + 0.5 FTE MLOps ($6,000) + hạ tầng riêng ($1,000) —~$10,024/tháng.

Tự lưu trữ giờ rõ ràng rẻ hơn —tiết kiệm 60–70%— kể cả khi tính 40% rủi ro utilization và toàn bộ chi phí kỹ thuật. Đây là vùng giao cắt nơi tự lưu trữ xứng với độ phức tạp vận hành của nó.

Phán quyết: Tự lưu trữ, hoặc hybrid. Bắt đầu lên kế hoạch thu mua GPU ở 30M token/ngày để vận hành khi chi phí cloud chạm $75K/tháng.

Lớn: 100M+ token/ngày (~3B/tháng)

Cloud API: $180K+/tháng.

Tự lưu trữ: cụm 4–8×H100 ($6–12K) + 1.0 FTE MLOps ($10K) + hạ tầng riêng ($2K) —$18–24K/tháng.

Lợi thế tự lưu trữ nới rộng lên 80%+. Ở quy mô này, bạn gần như chắc chắn đã có đội hạ tầng riêng —tính toán TCO nên bao gồm khấu hao, không gian trung tâm dữ liệu, băng thông mạng và dự phòng.

Phán quyết: Tự lưu trữ là người thắng kinh tế rõ ràng. Nhưng ở quy mô này, bạn không chọn giữa tự lưu trữ và cloud —bạn đang vận hành kiến trúc hybrid nơi tự lưu trữ xử lý nền và cloud cung cấp tràn và truy cập model frontier.

Hàng hybrid

70% lưu lượng định kỳ —tự lưu trữ hoặc API rẻ (DeepSeek V3.2 ở $0.27/M đầu vào). 30% lưu lượng phức tạp —model frontier cloud (Claude Sonnet 4, GPT-5.5). Tổng hybrid ở 50M token/ngày: ~$32K/tháng so với cloud thuần $90K/tháng —tiết kiệm 64% trong khi vẫn truy cập các model tốt nhất hiện có.

Chọn đúng model cho mỗi tầng cần dữ liệu giá hiện tại. So sánh giá LLM API 2026 của chúng tôi xếp hạng mọi model chính theo chi phí và năng lực cho từng loại tác vụ —để quyết định định tuyến của bạn phản ánh giá tháng này, không phải quý trước.

Kiến trúc hybrid: “Điểm tốt nhất của cả hai” thực sự trông thế nào

Phần này cho bạn tổng quan kiến trúc và cơ sở chi phí cho từng mẫu hybrid. Cho triển khai Python hoàn chỉnh với mã định tuyến, kết nối hạ tầng và kiến trúc bộ phân loại PII, xem S10: Kiến trúc LLM hybrid —Hướng dẫn triển khai.

Mẫu 1: Định tuyến model phân tầng

Mọi lưu lượng chảy qua một gateway API hợp nhất. Bộ phân loại nhẹ xác định độ phức tạp. Tác vụ đơn giản (phân loại, trích xuất, Q&A đơn giản) định tuyến đến model rẻ —Qwen3-8B tự lưu trữ hoặc DeepSeek V3.2 qua API. Tác vụ trung bình định tuyến đến model cloud tầng giữa. Tác vụ phức tạp —suy luận đa bước, lập trình agentic, tương tác khách hàng nhạy cảm— định tuyến đến model frontier cloud.

Hạ tầng chính: một base URL, một API key, logic định tuyến ở lớp gateway. Mã ứng dụng không biết cũng không quan tâm request cuối cùng chạy ở đâu. Xem hướng dẫn kiến trúc đa model của chúng tôi cho phần triển khai.

Mẫu 2: Nền tự lưu trữ + tràn cloud

Inference tự lưu trữ xử lý tải nền —phần lưu lượng ổn định có thể dự đoán mà nếu không bạn phải trả markup cloud cho nó. Khi nhu cầu vượt năng lực, tràn tự động định tuyến đến endpoint cloud API. Stack tự lưu trữ duy trì utilization cao. Cloud cung cấp tính co giãn không cần cấp phát quá mức. Mảnh hạ tầng quan trọng: giám sát độ sâu hàng đợi ở gateway với trình kích hoạt tự mở rộng bật định tuyến cloud khi độ trễ tự lưu trữ vượt ngưỡng.

Mẫu 3: Nhạy cảm cục bộ + chung cloud

PII, PHI hoặc dữ liệu được quản lý khác —inference tự lưu trữ. Dữ liệu không bao giờ rời mạng của bạn. Danh sách tuân thủ giữ màu xanh. Truy vấn chung, dữ liệu công khai, workload không nhạy cảm —cloud API để truy cập model frontier mới nhất. Cùng ứng dụng. Cùng codebase. Cùng định dạng API. Chỉ khác quy tắc định tuyến —bộ phân loại PII gắn nhãn request, gateway định tuyến tương ứng.

Phản biện và giới hạn thành thật

”Model nguồn mở đang thu hẹp khoảng cách —sớm sẽ không còn lý do trả tiền cho cloud API.”

Trên benchmark rộng, đúng vậy: DeepSeek V3.2 kém GPT-4o dưới 5 điểm trên MMLU. Trên tác vụ rủi ro cao cụ thể —lập trình agentic đa bước phức tạp (SWE-bench verified), suy luận tầm frontier (GPQA Diamond), hiểu video đa phương thức— model độc quyền vẫn dẫn trước 8–15 điểm. Nếu khác biệt cạnh tranh của sản phẩm phụ thuộc các năng lực frontier này, tự lưu trữ thuần chưa khả thi. Thêm nữa: năng lực đa phương thức (video, audio) vẫn yếu hơn đáng kể ở model nguồn mở. Cho cái nhìn song song về khoảng cách năng lực theo loại tác vụ —không chỉ điểm benchmark tổng— xem thư mục model TokSpan với giá hiện tại và nhãn năng lực cho mọi model được hỗ trợ.

”vLLM và Ollama khiến tự lưu trữ trở nên đơn giản.”

Chúng khiến chạy một model đơn giản —từ nhiều ngày cấu hình xuống vài phút. Chạy một model không phải vận hành một dịch vụ sản xuất. Tự mở rộng qua nhiều GPU, xuống cấp mượt khi cập nhật model, phục vụ đa model với hàng đợi công bằng, tích hợp quan sát, hạ tầng A/B testing —vLLM và Ollama không giải quyết những thứ này. Bạn vẫn cần 0.3–0.5 FTE cho sẵn sàng sản xuất, kể cả với công cụ tốt nhất.

”Đội của tôi cần chủ quyền dữ liệu —tự lưu trữ là lựa chọn duy nhất của chúng tôi.”

Nếu yêu cầu tuân thủ của bạn bắt buộc dữ liệu không bao giờ rời mạng, inference tự lưu trữ cho workload nhạy cảm là không thể thương lượng. Nhưng điều đó không có nghĩa 100% tự lưu trữ. Mẫu hybrid 3 —dữ liệu nhạy cảm ở cục bộ, mọi thứ khác cloud— giữ truy cập model frontier trong khi thỏa mãn yêu cầu tuân thủ nghiêm ngặt nhất.

Câu hỏi thường gặp

Ở khối lượng nào tự lưu trữ trở nên rẻ hơn?

Điểm giao cắt nằm quanh 50M token mỗi ngày (1.5B/tháng) cho hầu hết kịch bản. Giữa 10–50M, câu trả lời phụ thuộc tỷ lệ utilization, năng lực kỹ thuật và đặc điểm workload. Dưới 10M, cloud API gần như luôn kinh tế hơn. Lời khuyên thực dụng nhất: chạy trên cloud, thêm giám sát/telemetry cho mọi thứ, thu ba tháng dữ liệu sử dụng thực, rồi mô hình hóa điểm hòa vốn cụ thể của bạn. Đừng tự lưu trữ dựa trên khối lượng dự kiến —hãy tự lưu trữ dựa trên khối lượng đo được.

Tôi chỉ cần dùng model rẻ hơn thay vì tự lưu trữ được không?

DeepSeek V3.2 ở $0.27/M token đầu vào tiến gần chi phí biên mỗi token của tự lưu trữ. Với nhiều kịch bản, định tuyến phân tầng với model cloud rẻ đạt được phần lớn mức giảm chi phí của tự lưu trữ mà không có bất kỳ chi phí vận hành nào. Cạn kiệt tối ưu định tuyến —dùng đúng model cho mỗi tầng độ phức tạp— trước khi cân nhắc tự lưu trữ. Nó mang lại giảm chi phí 50–70% với không thay đổi hạ tầng. Xếp hạng nhà cung cấp LLM API rẻ nhất cập nhật thường xuyên của chúng tôi theo dõi model nào cung cấp giá dưới $0.15 mỗi triệu token đầu vào mỗi tháng —tham chiếu nhanh khi gán model cho các tầng thấp hơn của bạn.

Model tự lưu trữ cần nâng cấp bao lâu một lần?

Các gia đình model nguồn mở chính (Llama, Qwen, DeepSeek, Gemma) phát hành phiên bản mới đáng kể mỗi 4–6 tháng. Mỗi lần nâng cấp cần 2–6 tuần cho đánh giá, tối ưu lại prompt, A/B testing và ra mắt sản xuất. Đây không phải gián đoạn thỉnh thoảng —là cam kết kỹ thuật định kỳ nên được đưa vào kế hoạch năng lực đội.

Kiến trúc hybrid đơn giản hơn, hay tôi chỉ đang thêm độ phức tạp?

Hybrid giới thiệu logic định tuyến và quản lý đa môi trường —độ phức tạp thêm thực sự. Nhưng nếu bạn dùng nền tảng API hợp nhất làm gateway, hầu hết độ phức tạp định tuyến được hấp thụ ở lớp hạ tầng. Mã ứng dụng của bạn thấy một endpoint. Span phát ra từ gateway (xem hướng dẫn quan sát của chúng tôi) hiển thị mọi endpoint —tự lưu trữ và cloud— trong một dashboard. Lợi ích vận hành của hybrid là bạn không bị ép vào quyết định tất cả hoặc không gì. Bắt đầu chỉ cloud. Thêm tự lưu trữ cho tầng cụ thể khi dữ liệu ủng hộ.

Còn việc dùng TokSpan hoặc OpenRouter so với đi trực tiếp thì sao?

Nền tảng tổng hợp API cung cấp giá bán buôn thấp hơn 15–35% so với mức bán lẻ trực tiếp API —đòn bẩy chi phí đầu tiên và dễ nhất cho người dùng cloud API. Chúng cũng cung cấp định tuyến phân tầng, quan sát tập trung và thanh toán hợp nhất giữa các nhà cung cấp qua một endpoint. Nếu bạn đang cân nhắc tự lưu trữ để giảm chi phí, hãy thử giá nền tảng tổng hợp trước. Khoản tiết kiệm có thể đủ để bạn ở lại cloud —với không thay đổi hạ tầng. Logic định tuyến phân tầng thúc đẩy những khoản tiết kiệm này được trình bày trong tài liệu custom routing —định tuyến dựa quy tắc, định tuyến ngữ nghĩa và dự phòng model tự động từ một endpoint API duy nhất.

“Tự lưu trữ so với cloud” là bài toán, không phải triết lý. Toán nói: cloud thắng dưới 10M token/ngày, hybrid thắng từ 10–100M, và lợi thế tự lưu trữ trở nên quyết định trên 100M —nhưng kể cả vậy, hybrid với tràn cloud cho truy cập model frontier là người thắng thực dụng cho hầu hết đội.

Bắt đầu với cloud. Thêm giám sát/telemetry cho mọi thứ. Thu dữ liệu thực. Mô hình hóa điểm hòa vốn của bạn. Việc dự trữ GPU có thể chờ. Tối ưu chi phí —định tuyến phân tầng, prompt caching, dùng batch API— không thể.

Muốn xem giá TokSpan so với mức trực tiếp của nhà cung cấp và chi phí tự lưu trữ ở quy mô của bạn? Khám phá giá TokSpan —truy cập API hợp nhất đến 200+ model với mức bán buôn thấp hơn 15–35% so với bán lẻ trực tiếp.