LLM API PricingAI Model ComparisonAPI Cost Optimization

So sánh giá LLM API 2026: xếp hạng mọi model

1 phút đọc

Một triệu token đầu ra tốn $0.15 trên DeepSeek-V3, $30 trên GPT-5.5 và $45 trên o1-Pro. Đó là chênh lệch giá gấp 300 lần —giữa những model mà, với phần lớn khối lượng công việc sản xuất, cho ra kết quả không thể phân biệt. Nếu bạn chọn nhầm model và không bao giờ nhìn lại, hóa đơn API của bạn đang kể câu chuyện đó ngay lúc này.

Khoảng cách là có thật và đang ngày càng rộng. Trong mười tám tháng qua, giá model hàng đầu tăng cùng với sự mở rộng năng lực suy luận, trong khi làn sóng song song các model hiệu suất cao —DeepSeek, Gemini Flash, Llama 4— đã đẩy mức sàn xuống gần bằng không. Kết quả là một thị trường nơi hai đội chạy khối lượng công việc tương tự có thể trả $300/tháng hoặc $9,000/tháng, và đội rẻ hơn thường mang lại trải nghiệm người dùng tốt hơn vì phản hồi nhanh hơn.

Thu hẹp khoảng cách đó không đòi hỏi đại tu hạ tầng. Một đội chuyển “xin chào” và “cảm ơn” qua một bộ phân loại nhẹ thay vì model suy luận và cắt $7,500 khỏi hóa đơn tháng $9,700 —giảm 78%— trong khi độ trễ cải thiện. Một đội khác bật prompt caching cho các system prompt lặp lại và tiết kiệm 50% chi phí token đầu vào mà không cần thay đổi code. Dữ liệu tổng hợp từ các hệ thống sản xuất cho thấy: định tuyến theo tầng model có hệ thống cộng với caching thường thu hồi được 60–80% chi phí LLM API.

Đây là những gì bạn sẽ nhận được: bảng giá bốn tầng bao phủ mọi model quan trọng vào tháng 7 năm 2026, bảng xếp hạng chất lượng trên mỗi đô la cho biết model nào thực sự mang lại giá trị cho số tiền bạn trả, ba gợi ý theo hồ sơ độc giả (không phải các tầng ngân sách chung chung) và một khung quyết định trả lời “model nào cho việc gì” trong một câu.

Bảng giá LLM API đầy đủ 2026

Có hơn 180 model khả dụng qua các API chính tính đến giữa năm 2026. Hầu hết bạn sẽ không bao giờ dùng. Điều quan trọng là hiểu cấu trúc giá —chứ không phải ghi nhớ từng con số. Các model gom vào bốn tầng dựa trên năng lực và chi phí. Đây là những gì bạn cần biết về mỗi tầng.

Tầng 1: Model hàng đầu ($2–30 mỗi triệu token)

Đây là những model cờ đầu. Bạn chạy chúng khi tác vụ đòi hỏi độ sâu suy luận tối đa: phiên gỡ lỗi phức tạp, quy trình agent đa bước, phân tích tài liệu pháp lý nơi một lần ảo giác tốn hơn cả request API.

Mô hìnhNhà cung cấpInput ($/1M tok)Output ($/1M tok)Context WindowSWE-bench Verified
GPT-5.5OpenAI$5.00$30.001M88.7%
GPT-5.5 ProOpenAI$30.00$180.00
Claude Opus 4.8Anthropic$5.00$25.001M88.6%
Claude Sonnet 4.6Anthropic$3.00$15.001M~85%
Gemini 3.1 ProGoogle$2.00 ($4 >200K)$12.00 ($18 >200K)1M (2M preview)80.6%

GPT-5.5 và Claude Opus 4.8 đứng đầu bảng xếp hạng SWE-bench Verified với kết quả ngang bằng về mặt thống kê. Trên thực tế, yếu tố quyết định không phải năng lực —mà là hệ sinh thái. GPT-5.5 có hệ sinh thái plugin và SDK lớn nhất. Claude Opus có giao thức sử dụng công cụ gốc mạnh nhất và tư duy mở rộng. Gemini 3.1 Pro là lựa chọn giá trị trong tầng này: rẻ hơn 2,5 lần so với GPT-5.5 về đầu ra, có gói miễn phí tốt nhất (1,500 request/ngày qua Google AI Studio) và là model duy nhất có hỗ trợ đa phương thức gốc —video, âm thanh và hình ảnh xử lý trong một request API duy nhất.

Tầng GPT-5.5 Pro ở mức $30/$180 mỗi triệu token tồn tại cho khối lượng công việc nơi độ sâu suy luận tối đa là bất khả nhượng: mô phỏng khám phá thuốc, xác minh chính thức các hệ thống an toàn tới hạn, nghiên cứu tiên phong. Với 99.7% trường hợp sử dụng, GPT-5.5 bản thường là lựa chọn đúng.

Tầng 2: Ranh giới giá trị ($0.50–$2 mỗi triệu token)

Đây là nơi cuộc cách mạng giá-hiệu suất 2026 diễn ra. Các model ở tầng này đạt 80%+ SWE-bench Verified —cạnh tranh với model hàng đầu của 18 tháng trước— với chi phí thấp hơn 5–20 lần.

Mô hìnhNhà cung cấpInput ($/1M tok)Output ($/1M tok)ContextSWE-bench
DeepSeek V4 ProDeepSeek$0.435$0.871M~85%
Qwen3.7 MaxAlibaba$1.25$3.751M80.4%
MiniMax M3MiniMax$0.60$2.401M80.5%
Kimi K2.6Moonshot$0.95$4.00256K80.2%
GLM-5.2Z.AI$1.40$4.401M
Mistral Large 3Mistral$0.50$1.50262K

Model nổi bật của tầng này là MiniMax M3: chỉ $0.03 mỗi điểm SWE-bench —năng lực code tốt nhất trên mỗi đô la của bất kỳ model nào trên thị trường. DeepSeek V4 Pro là nhà lãnh đạo giá trị tổng thể: chi phí đầu ra bằng 1/34 GPT-5.5 trong khi mang lại chất lượng code không thể phân biệt với model hàng đầu cho ~85% tác vụ thực tế.

Mistral Large 3 xứng đáng được nhắc đến đặc biệt cho các đội EU: tuân thủ GDPR, lưu trữ tại EU, có gói miễn phí và là model duy nhất trong tầng có câu chuyện cư trú dữ liệu rõ ràng.

Tầng 3: Ngựa thồ giá rẻ ($0.10–$0.50 mỗi triệu token)

Cho khối lượng công việc lớn, nhạy cảm chi phí, nơi không cần năng lực hàng đầu tuyệt đối:

Mô hìnhNhà cung cấpInput ($/1M tok)Output ($/1M tok)ContextTốt nhất cho
DeepSeek V4 FlashDeepSeek$0.14$0.281MSinh văn bản, phân loại, code đơn giản
GPT-5.4 NanoOpenAI$0.20$1.25128KHệ sinh thái OpenAI, nhu cầu chất lượng trung bình
GPT-4.1 NanoOpenAI$0.10$0.401MNgữ cảnh dài, giá OpenAI thấp nhất
Gemini 3.1 FlashGoogle$0.50$3.001MKhối lượng công việc đa phương thức lớn
Qwen3-32BAlibaba$0.18$0.2832KĐa ngôn ngữ (tiếng Ả Rập, tiếng Nhật, tiếng Hàn)
Llama 4 ScoutMeta (hosted)$0.11$0.3410MCửa sổ ngữ cảnh dài nhất trong tầng này

DeepSeek V4 Flash ở mức $0.14/$0.28 là mỏ neo của tầng này. Nó đạt 92% HumanEval (code) —thấp hơn GPT-4o chỉ 0.5 điểm— với giá đầu ra bằng 1/40. Cho phân loại văn bản, tóm tắt, Q&A đơn giản và sinh code mẫu, không có lý do gì để dùng thứ gì đắt hơn.

Tầng 4: Model miễn phí (vĩnh viễn)

Đây không phải bản dùng thử. Chúng miễn phí vĩnh viễn —với giới hạn tốc độ và lưu ý bạn cần hiểu trước khi xây dựng dựa trên chúng.

Mô hìnhNhà cung cấpGiới hạn tốc độContextLưu ý
GLM-4.7 FlashZ.AI~1,000 req/day128KMiễn phí hoàn toàn, tài liệu tiếng Trung là chính
Gemini 2.5 FlashGoogle1,500 req/day1MCó thể dùng dữ liệu để huấn luyện (gói miễn phí)
Model miễn phí của GroqGroq30 RPM / 14,400 RPDKhác nhauSuy luận nhanh nhất (300–500 tok/s)
Cerebras freeCerebras30 RPM / 1M tok/dayKhác nhauThông lượng batch nhanh nhất (2,500+ tok/s)
OpenRouter freeOpenRouter20 RPM / 200 RPDKhác nhau35+ model miễn phí, một key duy nhất

Gói miễn phí dành cho nguyên mẫu và công cụ cá nhân. Khoảnh khắc bạn cần độ tin cậy, SLA hoặc bảo đảm quyền riêng tư dữ liệu, hãy chuyển sang gói trả phí —hoặc tốt hơn, một nền tảng tổng hợp cho phép bạn mở rộng từ nguyên mẫu miễn phí lên sản xuất trả phí mà không đổi endpoint API.

Để phân tích đầy đủ về năng lực gói miễn phí —bạn thực sự có thể xây dựng gì với $0— xem hướng dẫn Nhà cung cấp LLM API rẻ nhất của chúng tôi (bài #3 của loạt bài này).

Khoảng cách giá 300 lần

Model rẻ nhất trong bảng này là $0.10 mỗi triệu token đầu vào (GPT-4.1 Nano). Đắt nhất là $30 mỗi triệu (GPT-5.5 Pro) —chênh lệch 300 lần chỉ riêng đầu vào. Về đầu ra, khoảng cách còn rộng hơn: từ $0.01/M (Qwen3-8B, GLM-4-9B ở mức sàn tuyệt đối) đến $180/M (GPT-5.5 Pro) —chênh lệch lên tới 18,000 lần giữa token đầu ra rẻ nhất và đắt nhất.

Điều gì tạo ra khoảng cách này? Ba thứ: năng lực model (độ sâu suy luận, độ chính xác code, hỗ trợ đa phương thức), chi phí suy luận (model lớn hơn cần nhiều giờ GPU hơn) và vị thế thị trường (OpenAI và Anthropic đặt giá cao cấp nhờ lợi thế hệ sinh thái —mọi hướng dẫn, SDK và công cụ đều hỗ trợ họ trước tiên).

Câu hỏi thực tế không phải “model nào rẻ nhất”. Mà là “model nào đủ tốt cho tác vụ của tôi, và tôi đang trả quá nhiều bao nhiêu cho năng lực mình không cần?”

Prompt caching thay đổi mạnh giá hiệu quả. Anthropic giảm 90% cho đầu vào được cache, các lần cache hit của DeepSeek chỉ tốn $0.0036/M, và với 80% độ phủ cache, chi phí đầu vào hiệu quả của bạn giảm khoảng 72%. Cho chiến lược caching đầy đủ giữa các nhà cung cấp và hướng dẫn triển khai, xem hướng dẫn triển khai caching của chúng tôi.

Ai nên dùng model nào: theo hồ sơ độc giả

Các “tầng ngân sách $50/$500/$5,000” chung chung vô dụng nếu không có bối cảnh. Đây là chân dung của bạn và những gì bạn nên dùng.

Lập trình viên solo

Bạn đang xây dựng một dự án phụ, nguyên mẫu hoặc SaaS nhỏ. Ràng buộc của bạn: ngân sách ($20–50/tháng cho API), thời gian (bạn là lập trình viên duy nhất) và ma sát (bạn không muốn tạo năm tài khoản nhà cung cấp). Bạn cần: một model rẻ xử lý 90% tác vụ + một model dự phòng cao cấp cho 10% còn lại.

Bộ công nghệ: DeepSeek V4 Flash làm công cụ hàng ngày ($0.14/$0.28). Với ~10% request cần độ sâu hơn, định tuyến tới Claude Sonnet 4.6 ($3/$15) hoặc GPT-5.4 Mini ($0.75/$4.50). Chi phí dự kiến: $25–50/tháng với ~2 triệu token đầu ra. Tất cả truy cập qua một endpoint tổng hợp duy nhất —không cần tài khoản nhà cung cấp riêng.

Lộ trình phát triển: khi dự án phụ đạt 10,000 request/ngày, bạn đã vượt gói miễn phí nhưng chưa cần hạ tầng doanh nghiệp. Nền tảng tổng hợp cho phép bạn giữ nguyên code, endpoint và chỉ tăng số dư trả trước. Không cần di chuyển. Xem hướng dẫn định tuyến đa model để thiết lập đầy đủ.

CTO khởi nghiệp

Bạn dẫn dắt đội 3–8 lập trình viên. App sản xuất của bạn thực hiện 50,000–200,000 request API mỗi tháng. Ràng buộc: độ tin cậy (downtime đánh mất người dùng), dự đoán được chi phí (hóa đơn mất kiểm soát giết chết nguồn vốn) và tốc độ phát triển (đội của bạn không nên dành thời gian quản lý tài khoản nhà cung cấp).

Bộ công nghệ: DeepSeek V4 Pro làm model code chính ($0.44/$0.87) —xử lý 70% request với chất lượng gần hàng đầu. Claude Sonnet 4.6 cho gỡ lỗi phức tạp và review PR ($3/$15). GPT-5.4 Mini cho quy trình agent ($0.75/$4.50). Gemini 3 Flash cho tác vụ đa phương thức ($0.50/$3). Chi phí dự kiến: $400–$1,200/tháng.

Hai quyết định kiến trúc quan trọng hơn cả chọn model: (1) Triển khai fallback model —app của bạn không bao giờ nên trả “model không khả dụng” cho người dùng vì một nhà cung cấp gặp sự cố. Một try/except hai dòng chuyển từ Claude sang GPT-5.5 khi lỗi 429 hoặc 5xx là khác biệt giữa “sự cố” và “không ai nhận ra”. (2) Đặt trần chi phí mỗi request. Không phải ngân sách tháng —mà giới hạn từng request. Một vòng lặp agent mất kiểm soát có thể đốt $50 token trước khi cảnh báo tháng kích hoạt.

Nền tảng tổng hợp xử lý fallback và định tuyến chi phí ở cấp hạ tầng. Nếu đội của bạn dành hơn 2 giờ/tháng quản lý bảng điều khiển nhà cung cấp, bạn đang trả một khoản thuế ẩn mà giá API trực tiếp không cho thấy. Xem toán so sánh chi phí trong bài tại sao lập trình viên chuyển sang nền tảng tổng hợp.

Kiến trúc sư doanh nghiệp

Bạn đang đánh giá hạ tầng LLM cho đội 50+ lập trình viên hoặc sản phẩm hướng khách hàng quy mô lớn. Ràng buộc: tuân thủ (SOC 2, HIPAA, EU AI Act, cư trú dữ liệu), quản trị (ai dùng model nào, khi nào, chi phí bao nhiêu) và quản lý nhà cung cấp (bạn không thể đàm phán lại hợp đồng với năm nhà cung cấp mỗi quý).

Bộ công nghệ: sự kết hợp model của bạn phụ thuộc khối lượng công việc —nhưng hạ tầng quan trọng hơn việc chọn model. Ở quy mô doanh nghiệp, ba thứ quyết định tổng chi phí: tỷ lệ hit prompt caching (mục tiêu >60% để giảm nửa chi phí đầu vào), tận dụng batch API (mọi khối lượng không real-time nên dùng batch với giảm giá 50%) và hiệu quả định tuyến đa model (khác biệt giữa “mọi request đến GPT-5.5” và “định tuyến thông minh” thường là giảm 60–80% chi phí).

Tự lưu trữ gateway như LiteLLM cho bạn toàn quyền kiểm soát cư trú dữ liệu, quản lý khóa và nhật ký kiểm toán —nhưng cần đầu tư DevOps. Nền tảng tổng hợp được quản lý cung cấp cùng tầng quản trị (khóa ảo với ngân sách và danh sách model cho phép theo đội, dấu vết kiểm toán hợp nhất, tùy chọn cư trú dữ liệu) mà không cần gánh nặng hạ tầng.

Cho đường cơ sở bảo mật mà mọi triển khai LLM doanh nghiệp cần, hãy bắt đầu với hướng dẫn quản lý API key. Sau đó thêm các yêu cầu tuân thủ riêng cho ngành của bạn. Nhưng bảo mật và tuân thủ chỉ là một nửa phương trình chi phí doanh nghiệp —nửa còn lại là điều xảy ra khi đội của bạn cần đổi hướng.

Chi phí ẩn không ai theo dõi: di chuyển. Mỗi lần đổi model, bạn phải đo lại benchmark prompt của mình. Một đội năm kỹ sư dành hai ngày mỗi lần di chuyển với giá $500/ngày đốt $5,000 cho mỗi lần đổi model. Các đội chạy ba model đằng sau một lớp định tuyến đổi model trong sản xuất bằng cách thay một giá trị cấu hình —rồi đo kết quả trên lưu lượng thực với rollout 5%. Cùng kết quả. Không chi phí di chuyển. Bảng giá trên hiển thị chi phí mỗi token. Điều nó không hiển thị: khác biệt chi phí thực giữa cấu hình một model và đa model không nằm ở giá token —mà ở ma sát tổ chức của sự thay đổi. Khi giá model đổi mỗi quý và đối thủ mới xuất hiện mỗi tháng, khả năng đổi model mà không tốn công sức kỹ thuật đáng giá hơn bất kỳ khoản giảm giá nào trên mỗi token.

Chất lượng trên mỗi đô la: bảng xếp hạng giá trị duy nhất đáng xem (tính đến tháng 7/2026)

Điểm benchmark không có giá là marketing. Giá không có điểm benchmark là mua hàng bịt mắt —các nền tảng độc lập như Artificial Analysis theo dõi cả hai trên mọi nhà cung cấp lớn. Chỉ số quan trọng là chất lượng mang lại trên mỗi đô la chi tiêu.

SWE-bench Verified mỗi đô la (giá trị code)

Bảng xếp hạng này chia điểm SWE-bench Verified của mỗi model cho giá đầu ra mỗi triệu token. Càng cao càng tốt —nghĩa là nhiều năng lực code hơn trên mỗi đô la.

Mô hìnhSWE-benchOutput $/MĐiểm mỗi đô la
DeepSeek V4 Flash~78%$0.28279
DeepSeek V4 Pro~85%$0.8798
MiniMax M380.5%$2.4034
Qwen3.7 Max80.4%$3.7521
Kimi K2.680.2%$4.0020
Gemini 3.1 Pro80.6%$12.007
Claude Opus 4.888.6%$25.003.5
GPT-5.588.7%$30.003.0

Công thức: phần trăm SWE-bench ÷ đô la đầu ra mỗi triệu token. Càng cao = càng nhiều năng lực code trên mỗi đô la.

DeepSeek V4 Flash mang lại 279 điểm code mỗi đô la —gấp 93 lần giá trị GPT-5.5 (3.0). Ngay cả DeepSeek V4 Pro, một model gần hàng đầu, cũng mang lại gấp 28 lần giá trị code mỗi đô la. Nhãn “bình dân” đang đánh giá thấp điều đang xảy ra: những model này mang lại code cạnh tranh hàng đầu với mức giá khiến các stack toàn hàng đầu nhìn lại là lãng phí.

Cách diễn giải quan trọng: Nếu bạn chi $1,000/tháng cho GPT-5.5 cho các tác vụ code, chuyển sang DeepSeek V4 Flash sẽ cho đầu ra chất lượng tương tự với khoảng $11/tháng. Chuyển sang DeepSeek V4 Pro: khoảng $30/tháng. Khoảng cách giữa “bạn đang trả” và “bạn có thể trả” rộng hơn hầu hết các đội nhận thức.

Chỉ số này phơi bày điều mà bảng giá thô không cho thấy. GPT-5.5 đạt 88.7% SWE-bench —cao nhất trong so sánh này. Nhưng nó đắt hơn 93 lần mỗi điểm benchmark so với DeepSeek V4 Flash. Với đội chi $5,000/tháng cho API code, hệ số 93 lần đó là khác biệt giữa hóa đơn $5,000 và hóa đơn $54 cho hiệu suất benchmark tương đương. Khoảng cách chất lượng —3 điểm phần trăm SWE-bench— tương đương khoảng một giải pháp đúng thêm cho mỗi 33 tác vụ code. Việc đó có đáng $4,946 mỗi tháng hay không là quyết định kinh doanh, không phải kỹ thuật. Hầu hết các đội, sau khi tính toán, phát hiện họ cần model hàng đầu cho khoảng 5% khối lượng thực tế.

MMLU-Pro mỗi đô la (giá trị suy luận tổng quát)

Mô hìnhMMLU-ProOutput $/MĐiểm mỗi đô la
DeepSeek V4 Flash85.5$0.28305
DeepSeek V4 Pro~87$0.87100
Qwen3.7 Max~86$3.7523
Claude Opus 4.8~89$25.003.6
GPT-5.5~89$30.003.0

Với các tác vụ kiến thức tổng quát và suy luận, khoảng cách giá trị còn rộng hơn code. DeepSeek V4 Flash đạt trong vòng 3,5 điểm GPT-5.5 trên MMLU-Pro —với giá mỗi điểm suy luận bằng 1/100.

Điểm ngọt giá trị

Nếu vẽ mọi model lên biểu đồ phân tán —điểm SWE-bench trên trục X, giá đầu ra trên trục Y— bạn thấy ba cụm:

  • Góc cao cấp (trên phải): GPT-5.5 và Claude Opus 4.8. Điểm cao nhất, giá cao nhất. Tốt nhất cho: tác vụ nơi câu trả lời sai tốn hơn request API.
  • Điểm ngọt giá trị (trên giữa, xa bên trái): DeepSeek V4 Pro, MiniMax M3, Qwen3.7 Max. 80%+ SWE-bench ở $0.87–3.75. Tốt nhất cho: 90% khối lượng sản xuất.
  • Vùng bình dân (giữa, xa bên trái): DeepSeek V4 Flash, GPT-4.1 Nano, Qwen3-32B. Chất lượng đủ dùng với chi phí gần bằng không. Tốt nhất cho: phân loại, trích xuất, tóm tắt, sinh code mẫu.

Các model vô nghĩa trên biểu đồ này: bất cứ thứ gì dưới 75% SWE-bench với đầu ra >$5/M. Bạn đang trả giá hàng đầu cho chất lượng không phải hàng đầu. Kiểm tra phiên bản model —bạn có thể đang chạy một model lỗi thời đã bị thay thế bởi phiên bản rẻ hơn, tốt hơn sáu tháng trước.

Nền tảng tổng hợp thay đổi phương trình giá trị như thế nào. Nhu cầu tổng hợp từ lượng lớn người dùng mở khóa giá mỗi token thấp hơn bất kỳ đội đơn lẻ nào đàm phán trực tiếp —cùng nguyên tắc kinh tế khiến bảng chất lượng mỗi đô la của bài viết này khả thi. Thêm định tuyến theo chi phí gửi mỗi request đến model rẻ nhất có thể xử lý, và một stack pha trộn (DeepSeek V4 Flash cho 70% lưu lượng + Claude Sonnet cho 20% + GPT-5.5 cho 10%) vận hành thấp hơn 30–50% so với đường cơ sở toàn hàng đầu. Người dùng cuối không nhận thấy khác biệt chất lượng vì mỗi request vẫn đến model phù hợp với độ phức tạp.

Khung quyết định nhanh

Nếu cần sinh code —DeepSeek V4 Pro (giá trị tốt nhất), Claude Opus 4.8 (chất lượng tốt nhất). Dự phòng: GPT-5.5.

Nếu cần phân tích tài liệu dài (>100K token) —Gemini 3.1 Pro (ngữ cảnh 2M, rẻ nhất mỗi token cho tài liệu dài). Dự phòng: GPT-4.1 Nano (ngữ cảnh 1M, $0.10/M đầu vào).

Nếu cần đa ngôn ngữ (không phải tiếng Anh) —Qwen3.7 Max hoặc DeepSeek V4 Pro (cả hai đều vượt GPT-5.5 ở benchmark C-Eval, tiếng Nhật, Hàn, Ả Rập). Dự phòng: Claude Opus 4.8.

Nếu cần thị giác/đa phương thức —Gemini 3.1 Pro (video + âm thanh + hình ảnh gốc). Dự phòng: GPT-5.5.

Nếu cần quy trình agent (tool calling) —GPT-5.5 (function calling đáng tin cậy nhất, thực thi công cụ song song tốt nhất). Dự phòng: Claude Opus 4.8 (suy luận đa bước phức tạp tốt nhất).

Nếu cần chi phí thấp nhất tuyệt đối —DeepSeek V4 Flash ($0.14/$0.28). Miễn phí: GLM-4.7 Flash (gói miễn phí vĩnh viễn, ngữ cảnh 128K).

Nếu bạn cần khả dụng toàn cầu —Dùng nền tảng tổng hợp cung cấp truy cập tới mọi model qua một endpoint. Không rào cản thanh toán theo nhà cung cấp. Một API key.

Câu hỏi thường gặp

Model nào rẻ nhất tổng thể trong 2026?

DeepSeek V4 Flash ở mức $0.14 đầu vào / $0.28 đầu ra mỗi triệu token. Để truy cập miễn phí vĩnh viễn: GLM-4.7 Flash (không cần thẻ tín dụng, ngữ cảnh 128K, tương thích OpenAI).

Claude Opus có đáng gấp 5 lần giá DeepSeek V4 Pro không?

Chỉ khi bạn cần các tính năng giao thức gốc Anthropic (tư duy mở rộng, computer use) hoặc ~3 điểm phần trăm cuối cùng của năng lực SWE-bench cho gỡ lỗi phức tạp. Với 95% tác vụ code, DeepSeek V4 Pro mang lại chất lượng không thể phân biệt với 1/29 chi phí đầu ra. So sánh chi tiết: xem so sánh OpenAI vs Anthropic vs Google vs DeepSeek của chúng tôi.

Nền tảng tổng hợp có thực sự tiết kiệm so với API trực tiếp không?

Áp dụng logic chi phí mỗi điểm benchmark từ phần Chất lượng mỗi đô la vào hóa đơn tháng của bạn và câu trả lời trở nên rõ ràng. Ba cơ chế cộng hưởng: (1) sức mua tổng hợp đẩy giá mỗi token xuống dưới mức tài khoản cá nhân đạt được, (2) bạn không còn để $50–200 khoản nạp tối thiểu nằm im trên bảng điều khiển nhà cung cấp, và (3) định tuyến theo chi phí áp dụng cùng logic tầng mà bài viết này mô tả —query đơn giản đến model $0.14/M, suy luận phức tạp đến model $3/M, công việc hàng đầu chỉ đến model $30/M. Các đội chạy ba model trở lên thường thấy tổng chi tiêu LLM giảm 30–50% so với duy trì tài khoản trực tiếp riêng không có lớp định tuyến.

Giá này thay đổi bao lâu một lần?

Các nhà cung cấp Trung Quốc (DeepSeek, Qwen, MiniMax, Kimi, GLM) cắt giá sáu lần chỉ riêng nửa đầu 2026. Các nhà cung cấp Mỹ (OpenAI, Anthropic) điều chỉnh theo quý. Google điều chỉnh mỗi 2–3 tháng. Nếu bạn dùng dữ liệu giá hơn 60 ngày tuổi, rất có thể bạn đang trả quá nhiều.

Giá batch API thì sao?

OpenAI, Anthropic và Google cung cấp giảm ~50% cho xử lý batch không đồng bộ (thời gian phản hồi 24 giờ). Giá batch của DeepSeek giống real-time —không giảm giá, nhưng cũng không phạt trễ. Cho chiến lược tối ưu chi phí với dữ liệu trước/sau, hướng dẫn 12 cách cắt giảm hóa đơn trình bày chi tiết.

Tôi có thể dùng API gói miễn phí trong sản xuất không?

Không. Gói miễn phí giới hạn 15–30 request/phút, không có SLA và một số (gói miễn phí của Google) có thể dùng dữ liệu của bạn để huấn luyện. Hãy dùng chúng cho nguyên mẫu và dự án cá nhân. Khi sẵn sàng sản xuất, nền tảng tổng hợp cho phép bạn chuyển từ nguyên mẫu miễn phí sang sản xuất trả phí mà không đổi endpoint API.

Bảng giá chỉ hữu ích nếu bạn hành động theo chúng. Chuyển từ stack mặc định hầu hết các đội dùng —mọi request đến GPT-5.5— sang stack đa model tối ưu với định tuyến thông minh thường mang lại giảm 80% chi phí với không mất chất lượng. Con số nằm trong bài viết này.

Đây là việc cần làm tiếp theo: chọn một model từ tầng 2 hoặc 3 trong bảng trên. Định tuyến 20% lưu lượng của bạn đến nó trong tuần này. Đo chất lượng. Nếu đủ tốt —và với 85% khối lượng công việc thì sẽ đủ— bạn vừa cắt hóa đơn 80%. Đó không phải con số mơ ước. Đó là phép toán trong phần “Chất lượng mỗi đô la”.

Các đội coi giá như một cuộc kiểm tra định kỳ —“quý sau hãy xem giá model”— là những đội phát hiện mình đã trả quá nhiều 80% trong sáu tháng. Giá biến động quá nhanh để review theo quý. Đặt nhắc lịch vào ngày đầu mỗi tháng. Kiểm tra bảng giá. Điều chỉnh quy tắc định tuyến. Năm phút. Đó là khác biệt giữa hóa đơn $1,000 và $200 —không phải model tốt hơn, không phải kỹ sư thông minh hơn, chỉ là một sự kiện lặp lại trong lịch.

Dữ liệu giá trong các bảng trên đã được xác minh với bảng điều khiển nhà cung cấp và phản hồi API vào tháng 7/2026. Xác nhận con số bằng prompt của riêng bạn —cùng model, cùng tham số, so sánh chi phí mỗi token— bằng playground của TokSpan, nơi báo cáo giá giữa các model song song mà không cần tài khoản nhà cung cấp. Số dư trả trước $5 là đủ để đo benchmark mọi model tầng 2 và tầng 3.