Cheap LLM APIFree AI APIAPI Cost Comparison

Nhà cung cấp API LLM rẻ nhất 2026: từ $0.10/triệu token

1 phút đọc

$0.14. Mỗi triệu token. Đó là chi phí AI trong sản xuất hiện nay. Không phải lỗi đánh máy. Không phải gói dùng thử.

Nhưng bạn có thể đang trả $30 cho mỗi triệu token cho GPT-5.5. Tức là ba xu cho mỗi phản hồi. Một nghìn phản hồi mỗi ngày: $30. Một tháng: $900. Trước cả khi bạn ra mắt. Trước khi bạn nhận ra các token suy luận đang âm thầm ngốn thêm 2–5x hóa đơn của bạn.

Dừng lại. Bạn không cần phải sống như thế này.

Vào năm 2026, tồn tại những mô hình có chi phí chỉ bằng 1/40 giá của OpenAI. Chất lượng tương đương cho 85% các tác vụ thực tế. Khoảng cách không nằm ở năng lực — mà nằm ở nhận thức.

Bài viết này phác họa toàn cảnh: 15 mô hình rẻ nhất được xếp hạng với chuẩn chất lượng thực tế, các khoản phí ẩn biến API “rẻ” thành sai lầm tốn kém, các gói miễn phí mà bạn thực sự có thể xây dựng tính năng sản xuất, và lộ trình từ con số 0 đến quy mô lớn mà không cần thay đổi dù chỉ một dòng mã.

API LLM Rẻ Nhất 2026: Xếp Hạng (tính đến tháng 7/2026)

“Rẻ” không có ý nghĩa gì nếu thiếu mức chất lượng tối thiểu. Mọi mô hình trong bảng xếp hạng này đều có trường hợp sử dụng đã được kiểm chứng nơi nó mang lại chất lượng chấp nhận được. Các mô hình rẻ nhưng không dùng được sẽ không được liệt kê.

Phân khúc Siêu Tiết Kiệm ($0.01–0.15 mỗi triệu token)

Đây là những mô hình rẻ nhất vẫn tạo ra đầu ra mạch lạc và hữu ích. Chúng xử lý đáng tin cậy các tác vụ phân loại, trích xuất, hỏi đáp đơn giản và tạo mã mẫu. Chúng không dành cho suy luận phức tạp.

Mô hìnhInput $/MOutput $/MContextMức chất lượng tối thiểuTrường hợp sử dụng tốt nhất
GLM-4.7 FlashFreeFree128K~85% của GPT-4o-miniXây dựng nguyên mẫu, chatbot đơn giản
GLM-4-9B$0.01$0.0132KTác vụ văn bản cơ bảnPhân loại siêu chi phí thấp
Qwen3-8B$0.01$0.0132KVăn bản cơ bản + mãTrích xuất chi phí tối thiểu
GPT-4.1 Nano$0.10$0.401MSuy luận vững chắcTác vụ tiết kiệm ngữ cảnh dài
Llama 4 Scout$0.11$0.3410MTốt so với phân khúcNgữ cảnh siêu dài (10M)
DeepSeek V4 Flash$0.14$0.281M92% HumanEvalTạo văn bản, phân loại, lập trình đơn giản

DeepSeek V4 Flash đặt chuẩn mực cho phân khúc này. Với 92% HumanEval — ngang chuẩn lập trình của GPT-4o trong khoảng 0.5 điểm — nó không chỉ “tốt với mức giá này”. Nó tốt, đơn giản vậy thôi. Với $0.14 đầu vào và $0.28 đầu ra (bảng giá chính thức của DeepSeek), bạn có thể xử lý 3.5 triệu token đầu ra với $1. Tương đương khoảng 2,600 trang văn bản được tạo ra. Hãy thử với GPT-5.5: cùng một lượng đầu ra sẽ tốn $105.

GLM-4.7 Flash xứng đáng được nhắc đến đặc biệt: nó hoàn toàn miễn phí với ngữ cảnh 128K và API tương thích OpenAI. Không cần thẻ tín dụng, không hết hạn dùng thử, không giới hạn sử dụng (trong phạm vi sử dụng hợp lý). Với việc xây dựng nguyên mẫu, dự án cá nhân và học tập, không có lý do gì để trả tiền cho bất kỳ thứ nào khác. Điểm trừ: tài liệu ưu tiên tiếng Trung, API có thể không ổn định trong giờ làm việc của Trung Quốc, và chính sách sử dụng dữ liệu không rõ ràng. Đừng gửi dữ liệu nhạy cảm qua nó.

Phân khúc Tiết Kiệm ($0.15–0.50 mỗi triệu token)

Những mô hình này mang lại chất lượng gần với tiên phong cho các tác vụ cụ thể với mức giá khiến việc “dùng GPT-5.5 cho mọi thứ” trở thành sai lầm $500/tháng.

Mô hìnhInput $/MOutput $/MSWE-benchTốt nhất cho
DeepSeek V4 Pro$0.435$0.87~85%Mô hình lập trình chính, suy luận tổng quát
Qwen3-32B$0.18$0.28~75%Đa ngôn ngữ (Nhật, Hàn, Ả Rập)
GPT-5.4 Nano$0.20$1.25Hệ sinh thái OpenAI, chất lượng trung bình
Llama 3.3 70B$0.10$0.40Tự lưu trữ, nhạy cảm quyền riêng tư

DeepSeek V4 Pro là mô hình lập trình có giá trị tốt nhất hiện nay. Với đầu ra $0.87/M và ~85% SWE-bench, nó chỉ tốn 1/29 chi phí của Claude Opus 4.8 để mang lại chất lượng lập trình không thể phân biệt trong ~85% tác vụ thực tế. Khoảng cách chỉ lộ ra ở các quyết định kiến trúc phức tạp và gỡ lỗi trường hợp biên — không phải ở chỗ “viết giúp tôi hàm phân tích file CSV”.

Qwen3-32B với $0.18/$0.28 là lựa chọn tốt nhất cho ứng dụng đa ngôn ngữ. Nó vượt trội GPT-5.5 ở các chuẩn C-Eval (tiếng Trung), tiếng Nhật, tiếng Hàn và tiếng Ả Rập. Nếu người dùng của bạn chủ yếu không nói tiếng Anh, đây có lẽ là mô hình tốt nhất của bạn bất kể giá cả.

Phân khúc Giá Trị ($0.50–1.50 mỗi triệu token)

Đây là những mô hình gần tiên phong đã gia nhập “câu lạc bộ SWE-bench 80%+” — ngưỡng năng lực mà 18 tháng trước chỉ dành riêng cho các mô hình $15–30/M.

Mô hìnhInput $/MOutput $/MSWE-benchContext
MiniMax M3$0.60$2.4080.5%1M
Qwen3.7 Max$1.25$3.7580.4%1M
Kimi K2.6$0.95$4.0080.2%256K
GLM-5$1.00$3.20200K
Mistral Large 3$0.50$1.50262K

MiniMax M3 là mô hình rẻ nhất trong câu lạc bộ SWE-bench 80%+ — đầu ra $2.40/M — và mang lại giá trị lập trình trên mỗi đô la tốt nhất trong mọi mô hình (0.034 điểm SWE-bench mỗi đô la; GPT-5.5 chỉ đạt 0.003). Với những đội ngũ cần chất lượng lập trình đảm bảo nhưng không thể biện minh cho mức đầu ra $25–50/M, đây chính là mô hình dành cho họ.

Chi Phí Ẩn Làm Đội Hóa Đơn Của Bạn

Giá niêm yết nói dối. Đây là những gì trang giá không cho bạn thấy.

Token suy luận vô hình và đắt đỏ. Khi GPT-5.5 hoặc Claude Opus “suy nghĩ” trước khi phản hồi, những token chuỗi suy nghĩ nội bộ đó bị tính theo mức giá đầu ra. Bạn không thấy chúng trong phản hồi — nhưng bạn vẫn phải trả tiền. Một yêu cầu tạo ra 500 token đầu ra hiển thị có thể đã tiêu thụ 1,500 token suy luận đằng sau hậu trường. Mức $30/M hiệu dụng của bạn trở thành $120/M cho yêu cầu đó. OpenAI gần đây đã thêm trường reasoning_tokens để theo dõi điều này; hãy giám sát nó.

Sự phình to thầm lặng của độ dài prompt. Prompt “phân loại đơn giản” của bạn bắt đầu với 200 token và hai ví dụ. Sáu tháng sau, bạn đã thêm năm ví dụ nữa, một đặc tả định dạng đầu ra chi tiết, và một đoạn mở đầu “bạn là một trợ lý hữu ích”. Giờ prompt đã lên 2,500 token. Bạn đang trả gấp 12.5 lần cho mỗi yêu cầu — và bạn không hề nhận ra vì mức tăng chi phí diễn ra từ từ. Hãy kiểm toán độ dài prompt hàng quý.

“Bẫy gói miễn phí” có nanh. Gói Gemini miễn phí của Google có thể dùng dữ liệu của bạn để huấn luyện. Chính sách quyền riêng tư của DeepSeek mơ hồ về việc sử dụng dữ liệu. Nhiều gói miễn phí phục vụ các phiên bản lượng tử hóa thấp hơn của mô hình (chất lượng kém hơn đáng kể so với gói trả phí). Và giới hạn tốc độ của gói miễn phí (15–30 RPM) sẽ làm hỏng ứng dụng sản xuất của bạn vào đúng thời điểm tồi tệ nhất. Gói miễn phí dành cho việc xây dựng nguyên mẫu. Ngay khi có người dùng thật, hãy chuyển sang gói trả phí.

Lãng phí giới hạn tốc độ thêm 15–20% chi phí vận hành. Nếu client của bạn thử lại khi gặp lỗi 429 với khoảng cách cố định 1 giây, bạn đang tạo ra một hiệu ứng đoàn quân bảo đảm thêm nhiều lỗi 429. Giải pháp là backoff hàm mũ với nhiễu jitter — tenacity trong Python, llm-retry-kit trong Node.js. Nhưng giải pháp lớn hơn là tiết lưu dự đoán: đọc các header x-ratelimit-remaining-* và giảm tốc trước khi chạm giới hạn. Để biết cách triển khai xử lý giới hạn tốc độ đầy đủ, xem hướng dẫn xử lý giới hạn tốc độ trong sản xuất của chúng tôi.

Để có sổ tay tối ưu hóa chi phí đầy đủ với 12 chiến lược kèm dữ liệu trước/sau, hãy đọc hướng dẫn cắt giảm chi phí API của chúng tôi.

API LLM Miễn Phí: Bạn Thực Sự Xây Được Gì Với $0

Năm 2026 có nhiều API LLM thực sự miễn phí và tồn tại vĩnh viễn hơn bất kỳ thời điểm nào trong lịch sử ngành. Đây là những gì thực sự dùng được — và mỗi cái có thể xử lý được gì.

Nhà cung cấpMô hìnhLimitTốt nhất choHuấn luyện trên dữ liệu?
Google AI StudioGemini 2.5 Flash1,500 req/dayXây dựng nguyên mẫu, ngữ cảnh dài, đa phương thứcCó (gói miễn phí)
GroqLlama 3.3 70B, Qwen3 32B30 RPM / 14,400 RPDChat thời gian thực (300–500 tok/s)Không
CerebrasLlama 3.3 70B, Qwen3 235B30 RPM / 1M tok/dayXử lý hàng loạt (2,500+ tok/s)Không
OpenRouter35+ free models20 RPM / 200 RPDThử nghiệm mô hìnhTùy theo mô hình
Z.AI (Zhipu)GLM-4.7 Flash~1,000 RPDSản xuất miễn phí cho tác vụ đơn giảnKhông rõ
GitHub ModelsGPT-4o, Claude 3.5 Sonnet, 45+10–15 RPM / 50–150 RPDTruy cập miễn phí mô hình tiên phongKhông

GitHub Models sẽ ngừng hoạt động vào ngày 30 tháng 7 năm 2026. Nếu bạn đang sử dụng nó, hãy di trú trước thời điểm đó. Gói miễn phí của OpenRouter hoặc nền tảng tổng hợp chi phí thấp là những lựa chọn thay thế đơn giản nhất với quyền truy cập mô hình tương đương.

Những gì bạn thực sự có thể xây dựng: chatbot hỗ trợ khách hàng xử lý ~200 cuộc hội thoại/ngày (gói miễn phí Gemini Flash). Bot đánh giá mã cho các PR của một đội nhỏ (gói miễn phí Groq, Llama 3.3 70B). Trợ lý viết lách cá nhân (gói miễn phí Cerebras). Đường ống trích xuất dữ liệu tự động cho ~500 tài liệu/ngày (GLM-4.7 Flash).

Những gì bạn không thể xây dựng: bất cứ thứ gì yêu cầu SLA. Bất cứ thứ gì xử lý dữ liệu nhạy cảm của người dùng cần tùy chọn từ chối huấn luyện. Bất cứ thứ gì vượt quá 50 yêu cầu đồng thời. Gói miễn phí rất tốt cho việc xác thực — “có ai thực sự muốn sản phẩm này không?”. Chúng không dành cho sản xuất.

Cây cầu từ $0 đến trả phí. Sự ma sát khi chuyển từ nguyên mẫu miễn phí sang sản xuất trả phí thường liên quan đến việc tạo tài khoản mới, thêm phương thức thanh toán và đổi endpoint API. Các nền tảng tổng hợp loại bỏ ma sát này: bạn xây dựng nguyên mẫu trên các mô hình gói miễn phí, thêm $5–20 vào số dư trả trước khi sẵn sàng, và giữ nguyên endpoint, mã SDK và tên mô hình. Không cần di trú. Đây là con đường nhanh nhất từ “tôi có một ý tưởng” đến “tôi có một ứng dụng sản xuất”, và chi phí khởi đầu ít hơn một bữa trưa.

Khi API Rẻ Thất Bại: Ranh Giới Chất Lượng

Mô hình rẻ có giới hạn thực sự. Biết chúng thất bại ở đâu quan trọng hơn biết chúng thành công ở đâu.

Các tác vụ mà mô hình rẻ gặp khó: suy luận đa bước phức tạp đòi hỏi giữ đồng thời 3+ ràng buộc (ví dụ: “phân tích hợp đồng này, xác định các điều khoản xung đột với luật California, và soạn thảo ngôn ngữ thay thế”). Viết sáng tạo tinh tế với giọng điệu hoặc phong cách cụ thể. Đánh giá mã đòi hỏi hiểu các hệ quả kiến trúc của một thay đổi (không chỉ “dòng này có đúng không”).

Mô hình leo thang thông minh. Định tuyến 80% yêu cầu đến mô hình rẻ (DeepSeek V4 Flash, $0.14/$0.28). Với 15% cần nhiều năng lực hơn, leo thang lên mô hình tầm trung (DeepSeek V4 Pro, $0.44/$0.87, hoặc Claude Sonnet, $3/$15). Với 5% cần độ sâu tối đa, leo thang lên mô hình tiên phong (Claude Opus, $5/$25, hoặc GPT-5.5, $5/$30). Chi phí trung bình có trọng số: khoảng $0.55/M đầu ra — rẻ hơn 98% so với dùng toàn tiên phong. Chất lượng: giống hệt đối với người dùng cuối không thể biết mô hình nào xử lý yêu cầu của họ. Để biết triển khai định tuyến hoàn chỉnh kèm mã, xem thiết lập custom routing của chúng tôi.

Điều khiến mô hình rẻ khả thi ở quy mô lớn. Một mô hình tốn $0.14/M token trên giấy tờ vẫn cần tài khoản, phương thức thanh toán và bảng điều khiển giới hạn tốc độ để sử dụng. Chồng năm mô hình như vậy lên, bạn lại quay về việc quản lý năm mối quan hệ nhà cung cấp — chi phí vận hành cho từng nhà cung cấp nuốt chửng khoản tiết kiệm. Các nền tảng tổng hợp giải quyết điều này bằng cách gộp quyền truy cập vào một số dư trả trước duy nhất: nạp $10 một lần, định tuyến mọi mô hình trong bài viết này qua cùng một endpoint. Việc gộp khối lượng hàng nghìn người dùng khiến mức giá hiệu dụng mỗi token thấp hơn giá bán lẻ chính thức, thường từ 10–20%. Kết quả thực tế: bạn có thể dùng DeepSeek Flash với giá hiệu dụng $0.10/M đầu vào cùng Claude Opus với $22/M đầu ra, từ một tài khoản, với một hóa đơn. Đó là lúc “rẻ” thực sự trở nên rẻ.

Câu hỏi thường gặp

DeepSeek V4 Flash có thực sự tốt bằng GPT-4o không?

Về chuẩn lập trình: 92% HumanEval so với 92.5% (GPT-4o). Về suy luận tổng quát: 85.5% MMLU so với 88.7% (GPT-4o). Với 90% tác vụ văn bản — phân loại, trích xuất, tóm tắt, lập trình đơn giản — có, về chức năng chúng tương đương. Với thị giác, đa phương thức và suy luận đa bước phức tạp: không. Khoảng cách đo được nhưng không quan trọng với phần lớn khối lượng công việc sản xuất. Xem so sánh bốn chiều đầy đủ của chúng tôi để biết dữ liệu chuẩn chi tiết.

API LLM rẻ nhất tuyệt đối mà không cần thẻ tín dụng là gì?

GLM-4.7 Flash của Zhipu AI — hoàn toàn miễn phí, ngữ cảnh 128K, endpoint tương thích OpenAI. Google Gemini Flash — gói miễn phí, 1,500 yêu cầu/ngày, không cần thẻ tín dụng. Nếu trả phí: DeepSeek V4 Flash ở mức $0.14/$0.28 mỗi triệu token, có thể truy cập mà không cần thẻ tín dụng qua các nền tảng tổng hợp chấp nhận thanh toán thay thế.

API AI Trung Quốc có đáng tin cậy cho sản xuất không?

DeepSeek và Qwen duy trì thời gian hoạt động 99.5%+ trên các gói trả phí. Những điểm ma sát chính với nhà phát triển quốc tế là tài liệu tiếng Trung, yêu cầu số điện thoại Trung Quốc để đăng ký trực tiếp, và hỗ trợ cộng đồng tiếng Anh hạn chế. Các nền tảng tổng hợp giải quyết cả ba: tài liệu tiếng Anh, không yêu cầu số điện thoại, và hỗ trợ cộng đồng bằng ngôn ngữ của bạn. Sau khi kết nối, độ tin cậy của API tương đương với các nhà cung cấp phương Tây.

API rẻ có huấn luyện trên dữ liệu của tôi không?

Tùy trường hợp. Gói miễn phí của Google có thể dùng dữ liệu để huấn luyện (họ nói rõ điều này). Chính sách của DeepSeek mơ hồ — các điều khoản không nêu rõ liệu dữ liệu API có được dùng để huấn luyện hay không. Zhipu (GLM) cũng có chính sách mơ hồ tương tự. Các gói trả phí thường cung cấp tùy chọn từ chối huấn luyện. Các gói doanh nghiệp có cam kết theo hợp đồng. Nếu bạn xử lý dữ liệu nhạy cảm, hãy dùng nhà cung cấp có điều khoản sử dụng dữ liệu rõ ràng hoặc nền tảng tổng hợp cung cấp thỏa thuận xử lý dữ liệu theo hợp đồng.

Làm thế nào để bắt đầu với $0 và mở rộng đến sản xuất?

Bắt đầu với các gói miễn phí (Google AI Studio, Groq, GLM-4.7 Flash) để xây dựng và xác thực. Khi cần thông lượng lớn hơn, thêm $5 vào số dư trả trước của nền tảng tổng hợp. Mã của bạn không thay đổi — cùng endpoint, cùng SDK, cùng tên mô hình. Bạn chỉ nhận được giới hạn tốc độ cao hơn, chất lượng gói trả phí (mô hình không lượng tử hóa), và quyền truy cập vào các mô hình cao cấp khi cần. Quá trình chuyển từ “nguyên mẫu miễn phí” sang “sản xuất trả phí” mất 60 giây và không yêu cầu thay đổi mã nào. Hướng dẫn bắt đầu của chúng tôi sẽ dẫn bạn qua toàn bộ thiết lập.

Đây là bước tiếp theo cụ thể của bạn. Kiểm toán 1,000 lệnh gọi API gần nhất. Đếm xem có bao nhiêu lệnh gọi đến các mô hình có giá trên $5 mỗi triệu token đầu ra. Đưa mọi lệnh gọi phân loại, trích xuất và hỏi đáp đơn giản trong nhóm đó về DeepSeek V4 Flash với $0.28 mỗi triệu token đầu ra. Đưa mọi lệnh gọi lập trình và suy luận về DeepSeek V4 Pro với $0.87. Giữ các mô hình tiên phong ở chế độ chờ cho 5% yêu cầu thực sự cần chúng — gỡ lỗi phức tạp, phân tích pháp lý, agent đa bước. Hãy thực hiện việc định tuyến lại trong tuần này. Hóa đơn của bạn sẽ giảm 80 đến 90 phần trăm, người dùng sẽ không nhận ra sự khác biệt, và bạn sẽ không cần đọc thêm bài viết về giá nào nữa.

Việc thay đổi định tuyến mất mười phút. Nếu bạn muốn rút xuống còn một — cùng endpoint cho mọi mô hình trong bảng giá, không cần đăng ký từng nhà cung cấp, một số dư trả trước duy nhất — endpoint tổng hợp của TokSpan cho phép bạn chuyển đổi giữa DeepSeek V4 Flash và Claude Opus bằng cách đổi chuỗi mô hình. Gói miễn phí bao trùm việc xây dựng nguyên mẫu. Các gói trả phí bắt đầu từ $5.