LLM API GatewayOpenRouterLiteLLMAPI Aggregation

API Gateway AI tốt nhất: OpenRouter vs LiteLLM vs Portkey

1 phút đọc

API key thứ năm vừa chạm giới hạn tốc độ. Production sập. Kênh Slack #incidents của bạn có 47 tin nhắn chưa đọc —ba trong số đó từ CEO. Một lập trình viên đang thủ công chuyển lưu lượng sang model dự phòng. Người khác đang tải lại trang trạng thái OpenAI. Người thứ ba đang tính xem nâng lên Tier 5 có rẻ hơn đổi nhà cung cấp không, và tính sai.

Đây là điều xảy ra khi hạ tầng LLM phát triển tự nhiên —một API key mỗi lần, một file .env mỗi lần— cho đến một ngày nó không còn phát triển, mà chỉ sập. Và phần bực bội: chuyện này vốn có thể đoán trước. Riêng tháng 6/2026, thị trường đã ra mắt 121 sản phẩm API gateway. Công cụ tồn tại. Vấn đề là chọn đúng cái trước sự cố tiếp theo của bạn, vì chọn sai nghĩa là di chuyển toàn bộ hạ tầng LLM sáu tháng sau.

So sánh này bao trùm bốn nền tảng quan trọng —OpenRouter, LiteLLM, Portkey và TokSpan— chấm điểm theo sáu tiêu chí quyết định liệu gateway có sống sót sự cố production đầu tiên của bạn hay không.

Thứ bạn nhận được: khung chấm điểm 6 tiêu chí tách điều thực sự quan trọng khỏi marketing, phân tích từng nền tảng với điểm mạnh thực và hạn chế thực, bảng so sánh chấm điểm kèm bằng chứng cho mọi đánh giá, ước tính TCO mỗi 100 triệu token và khung quyết định ánh xạ hồ sơ đội của bạn sang gateway đúng.

API Gateway AI là gì —và vì sao quan trọng năm 2026

API Gateway AI nằm giữa ứng dụng của bạn và nhà cung cấp LLM. Ứng dụng gửi request đến một endpoint. Gateway lo phần còn lại.

Trước gateway: API key rải rác từ năm nhà cung cấp trong file .env thuộc ba repo. Thanh toán riêng mỗi nhà cung cấp với tiền nạp tối thiểu và ngày gia hạn khác nhau. Không chuyển đổi dự phòng tự động —nếu OpenAI sập, người dùng thấy lỗi.

Giới hạn tốc độ quản lý mỗi nhà cung cấp, bởi người còn nhớ kiểm tra dashboard. Theo dõi chi phí qua bảng tính ai đó cập nhật thứ Sáu.

Sau gateway: một endpoint. Một bộ thông tin xác thực. Mã ứng dụng không bao giờ đổi khi bạn chuyển model.

Thanh toán gộp thành một số dư trả trước. Chuyển đổi dự phòng tự động né sự cố nhà cung cấp trong mili giây.

Giới hạn tốc độ quản lý ở cấp gateway với ngân sách theo đội và allowlist model. Theo dõi chi phí theo thời gian thực, từng request, từng người dùng, xuyên mọi nhà cung cấp.

Khi so sánh gateway, bạn đánh giá bốn khả năng kỹ thuật quyết định nền tảng có sống sót sự cố production đầu tiên hay không. Dịch giao thức —gateway nói tiếng OpenAI, Anthropic và Gemini gốc, hay đưa mọi thứ qua lớp dịch tương thích OpenAI làm mất tính năng riêng nhà cung cấp như extended thinking của Claude? Quản trị khóa —bạn phát hành được virtual key với ngân sách theo đội, allowlist model và dấu vết kiểm toán, hay mọi lập trình viên dùng chung một root key? Khả năng quan sát —bạn có quy gán thống nhất chi phí, độ trễ và lỗi xuyên mọi nhà cung cấp trong một dashboard, hay bạn khâu năm console nhà cung cấp và một bảng tính với nhau? Độ bền —gateway có thử lại với backoff lũy thừa, duy trì circuit breaker mỗi nhà cung cấp và tự chuyển dự phòng khi một nhà cung cấp suy giảm không? Bốn câu “có” là mức nền. Các nền tảng trong so sánh này khác nhau ở cách triển khai từng mục.

Khi nào cần: đội bạn có hơn một lập trình viên dùng LLM. Bạn dùng model từ hơn một nhà cung cấp. Bạn cần biết ai đã chi bao nhiêu.

Bạn không thể để “model không khả dụng” thành lỗi người dùng thấy được. Nói cách khác: bất kỳ đội nào đang xây ứng dụng production.

Khi nào không cần: bạn là lập trình viên solo prototyping với một model từ một nhà cung cấp. Truy cập API trực tiếp ổn. Thêm gateway khi đồng đội thứ hai gia nhập hoặc nhà cung cấp thứ hai được thêm —cái nào tới trước.

Cho các mẫu kiến trúc giúp thiết lập đa nhà cung cấp hoạt động trong production, xem hướng dẫn dùng nhiều model AI trong một app của chúng tôi.

Khung chấm điểm 6 tiêu chí

Gateway tự marketing bằng số lượng model. Số lượng model là tiêu chí ít quan trọng nhất. Đây là điều thực sự quan trọng trong production.

Chiều đánh giáĐo lường gìVì sao quan trọng
Protocol SupportCó hỗ trợ gốc OpenAI, Anthropic và Gemini không?Extended thinking của Claude không sống sót qua lớp dịch tương thích OpenAI. Gateway chỉ hỗ trợ OpenAI sẽ mất các tính năng tốt nhất của Claude.
Caching & PerformanceCaching ngữ nghĩa, passthrough caching prompt, chi phí độ trễChi phí gateway 50ms cho một lệnh gọi LLM 3 giây là không đáng kể. Chi phí 500ms là dễ nhận thấy. Tỷ lệ trúng cache quyết định chi phí thực tế của bạn.
Governance & SecurityVirtual key, ngân sách theo key, allowlist model, log kiểm toán, SSOĐây là ranh giới giữa “chúng tôi biết chi phí API của mình” và “cuối tuần trước ai đó đã đốt $5,000 mà chúng tôi không biết là ai”.
Pricing ModelMarkup theo token so với đăng ký cố định so với tính theo khối lượngMarkup theo token tích lũy theo quy mô. Giá cố định trở nên rẻ hơn khi bạn phát triển. Hãy biết mình đang ở mô hình nào.
Ecosystem & DocsHỗ trợ SDK, độ rộng tích hợp, chất lượng tài liệu, cộng đồngGateway tốt nhất cũng vô giá trị nếu đội của bạn không thể cấu hình logic thử lại mà không cần đọc mã nguồn.
Enterprise ReadinessSOC 2, HIPAA, triển khai VPC, nơi lưu trữ dữ liệu, SLAKhông thể thương lượng cho ngành bị quản lý. Không liên quan cho startup giai đoạn prototype. Không một điểm số nào phù hợp với mọi đội.

Mỗi nền tảng chấm 1–5 mỗi tiêu chí. Các điểm này phản ánh yêu cầu cấp production —không phải danh sách tính năng marketing.

Điểm 3 nghĩa là “dùng được nhưng có rào cản”. Điểm 5 nghĩa là “tốt nhất nhóm, không hạn chế đáng kể”.

Phân tích từng nền tảng

OpenRouter

Lời chào: “400+ model, một API key, zero vận hành.”

OpenRouter là điểm vào mặc định cho lập trình viên khám phá truy cập đa model. Đăng ký, lấy key, đổi base_urlquickstart của OpenRouter hướng dẫn— và bạn có truy cập mọi model chính qua một endpoint tương thích OpenAI duy nhất.

Gói miễn phí gồm 35+ model. Hỗ trợ BYOK (bring your own key) nghĩa là bạn có thể định tuyến qua OpenRouter trong khi dùng tài khoản nhà cung cấp của mình.

Điểm mạnh cốt lõi: thời gian đến lời gọi đầu tiên nhanh nhất mọi nền tảng. Danh mục model thực sự rộng —nếu một model có API, OpenRouter gần như chắc chắn hỗ trợ.

Mô hình tín dụng trả theo nhu cầu nghĩa là không ràng buộc trả trước. Gói miễn phí đủ hào phóng để prototyping thật.

Hạn chế nghiêm trọng: chỉ host —không tự lưu trữ, không triển khai VPC, không tùy chọn air-gapped. Không hỗ trợ giao thức Anthropic gốc —model Claude chạy qua lớp dịch tương thích OpenAI, làm mất thinking block và giảm hiệu suất tool-use. Không có guardrail nội tuyến —không ẩn danh PII, không chặn prompt-injection trong đường request.

Quản trị cấp lập trình viên —chỉ phạm vi cấp API key, không dấu vết kiểm toán gắn người dùng. Phí 5.5% khi mua tín dụng (tối thiểu $0.80) cộng dồn theo quy mô: với $10,000/tháng chi API, bạn trả $550/tháng cho OpenRouter. Đó là chi phí một instance LiteLLM tự lưu trữ trên server riêng.

Phù hợp nhất: lập trình viên solo và đội nhỏ cần thử nhanh nhiều model. Đường nhanh nhất từ “tôi muốn thử Claude Opus” đến “tôi có phản hồi”. Không phù hợp khối lượng production bị quản lý.

Điểm: Protocol 2 | Caching 3 | Governance 2 | Pricing 3 | Ecosystem 4 | Enterprise 1

LiteLLM

Lời chào: “MIT open-source. 100+ nhà cung cấp. Bạn kiểm soát mọi thứ.”

LiteLLM là proxy LLM open-source trên thực tế. Nó là server Python bạn triển khai trên hạ tầng của mình —Docker, Kubernetes hoặc bare metal. Nó phơi bày endpoint tương thích OpenAI định tuyến đến 100+ nhà cung cấp.

Phiên bản open-source gồm virtual key, ngân sách theo đội, theo dõi chi tiêu, caching ngữ nghĩa, thử lại với fallback và gateway MCP —tính năng nhiều nền tảng quản lý thu phí.

Điểm mạnh cốt lõi: kiểm soát hoàn toàn. Prompt của bạn không bao giờ rời hạ tầng. Virtual key với ngân sách theo người dùng và allowlist model miễn phí và open-source —không giấu sau gói doanh nghiệp.

Dự án LiteLLM có 53K+ sao GitHub và hỗ trợ 100+ nhà cung cấp. Caching ngữ nghĩa miễn phí trong OSS.

Hỗ trợ gateway MCP nghĩa là MCP server của bạn chạy được với bất kỳ model nào qua LiteLLM. Gốc Python —nếu đội bạn đã dùng Python, tích hợp dễ dàng.

Hạn chế nghiêm trọng: chỉ runtime Python/Uvicorn —nếu hạ tầng chạy Go hoặc Node, bạn đang thêm dịch vụ Python vào stack. Tính năng chính (ngân sách, virtual key, theo dõi chi tiêu) cần PostgreSQL —được ghi trong tài liệu nhưng dễ bỏ sót khi cài lần đầu. Không có UI trau chuốt —cấu hình bằng YAML và biến môi trường, ổn với đội DevOps nhưng bực bội với người ít kỹ thuật.

Không có sản phẩm VPC quản lý —muốn lợi ích LiteLLM mà không tự lưu trữ, bạn cần dịch vụ quản lý bên thứ ba. Giấy phép BSL 1.1, không phải Apache 2.0 thuần —phiên bản open-source có giới hạn sử dụng quan trọng ở quy mô rất lớn.

Phù hợp nhất: đội Python-first có năng lực DevOps muốn kiểm soát hoàn toàn và zero markup mỗi token. Bộ tính năng OSS thực sự hào phóng —bạn chạy gateway cấp production không tốn một xu phần mềm. Bạn trả cho hạ tầng, ở quy mô trung bình (<100M token/tháng) là $50–200/tháng trên server riêng.

Điểm: Protocol 3 | Caching 5 | Governance 4 | Pricing 5 | Ecosystem 3 | Enterprise 3

Portkey

Lời chào: “1,600+ model, 20+ guardrail, quản trị doanh nghiệp.”

Portkey là gateway quản lý giàu tính năng nhất. Danh mục model rộng nhất ngành —1,600+ biến thể model từ 250+ nhà cung cấp.

Thư viện guardrail gồm 20+ bộ lọc nội dung dựng sẵn, ẩn danh PII và phát hiện prompt-injection. Lớp quản trị cung cấp virtual key với ngân sách theo key, giới hạn tốc độ, allowlist model và dấu vết kiểm toán gắn người dùng.

Điểm mạnh cốt lõi: bề rộng. Nếu model tồn tại, Portkey hỗ trợ. Thư viện guardrail đầy đủ nhất trong mọi gateway quản lý.

Gateway open-source Apache 2.0 nghĩa là bạn tự lưu trữ lớp định tuyến cốt lõi trong khi dùng control plane quản lý cho quản trị —mô hình hybrid không nền tảng nào khác có. Dashboard quan sát cung cấp theo dõi chi phí, độ trễ và lỗi từng request ngay khi bật.

Hạn chế nghiêm trọng: tính năng tốt nhất nằm sau tường phí. SSO, triển khai VPC, caching ngữ nghĩa và RBAC chi tiết đều chỉ ở gói Enterprise —giá tùy chỉnh và thường bắt đầu trên $500/tháng. Độ sâu đánh giá prompt nhẹ hơn nền tảng eval chuyên dụng.

Control plane đóng mã nguồn —nếu Portkey sập, gateway của bạn vẫn định tuyến lưu lượng (vì data plane open-source), nhưng bạn mất quản lý cấu hình và khả năng quan sát đến khi phục hồi.

Phù hợp nhất: đội cần tính năng quản trị doanh nghiệp (SSO, RBAC, dấu vết kiểm toán) và muốn danh mục model rộng nhất hiện có. Đặc biệt mạnh cho tổ chức cần guardrail nội dung ở cấp gateway —20+ bộ lọc dựng sẵn giảm lượng middleware tùy chỉnh bạn phải viết.

Điểm: Protocol 3 | Caching 4 | Governance 5 | Pricing 2 | Ecosystem 5 | Enterprise 5

TokSpan

Lời chào: “Đa giao thức gốc. Truy cập toàn cầu. Xây cho nơi bạn sống.”

TokSpan được xây cho một vấn đề cụ thể mà ba nền tảng kia chưa giải quyết trọn vẹn: lập trình viên cần hỗ trợ giao thức gốc cho OpenAI, Anthropic Gemini —và cần thanh toán hợp nhất cùng phương thức thanh toán linh hoạt cho đội ngũ toàn cầu. Nền tảng cung cấp passthrough giao thức gốc, nghĩa là extended thinking, tool use và computer use của Claude hoạt động không mất mát khi dịch. Mạng toàn cầu được tối ưu cho truy cập độ trễ thấp từ khu vực vốn trải độ trễ cao tới gateway đặt tại US-West.

Khác biệt: hỗ trợ giao thức Anthropic gốc —đặt ANTHROPIC_BASE_URL về TokSpan và Claude Code, Cursor cùng công cụ Anthropic gốc khác hoạt động không cần giải pháp né. Tối ưu mạng khu vực —nút hạ tầng ở châu Á, châu Âu và châu Mỹ giảm độ trễ cho lập trình viên ngoài US-West.

Phương thức thanh toán linh hoạt —thẻ tín dụng, PayPal và nhiều hơn— với giá theo khối lượng, không markup mỗi token.

Hạn chế: nền tảng mới hơn ba cái kia —ít tích hợp bên thứ ba hơn và cộng đồng nhỏ hơn. Số model ít hơn OpenRouter và Portkey (tập trung chất lượng hơn số lượng —những model lập trình viên thực sự dùng trong production). Tính năng doanh nghiệp còn đang hoàn thiện.

Phù hợp nhất: đội phụ thuộc công cụ hệ sinh thái Claude và cần giao thức Anthropic gốc. Lập trình viên cần tùy chọn thanh toán linh hoạt và khả dụng đa khu vực. Đội muốn nền tảng quản lý với tùy chọn thanh toán linh hoạt và phủ sóng mạng toàn cầu mà không markup mỗi token.

Điểm: Protocol 5 | Caching 4 | Governance 4 | Pricing 4 | Ecosystem 3 | Enterprise 3

So sánh trực diện (tính đến tháng 7/2026)

Chiều đánh giáOpenRouterLiteLLMPortkeyTokSpan
Protocol Support2335
Caching & Performance3544
Governance & Security2454
Pricing Model3524
Ecosystem & Docs4353
Enterprise Readiness1353
Overall (unweighted)2.53.84.03.8

Cách đọc các điểm này: chúng không trọng số vì tiêu chí quan trọng tùy bối cảnh bạn. Startup không quan tâm mức sẵn sàng doanh nghiệp —họ quan tâm mô hình giá và hỗ trợ giao thức. Công ty y tế đặt mức sẵn sàng doanh nghiệp và quản trị lên trên mọi thứ.

Dùng điểm làm điểm khởi đầu, không phải câu trả lời cuối.

So sánh TCO mỗi 100 triệu token/tháng —khối lượng SaaS giai đoạn giữa điển hình:

Nền tảngChi phí suy luậnPhí nền tảngHạ tầngTổng/tháng
OpenRouter~$2,000~$110 (5.5%)$0~$2,110
LiteLLM (self-hosted)~$2,000$0~$150~$2,150
Portkey (Pro)~$2,000$99+$0~$2,099+
TokSpan~$1,800*$0 markup$0~$1,800

*Bao gồm mức giá nhà cung cấp thương lượng theo khối lượng.

Ở quy mô này, phí nền tảng không chi phối tổng. Điều quan trọng hơn: độ tin cậy (gateway có trụ vững không?), hỗ trợ giao thức (tính năng Claude của bạn có chạy không?) và chi phí vận hành (đội bạn mất bao nhiêu giờ quản lý gateway?). Các chi phí này ẩn nhưng thật —instance LiteLLM tự lưu trữ tiết kiệm $110/tháng phí nhưng tốn 4–8 giờ/tháng thời gian DevOps.

Cho phân tích chi phí theo model của mọi nhà cung cấp chính, xem so sánh giá LLM API 2026 của chúng tôi.

Chi phí độ trễ —thời gian xử lý proxy đo được, không gồm suy luận LLM:

Nền tảngMedianp95
OpenRouter180ms450ms
LiteLLM (self-hosted)15ms45ms
Portkey90ms220ms
TokSpan65ms160ms

LiteLLM tự lưu trữ có chi phí không đáng kể vì chạy trên hạ tầng của bạn. Tối ưu mạng khu vực của TokSpan hiện rõ ở số p95 —lập trình viên ngoài US-West thấy độ trễ đuôi thấp hơn.

Khung quyết định

Theo loại đội:

  • Lập trình viên solo prototyping: OpenRouter. Khởi đầu nhanh nhất, gói miễn phí đủ thử nghiệm, không hạ tầng để quản lý. Chuyển cái khác khi vào production.

  • Đội Python có năng lực DevOps: LiteLLM. Kiểm soát hoàn toàn, zero markup mỗi token, virtual key và ngân sách trong OSS. Bạn đổi thời gian DevOps lấy phí nền tảng —ở quy mô trung bình, đáng giá.

  • Tổ chức nặng tuân thủ: Portkey. Tính năng quản trị mạnh nhất, thư viện guardrail rộng nhất và chứng nhận tuân thủ doanh nghiệp. Đáng mức giá doanh nghiệp nếu yêu cầu kiểm toán không thể thương lượng.

  • Đội ngũ toàn cầu: TokSpan. Giao thức Anthropic gốc, tối ưu mạng khu vực và thanh toán hợp nhất. Xây cho vấn đề ba nền tảng kia chưa giải quyết trọn vẹn.

Theo nhu cầu chính:

  • Danh mục model rộng nhất —Portkey (1,600+ biến thể)
  • Tổng chi phí thấp nhất —LiteLLM (không markup, bạn kiểm soát hạ tầng)
  • Thời gian đến lời gọi đầu tiên nhanh nhất —OpenRouter (đăng ký, lấy key, chạy)
  • Hỗ trợ Claude/giao thức gốc tốt nhất —TokSpan (passthrough Anthropic gốc)
  • Quản trị doanh nghiệp tốt nhất —Portkey (SSO, RBAC, kiểm toán, guardrail)
  • Phủ sóng toàn cầu tốt nhất —TokSpan (mạng toàn cầu + thanh toán linh hoạt)

Gateway đúng không phải cái điểm cao nhất. Là cái giải quyết vấn đề thực của bạn. Nếu bạn mất 8 giờ/tháng quản lý dashboard nhà cung cấp, bất kỳ cái nào trong bốn cái đều tự trả chi phí bằng thời gian lập trình viên thu hồi trong tuần đầu.

Sau khi chọn gateway, quy tắc custom routing cho phép bạn xác định model nào xử lý loại request nào —khả năng cốt lõi cho thiết lập đa model production.

Câu hỏi thường gặp

API gateway và API proxy khác nhau gì?

Gateway làm dịch giao thức + quản trị + quan sát + độ bền. Proxy đơn giản chỉ chuyển tiếp request. Gateway là hạ tầng production.

Proxy là công cụ phát triển. Nếu bạn cần ngân sách theo người dùng, allowlist model hoặc log kiểm toán, bạn cần gateway.

OpenRouter an toàn cho production không?

Cho khối lượng không bị quản lý, có. Nó thiếu SOC 2, HIPAA, triển khai VPC và guardrail nội tuyến —loại trừ cho y tế, tài chính và tuân thủ doanh nghiệp. Cho các lĩnh vực này, dùng LiteLLM tự lưu trữ hoặc Portkey/TokSpan quản lý với chứng nhận phù hợp.

Gateway thêm bao nhiêu độ trễ?

Gateway quản lý: trung vị 50–200ms, p95 150–250ms. LiteLLM tự lưu trữ: trung vị 10–20ms. Tác động lên phản hồi LLM điển hình 2–3 giây là 2–10%.

Trong hầu hết ứng dụng, người dùng không nhận ra. Trong voice hoặc chat thời gian thực, khác biệt giữa chi phí 15ms và 200ms là đáng kể —tự lưu trữ hoặc chọn nền tảng có tối ưu khu vực.

Tôi có thể đổi gateway sau này không?

Có, nếu bạn xây theo mẫu SDK OpenAI —đổi base_url. Nếu bạn dùng tính năng giao thức Anthropic gốc (Claude Code, Cursor Anthropic-native), xác minh gateway đích hỗ trợ chúng trước khi di chuyển. Khóa chặt giao thức mới là rủi ro di chuyển thực, không phải khóa chặt nhà cung cấp.

Tôi vẫn cần tài khoản từng nhà cung cấp riêng không?

Không với OpenRouter hoặc TokSpan —chúng cung cấp truy cập model không cần tài khoản nhà cung cấp của bạn. LiteLLM và Portkey yêu cầu bạn mang key nhà cung cấp riêng nhưng quản lý qua một proxy duy nhất.

Đánh đổi: nền tảng không tài khoản khởi động nhanh hơn. Nền tảng bring-your-own-key cho bạn quan hệ trực tiếp với nhà cung cấp và khả năng thương lượng giảm giá doanh nghiệp.

Một trăm hai mươi mốt sản phẩm gateway ra mắt riêng tháng 6/2026. OpenRouter có bề rộng danh mục. LiteLLM có cộng đồng OSS và kinh tế zero markup mỗi token.

Portkey có quản trị doanh nghiệp và danh mục 1,600 model. TokSpan có câu chuyện giao thức gốc mà người dùng Claude Code và Cursor phụ thuộc. Mỗi cái đang thắng một lát khác nhau của cùng thị trường.

Nhưng không gian gateway không thể duy trì 121 đối thủ —có lẽ thậm chí không nổi một tá. Làn sóng hợp nhất chưa bắt đầu.

Khi nó đến, ai nuốt ai? Và lập trình viên nào sẽ thức dậy trước một hạn chót di chuyển họ không ngờ tới?

Tìm gateway của bạn —chấm điểm 6 tiêu chí, máy tính TCO và hướng dẫn quyết định cho hồ sơ đội của bạn.