API Cost OptimizationLLM Cost ReductionToken Optimization

Tối ưu chi phí LLM API: 12 cách cắt hóa đơn đến 90%

1 phút đọc

Một đội ở Berlin đang trả $4,200/tháng cho LLM API. Cùng một ứng dụng. Cùng lượng người dùng. Sau khi triển khai các chiến lược trong bài viết này: $340/tháng. Chất lượng đầu ra —đo bằng điểm hài lòng người dùng và tỷ lệ hoàn thành tác vụ— không thay đổi. Thứ duy nhất thay đổi là model nào xử lý request nào.

Việc đi từ “$4,200/tháng và lo lắng” đến “$340/tháng và thoải mái” mất khoảng bốn giờ công việc triển khai. Bài viết này bao quát 12 chiến lược tạo ra khoản tiết kiệm đó, sắp xếp theo tác động và công sức. Mỗi chiến lược kèm dữ liệu chi phí trước/sau thực tế. Hãy chọn những cái phù hợp khối lượng của bạn. Xếp chồng chúng để tiết kiệm lãi kép.

Bậc 1: Tác động cao, công sức thấp (Chiến lược 1–4)

Bốn chiến lược này tạo ra phần lớn khoản tiết kiệm —thường 70–85% cộng dồn— và không chiến lược nào mất quá một giờ để triển khai.

Chiến lược 1: Định cỡ model cho đúng.

Đòn bẩy chi phí lớn nhất. Bạn đang dùng GPT-5.5 ở $30/M đầu ra để phân loại ticket hỗ trợ thành “khẩn cấp” hay “không khẩn cấp”. DeepSeek V4 Flash làm việc này ở $0.28/M —rẻ hơn 107 lần— với độ chính xác phân loại tương đương cho tác vụ này.

Triển khai là một bộ phân loại đơn giản định tuyến tác vụ đến bậc model phù hợp. Một hàm Python 50 dòng. Trước: $875/tháng (toàn bộ request đến GPT-5.5). Sau: $150/tháng (tác vụ đơn giản đến DeepSeek Flash, tác vụ phức tạp đến GPT-5.5). Tiết kiệm: 83%.

Nơi dễ bắt đầu nhất: kiểm toán 1,000 request API gần nhất của bạn. Phân loại từng cái theo độ phức tạp tác vụ —đơn giản (phân loại, trích xuất, Q&A đơn giản), trung bình (lập trình, phân tích, tóm tắt), phức tạp (suy luận nhiều bước, gỡ lỗi, phân tích pháp lý). Kiểm tra model nào xử lý từng request. Đếm bao nhiêu request “đơn giản” và “trung bình” đã đến các model $25–30/M. Đó là ứng viên tiết kiệm của bạn.

Một đội kỹ thuật hỗ trợ tại công ty SaaS 40 người đã chạy đúng cuộc kiểm toán này. Ba yếu tố chi phí hàng đầu của họ kể một câu chuyện rõ ràng.

Phân loại ticket ngốn 32% chi phí và cần độ chính xác 94%+ cho tác vụ ba nhãn. DeepSeek V4 Flash đạt 96% trong kiểm thử —ngang bằng GPT-5.5. Q&A tài liệu (18% chi phí) lấy từ cơ sở tri thức cố định và model rẻ hơn xử lý giống hệt.

Soạn phản hồi là 28% quan trọng. Đội đã thử DeepSeek Flash cho việc soạn thảo và phát hiện những câu trả lời lệch giọng điệu cần con người viết lại. Những cái đó ở lại GPT-5.5.

Kết quả: $3,100/tháng giảm xuống $380/tháng. Hai bậc model bao phủ 70% request. Suy giảm độ chính xác trên mọi tác vụ: bằng không.

30% ở lại GPT-5.5 tiêu thụ 68% ngân sách mới —đội biết chính xác từng đô la đi đâu. Triển khai mất một giờ.

Để có phân tích chi tiết model nào dùng cho tác vụ nào —gồm điểm benchmark và giá— bài so sánh chi phí giữa các nhà cung cấp trình bày rõ. Nền tảng định giá token được giải thích trong hướng dẫn bắt đầu của chúng tôi —tài liệu tham khảo chính thức về cách định giá đầu vào/đầu ra/cache/cửa sổ ngữ cảnh hoạt động.

Chiến lược 2: Cache mọi thứ tĩnh trong prompt.

Prompt caching giảm mạnh chi phí đầu vào cho nội dung lặp lại giữa các request —Anthropic giảm 90%, OpenAI 50%, cache hit của DeepSeek ở $0.0036/M. Để nắm toàn bộ cơ chế cache, hành vi TTL và hướng dẫn triển khai theo từng nhà cung cấp, xem prompt caching hoạt động thế nào.

Trước: $500/tháng cho token đầu vào với system prompt 10,000 token ở 500 request/ngày (GPT-5.5). Sau: $95/tháng (system prompt đã cache + Claude Opus với chiết khấu cache 90%). Tiết kiệm: 81%. Triển khai: thêm một khối cache_control vào system prompt —3 dòng code.

Chiến lược 3: Batch API cho công việc không cần thời gian thực.

Mọi lần chạy đánh giá. Mọi pipeline xử lý dữ liệu. Mọi lần sinh báo cáo đêm. Mọi công việc gán nhãn tập dữ liệu. Những thứ này không cần phản hồi dưới giây. Chúng có thể chờ hàng giờ. OpenAI, Anthropic và Google cung cấp chiết khấu ~50% cho việc chấp nhận thời gian xử lý 24 giờ trên request batch.

Trước: $200/tháng (API thời gian thực cho chạy đánh giá và xử lý dữ liệu). Sau: $100/tháng (batch API cho khối lượng đủ điều kiện). Tiết kiệm: 50%. Triển khai: thay client.chat.completions.create() bằng phiên bản batch —batch API của OpenAI dùng file JSONL cho request và trả kết quả trong 24 giờ. Theo phân tích của chúng tôi, các đội thường thấy 30–50% khối lượng LLM của họ đủ điều kiện chạy batch sau khi kiểm toán khối lượng công việc.

Chiến lược 4: Đặt trần ngân sách cứng.

Điều này không giảm chi phí —nó ngăn cơn vượt ngân sách thảm khốc khiến việc tối ưu chi phí trở nên vô nghĩa. Một công ty mất $500M trong một tháng vì một API key không có giới hạn chi tiêu. Đặt trần cứng ở ba cấp: dashboard nhà cung cấp (tấm lưới an toàn), cấp nền tảng/ứng dụng (kiểm soát vận hành), theo key (quy chiếu người dùng/tính năng). Cảnh báo ở 80%. Từ chối cứng ở 100%. Năm phút cấu hình. Vô giá trong phòng ngừa.

Bậc 2: Tác động trung bình, công sức trung bình (Chiến lược 5–8)

Những chiến lược này cần nhiều công triển khai hơn nhưng cộng hưởng với chiến lược Bậc 1 để tiết kiệm thêm.

Chiến lược 5: Định tuyến chi phí đa nhà cung cấp.

Các model khác nhau thống trị các mức giá khác nhau. DeepSeek V4 Flash: $0.14/$0.28 —tốt nhất cho tác vụ văn bản khối lượng lớn. DeepSeek V4 Pro: $0.44/$0.87 —giá trị tốt nhất cho lập trình. Claude Sonnet: $3/$15 —suy luận mạnh ở chi phí hợp lý. Claude Opus: $5/$25 —độ sâu tối đa khi cần.

Một bộ định tuyến dựa trên chi phí phân loại từng request và gửi nó đến model rẻ nhất có khả năng đảm nhận. Trước: $500/tháng (toàn bộ Claude Sonnet). Sau: $120/tháng (DeepSeek Flash cho 60% request, DeepSeek V4 Pro cho 25%, Claude Sonnet cho 15%). Tiết kiệm: 76%. Triển khai: 50 dòng Python —bộ phân loại độ phức tạp + bảng định tuyến. Thiết lập định tuyến đa model có mã hoàn chỉnh.

Chiến lược 6: Tối ưu token.

Prompt của bạn dài hơn mức cần thiết. Kiểm toán system prompt của bạn —bạn có thể diễn đạt trong 2,000 token thay vì 5,000 không? Ví dụ few-shot của bạn —bạn cần năm cái, hay ba cái cũng cho chất lượng đầu ra tương đương? Độ dài đầu ra của bạn —bạn có đang đặt max_tokens hào phóng ở mức 4,000 trong khi phản hồi hữu ích trung bình chỉ 800 token không?

Giảm 20–40% token trên mọi request trực tiếp chuyển thành giảm 20–40% chi phí. Trước: trung bình 2,500 token mỗi request. Sau: 1,600 token (prompt tinh chỉnh + thắt chặt max_tokens). Tiết kiệm: 36% token, tỷ lệ thuận trên chi phí. Triển khai: kiểm toán, cắt gọn, kiểm thử, triển khai. Một buổi chiều.

Chiến lược 7: Streaming + dừng sớm.

Streaming không giảm chi phí mỗi token, nhưng giảm token lãng phí. Khi người dùng rời bỏ cuộc hội thoại giữa chừng —họ đã có câu trả lời cần từ hai câu đầu— chế độ không streaming đã sinh (và tính phí) toàn bộ phản hồi. Streaming cho bạn dừng luồng khi người dùng ngắt kết nối. Với ứng dụng chatbot có tỷ lệ rời bỏ 15–25%, điều này tiết kiệm 15–25% token đầu ra. Triển khai: stream=True + theo dõi ngắt kết nối client.

Chiến lược 8: Cache phản hồi ở cấp ứng dụng.

Cache các phản hồi giống hệt hoặc gần giống. Khách hàng hỏi “chính sách hoàn trả của bạn là gì?” —câu trả lời không đổi kể từ hôm qua. Phục vụ từ cache thay vì gọi LLM. Chatbot FAQ: tỷ lệ cache hit 30–80%. Triển khai Redis đơn giản: băm query người dùng, kiểm tra cache, trả về nếu trúng, gọi LLM nếu trượt. TTL cache: 1–4 giờ tùy tần suất thông tin nền thay đổi.

Bậc 3: Tác động thấp hơn, đáng làm (Chiến lược 9–12)

Những chiến lược này cho khoản tiết kiệm riêng nhỏ hơn nhưng cộng dồn lại và cần công sức tối thiểu.

Chiến lược 9: Cửa sổ ngữ cảnh ngắn hơn. Một số nhà cung cấp tính phí cao hơn cho việc dùng ngữ cảnh dài —định giá Gemini của Google cộng phụ phí trên 200K token. Nếu bạn thường xuyên gửi prompt 300K token, hãy kiểm toán xem bạn có cần toàn bộ ngữ cảnh hay có thể tóm tắt/cắt gọn. Cắt từ 300K xuống 150K trên Gemini tiết kiệm khoảng 20% chi phí đầu vào cho những request đó.

Chiến lược 10: Tối ưu riêng theo model. Mỗi nhà cung cấp có một tính năng tiết kiệm chi phí bị sử dụng thiếu. Anthropic: cache system prompt + định nghĩa công cụ để giảm 90% (hầu hết đội không làm). Google: context caching cho truy vấn tài liệu lặp lại (hầu hết đội không làm). OpenAI: prompt ngắn hơn giảm tiêu thụ token suy luận (token suy luận tỷ lệ với độ phức tạp prompt). Một tối ưu cho mỗi nhà cung cấp. Hiệu ứng cộng hưởng.

Chiến lược 11: Đàm phán chiết khấu theo khối lượng. API trực tiếp: yêu cầu chiết khấu cam kết sử dụng khi bạn chi $5,000+/tháng. Nền tảng tổng hợp: giá theo khối lượng được tích hợp sẵn —nền tảng gộp nhu cầu của hàng nghìn người dùng và chuyển qua mức giá dưới giá bán lẻ chính thức. Không cần đàm phán. Không có mức chi tối thiểu.

Chiến lược 12: Loại bỏ tiền đặt cọc nhàn rỗi. Mỗi tài khoản nhà cung cấp trực tiếp đều có mức đặt cọc tối thiểu —thường $10–20— nằm im, không sinh lời, và khóa vốn lưu động. Năm nhà cung cấp nghĩa là $50–150 bị đóng băng rải rác các dashboard. Đây không phải chi phí mỗi token; đây là sự kém hiệu quả trên bảng cân đối mà trang định giá API trực tiếp được thiết kế để che giấu. Nền tảng tổng hợp gộp năm số dư nhàn rỗi thành một số dư hoạt động. Nạp $20. Định tuyến qua mọi model. Nạp thêm khi sắp cạn. Với một startup đang theo dõi dòng tiền, thu hồi $150 tiền đặt cọc bị đóng băng là đáng kể. Với đội lớn hơn, đó là một dòng ít hơn để bộ phận tài chính đối soát mỗi tháng.

Tiết kiệm cộng dồn: các chiến lược xếp chồng ra sao

Các chiến lược cộng hưởng. Bắt đầu với Chiến lược 1 (định cỡ model, tiết kiệm 83%). Thêm Chiến lược 2 (prompt caching, thêm 50% trên chi phí còn lại). Thêm Chiến lược 5 (định tuyến đa nhà cung cấp, thêm 20%). Phép tính: mức nền $1,000 —$170 sau Chiến lược 1 —$85 sau Chiến lược 2 —$68 sau Chiến lược 5. Tổng cộng: giảm 93.2%.

Ba kịch bản thực tế:

  • Nhà phát triển độc lập (mức nền $50/tháng): Chiến lược 1 + 2 + 8 —~$8/tháng. Bốn giờ triển khai. Hai quyết định chuyển model.
  • Startup (mức nền $500/tháng): Chiến lược 1 + 2 + 3 + 5 —~$65/tháng. Một ngày triển khai. Chiến lược model phân tầng + cấu hình prompt caching.
  • Công ty mở rộng (mức nền $5,000/tháng): Chiến lược 1–5 + 10 —~$580/tháng. Hai ngày triển khai. Định tuyến tùy chỉnh + pipeline batch + tối ưu riêng theo nhà cung cấp.

Ưu tiên triển khai. Bắt đầu từ góc trên bên trái của ma trận công sức-tác động. Chiến lược 1 (định cỡ model) mất 10 phút và tiết kiệm 83%. Làm ngay hôm nay. Chiến lược 4 (trần ngân sách) mất 5 phút và ngăn thảm họa. Làm ngay bây giờ. Phần còn lại bạn triển khai theo thứ tự tác động khi có thời gian. Mọi chiến lược đều hoàn vốn thời gian triển khai trong tháng đầu tiên.

Câu hỏi thường gặp

Chiến lược nào tiết kiệm nhiều tiền nhất nhanh nhất?

Chiến lược 1 —định cỡ model cho đúng. Chuyển tác vụ đơn giản từ GPT-5.5 ($30/M đầu ra) sang DeepSeek V4 Flash ($0.28/M) là thay đổi code 10 phút thường tiết kiệm 70–80% tổng chi phí API. Kiểm toán 1,000 request gần nhất. Đếm những request không cần năng lực tiên phong. Chuyển chúng đi.

Prompt caching có thực sự tiết kiệm 90% không?

Có, trên token đầu vào đã cache —với Anthropic. Nếu 80% token đầu vào của bạn được cache (system prompt, ví dụ few-shot, ngữ cảnh tài liệu), chi phí đầu vào hiệu dụng của bạn giảm ~72%. OpenAI giảm 50% (giảm hiệu dụng ~40%). Đọc cache của DeepSeek ở $0.0036/M còn rẻ hơn về giá trị tuyệt đối. Cho chiến lược caching đầy đủ: Prompt Caching Giải Thích.

Batch API có đáng đổi lấy chậm 24 giờ không?

Cho chạy đánh giá, pipeline xử lý dữ liệu, sinh báo cáo, và mọi tác vụ nơi đầu ra được tiêu thụ bất đồng bộ: có. Tiết kiệm 50% khi chấp nhận thời gian xử lý 24 giờ. Các đội thường thấy 30–50% khối lượng LLM của họ đủ điều kiện chạy batch sau khi kiểm toán khối lượng công việc.

Các chiến lược này có ảnh hưởng chất lượng đầu ra không?

Chiến lược 1 và 5 có thể —nếu bạn định tuyến tác vụ phức tạp đến model không đảm nhận nổi. Biện pháp giảm thiểu: đặt mức sàn chất lượng. Bộ phân loại độ phức tạp trong Chiến lược 1 nên thận trọng —khi nghi ngờ, hãy định tuyến lên, không định tuyến xuống. Mọi chiến lược khác (cache, batch, tối ưu token, trần ngân sách) không ảnh hưởng chất lượng.

Nền tảng tổng hợp giúp tối ưu chi phí như thế nào?

Chiến lược 1, 4, 5, 11 và 12 hoặc được tích hợp sẵn vào nền tảng hoặc được đơn giản hóa đáng kể. Phân tầng model và định tuyến theo chi phí là thiết lập cấu hình. Trần ngân sách là tham số theo key. Giá theo khối lượng tự động. Không có tiền đặt cọc nhàn rỗi giữa các nhà cung cấp. Nền tảng lo phần hạ tầng; bạn tập trung vào ứng dụng. Để so sánh chi tiết tổng chi phí trực tiếp so với tổng hợp, xem phân tích vì sao nhà phát triển chuyển đổi.

Thứ tách hóa đơn API $4,200 khỏi hóa đơn API $340 không phải ứng dụng khác, người dùng khác, hay model khác —chỉ là quyết định định tuyến khác. Các chiến lược trong bài viết này chính là những quyết định định tuyến đó. Từng cái đều có thể triển khai trong chưa đầy một giờ. Hầu hết mất chưa đến mười phút. Các đội làm việc này hôm nay sẽ tự cứu mình khỏi cuộc họp nơi ai đó bên tài chính hỏi vì sao dòng LLM là chi phí tăng nhanh nhất công ty.

Hãy triển khai theo thứ tự ưu tiên —đội tài chính của bạn sẽ thấy khác biệt ngay trong chu kỳ thanh toán đầu tiên.

Nhưng đây là câu hỏi sâu hơn: mức sàn giá nằm ở đâu? DeepSeek V4 Flash đã mang đầu ra đẳng cấp GPT-4 ở $0.14 mỗi triệu token đầu vào. Model nguồn mở từ Meta và Mistral đang cải thiện hàng tháng. Các công ty tối ưu suy luận đang vắt thêm 30-50% hiệu quả từ mỗi thế hệ phần cứng. Nếu xu hướng tiếp tục, chi phí vận hành một chatbot sản xuất sẽ giảm dưới $1 mỗi tháng vào cuối năm 2027. Câu hỏi thực sự không phải “hôm nay tôi cắt hóa đơn thế nào?” Mà là “tôi xây gì khi hóa đơn gần như bằng không?”

Các chiến lược trong bài viết này được đo trên khối lượng sản xuất thực tế —khoản tiết kiệm từ $4,200 xuống $340 của đội Berlin diễn ra trong một buổi chiều. Các đội chứng kiến mức giảm lớn nhất có một điểm chung: họ hợp nhất về một endpoint duy nhất nơi phân tầng model và định tuyến chi phí là thiết lập cấu hình thay vì hạ tầng tùy chỉnh. Trang định giá của TokSpan hiển thị mức giá theo model ở khối lượng gộp —đáng để so sánh với những gì bạn đang trả trực tiếp, đặc biệt ở model Bậc 2 và Bậc 3 vốn gánh phần lớn lưu lượng sản xuất.