Tính theo ký tự. Tính theo giây. Tính theo request. Các nhà cung cấp TTS của bạn thậm chí không thống nhất được đơn vị họ tính phí — và các bài so sánh xếp hạng họ phần lớn được chính các nhà cung cấp viết ra.
Text-to-speech là hạng mục API có ý định thương mại cao nhất thị trường — và lại được phục vụ tệ nhất bởi chính nội dung của nó. Các kết quả hàng đầu là blog của nhà cung cấp tự so sánh lẫn nhau. Các bài listicle được viết bởi những người chưa từng tạo ra một giọng nói sản xuất thực sự nào. Trong khi đó, thị trường đã dịch chuyển: ElevenLabs giảm giá API và giới thiệu pay-as-you-go. OpenAI phát hành một tầng mini-TTS chi phí thấp. Các nhà dẫn đầu về độ trễ liên tục định giá lại.
Hướng dẫn này so sánh ElevenLabs, OpenAI, Azure và Deepgram trên các trục quan trọng — độ tự nhiên, độ trễ, cấu trúc chi phí — kèm một bộ kiểm thử mù bạn có thể chạy trên chính kịch bản của mình trong một buổi chiều, và một ma trận use case giúp câu hỏi “cái nào tốt nhất” không biến thành cuộc thi sở thích cá nhân.
Chúng tôi đã kiểm thử thế nào: một kịch bản, bốn nhà cung cấp
Điểm chính: chúng tôi không bán cho bạn bảng xếp hạng của mình — chúng tôi trao cho bạn bộ kiểm thử, vì sở thích TTS phụ thuộc người nghe và giá cả phụ thuộc thời điểm.
Độ tự nhiên mang tính chủ quan. Giá cả biến động. Một bài so sánh tĩnh sẽ lỗi thời trong vòng một quý. Thứ sống sót là phương pháp:
- Một kịch bản — 300-500 ký tự bao phủ câu trần thuật, câu nghi vấn và câu cảm xúc, trong ngôn ngữ mục tiêu của bạn.
- Nghe mù — bỏ tên nhà cung cấp, để 3-5 người nghe chấm độ tự nhiên và độ rõ trên thang 1-5, rồi lấy trung bình.
- Hai phép đo độ trễ — time-to-first-audio (streaming) và tổng thời gian cho toàn bộ clip.
- Một quy đổi giá — chuẩn hóa đơn vị thanh toán của mọi nhà cung cấp (ký tự, giây, request) về chi phí mỗi triệu ký tự, ở đúng tầng giá bạn thực sự dùng.
Chúng tôi xây dựng thứ này như một checklist dùng lại được thay vì một bài kiểm thử một lần, vì con số duy nhất đáng quan tâm là con số bạn đo trên kịch bản, ngôn ngữ và ngân sách độ trễ của chính bạn. Điều chúng tôi có thể xác minh và báo cáo một cách trung thực: đội hình model, cấu trúc định giá và định vị được tài liệu hóa của từng nhà cung cấp — nội dung đó ở bên dưới, theo thứ tự.
Lựa chọn 1: ElevenLabs — Nhà dẫn đầu độ tự nhiên và trọng tâm Agent
Điểm chính: ElevenLabs vẫn giữ ngôi vương độ tự nhiên — và việc định giá lại sang pay-as-you-go năm 2026 là sự kiện định giá có ảnh hưởng lớn nhất thị trường.
ElevenLabs là nơi khởi đầu kỷ nguyên “giọng AI nghe như người thật”, và lợi thế chất lượng là lý do nó trở thành điểm tham chiếu mặc định. Những thay đổi năm 2026 rất quan trọng: công ty hạ giá API và Agents, đồng thời giới thiệu pay-as-you-go, chuyển từ mô hình nặng về subscription sang thân thiện với tiêu dùng. Các tầng gói vẫn chạy từ cấp nhập môn đến khoảng $330/tháng cho người dùng sử dụng nhiều, cộng thêm mức giá API theo ký tự — cấu trúc giờ là “seat + meter,” cùng hình dạng với mọi thứ khác trong thị trường này.
Các chi phí cần theo dõi: thanh toán theo ký tự ở các tầng chất lượng cao cấp, add-on voice cloning và dubbing, và sự thật rằng giọng có độ trung thực cao (high-fidelity) tốn nhiều hơn giọng tiêu chuẩn trên mỗi ký tự. Các đối thủ như Deepgram từng công bố phân tích chi phí giải thích vì sao ElevenLabs trở nên đắt ở quy mô lớn — hãy đọc chúng như định vị của nhà cung cấp, rồi tự tính toán, vì phép toán theo ký tự ở 10 triệu ký tự một tháng rất khác phép toán demo.
Phù hợp với: sản phẩm ưu tiên chất lượng, quy trình nội dung và dubbing, voice agents nơi độ tự nhiên là thương hiệu, và các đội thực sự sẽ kiểm toán cách tính phí theo mức dùng.
Lựa chọn 2: OpenAI TTS — Sự đơn giản của hệ sinh thái
Điểm chính: TTS của OpenAI là lựa chọn tích hợp — và gpt-4o-mini-tts âm thầm trở thành lựa chọn mặc định giá rẻ cho các đội đã cam kết với OpenAI.
Nếu stack của bạn đã mang hình dạng OpenAI, TTS chỉ là một lệnh gọi hàm, không phải quyết định nhà cung cấp: cùng SDK, cùng key, cùng hóa đơn. Đội hình model chia thành các tầng cổ điển (tts-1, tts-1-hd) và gpt-4o-mini-tts mới hơn, nhắm đến việc tạo khối lượng lớn chi phí thấp với chất lượng tốt một cách đáng ngạc nhiên so với giá. Mức giá chính thức nằm trên trang định giá OpenAI và thay đổi theo dòng model.
Sự đánh đổi thẳng thắn: độ tự nhiên và khả năng điều khiển giọng thua ElevenLabs ở phân khúc cao cấp, và thư viện giọng nhỏ hơn. Thứ bạn mua thay vào đó là sự chắc chắn về tích hợp — một nhà cung cấp cho chat, TTS và STT, một dashboard cho mọi thứ, không cần đối soát giữa các nhà cung cấp. Với sản phẩm nơi giọng nói là một tính năng thay vì chính sản phẩm, đó thường là sự đánh đổi đúng.
Phù hợp với: các đội đã cam kết với OpenAI, tạo khối lượng lớn tiết kiệm qua tầng mini, và bất kỳ ai thích một hóa đơn duy nhất hơn việc tối ưu từng nhà cung cấp.
Lựa chọn 3: Microsoft Azure — Quy mô doanh nghiệp và chiều sâu SSML
Điểm chính: Azure thắng về kiểm soát và tuân thủ — hỗ trợ SSML sâu nhất thị trường, đổi lại là bảng giá phức tạp nhất.
Azure Speech là con ngựa thồ của doanh nghiệp: hàng chục giọng nói neural, kiểm soát SSML từng chi tiết về prosody và phát âm, triển khai theo khu vực, và câu chuyện tuân thủ (SOC 2, tương thích HIPAA, tùy chọn lưu trú dữ liệu) mà các ngành được quản lý yêu cầu. Nếu TTS của bạn cần đọc “3.14%” đúng theo cách CFO của bạn muốn, chiều sâu SSML chính là khác biệt giữa một bản demo và một sản phẩm.
Cái giá phải trả là sự phức tạp. Azure tính phí theo ký tự với hệ số nhân theo khu vực và một bậc thang tầng giá thưởng cho cam kết, và trang định giá là trang khó đọc lướt nhất trong bài so sánh này. Các đội áp dụng Azure cho một khu vực và một tầng giọng thì ổn; các đội trải rộng qua nhiều khu vực mà không theo dõi hệ số nhân sẽ bị bất ngờ. Hãy lập ngân sách bằng công cụ tính giá chính thức, không phải cảm tính.
Phù hợp với: ngành được quản lý, yêu cầu tuân thủ doanh nghiệp, kiểm soát giọng chi tiết, và các cam kết Azure hiện có.
Lựa chọn 4: Deepgram — Streaming ưu tiên thời gian thực
Điểm chính: Deepgram là lựa chọn độ trễ — Aura được xây cho stack giọng nói streaming, và nó đi cùng Deepgram STT trong một đầu mối thanh toán.
Dòng Aura của Deepgram được thiết kế cho thời gian thực: time-to-first-audio thấp, thiết kế API streaming-first, và một stack giọng nói dùng chung thanh toán và hạ tầng với dịch vụ STT của nó. Nếu bạn đang xây một voice agent nơi từng mili giây độ trễ TTS đều được cảm nhận, Aura là một ứng viên nghiêm túc chính xác vì độ trễ là mục tiêu thiết kế chứ không phải thứ được nghĩ đến sau.
Sự đánh đổi nằm ở trần chất lượng: độ tự nhiên của Aura cạnh tranh tốt ở phân khúc giữa nhưng không đuổi theo độ biểu cảm đỉnh cao của ElevenLabs. Phần Learn của Deepgram là một cửa sổ tốt để nhìn vào định vị của họ — nội dung của nhà cung cấp, hãy đọc theo cách đó. Với stack thời gian thực, độ trễ thắng; với tường thuật và dubbing, chất lượng thắng, và đó là những khoản mua khác nhau.
Phù hợp với: voice agents và IVR nơi độ trễ là sản phẩm, các đội đã dùng Deepgram STT, và các use case thời gian thực không đủ khả năng trả tầng cao cấp của ElevenLabs.
Kết quả kiểm thử mù: hãy tự chạy
Điểm chính: các sự thật đã xác minh là đội hình và cấu trúc định giá ở trên — thứ hạng độ tự nhiên là thứ bạn đo, trên kịch bản của bạn, ngay trong buổi chiều hôm nay.
Chúng tôi không công bố một bảng xếp hạng dàn dựng. Điều chúng tôi có thể nói với bạn một cách tự tin: điểm tiên phong về độ tự nhiên nằm ở ElevenLabs tại phân khúc cao cấp, gpt-4o-mini-tts là món hời bất ngờ của năm 2026, chất lượng Azure nhất quán nhưng bảo thủ, và Aura đánh đổi độ biểu cảm đỉnh cao lấy độ trễ. Nơi tồn tại bảng xếp hạng độc lập — bảng xếp hạng TTS của ArtificialAnalysis là tài liệu tham chiếu — chúng theo dõi chất lượng giọng theo nhà cung cấp với phương pháp mở; hãy kiểm tra nó vào thời điểm ra quyết định.
Sau đó chạy bộ kiểm thử bốn bước ở trên. Bảng kết quả trông như thế này:
| Nhà cung cấp | Độ tự nhiên (điểm nghe mù của bạn) | TTFB (phép đo của bạn) | Chi phí mỗi M ký tự (tầng của bạn) |
|---|---|---|---|
| ElevenLabs | ___ / 5 | ___ ms | $___ |
| OpenAI (mini) | ___ / 5 | ___ ms | $___ |
| Azure | ___ / 5 | ___ ms | $___ |
| Deepgram Aura | ___ / 5 | ___ ms | $___ |
Một dự đoán thẳng thắn: chênh lệch độ tự nhiên giữa cao nhất và thấp nhất sẽ nhỏ hơn marketing gợi ý, còn chênh lệch độ trễ sẽ lớn hơn. Chất lượng TTS đã thu hẹp lại; hành vi thời gian thực thì chưa.
Chọn theo use case: Voice Agents vs Narration vs Realtime vs Dubbing
Điểm chính: định tuyến theo use case — độ trễ cho agent, chất lượng cho tường thuật, SSML cho đầu ra có kiểm soát, hệ sinh thái cho tích hợp.
| Use case | Lựa chọn mặc định | Lý do |
|---|---|---|
| Voice agents (tương tác) | Deepgram Aura hoặc ElevenLabs | ngân sách độ trễ chính là sản phẩm |
| Narration / nội dung | ElevenLabs | độ tự nhiên ở mức trần |
| Đầu ra được quản lý / có kiểm soát | Azure | chiều sâu SSML + tuân thủ |
| Ứng dụng hệ sinh thái OpenAI | OpenAI (tầng mini cho khối lượng) | một SDK, một hóa đơn |
| Dubbing / cloning | ElevenLabs | nhà dẫn đầu hạng mục |
Ghi chú kiến trúc: đừng gắn cứng nhà cung cấp vào pipeline giọng nói của bạn. TTS nằm sau một endpoint âm thanh hợp nhất giống như chat nằm sau một endpoint hợp nhất — đổi nhà cung cấp bằng cấu hình, đo chi phí theo ký tự trên một dashboard, và định tuyến tầng tương tác đến nhà cung cấp độ trễ thấp trong khi tường thuật nền chạy trên nhà cung cấp rẻ. Mẫu custom routing áp dụng cho giọng nói giống hệt như áp dụng cho tokens, và danh mục model cho thấy những giọng nào khả dụng qua endpoint hợp nhất. Hướng dẫn tích hợp mobile và hướng dẫn chatbot hỗ trợ khách hàng của chúng tôi cho thấy cả hai thái cực — streaming phía thiết bị và giọng nói sản xuất trong hỗ trợ khách hàng.
Câu hỏi thường gặp
API TTS nào có độ tự nhiên tốt nhất?
ElevenLabs ở phân khúc cao cấp, với khoảng cách so với đối thủ thu hẹp mỗi quý. Độ tự nhiên phụ thuộc người nghe, nên hãy chạy bài kiểm thử mù trên kịch bản của bạn — bảng xếp hạng từ chính người nghe của bạn vượt qua mọi bản demo của nhà cung cấp.
Các nhà cung cấp TTS tính phí thế nào — theo ký tự, theo giây hay theo request?
Cả ba, tùy nhà cung cấp: ElevenLabs theo ký tự, Azure theo ký tự kèm hệ số nhân khu vực, OpenAI theo ký tự theo từng tầng model, Deepgram theo ký tự kèm tầng khối lượng. Hãy chuẩn hóa mọi thứ về chi phí mỗi triệu ký tự trước khi so sánh — đó là con số duy nhất sống sót khi chạm vào đội tài chính của bạn.
TTS tốn bao nhiêu ở quy mô sản xuất?
Một triệu ký tự một tháng thường rơi vào khoảng vài chục đô la ở các tầng giá rẻ — và vài trăm đô la ở chất lượng cao cấp; chênh lệch giữa tầng rẻ nhất và tầng cao cấp trên cùng một nhà cung cấp có thể lên tới 5-10×. Ở khối lượng lớn, lựa chọn tầng quan trọng hơn lựa chọn nhà cung cấp.
Streaming TTS có đáng dùng cho voice agents không?
Bất khả thương lượng cho giọng nói tương tác: time-to-first-audio là một metric sản phẩm trong cuộc hội thoại, không phải thứ làm đẹp thêm về hiệu năng. Hãy đo TTFB trong khu vực của bạn trước khi chọn giữa trọng tâm thời gian thực của Aura và lợi thế chất lượng của ElevenLabs.
Tôi có thể dùng TTS để voice cloning một cách hợp pháp không?
Chỉ với sự cho phép và tiết lộ rõ ràng — cloning giọng ai đó mà không có sự đồng thuận là một quả mìn pháp lý và danh tiếng ở mọi thị trường lớn. Hãy giữ dấu vết đồng thuận cùng các file âm thanh; “chúng tôi đã hỏi trong bản demo” không phải là đồng thuận.
Giá TTS thay đổi bao lâu một lần?
Thường xuyên — riêng năm 2026 đã mang đến đợt định giá lại PAYG của ElevenLabs và các tầng mới của OpenAI. Lập ngân sách theo quý, xác minh hàng tháng, và giữ nhà cung cấp TTS có thể cấu hình để một lần định giá lại là một thay đổi định tuyến, không phải một cuộc di trú.
Tóm tắt
Thị trường text-to-speech năm 2026 là một điểm tiên phong về chất lượng ở ElevenLabs, một mặc định tích hợp ở OpenAI, một lựa chọn kiểm soát ở Azure và một lựa chọn độ trễ ở Deepgram — với mức giá dịch chuyển nhiều hơn trong năm qua so với ba năm trước cộng lại. Hãy chạy bộ kiểm thử mù trên kịch bản của bạn, chuẩn hóa chi phí về mỗi triệu ký tự, định tuyến theo use case, và giữ nhà cung cấp đứng sau một endpoint âm thanh hợp nhất để lần định giá lại tiếp theo chỉ là một thay đổi cài đặt, không phải một cuộc di trú.
Hãy lắng nghe trước khi chọn. Nhận TokSpan API key của bạn, chạy kịch bản của bạn qua nhiều giọng TTS, và để đôi tai của bạn — không phải marketing — quyết định. $5 tín dụng miễn phí đủ cho buổi thử giọng.