Kết quả tìm kiếm là một mê cung gương: blog của Deepgram so sánh Deepgram với AssemblyAI, blog của AssemblyAI đáp lại tương tự, và mọi con số WER được trích dẫn đều được đo trên audio làm nổi bật tác giả. Chưa ai kiểm thử audio của bạn — bản ghi âm ở quán cà phê, cuộc gọi của khách hàng nói giọng địa phương, mớ hỗn độn hai người nói chồng lên nhau.
Những điểm khác biệt thực sự — WER trên audio của bạn, độ trễ streaming, chi phí mỗi giờ và câu hỏi tự lưu trữ — chính xác là những thứ blog của nhà cung cấp không đề cập.
Hướng dẫn này đặt đội hình 2026 đối đầu trực diện — Universal-3-Pro của AssemblyAI, Nova-3 của Deepgram, Whisper mã nguồn mở và các model transcription của OpenAI — kèm một bộ kiểm thử WER bạn có thể chạy trên audio của mình trong một buổi chiều, một khung quyết định streaming-vs-async, và phép toán TCO tự lưu trữ mà hầu hết bài so sánh bỏ qua.
Chúng tôi đã kiểm thử thế nào: cùng audio, cùng metric
Điểm chính: WER chỉ có ý nghĩa trên audio của bạn — bộ kiểm thử quan trọng hơn bất kỳ bảng xếp hạng nào chúng tôi có thể công bố.
Bí mật bẩn của ngành: những khác biệt WER trông có tính quyết định trên audio phòng thu sạch sẽ co lại hoặc đảo ngược trên bản ghi thực. Phương pháp vững chắc duy nhất:
- Ba tập audio — lời nói sạch, audio thực tế ồn ào và hội thoại nhiều người nói. Mỗi tập mười phút, từ use case thực của bạn, không phải thư viện mẫu của nhà cung cấp.
- Một metric — word error rate, tính trên cùng bản transcript tham chiếu, đã bỏ dấu câu và bỏ qua phân biệt hoa thường.
- Đo độ trễ theo hai cách — time-to-first-token (streaming) và end-to-end cho một file 10 phút (async).
- Một quy đổi giá — chuẩn hóa đơn vị thanh toán của mọi nhà cung cấp (mỗi giờ, mỗi phút, mỗi giây) về chi phí mỗi giờ audio, ở đúng tầng giá bạn thực sự dùng.
Chạy bộ kiểm thử đó và bạn sẽ biết nhiều hơn mọi bài so sánh cộng lại, kể cả bài này. Điều chúng tôi có thể xác minh và báo cáo bên dưới: đội hình model, cấu trúc định giá và định vị — những dữ kiện ổn định.
Lựa chọn 1: AssemblyAI — Nền tảng async giàu tính năng
Điểm chính: AssemblyAI là lựa chọn nền tảng — bộ tính năng hậu xử lý sâu nhất, neo bởi Universal-3-Pro — đổi lại độ trễ realtime vốn không phải thế mạnh của nó.
Model đầu bảng hiện tại của AssemblyAI, Universal-3-Pro, đi đầu về độ chính xác cho transcription, và nền tảng quanh nó là sâu nhất trong bài so sánh này: speaker diarization, entity detection, phân tích chủ đề và cảm xúc, custom vocabulary và language detection như những tính năng hạng nhất thay vì add-on. Nếu sản phẩm của bạn là một pipeline transcription — ghi âm, transcribe, làm giàu, lưu trữ — AssemblyAI cho bạn nhiều thứ nhất ngay khi bắt đầu. Trang định giá thực sự đáng tin cậy, với mức giá mỗi giờ theo tầng model và tính năng.
Sự đánh đổi: di sản async-first của AssemblyAI lộ ra ở realtime. Streaming hoạt động, nhưng đặc tính độ trễ không phải điểm nhấn — với voice agents nơi từng 100ms đều quan trọng, các nhà cung cấp ưu tiên thời gian thực dẫn đầu. Chọn nền tảng cho pipeline; đo cẩn thận cho agent.
Phù hợp với: nền tảng transcription, pipeline truyền thông và pháp lý, phân tích cuộc họp, và các đội muốn hậu xử lý mà không cần tự xây.
Lựa chọn 2: Deepgram — Ưu tiên thời gian thực và độ trễ thấp
Điểm chính: Nova-3 của Deepgram là chuẩn mực realtime — được xây cho voice agents và phụ đề trực tiếp, với streaming là trung tâm thiết kế thay vì thêm vào sau.
Nova-3 của Deepgram là nhà dẫn đầu realtime hiện tại trong cộng đồng nhà phát triển: time-to-first-token thấp, API streaming-native, hỗ trợ interruption và barge-in trong stack voice-agent, và mức giá được định vị cạnh tranh theo giờ audio. Nếu sản phẩm của bạn mang tính tương tác — một voice agent, phụ đề trực tiếp, một bot cuộc họp biết đáp lời — Deepgram là điểm khởi đầu mặc định cho đường audio.
Các lưu ý: độ chính xác ở phân khúc cao nhất thua Universal-3-Pro trên một số bộ benchmark (trên audio của họ — hãy chạy audio của bạn), và độ sâu tính năng quanh transcription mỏng hơn của AssemblyAI. Thứ bạn mua là tốc độ và sự cộng hưởng stack giọng nói: STT của Deepgram và Aura TTS dùng chung một tài khoản thanh toán, điều quan trọng với sản phẩm giọng nói. Trang định giá Nova-3 trên OpenRouter là một cách đối chiếu mức giá tiện lợi.
Phù hợp với: voice agents, phụ đề trực tiếp, công cụ cuộc họp thời gian thực và sản phẩm tương tác nhạy cảm độ trễ.
Lựa chọn 3: Whisper — Kiểm soát tự lưu trữ
Điểm chính: Whisper là lựa chọn chủ quyền dữ liệu — có năng lực và miễn phí mỗi giờ, nhưng phải trả chi phí thật về GPU, vận hành và kỹ thuật độ chính xác mà phép toán “mã nguồn mở là miễn phí” bỏ qua.
Họ Whisper mã nguồn mở cho bạn transcription chạy trên phần cứng của mình với phí mỗi giờ bằng không và kiểm soát dữ liệu hoàn toàn. Các biến thể fine-tune và distillation hiện đại thu hẹp phần lớn khoảng cách với các model đầu bảng thương mại, và với một cấu hình audio cố định (một ngôn ngữ, một lĩnh vực), một Whisper được tinh chỉnh có thể thắng các API đa dụng cả về độ chính xác lẫn chi phí.
Phép toán thẳng thắn: chi phí GPU, rủi ro mức sử dụng, cập nhật model và khoản thuế MLOps — cùng hình dạng mà phân tích TCO cloud API so với tự lưu trữ của chúng tôi xử lý cho các model văn bản, khắc nghiệt hơn ở đây vì khối lượng audio bùng nổ theo đợt. Ngưỡng là có thật: khối lượng bền vững, cấu hình audio ổn định và đội ngũ vận hành GPU hiện có. Dưới ngưỡng đó, các nhà cung cấp API thắng về tổng chi phí.
Phù hợp với: sản phẩm coi trọng chủ quyền dữ liệu, pipeline audio ổn định khối lượng lớn, và các đội có vận hành GPU muốn chi phí mỗi giờ bằng không.
Lựa chọn 4: OpenAI Transcription — Tích hợp hệ sinh thái
Điểm chính: các model transcription của OpenAI là lựa chọn tích hợp — độ chính xác tốt, thiết lập tối thiểu và một tài khoản thanh toán duy nhất cho các đội đã dùng OpenAI.
API transcription của OpenAI là lựa chọn không rào cản: cùng SDK, cùng key, cùng hóa đơn với chat và TTS — và một quickstart đưa bạn đến bản transcription đầu tiên trong vài phút. Độ chính xác vững chắc và ngày càng cải thiện, hỗ trợ streaming tồn tại, và với các đội có stack AI được xây dựng quanh OpenAI, chi phí tích hợp thêm transcription gần như bằng không.
Các đánh đổi: độ sâu tính năng quanh transcription (chất lượng diarization trên audio lộn xộn, hậu xử lý chi tiết) thua các nhà cung cấp chuyên biệt, và dòng model kém minh bạch về versioning hơn các nhà cung cấp chuyên biệt. Đó là lựa chọn đúng khi transcription là một tính năng của sản phẩm OpenAI của bạn, và là lựa chọn sai khi transcription chính là sản phẩm.
Phù hợp với: các đội đã cam kết với OpenAI, nhu cầu transcription đơn giản và prototype cần giọng nói trong một cuối tuần.
Đối đầu trực diện: WER, độ trễ và chi phí
Điểm chính: các dữ kiện ổn định lâu dài là đội hình và cấu trúc — thứ hạng WER là phép đo của bạn, trên audio của bạn, ngay trong buổi chiều hôm nay.
Điều có thể xác minh: Universal-3-Pro đi đầu về độ chính xác. Nova-3 dẫn đầu realtime. Whisper dẫn đầu về kiểm soát tự lưu trữ. OpenAI dẫn đầu về tích hợp. Các con số chính xác dịch chuyển theo quý, và chúng phụ thuộc cấu hình audio của bạn. Bảng đầu ra của bộ kiểm thử:
| Nhà cung cấp | WER (3 tập audio của bạn) | TTFB (streaming) | Chi phí mỗi giờ audio (tầng của bạn) |
|---|---|---|---|
| AssemblyAI Universal-3-Pro | ___ / ___ / ___ | ___ ms | $___ |
| Deepgram Nova-3 | ___ / ___ / ___ | ___ ms | $___ |
| Whisper (tự lưu trữ) | ___ / ___ / ___ | ___ ms | $___ + GPU |
| OpenAI transcription | ___ / ___ / ___ | ___ ms | $___ |
Một dự đoán thẳng thắn: trên audio sạch, chênh lệch sẽ nhỏ — các model đầu bảng đều transcribe lời nói sạch tốt. Trên audio ồn ào và nhiều người nói, chênh lệch sẽ rất lớn, và thứ hạng có thể làm bạn bất ngờ. Đó chính xác là lý do bộ kiểm thử tồn tại.
Streaming so với Async — và góc nhìn Voice-Agent
Điểm chính: hội thoại thời gian thực cần streaming và mọi thứ khác nên đi async — quyết định chế độ là một quyết định chi phí trá hình thành quyết định độ trễ.
Hai quy tắc, không ngoại lệ:
- Tương tác = streaming. Voice agents, phụ đề trực tiếp và bất cứ thứ gì người dùng chờ đều cần streaming với time-to-first-token thấp — đó là trung tâm thiết kế của Nova-3, với xử lý interruption là yêu cầu cứng cho stack agent. Và hãy để ý rate limits trên các tầng realtime — streaming đốt requests nhanh hơn async rất nhiều.
- Mọi thứ khác = async. Transcription file, làm giàu theo batch, lưu trữ truyền thông — async rẻ hơn, đáng tin cậy hơn và dễ retry hơn. Nền tảng AssemblyAI và pipeline batch của Whisper đều tỏa sáng ở đây.
Góc độ thanh toán: các tầng async thường rẻ hơn mỗi giờ so với tầng realtime, và chiết khấu khối lượng cộng dồn. Nếu bạn đang transcribe 10,000 giờ lưu trữ, quyết định chế độ sẽ dịch chuyển hóa đơn của bạn theo một hệ số, không phải một tỷ lệ phần trăm.
Ghi chú về stack. Trong một stack voice-agent, STT là một trong ba thành phần — STT, LLM, TTS — và mỗi thành phần có thể đến từ một nhà cung cấp khác nhau. Cách làm giúp mọi thứ dễ quản lý: giữ mỗi thành phần đứng sau endpoint hợp nhất của bạn, với STT giữ nguyên bản chất nhà cung cấp gốc (lớp hợp nhất cho bạn một key, một tài khoản thanh toán chung và một dashboard xuyên suốt audio và chat — nó không thay thế nhà cung cấp STT, nó hợp nhất phần đường ống; danh mục model cho thấy những model audio nào truy cập được qua đó). Hướng dẫn tích hợp mobile của chúng tôi cho thấy mặt streaming trên thiết bị, và tài liệu audio API bao quát endpoint hợp nhất cho cả hai chiều của giọng nói.
Câu hỏi thường gặp
API STT nào có WER thấp nhất?
Trên audio sạch, các model đầu bảng gần nhau — Universal-3-Pro và Nova-3 đều transcribe lời nói sạch tốt. Trên audio ồn ào và nhiều người nói, chênh lệch rất lớn và phụ thuộc audio. Hãy chạy bộ kiểm thử ba ngữ liệu; câu trả lời cho sản phẩm của bạn nằm trong bản ghi của bạn, không phải trong marketing của ai cả.
Các nhà cung cấp STT tính phí thế nào — mỗi giờ, mỗi phút hay mỗi giây?
Cả ba đều tồn tại. AssemblyAI và Deepgram tính phí mỗi giờ audio (với tùy chọn mỗi giây trên một số tầng), OpenAI mỗi phút, và Whisper mỗi GPU-giờ trên phần cứng của bạn. Hãy chuẩn hóa về chi phí mỗi giờ audio trước khi so sánh — đó là đơn vị duy nhất sống sót.
Streaming hay async — tôi nên dùng cái nào?
Sản phẩm tương tác thì stream; mọi thứ khác đi async. Async rẻ hơn mỗi giờ, đáng tin cậy hơn và dễ retry hơn; streaming là bắt buộc khi người dùng đang chờ. Không có chế độ thứ ba nào giúp bạn khỏi phải chọn.
Tự lưu trữ Whisper có rẻ hơn API transcription không?
Chỉ khi vượt qua khối lượng thực với cấu hình audio ổn định và vận hành GPU hiện có. Dưới ngưỡng đó, chi phí sử dụng GPU và MLOps vượt quá khoản tiết kiệm mỗi giờ — và phân tích TCO được liên kết ở trên cho thấy vì sao.
Speaker diarization năm 2026 tốt đến mức nào?
Tốt hơn năm 2024, nhưng vẫn chưa đáng tin cậy cho các cuộc hội thoại dài nói chồng lên nhau — đó là lý do ngữ liệu nhiều người nói trong bộ kiểm thử quan trọng. Nếu độ chính xác diarization là sản phẩm của bạn, hãy benchmark các nhà cung cấp chuyên biệt trên mẫu cuộc gọi thực của bạn trước khi cam kết.
Tôi có thể dùng STT để xử lý interruption trong voice-agent không?
Chỉ với hỗ trợ streaming và barge-in — đó là thế mạnh của Deepgram (và ngày càng của AssemblyAI). Transcription async không có khái niệm interruption; nếu agent của bạn cần nó, tầng realtime là bất khả thương lượng.
Tóm tắt
Khi so sánh các API speech-to-text trong năm 2026, bạn có một neo độ chính xác (AssemblyAI Universal-3-Pro), một neo realtime (Deepgram Nova-3), một lựa chọn kiểm soát (Whisper tự lưu trữ) và một mặc định tích hợp (OpenAI) — với quyết định thực sự do audio và chế độ của bạn quyết định. Hãy chạy bộ kiểm thử WER ba ngữ liệu, chuẩn hóa về chi phí mỗi giờ audio, chọn streaming hay async một cách có chủ đích, và giữ phần đường ống của stack hợp nhất để lựa chọn nhà cung cấp vẫn là lựa chọn thành phần.
Các benchmark của nhà cung cấp do chính nhà cung cấp viết. Hãy tự chạy bài kiểm thử của bạn. Nhận TokSpan API key của bạn và transcribe cùng một bản ghi với nhiều engine STT; $5 tín dụng miễn phí đủ cho bài kiểm thử.