搜尋結果是一座鏡子迷宮:Deepgram 的部落格拿 Deepgram 跟 AssemblyAI 比較,AssemblyAI 的部落格禮尚往來,而每個被引用的 WER 數字,都是在對作者有利的音檔上量出來的。沒有人測試過你的音檔——你的咖啡廳錄音、帶口音的來電者、兩個人搶著說話的一團亂。
真正的差異化因素——你的音檔上的 WER、串流延遲、每小時成本,以及自架與否的問題——恰好是供應商部落格不碰的。
這份指南讓 2026 年的陣容正面對決——AssemblyAI 的 Universal-3-Pro、Deepgram 的 Nova-3、開源 Whisper 與 OpenAI 的轉錄模型——附帶一個你一個下午就能在自己的音檔上跑的 WER 測試工具包、一套 streaming 與 async 的決策框架,以及多數比較都跳過的自架 TCO 計算。
我們怎麼測試:同一份音檔、同一個指標
重點:WER 只有在你的音檔上才有意義——測試工具包比我們能發布的任何排行榜都重要。
這個產業的骯髒秘密:在乾淨的錄音室音檔上看似決定性的 WER 差異,到了真實錄音上會縮小甚至反轉。唯一站得住腳的方法:
- 三組音檔——乾淨語音、吵雜的真實世界音檔,與多人對話。每組十分鐘,取自你的實際使用場景,不是供應商的範例庫。
- 一個指標——word error rate,在同一份參考逐字稿上計算,去除標點與大小寫。
- 延遲的兩種讀數——time-to-first-token(streaming)與 10 分鐘音檔的端到端時間(async)。
- 一種價格換算——把每家供應商的計費單位(每小時、每分鐘、每秒)標準化為每音檔小時成本,以你實際會用的層級為準。
跑完這套工具包,你懂的會比所有比較文章加起來還多,包括這一篇。下面我們能驗證並報告的:模型陣容、定價結構與定位——那些持久的事實。
選項一:AssemblyAI——功能豐富的 Async 平台
重點:AssemblyAI 打的是平台牌——以 Universal-3-Pro 為核心、最深的後處理功能集,代價是 realtime 延遲並非它的強項。
AssemblyAI 目前的旗艦模型 Universal-3-Pro 站在轉錄準確度的前沿,而圍繞它的平台是這份比較中最深的:speaker diarization、實體偵測、主題與情緒分析、自訂詞彙,以及語言偵測,都是第一等公民功能,而不是附加服務。如果你的產品是一條轉錄 pipeline——錄音、轉錄、加值、儲存——AssemblyAI 開箱即給最多。定價頁面確實具有權威性,按模型層級與功能列出每小時費率。
取捨:AssemblyAI 的 async 優先血統在 realtime 上顯露無遺。串流能用,但延遲表現不是頭條——對每 100ms 都很重要的語音 agent 來說,realtime 優先的供應商領先。為 pipeline 選平台;為 agent 仔細量測。
適合誰: 轉錄平台、媒體與法律 pipeline、會議分析,以及想要後處理功能卻不想自己開發的團隊。
選項二:Deepgram——Realtime 優先與低延遲
重點:Deepgram 的 Nova-3 是 realtime 的基準——為語音 agent 與即時字幕而打造,串流是設計核心,而不是事後才想到的事。
Deepgram 的 Nova-3 是開發者圈子裡目前的 realtime 領先者:低 time-to-first-token、串流原生的 API、語音 agent 技術棧中的插話與 barge-in 支援,以及每音檔小時具有競爭力的定價。如果你的產品是互動式的——語音 agent、即時字幕、會回話的會議機器人——Deepgram 是音檔路徑的預設起點。
注意事項:最頂端的準確度,在一些基準集上落後 Universal-3-Pro(那是在他們的音檔上——跑你自己的),而轉錄周邊的功能深度比 AssemblyAI 薄。你買到的是速度與語音技術棧的綜效:Deepgram 的 STT 與 Aura TTS 共用一份帳單關係,這對語音產品很重要。OpenRouter 上的 Nova-3 定價頁面是核對費率的方便途徑。
適合誰: 語音 agent、即時字幕、realtime 會議工具,以及對延遲敏感的互動型產品。
選項三:Whisper——自架掌控
重點:Whisper 是資料主權的選項——能力夠、每小時免費,但 GPU、維運與準確度工程的真實成本,是「開源就是免費」這種算術忽略的。
開源的 Whisper 家族讓轉錄跑在你自己的硬體上,每小時費用為零,資料完全由你掌控。現代的 fine-tune 與 distillation 變體大幅縮小了與商業旗艦的差距,而對固定的音檔輪廓(單一語言、單一領域),調校過的 Whisper 能在準確度與成本兩方面同時打敗通用 API。
誠實的算術:GPU 成本、利用率風險、模型更新與 MLOps 稅——與我們的雲端 API vs 自架 TCO 分析為文字模型算過的是同一個形狀,這裡更嚴苛,因為音檔工作負載是突發性的。門檻是真實存在的:持續的量、穩定的音檔輪廓,以及既有的 GPU 維運。低於這個門檻,API 供應商在總成本上勝出。
適合誰: 資料主權產品、高吞吐的穩定音檔 pipeline,以及有 GPU 維運、想把每小時成本壓到零的團隊。
選項四:OpenAI 轉錄——生態系整合
重點:OpenAI 的轉錄模型是整合的選擇——準確度不錯、設定最少,而且對已經在用 OpenAI 的團隊只有一份帳單關係。
OpenAI 的轉錄 API 是零摩擦的選項:與 chat 和 TTS 用同一個 SDK、同一把 Key、同一張帳單——還有快速上手,幾分鐘就能拿到第一份轉錄。準確度紮實且持續進步,支援串流,而對 AI 技術棧本來就以 OpenAI 為基礎的團隊來說,加入轉錄的整合成本接近於零。
取捨:轉錄周邊的功能深度(凌亂音檔上的 diarization 品質、細粒度的後處理)落後專門業者,而模型產品線在版本管理上也不如專門供應商透明。當轉錄只是你 OpenAI 產品的一項功能時,這是正確的選擇;當轉錄本身就是產品時,這就是錯誤的選擇。
適合誰: OpenAI 綁定團隊、簡單的轉錄需求,以及想用一個週末做出語音功能的原型。
正面對決:WER、延遲與成本
重點:持久的事實是陣容與結構——WER 排名是你今天下午在自己的音檔上量出來的。
可以驗證的:Universal-3-Pro 守住準確度前沿。Nova-3 守住 realtime。Whisper 守住自架掌控。OpenAI 守住整合。確切數字每季都在變,而且取決於你的音檔輪廓。測試工具包的輸出表格:
| 供應商 | WER(你的 3 組音檔) | TTFB(streaming) | 每音檔小時成本(你的層級) |
|---|---|---|---|
| AssemblyAI Universal-3-Pro | ___ / ___ / ___ | ___ ms | $___ |
| Deepgram Nova-3 | ___ / ___ / ___ | ___ ms | $___ |
| Whisper (self-host) | ___ / ___ / ___ | ___ ms | $___ + GPU |
| OpenAI 轉錄 | ___ / ___ / ___ | ___ ms | $___ |
一個誠實的預測:在乾淨音檔上,差距會很小——旗艦們都能把乾淨語音轉錄得很好。在吵雜與多人音檔上,差距會很戲劇化,排名也可能出乎你的意料。這正是工具包存在的原因。
Streaming 與 Async——以及語音 Agent 的視角
重點:realtime 對話需要 streaming,其他一切都該走 async——模式的抉擇,其實是一場偽裝成延遲抉擇的成本抉擇。
兩條規則,沒有例外:
- 互動 = streaming。 語音 agent、即時字幕,以及任何需要使用者等待的功能,都需要低 time-to-first-token 的串流——這是 Nova-3 的設計核心,插話處理是 agent 技術棧的硬性要求。另外留意 realtime 層級的 rate limit——串流消耗請求的速度遠比 async 快。
- 其他一切 = async。 檔案轉錄、批次加值、媒體檔案庫——async 更便宜、更可靠,也更容易重試。AssemblyAI 的平台與 Whisper 的批次 pipeline 在這裡都很出色。
帳單的視角:async 層級每小時通常比 realtime 層級便宜,而且用量折扣可以疊加。如果你要轉錄 10,000 小時的檔案庫,模式的抉擇會讓帳單以倍數移動,而不是百分比。
技術棧備註。 在語音 agent 技術棧中,STT 是三個元件之一——STT、LLM、TTS——而且各自可以來自不同的供應商。讓這件事保持可管理的模式:把每個元件放在你的統一 endpoint後面,STT 則保持供應商原生(統一層給你一把 Key、一份帳單關係,以及橫跨音訊與聊天的一個儀表板——它不是取代 STT 供應商,而是整合管道;模型目錄顯示哪些音訊模型可以透過它取用)。我們的行動裝置整合指南展示了裝置端的串流,而 audio API 文件涵蓋語音雙向的統一 endpoint。
常見問題
哪個 STT API 的 WER 最低?
在乾淨音檔上,旗艦們很接近——Universal-3-Pro 與 Nova-3 都能把乾淨語音轉錄得很好。在吵雜與多人音檔上,差距很戲劇化,而且取決於音檔本身。跑那套三語料工具包;你產品的答案在你的錄音裡,不在任何人的行銷裡。
STT 供應商怎麼計費——每小時、每分鐘、還是每秒?
三種都存在。AssemblyAI 與 Deepgram 按音檔小時計費(部分層級有按秒的選項)、OpenAI 按分鐘、Whisper 則按你硬體上的 GPU 小時。比較之前標準化為每音檔小時成本——這是唯一存活得下來的單位。
Streaming 還是 async——我該用哪一個?
互動型產品用串流;其他一切走 async。Async 每小時更便宜、更可靠、更容易重試;當使用者正在等待時,串流是強制性的。沒有第三種模式能讓你不必選擇。
自架 Whisper 比 API 轉錄便宜嗎?
只有在確實的量、穩定的音檔輪廓與既有 GPU 維運之下才成立。低於這個門檻,GPU 利用率與 MLOps 成本會超過每小時省下的錢——前面連結的 TCO 分析說明了原因。
2026 年的 speaker diarization 表現如何?
比 2024 年好,但對長時間重疊的對話仍然不可信賴——這就是為什麼測試工具包裡的多人語料很重要。如果 diarization 準確度就是你的產品,投入之前,先在你實際的通話模式上對專門業者做基準測試。
我可以用 STT 處理語音 agent 的插話嗎?
只有在串流與 barge-in 支援之下才行——這是 Deepgram(以及越來越多的 AssemblyAI)的強項。Async 轉錄沒有插話的概念;如果你的 agent 需要它,realtime 層級就是沒得商量的事。
總結
比較 2026 年的語音轉文字 API,你會得到一個準確度基準(AssemblyAI Universal-3-Pro)、一個 realtime 基準(Deepgram Nova-3)、一個掌控選項(自架 Whisper),以及一個整合預設(OpenAI)——真正的決定權在你的音檔與你的模式。跑那套三語料 WER 工具包、標準化為每音檔小時成本、審慎選擇串流或 async,並讓技術棧的管道保持統一,讓供應商的選擇始終只是元件的選擇。
供應商的基準測試是供應商自己寫的。自己跑一份。立即取得你的 TokSpan API Key,用幾種 STT 引擎轉錄同一段錄音;$5 免費額度就夠支付這項測試。