Los resultados de búsqueda son un salón de espejos: el blog de Deepgram compara a Deepgram con AssemblyAI, el blog de AssemblyAI devuelve el favor, y cada cifra de WER citada fue medida con audio que favorece al autor. Nadie ha probado tu audio — tus grabaciones de cafetería, tus llamadas con acento, tu caos de dos personas hablando al mismo tiempo.
Los diferenciadores reales — WER con tu audio, latencia de streaming, costo por hora y la pregunta del self-hosting — son exactamente lo que los blogs de los proveedores no cubren.
Esta guía enfrenta a la línea de 2026 cara a cara — Universal-3-Pro de AssemblyAI, Nova-3 de Deepgram, Whisper de código abierto y los modelos de transcripción de OpenAI — con un kit de prueba de WER que puedes correr con tu propio audio en una tarde, un marco de decisión streaming-vs-async y la matemática de TCO del self-hosting que la mayoría de las comparaciones se saltan.
Cómo probamos: mismo audio, misma métrica
En resumen: el WER solo tiene sentido con tu audio — el kit de prueba importa más que cualquier ranking que pudiéramos publicar.
El secreto sucio de la industria: las diferencias de WER que parecen decisivas con audio limpio de estudio se reducen o se invierten con grabaciones reales. El único método defendible:
- Tres conjuntos de audio — habla limpia, audio ruidoso del mundo real y conversación con varios hablantes. Diez minutos de cada uno, de tu caso de uso real, no de la biblioteca de muestras del proveedor.
- Una métrica — word error rate, calculada sobre la misma transcripción de referencia, sin puntuación ni mayúsculas.
- Latencia en dos lecturas — time-to-first-token (streaming) y de extremo a extremo para un archivo de 10 minutos (async).
- Una conversión de precios — normaliza la unidad de facturación de cada proveedor (por hora, por minuto, por segundo) al costo por hora de audio, en el nivel que realmente usarías.
Corre ese kit y sabrás más que todos los artículos de comparación juntos, incluido este. Lo que podemos verificar y reportar abajo: líneas de modelos, estructuras de precios y posicionamiento — los hechos duraderos.
Opción 1: AssemblyAI — plataforma async con muchas funciones
En resumen: AssemblyAI es la jugada de plataforma — el conjunto de funciones de post-procesamiento más profundo, anclado por Universal-3-Pro, a costa de una latencia en tiempo real que no es su fuerte.
El modelo insignia actual de AssemblyAI, Universal-3-Pro, está en la frontera de la precisión para transcripción, y la plataforma a su alrededor es la más profunda de esta comparación: speaker diarization, detección de entidades, análisis de temas y sentimiento, vocabulario personalizado y detección de idioma como funciones de primera clase y no como complementos. Si tu producto es un pipeline de transcripción — grabar, transcribir, enriquecer, almacenar — AssemblyAI te da lo máximo listo para usar. La página de precios es genuinamente la referencia de autoridad, con tarifas por hora según el nivel de modelo y la función.
La contrapartida: la herencia async-first de AssemblyAI se nota en tiempo real. El streaming funciona, pero el perfil de latencia no es el titular — para agentes de voz donde cada 100ms importa, los proveedores realtime-first lideran. Elige la plataforma para el pipeline; mide con cuidado para el agente.
Para quién es: plataformas de transcripción, pipelines de medios y legales, analítica de reuniones y equipos que quieren post-procesamiento sin construirlo.
Opción 2: Deepgram — realtime-first y baja latencia
En resumen: Nova-3 de Deepgram es el benchmark de tiempo real — construido para agentes de voz y subtítulos en vivo, con el streaming como centro del diseño y no como una idea de último momento.
Nova-3 de Deepgram es el líder actual en tiempo real en la conversación de los desarrolladores: bajo time-to-first-token, API nativa de streaming, soporte de interrupciones y barge-in en el stack de agentes de voz, y precios posicionados de forma competitiva por hora de audio. Si tu producto es interactivo — un agente de voz, subtítulos en vivo, un bot de reuniones que responde — Deepgram es el punto de partida por defecto para la ruta de audio.
Las advertencias: la precisión en el extremo superior queda detrás de Universal-3-Pro en algunos conjuntos de benchmark (con su audio — corre el tuyo), y la profundidad de funciones alrededor de la transcripción es más delgada que la de AssemblyAI. Lo que compras es velocidad y la sinergia del stack de voz: el STT de Deepgram y Aura TTS comparten una sola relación de facturación, lo que importa para productos de voz. La página de precios de Nova-3 en OpenRouter es un buen punto de contraste de tarifas.
Para quién es: agentes de voz, subtítulos en vivo, herramientas de reuniones en tiempo real y productos interactivos sensibles a la latencia.
Opción 3: Whisper — control con self-hosting
En resumen: Whisper es la opción de soberanía de datos — capaz y gratis por hora, con un costo real en GPUs, operaciones e ingeniería de precisión que la matemática de «open source es gratis» ignora.
La familia de código abierto Whisper te da transcripción que corre en tu propio hardware con cero tarifas por hora y control total de los datos. Los fine-tunes modernos y las variantes de destilación cierran gran parte de la brecha frente a los modelos insignia comerciales, y para un perfil de audio fijo (un idioma, un dominio), un Whisper ajustado puede superar a las APIs de propósito general tanto en precisión como en costo.
La matemática honesta: costo de GPU, riesgo de utilización, actualizaciones de modelos y el impuesto de MLOps — la misma forma que nuestro análisis de TCO cloud API vs self-hosting trabaja para los modelos de texto, más dura aquí porque las cargas de audio son ráfagas. El umbral es real: volumen sostenido, un perfil de audio estable y operaciones de GPU existentes. Por debajo de eso, los proveedores de API ganan en costo total.
Para quién es: productos con soberanía de datos, pipelines de audio estable de alto volumen y equipos con operaciones de GPU que quieren el costo por hora en cero.
Opción 4: Transcripción de OpenAI — integración de ecosistema
En resumen: los modelos de transcripción de OpenAI son la opción de integración — buena precisión, configuración mínima y una sola relación de facturación para equipos que ya están en OpenAI.
La API de transcripción de OpenAI es la opción sin fricción: mismo SDK, misma clave, misma factura que el chat y el TTS — y un quickstart que te da una primera transcripción en minutos. La precisión es sólida y va mejorando, existe soporte de streaming y, para equipos cuyo stack de IA ya tiene la forma de OpenAI, el costo de integración de agregar transcripción es casi cero.
Las contrapartidas: la profundidad de funciones alrededor de la transcripción (calidad de diarization con audio desordenado, post-procesamiento fino) queda detrás de los especialistas, y la línea de modelos es menos transparente sobre versiones que los proveedores dedicados. Es la elección correcta cuando la transcripción es una función de tu producto de OpenAI, y la incorrecta cuando la transcripción es el producto.
Para quién es: equipos comprometidos con OpenAI, necesidades simples de transcripción y prototipos que necesitan voz en un fin de semana.
Cara a cara: WER, latencia y costo
En resumen: los hechos duraderos son las líneas de modelos y las estructuras — el ranking de WER es tu medición, con tu audio, esta misma tarde.
Lo verificable: Universal-3-Pro ancla la frontera de precisión. Nova-3 ancla el tiempo real. Whisper ancla el control con self-hosting. OpenAI ancla la integración. Las cifras exactas se mueven cada trimestre y dependen de tu perfil de audio. La tabla de salida del kit de prueba:
| Proveedor | WER (tus 3 conjuntos de audio) | TTFB (streaming) | Costo por hora de audio (tu nivel) |
|---|---|---|---|
| AssemblyAI Universal-3-Pro | ___ / ___ / ___ | ___ ms | $___ |
| Deepgram Nova-3 | ___ / ___ / ___ | ___ ms | $___ |
| Whisper (self-host) | ___ / ___ / ___ | ___ ms | $___ + GPU |
| Transcripción de OpenAI | ___ / ___ / ___ | ___ ms | $___ |
Una predicción honesta: con audio limpio, la brecha será pequeña — todos los modelos insignia transcriben bien la habla limpia. Con audio ruidoso y de varios hablantes, la brecha será dramática, y el ranking puede sorprenderte. Es exactamente por eso que existe el kit.
Streaming vs async — y el ángulo del agente de voz
En resumen: las conversaciones en tiempo real requieren streaming y todo lo demás debería ir por async — la decisión de modo es una decisión de costo disfrazada de decisión de latencia.
Dos reglas, sin excepciones:
- Interactivo = streaming. Los agentes de voz, los subtítulos en vivo y todo lo que un usuario espera necesita streaming con bajo time-to-first-token — ese es el centro de diseño de Nova-3, con el manejo de interrupciones como requisito estricto para los stacks de agentes. Y vigila los rate limits en los niveles de tiempo real — el streaming consume solicitudes mucho más rápido que el async.
- Todo lo demás = async. Transcripción de archivos, enriquecimiento batch, archivos de medios — el async es más barato, más confiable y más fácil de reintentar. La plataforma de AssemblyAI y los pipelines batch de Whisper brillan aquí.
El ángulo de facturación: los niveles async suelen ser más baratos por hora que los de tiempo real, y los descuentos por volumen se acumulan. Si transcribes 10,000 horas de archivos, la decisión de modo mueve tu factura por un factor, no por un porcentaje.
La nota del stack. En un stack de agente de voz, el STT es uno de tres componentes — STT, LLM, TTS — y cada uno puede venir de un proveedor distinto. El patrón que mantiene esto manejable: mantén cada componente detrás de tu endpoint unificado, con el STT quedándose nativo del proveedor (la capa unificada te da una clave, una relación de facturación y un dashboard para audio y chat — no reemplaza al proveedor de STT, consolida la infraestructura de conexión; el catálogo de modelos muestra qué modelos de audio son alcanzables a través de él). Nuestra guía de integración móvil muestra el lado del streaming en dispositivos, y la documentación de la API de audio cubre el endpoint unificado para ambas direcciones de la voz.
FAQ
¿Qué API de STT tiene el WER más bajo?
Con audio limpio, los modelos insignia están cerca — Universal-3-Pro y Nova-3 transcriben bien la habla limpia. Con audio ruidoso y de varios hablantes, la brecha es dramática y depende del audio. Corre el kit de tres corpus; la respuesta para tu producto está en tus grabaciones, no en el marketing de nadie.
¿Cómo facturan los proveedores de STT — por hora, por minuto o por segundo?
Las tres existen. AssemblyAI y Deepgram facturan por hora de audio (con opciones por segundo en algunos niveles), OpenAI por minuto y Whisper por hora de GPU en tu hardware. Normaliza al costo por hora de audio antes de comparar — es la única unidad que sobrevive.
¿Streaming o async — cuál debería usar?
Los productos interactivos usan streaming; todo lo demás va por async. El async es más barato por hora, más confiable y más fácil de reintentar; el streaming es obligatorio cuando un usuario está esperando. No existe un tercer modo que te salve de elegir.
¿Es más barato el self-hosting de Whisper que la transcripción por API?
Solo superando un volumen real con un perfil de audio estable y operaciones de GPU existentes. Por debajo de ese umbral, la utilización de GPU y los costos de MLOps superan el ahorro por hora — y el análisis de TCO enlazado antes muestra por qué.
¿Qué tan buena es la speaker diarization en 2026?
Mejor que en 2024, pero todavía no confiable para conversaciones largas superpuestas — que es por lo que importa el corpus de varios hablantes en el kit de prueba. Si la precisión de la diarization es tu producto, haz benchmark de los especialistas con tus patrones reales de llamadas antes de comprometerte.
¿Puedo usar STT para el manejo de interrupciones en agentes de voz?
Solo con streaming y soporte de barge-in — esa es la fortaleza de Deepgram (y cada vez más de AssemblyAI). La transcripción async no tiene concepto de interrupción; si tu agente la necesita, el nivel de tiempo real es no negociable.
Resumen
Cuando comparas APIs de speech-to-text en 2026, obtienes un ancla de precisión (AssemblyAI Universal-3-Pro), un ancla de tiempo real (Deepgram Nova-3), una opción de control (Whisper con self-hosting) y un default de integración (OpenAI) — con la decisión real tomada por tu audio y tu modo. Corre el kit de WER de tres corpus, normaliza al costo por hora de audio, elige streaming o async deliberadamente y mantén unificada la infraestructura de conexión del stack para que la elección del proveedor siga siendo una elección de componente.
Los benchmarks de los proveedores están escritos por los proveedores. Corre los tuyos. Obtén tu API key de TokSpan y transcribe la misma grabación con varios motores de STT; $5 en créditos gratis cubren la prueba.