Voice AgentsRealtime AISTTTTS

Guía 2026: cómo construir agentes de voz con IA

1 min de lectura

800 milisegundos. Esa es la distancia entre «una llamada telefónica» y «un ticket de soporte» — y es un presupuesto que se diseña, no un benchmark que se admira. Aquí está el presupuesto, la matemática de build-vs-buy y el piso de cumplimiento, antes de que elijas un solo vendor.

Construir agentes de voz con IA es el rincón de más rápido crecimiento del espacio de agentes, y el peor documentado. Casi todas las guías en línea son tutoriales de vendors — Vapi, Retell, LiveKit y Pipecat explican cada uno cómo usar su plataforma — y ninguna responde las preguntas que deciden los resultados en producción: cuál es realmente tu presupuesto de latencia de extremo a extremo, cuánto cuesta cada minuto entre stacks, y si construir le gana a comprar.

Esta guía es la capa neutral: la arquitectura de componentes (STT → LLM → TTS) dejando la elección de vendor en tus manos, la matemática del presupuesto de latencia que convierte «se siente lento» en una hoja de cálculo, un modelo de costo por minuto que puedes aplicar a cualquier stack, y la checklist de cumplimiento que mantiene todo dentro de la legalidad. Las comparaciones de TTS y STT de esta serie cubren la selección de vendors; esta cubre la arquitectura que los mantiene unidos.

Qué es realmente un agente de voz

En resumen: un agente de voz es un agente de chat más una capa de I/O de voz — y la capa de voz, no el LLM, es donde vive la dificultad de producción.

Quita el marketing y la arquitectura son tres componentes en un loop:

Audio in → STT (speech to text) → LLM (decide & respond) → TTS (text to speech) → Audio out
                ↑                                                              |
                └────────────── interruption / barge-in handling ←────────────┘

El LLM del medio es el mismo modelo que usa tu producto de chat — esa parte ya la conoces. Lo que hace difíciles a los agentes de voz es todo lo que los rodea: reconocer el habla en tiempo real, decidir cuándo responder (turn-taking), detener la respuesta cuando el llamante interrumpe, y mantener todo dentro de un presupuesto de latencia que una interfaz de texto nunca tuvo que cumplir. Un usuario de chat tolera una espera de dos segundos; un llamante lo interpreta como un sistema roto.

La otra idea errónea que hay que matar desde el principio: un agente de voz no es un chatbot con un micrófono atornillado. Es un sistema realtime con audio como interfaz, y necesita la disciplina de uno — que es también por qué la arquitectura de chatbot de soporte que ya conoces sigue aplicando para todo lo que está por encima de la capa de voz.

Por qué la voz IA de producción es diferente

En resumen: tres restricciones separan la voz de cualquier otro workload de agentes — latencia, interrupción y costo por minuto.

  1. La latencia es el producto. La conversación humana tolera aproximadamente 800ms de extremo a extremo antes de que se sienta mal, y por debajo de 500ms se siente natural — la regla general de la industria está bien documentada en el análisis de presupuesto de latencia de Twig. Una API de texto que responde en 2 segundos está bien; un agente de voz que responde en 2 segundos está roto. Cada componente contribuye a ese presupuesto, así que cada componente debe medirse.
  2. La interrupción es una feature. El barge-in — el llamante hablando por encima del agente — debe detener el TTS a mitad de frase, reiniciar la escucha del STT y re-planificar la respuesta del LLM. Las plataformas que lo manejan de forma nativa valen dinero real; las implementaciones que lo ignoran producen agentes que le hablan por encima a sus clientes, que es el camino más rápido hacia una solicitud de reembolso.
  3. El costo es por minuto, no por token. Una conversación de voz quema segundos de STT, tokens de LLM y caracteres de TTS simultáneamente, por cada minuto de cada llamada. El modelo de costo por minuto de abajo es el único número que tu equipo de finanzas pedirá primero.

Cómo elegir: construir vs comprar

En resumen: compra la plataforma cuando la voz es una feature; construye el stack cuando la voz es el producto — y el mercado de 2026 hizo ambas opciones dramáticamente más baratas.

El nivel de plataformas — Vapi, Retell, LiveKit Agents, Pipecat y los nuevos participantes — ha madurado hasta convertirse en una opción real: telefonía administrada, turn-taking, barge-in y tooling de evaluación listos de fábrica, con precio por minuto. La guerra de precios de 2026 hizo que empezar sea genuinamente barato: xAI entró con un builder de agentes de voz a $0.05 por minuto, por debajo de las plataformas establecidas, y el producto de agentes de ElevenLabs empieza alrededor de $0.08 por minuto. Si tu empresa necesita una línea telefónica que hable con clientes, y la voz es un canal de soporte más que el producto en sí, compra — el markup de la plataforma te compra el manejo de interrupciones y la integración de telefonía que de otro modo construirías durante meses.

Construye el stack de componentes cuando la voz es el diferenciador: necesitas turn-taking personalizado, combinaciones específicas de vendors de STT/TTS, fronteras de datos on-premise, o control de costos por componente. El camino de construir son tres integraciones en lugar de una plataforma — más trabajo, más control, y un costo por minuto que a volumen puede quedar muy por debajo del precio de las plataformas. El camino medio honesto: construye los componentes, compra la infraestructura de conexión — arma tú mismo el STT/LLM/TTS detrás de un solo endpoint, y deja que una capa de orquestación delgada (o ninguna) maneje el loop.

Cómo construir: el stack de componentes

En resumen: el stack son tres componentes reemplazables, no un solo vendor — elige cada uno por sus propios méritos y mantenlos intercambiables.

  • STT — reconocimiento en streaming con conciencia de interrupciones. La generación actual (Universal-3-Pro de AssemblyAI, Nova-3 de Deepgram y las alternativas) está cubierta en la comparación de STT de esta serie: nivel realtime para el agente, y presta atención al time-to-first-token, no solo al WER, porque en una conversación un WER que no puedes oír es menos importante que una latencia que sí puedes sentir.
  • LLM — la misma capa de modelos que usa tu producto de chat, con tool calling para acciones reales (reservas, consultas, pagos) y output estructurado para slot-filling. Nada específico de voz aquí; los patrones de function calling que ya usas aplican sin cambios.
  • TTS — salida en streaming con el perfil de latencia que encaje en tu presupuesto. La comparación de TTS de esta serie cubre el tradeoff entre calidad y latencia; para agentes, el time-to-first-audio es el criterio de selección, con la naturalidad en segundo lugar.

La regla arquitectónica: cada componente se queda detrás de tu endpoint unificado — una sola key, una relación de facturación compartida y un dashboard que abarca audio y chat. La capa unificada es consolidación de infraestructura de conexión, no reemplazo de proveedores. El STT se mantiene nativo del proveedor, el TTS se mantiene nativo del proveedor, y el LLM enruta por tarea — modelo barato para slot-filling, modelo de frontera para las respuestas matizadas. Ese es el patrón de routing personalizado aplicado a una conversación.

Una nota sobre la pregunta de la realtime API: los endpoints realtime todo-en-uno son una opción legítima, pero no son un requisito. Un pipeline estilo componentes — STT en streaming, LLM de chat, TTS en streaming — es una arquitectura de producción probada con mejor flexibilidad de proveedores, que importa en el momento en que un proveedor cambia sus precios. La documentación de la API de audio cubre ambas direcciones de la voz en el mismo endpoint.

Cómo cumplir el presupuesto de latencia

En resumen: el presupuesto de 800ms es un problema de stack, no de modelo — presupuesta cada componente y mide en producción, no en la demo.

El presupuesto de extremo a extremo se descompone aproximadamente en: VAD/detección de turno (~100-200ms) → STT time-to-text (~200-300ms) → LLM time-to-first-token (~200-400ms) → TTS time-to-first-audio (~100-200ms) → playback. Suma los saltos de red y el total es exactamente por qué «cada componente es rápido» no significa «el agente es rápido».

Tres palancas, en orden de impacto:

  1. Pipeline en paralelo, no en serie. Inicia la síntesis de TTS en el primer chunk del LLM mientras el resto de la respuesta hace streaming; inicia la escucha del STT durante la reproducción del TTS (eso es lo que habilita el barge-in). Las implementaciones en serie pagan la latencia completa de cada componente; las implementaciones en paralelo pagan solo el camino más largo.
  2. Haz streaming de todo. STT en streaming, respuestas de LLM en streaming, TTS en streaming — los componentes sin streaming son asesinos del presupuesto en un loop de voz.
  3. Nivela el modelo por tipo de turno. El slot-filling y las confirmaciones corren en el nivel barato/rápido; el razonamiento complejo corre en el nivel de frontera. La diferencia de latencia entre niveles suele ser mayor que la diferencia de costo, y ambas favorecen el tiering.

Mide con grabaciones de llamadas reales, en regiones de producción, en P50 y P95 — la mediana esconde las llamadas que de verdad duelen. El presupuesto de latencia es lo primero que se prueba, no lo último.

Cuánto cuesta: costo por minuto

En resumen: un agente de producción típico queda en el rango de $0.02-0.10 por minuto según el stack y los niveles — con los precios de plataforma y de componentes convergiendo a medida que se desarrolla la guerra de precios de 2026.

El modelo por minuto, aplicable a cualquier stack:

Cost per minute =
  (STT seconds × per-second rate)
  + (LLM tokens × per-token rate, input + output)
  + (TTS characters × per-character rate)

Un ejemplo resuelto con una llamada de 60 segundos: ~40 segundos de audio de STT, ~300-600 tokens de LLM, ~100-150 caracteres de TTS. A las tarifas típicas de 2026, los componentes suman aproximadamente $0.02-0.06 por minuto para un stack bien nivelado — y productos de plataforma como el modelo de costos resuelto de Inworld y las entradas de $0.05-0.08 por minuto de xAI y ElevenLabs confirman el rango. La variación viene de tres lugares: qué nivel de LLM maneja la conversación, si el STT/TTS corre en niveles realtime o async, y si estás pagando markup de plataforma o tarifas de componentes.

La trampa de la escala: un agente de soporte que maneja 10,000 minutos de llamada al mes a $0.05/min es una partida de $500 — pequeña. Un agente de ventas que corre 100,000 minutos con un stack sin niveles (LLM de frontera para cada turno, TTS premium para cada frase) puede costar 3-5× más por minuto. El tiering no es optimización; es la diferencia entre una feature y una partida que audita tu CFO.

Errores comunes que debes evitar

En resumen: cuatro fallas impulsadas por la arquitectura hunden a los agentes de voz en producción — ninguna de ellas es un bug de código.

  1. Sin presupuesto de latencia antes del lanzamiento. La demo corre en un escritorio silencioso con conexión rápida; la producción corre en líneas telefónicas en P95. Si la regla de los 800ms no se aplica en tu suite de tests, no se aplica en ningún lado.
  2. Ignorar el barge-in y el turn-taking. Los agentes que le hablan por encima al llamante, o hacen pausas incómodas esperando silencio, terminan colgados. El manejo del barge-in es una feature que se compra o se construye deliberadamente — nunca es un accidente.
  3. Atarse a un solo vendor. Una sola plataforma para STT+LLM+TTS se siente conveniente hasta que llega un cambio de precios o la eliminación de un modelo — y los rate limits de cualquier vendor pueden morder a un agente de alto volumen. Mantén los componentes intercambiables detrás de un solo endpoint.
  4. Sin atribución de costos. Si no puedes responder «¿cuánto costó este agente por minuto, por tipo de llamada» al final del mes, descubrirás la respuesta en la factura — que es el peor momento para aprenderla.

Cumplimiento: consentimiento y divulgación

En resumen: la divulgación y el consentimiento ahora están regulados, no son opcionales — las reglas de llamadas de voz con IA de la FCC de 2026 y el marco TCPA/CCPA/GDPR aplican a tu agente desde la primera llamada.

El panorama regulatorio para las llamadas de voz con IA se endureció en 2026: las reglas de llamadas de voz con IA de la FCC de EE. UU., sobre la TCPA, más CCPA y GDPR para grabaciones y datos — una combinación cubierta en profundidad por las guías de cumplimiento de grabación de llamadas y el marco de cumplimiento GDPR. La línea base práctica para cada despliegue:

  1. Divulga al inicio de la llamada — el llamante debe saber que está hablando con una IA, no con un humano, antes de que la conversación avance a cualquier lado.
  2. Consentimiento para grabar — donde la grabación esté permitida, captura el consentimiento explícito y guárdalo junto con los datos de la llamada.
  3. Minimiza la retención — conserva el audio y las transcripciones solo mientras la necesidad del negocio lo justifique, y atiende las solicitudes de eliminación por el mismo proceso que tus otros datos personales.
  4. Documenta el pipeline — los términos de procesamiento de datos de cada vendor de componentes (STT, LLM, TTS) son parte de tu registro de cumplimiento, no una ocurrencia de último momento.

El patrón de toda la checklist: trata cada llamada de voz como procesamiento de datos personales por defecto. Esa suposición no cuesta nada adoptarla y cuesta todo saltársela.

FAQ

¿Cuál es la diferencia entre un agente de voz y un chatbot?

El núcleo de LLM es idéntico — la diferencia es la capa de I/O de voz: STT/TTS en realtime, turn-taking, barge-in, y un presupuesto de latencia en cientos de milisegundos en lugar de segundos. La guía de arquitectura de chatbot enlazada arriba cubre todo lo que está por encima de la capa de voz.

¿Debo construir o comprar un agente de voz?

Compra la plataforma (Vapi, Retell, LiveKit, Pipecat y los nuevos participantes de $0.05-0.08/min) cuando la voz es un canal de soporte y tu diferenciador está en otro lado. Construye el stack de componentes cuando la voz es el producto — el turn-taking personalizado, las combinaciones de vendors o las fronteras de datos hacen que el camino de construir sea el correcto.

¿Qué presupuesto de latencia es aceptable?

Menos de 800ms de extremo a extremo es la línea de aceptabilidad para la conversación humana; menos de 500ms se siente natural. Presupuesta cada componente — VAD, STT, TTFB del LLM, primer audio del TTS — y haz cumplir el presupuesto en P95 en regiones de producción, no en el escritorio de la demo.

¿Cuánto cuesta un agente de voz por minuto?

Un stack de componentes bien nivelado queda típicamente en $0.02-0.06 por minuto; los productos de plataforma entran alrededor de $0.05-0.08. La variación la impulsan el tiering del LLM, el precio del audio realtime-vs-async y el markup de plataforma — el modelo por minuto de esta guía aplica a cualquier stack.

¿Necesito una realtime API para construir un agente de voz?

No. Un pipeline estilo componentes — STT en streaming, LLM de chat, TTS en streaming — es una arquitectura de producción probada con mejor flexibilidad de vendors, y mantiene cada componente intercambiable cuando cambian los precios o los modelos. Los endpoints realtime son una opción, no un requisito.

¿Qué necesito para el cumplimiento de grabación de llamadas y divulgación?

Divulgación al inicio de la llamada, consentimiento explícito para grabar donde se requiera, retención mínima y términos de procesamiento de datos de vendors documentados — las reglas de llamadas de voz con IA de la FCC de 2026 más TCPA/CCPA/GDPR son el marco, y la guía de GDPR enlazada arriba es la checklist de línea base.

Resumen

Cuando construyes agentes de voz con IA en 2026, la arquitectura son tres componentes intercambiables — STT, LLM, TTS — mantenidos juntos por un presupuesto de latencia que manda a 800ms, un modelo de costo por minuto que manda en $0.02-0.10, y una capa de cumplimiento que manda desde la primera llamada. Compra la plataforma cuando la voz es una feature, construye los componentes cuando es el producto, mantén cada componente detrás de un endpoint unificado, y trata el manejo de interrupciones y la divulgación como features — porque ambos lo son.

Construye el loop de voz más pequeño que responda. Obtén tu TokSpan API key — tus primeros $5 en créditos vienen gratis — y mira la latencia por componente aterrizar en un solo dashboard desde la primera llamada.