Voice AgentsRealtime AISTTTTS

Голосовые AI-агенты: руководство разработчика (2026)

1 мин чтения

800 миллисекунд. Вот дистанция между «телефонным звонком» и «тикетом в поддержке» — и это бюджет, который нужно проектировать, а не ориентир, которым нужно восхищаться. Вот бюджет, математика «собирать или покупать» и минимальный уровень соответствия требованиям — прежде чем вы выберете хоть одного вендора.

Создание голосовых AI-агентов — самый быстрорастущий сегмент агентного пространства и самый плохо документированный. Почти каждый гайд в интернете — туториал вендора: Vapi, Retell, LiveKit, Pipecat объясняют, как пользоваться своей платформой, — и ни один не отвечает на вопросы, которые решают исход продакшна: каков на самом деле ваш бюджет сквозной задержки, сколько стоит каждая минута на разных стеках и побеждает ли самостоятельная сборка покупку.

Этот гайд — нейтральный слой: компонентная архитектура (STT → LLM → TTS), где выбор вендора остаётся за вами, математика бюджета задержки, которая превращает «тормозит» в таблицу, модель стоимости минуты, применимая к любому стеку, и чек-лист соответствия требованиям, который держит всё это в рамках закона. Сравнения TTS и STT в этой серии разбирают выбор вендора; этот материал — архитектуру, которая их связывает.

Что такое голосовой агент на самом деле

Ключевой вывод: голосовой агент — это чат-агент плюс слой голосового ввода-вывода, и именно голосовой слой, а не LLM, — источник сложности в продакшне.

Уберите маркетинг — и архитектура окажется тремя компонентами в цикле:

Audio in → STT (speech to text) → LLM (decide & respond) → TTS (text to speech) → Audio out
                ↑                                                              |
                └────────────── interruption / barge-in handling ←────────────┘

LLM в середине — та же модель, что использует ваш чат-продукт; эту часть вы уже знаете. Сложность голосовых агентов — всё вокруг: распознавание речи в реальном времени, решение, когда отвечать (turn-taking), остановка ответа, когда звонящий перебивает, и удержание всего этого в бюджете задержки, который текстовый интерфейс никогда не был обязан соблюдать. Пользователь чата прощает двухсекундное ожидание; звонящий воспринимает его как сломанную систему.

Ещё одно заблуждение, которое стоит развеять сразу: голосовой агент — это не чат-бот с прикрученным микрофоном. Это realtime-система с аудио в качестве интерфейса, и ей нужна дисциплина такой системы, — а ещё поэтому архитектура чат-бота поддержки, которую вы уже знаете, по-прежнему применима ко всему, что выше голосового слоя.

Почему голосовой AI в продакшне отличается

Ключевой вывод: три ограничения отличают голос от любой другой агентной нагрузки — задержка, прерывание и стоимость минуты.

  1. Задержка — это и есть продукт. Живой разговор терпит примерно 800 мс сквозной задержки, прежде чем начинает ощущаться неправильным, а до 500 мс — ощущается естественно; отраслевое эмпирическое правило хорошо задокументировано в анализе бюджета задержки от Twig. Текстовый API, отвечающий за 2 секунды, — нормально; голосовой агент, отвечающий за 2 секунды, — сломан. Каждый компонент вносит вклад в этот бюджет, поэтому каждый компонент должен измеряться.
  2. Прерывание — это фича. Barge-in — когда звонящий перебивает агента — должен остановить TTS на середине фразы, перезапустить прослушивание STT и перепланировать ответ LLM. Платформы, обрабатывающие это нативно, стоят реальных денег; реализации, игнорирующие это, дают агентов, которые перебивают своих клиентов, а это самый быстрый путь к запросу возврата.
  3. Стоимость считается за минуту, а не за токен. Голосовой разговор сжигает секунды STT, токены LLM и символы TTS одновременно, каждую минуту каждого звонка. Модель стоимости минуты ниже — та самая цифра, которую ваш финотдел спросит первой.

Как выбирать: собирать или покупать

Ключевой вывод: покупайте платформу, когда голос — это функция; собирайте стек, когда голос — это продукт; а рынок 2026 года сделал оба варианта радикально дешевле.

Платформенный уровень — Vapi, Retell, LiveKit Agents, Pipecat и новые игроки — созрел в реальный вариант: управляемая телефония, turn-taking, barge-in и инструменты оценки из коробки, тарификация за минуту. Ценовая война 2026 года сделала старт по-настоящему дешёвым: xAI вышел с конструктором голосовых агентов по $0.05 за минуту, подрезав устоявшиеся платформы, а агентский продукт ElevenLabs стартует примерно с $0.08 за минуту. Если вашей компании нужна телефонная линия, которая разговаривает с клиентами, и голос — это канал поддержки, а не сам продукт, покупайте — наценка платформы покупает вам обработку прерываний и интеграцию телефонии, которые иначе вы строили бы месяцами.

Собирайте компонентный стек, когда голос — дифференциатор: вам нужны кастомный turn-taking, конкретные комбинации вендоров STT/TTS, границы данных on-premise или контроль затрат по компонентам. Путь сборки — три интеграции вместо одной платформы: больше работы, больше контроля и стоимость минуты, которая при объёмах может оказаться заметно ниже платформенных цен. Честный средний путь: собирайте компоненты, покупайте обвязку — соберите STT/LLM/TTS сами за одним endpoint, а тонкий слой оркестрации (или вообще никакой) пусть управляет циклом.

Как собирать: компонентный стек

Ключевой вывод: стек — это три заменяемых компонента, а не один вендор: выбирайте каждый по его достоинствам и держите их взаимозаменяемыми.

  • STT — потоковое распознавание с учётом прерываний. Текущее поколение (Universal-3-Pro от AssemblyAI, Nova-3 от Deepgram и альтернативы) разобрано в сравнении STT в этой серии: для агента берите realtime-тариф и следите за time-to-first-token, а не только за WER, потому что в разговоре WER, который вы не слышите, менее важен, чем задержка, которую вы слышите.
  • LLM — тот же слой моделей, что использует ваш чат-продукт, с tool calling для реальных действий (бронирование, поиск, оплата) и структурированным выводом для slot-filling. Ничего голосо-специфичного здесь нет; паттерны function calling, которые вы уже используете, применяются без изменений.
  • TTS — потоковый вывод с профилем задержки под ваш бюджет. Сравнение TTS в этой серии разбирает компромисс качества и задержки; для агентов критерий выбора — time-to-first-audio, а естественность — на втором месте.

Архитектурное правило: каждый компонент остаётся за вашим унифицированным endpoint — один ключ, единые биллинговые отношения и один дашборд для аудио и чата. Унифицированный слой — это консолидация обвязки, а не замена вендоров. STT остаётся нативным для провайдера, TTS — нативным для провайдера, а LLM маршрутизируется по задачам: дешёвая модель для slot-filling, frontier-модель для нюансированных ответов. Это паттерн кастомной маршрутизации, применённый к разговору.

Замечание по вопросу realtime API: realtime-endpoint «всё-в-одном» — легитимный вариант, но не обязательное требование. Компонентный пайплайн — потоковый STT, чат-LLM, потоковый TTS — это проверенная продакшн-архитектура с лучшей гибкостью по вендорам, а это важно в тот момент, когда один вендор меняет цены. Документация audio API покрывает оба направления голоса на одном endpoint.

Как уложиться в бюджет задержки

Ключевой вывод: бюджет 800 мс — это проблема стека, а не модели: закладывайте бюджет на каждый компонент и измеряйте в продакшне, а не в демо.

Сквозной бюджет раскладывается примерно так: VAD/определение момента речи (~100-200 мс) → STT time-to-text (~200-300 мс) → LLM time-to-first-token (~200-400 мс) → TTS time-to-first-audio (~100-200 мс) → воспроизведение. Добавьте сетевые переходы — и сумма как раз объясняет, почему «каждый компонент быстрый» не означает «агент быстрый».

Три рычага в порядке влияния:

  1. Пайплайн параллельный, а не последовательный. Запускайте синтез TTS на первом чанке LLM, пока остаток ответа стримится; запускайте прослушивание STT во время воспроизведения TTS (именно это включает barge-in). Последовательные реализации платят за задержку каждого компонента полностью; параллельные платят только за самый длинный путь.
  2. Стримьте всё. Потоковый STT, потоковые ответы LLM, потоковый TTS — непотоковые компоненты убивают бюджет в голосовом цикле.
  3. Подбирайте тариф модели по типу реплики. Slot-filling и подтверждения работают на дешёвом/быстром тарифе; сложные рассуждения — на frontier-тарифе. Разница в задержке между тарифами часто больше разницы в стоимости, и обе говорят в пользу тирования.

Измеряйте на реальных записях звонков, в продакшн-регионах, на P50 и P95 — медиана прячет звонки, которые действительно вредят. Бюджет задержки — первое, что нужно тестировать, а не последнее.

Сколько это стоит: стоимость минуты

Ключевой вывод: типичный продакшн-агент укладывается в диапазон $0.02-0.10 за минуту в зависимости от стека и тарифов — а платформенные и компонентные цены сходятся по мере развития ценовой войны 2026 года.

Модель стоимости минуты, применимая к любому стеку:

Cost per minute =
  (STT seconds × per-second rate)
  + (LLM tokens × per-token rate, input + output)
  + (TTS characters × per-character rate)

Пример с 60-секундным звонком: ~40 секунд аудио STT, ~300-600 токенов LLM, ~100-150 символов TTS. По типичным тарифам 2026 года компоненты в сумме дают примерно $0.02-0.06 за минуту для хорошо тированного стека — а платформенные продукты вроде подробной модели расчёта затрат Inworld и тарифы $0.05-0.08 за минуту от xAI и ElevenLabs подтверждают диапазон. Разброс идёт из трёх мест: какой LLM-тариф ведёт разговор, работают ли STT/TTS на realtime- или async-тарифах и платите ли вы платформенную наценку или компонентные ставки.

Ловушка масштабирования: агент поддержки, обрабатывающий 10,000 минут звонков в месяц по $0.05/мин, — это статья на $500, мелочь. Продающий агент, обрабатывающий 100,000 минут на нетированном стеке (frontier-LLM для каждой реплики, премиальный TTS для каждой фразы), может стоить в 3-5 раз дороже за минуту. Тирование — это не оптимизация; это разница между фичей и статьёй, которую аудирует ваш CFO.

Частые ошибки, которых стоит избегать

Ключевой вывод: четыре архитектурные ошибки топят голосовых агентов в продакшне — и ни одна из них не является багом в коде.

  1. Нет бюджета задержки до запуска. Демо работает на тихом столе с быстрым соединением; продакшн работает на телефонных линиях на P95. Если правило 800 мс не соблюдается в вашем тестовом наборе, оно не соблюдается нигде.
  2. Игнорирование barge-in и turn-taking. Агентов, которые перебивают звонящих или неловко паузят в ожидании тишины, просто кладут трубку. Обработка barge-in — фича, которую нужно покупать или строить осознанно; случайной она не бывает.
  3. Привязка к одному вендору. Одна платформа для STT+LLM+TTS кажется удобной до первого пересмотра цен или удаления модели — а rate limits любого вендора могут укусить высоконагруженного агента. Держите компоненты взаимозаменяемыми за одним endpoint.
  4. Нет атрибуции затрат. Если в конце месяца вы не можете ответить на вопрос «сколько стоил этот агент за минуту по каждому типу звонков», вы узнаете ответ из счёта — а это худший момент, чтобы его узнать.

Соответствие требованиям: согласие и раскрытие

Ключевой вывод: раскрытие и согласие теперь регулируются законом, а не опциональны: правила FCC 2026 года для AI-звонков и рамка TCPA/CCPA/GDPR применяются к вашему агенту с первого звонка.

Регуляторный ландшафт для AI-звонков ужесточился в 2026 году: правила FCC США для AI-звонков поверх TCPA, плюс CCPA и GDPR для записи и данных — комбинация, подробно разобранная в гайдах по соответствию записи звонков и в рамке соответствия GDPR. Практический базовый уровень для каждого развёртывания:

  1. Раскрывайте в начале звонка — звонящий должен знать, что говорит с AI, а не с человеком, прежде чем разговор куда-либо уйдёт.
  2. Согласие на запись — там, где запись вообще разрешена, фиксируйте явное согласие и храните его вместе с данными звонка.
  3. Минимизируйте хранение — храните аудио и транскрипты ровно столько, сколько оправдана бизнес-необходимость, и исполняйте запросы на удаление через тот же процесс, что и для остальных персональных данных.
  4. Документируйте пайплайн — условия обработки данных каждого вендора компонентов (STT, LLM, TTS) — часть вашего реестра соответствия, а не мысль задним числом.

Паттерн для всего чек-листа: по умолчанию относитесь к каждому голосовому звонку как к обработке персональных данных. Это допущение ничего не стоит принять и стоит всего — пропустить.

FAQ

В чём разница между голосовым агентом и чат-ботом?

Ядро LLM идентично — разница в слое голосового ввода-вывода: realtime STT/TTS, turn-taking, barge-in и бюджет задержки в сотнях миллисекунд вместо секунд. Гайд по архитектуре чат-ботов, на который ссылались выше, покрывает всё, что выше голосового слоя.

Собирать голосового агента или покупать?

Покупайте платформу (Vapi, Retell, LiveKit, Pipecat и новых игроков за $0.05-0.08/мин), когда голос — канал поддержки, а ваш дифференциатор в другом. Собирайте компонентный стек, когда голос — продукт: кастомный turn-taking, комбинации вендоров или границы данных делают путь сборки правильным.

Какой бюджет задержки приемлем?

Сквозная задержка до 800 мс — граница приемлемости для живого разговора; до 500 мс ощущается естественно. Закладывайте бюджет на каждый компонент — VAD, STT, TTFB LLM, первое аудио TTS — и соблюдайте его на P95 в продакшн-регионах, а не на демо-столе.

Сколько стоит голосовой агент за минуту?

Хорошо тированный компонентный стек обычно укладывается в $0.02-0.06 за минуту; платформенные продукты входят примерно с $0.05-0.08. Разброс определяется тированием LLM, ценами realtime- и async-аудио и платформенной наценкой — модель стоимости минуты из этого гайда применима к любому стеку.

Нужен ли мне realtime API для голосового агента?

Нет. Компонентный пайплайн — потоковый STT, чат-LLM, потоковый TTS — проверенная продакшн-архитектура с лучшей гибкостью по вендорам, и он держит каждый компонент взаимозаменяемым при изменении цен или моделей. Realtime-endpoint — это вариант, а не требование.

Что нужно для соответствия при записи звонков и раскрытии?

Раскрытие в начале звонка, явное согласие на запись там, где оно требуется, минимальное хранение и задокументированные условия обработки данных вендоров — правила FCC 2026 года для AI-звонков плюс TCPA/CCPA/GDPR образуют рамку, а гайд по GDPR, на который ссылались выше, — базовый чек-лист.

Итоги

Когда вы строите голосовых AI-агентов в 2026 году, архитектура — это три взаимозаменяемых компонента — STT, LLM, TTS, — скреплённые бюджетом задержки, который жёстко задаёт 800 мс, моделью стоимости минуты, которая действует в диапазоне $0.02-0.10, и слоем соответствия, который правит с первого звонка. Покупайте платформу, когда голос — фича; собирайте компоненты, когда голос — продукт; держите каждый компонент за унифицированным endpoint и относитесь к обработке прерываний и раскрытию как к фичам — потому что обе ими и являются.

Соберите самый маленький голосовой цикл, который отвечает. Получите API-ключ TokSpan — первые $5 кредитов бесплатно — и наблюдайте, как задержка по компонентам ложится на один дашборд с первого звонка.