Голосовой ИИ для бизнеса сегодня уверенно решает одну задачу из двух. Принять голосовое сообщение, расшифровать его и ответить — это работает, стоит меньше двух центов за минуту и внедряется за недели. Вести живой разговор голосом — совсем другой проект, и упирается он не в модель, а в задержку.
8 июля OpenAI выпустил GPT-Live: голос ChatGPT, который слушает и говорит одновременно, поддакивает, замолкает, когда вы задумались, и умеет перебить. Заявленная задержка — около 300 миллисекунд. После таких релизов к нам приходят с формулировкой «хотим как в демо», и разговор быстро упирается в один и тот же вопрос: а за сколько сейчас отвечает ваш текстовый бот?
Мы это замерили на живом проекте. Ответ оказался неудобным, и именно он определяет, что бизнесу стоит делать с голосом прямо сейчас.
Голос как ввод работает уже сегодня
Самый дешёвый голосовой сценарий не требует никакого реального времени. Клиент записывает голосовое в мессенджер, модель превращает его в текст, дальше отрабатывает обычный текстовый бот. Человек в переписке и так не ждёт мгновенного ответа, поэтому секунды здесь никого не раздражают.
У нас так устроен бот-продавец поставщика офисной мебели: WhatsApp, каталог, остатки, счета, два языка — русский и арабский. Голосовые сообщения расшифровывает openai/gpt-audio-mini через OpenRouter, температура ноль, лимит на файл 25 мегабайт. Ограничение по размеру стоит не для красоты: без него любой присланный час аудио превращается в счёт и в подвисшую очередь.
По ценам это самая скучная строка сметы. Официальный прайс OpenAI даёт для gpt-live-transcribe и gpt-realtime-whisper 0,017 доллара за минуту. Минута клиентского голосового обходится дешевле, чем несколько секунд работы менеджера, который сейчас это голосовое отслушивает и перепечатывает.
Одни грабли на этом пути мы всё же собрали. Сначала запрос к модели шёл через сырой HTTP-клиент, и модель молча игнорировала блок с аудио: не ошибка, не отказ, а вежливый ответ на пустоту. Расшифровка приходила пустой, а в логах всё выглядело здоровым. Лечилось переходом на официальный SDK. У мультимодальных моделей отсутствие ошибки ещё не значит, что вашу картинку или ваш звук вообще прочитали.
Живой разговор упирается в задержку
С разговором в реальном времени всё сложнее, и цифра тут ровно одна: сколько секунд проходит от «клиент договорил» до «бот начал отвечать».
27 июля мы прогнали на этом же боте матрицу из шести сценариев с реальной доставкой сообщений в WhatsApp.
| Сценарий | Время до ответа |
|---|---|
| Вопрос по условиям работы | 22,1 с |
| Подбор товара | 24,4 с |
| Сравнение двух позиций | 37,8 с |
| Оформление заказа | 8,7 с |
| Диалог на арабском | 21,1 с |
| Передача менеджеру | 7,7 с |
Медиана — 21,6 секунды, девяносто пятый процентиль — 34,4. Наши собственные цели были p50 не выше 15 секунд и p95 не выше 25; из трёх целевых порогов взят только потолок в 45 секунд. Мы записали это как невыполненную цель: бот работает и продаёт, но по скорости он пока не там, где мы его хотим видеть.
Теперь сопоставьте с тремястами миллисекундами из демо. Разница — в семьдесят два раза.
Задержку создаёт не ваш код
Дальше — самое практичное наблюдение, ради которого мы вообще разбили замер на тринадцать фаз.
На самом медленном сценарии — сравнении двух позиций каталога — время разошлось так.
| Что происходит | Время | Доля |
|---|---|---|
| Обращения модели к инструментам | 30,803 с | 82,2% |
| Всё остальное: очередь, контекст, поиск по базе, запись | 6,428 с | 17,2% |
| Отправка готового ответа в WhatsApp | 0,231 с | 0,6% |
| Итого | 37,462 с | 100% |
Найти товар в каталоге, проверить остаток в учётной системе, собрать ответ — и всё это по очереди, потому что каждый следующий вызов зависит от предыдущего. На арабском диалоге картина та же: 13,4 секунды из 15,1 — снова инструменты.

Вывод для заказчика неприятный, но экономит деньги. Когда подрядчик обещает ускорить голосового бота, оптимизировав бэкенд, кэш и очереди, он предлагает бороться за проценты в той доле, где их почти нет. Ускорение живёт в другом месте: меньше последовательных вызовов, часть проверок параллельно, часть данных заранее в контексте, а иногда — просто другая модель.
Кстати, в этих же логах задержки нет ни одной буквы клиентского текста, ни телефона, ни идентификатора диалога — только фазы и миллисекунды. Мы такие вещи закладываем сразу, потому что обезличивание данных задним числом стоит дороже, чем сделанное на старте.
Когда это возражение не работает
Здесь надо честно указать границу собственного аргумента, иначе получится реклама позиции.
Наши 82% — это про бота, который лезет в каталог, в остатки и в учётную систему. Голосовой бот, который здоровается, отвечает по короткой базе знаний, уточняет один параметр и переводит на нужного человека, никуда не лезет — и укладывается в приличную задержку уже сегодня. Такие сценарии в колл-центрах работают, и продавцы realtime-решений совершенно правы, когда это показывают.
Разрыв возникает ровно там, где голосу нужны ваши данные. Голосовой ИИ для бизнеса упирается в число обращений к вашим системам за разговор, а не в то, какая модель озвучивает ответ. Если ни разу — берите realtime и не читайте дальше. Если каждый второй ответ требует остатка на складе, вы упрётесь в то же, во что упёрлись мы.

Цена realtime считается не в минутах
Отдельная ловушка ждёт того, кто пойдёт считать бюджет живого голоса по популярным разборам. Почти все они называют цену за минуту разговора. В официальном прайсе такой строки нет.
Realtime-аудио тарифицируется за токены. gpt-realtime-2.1 — 32 доллара за миллион входных аудиотокенов и 64 за миллион выходных, у облегчённого gpt-realtime-2.1-mini те же позиции стоят 10 и 20. Кэшированный вход дешевле почти в сто раз: 40 и 30 центов за миллион соответственно.
Отсюда практическое следствие: стоимость минуты зависит от того, кто в этой минуте говорит. Разговор, где бот произносит длинные ответы, стоит принципиально дороже разговора, где он отвечает коротко и слушает. Поэтому в смету голосового проекта минуту вписывать нельзя — только диапазон, и только после того, как вы увидели реальные диалоги. Мы у себя договорились считать стоимость по активным минутам разговора и измеренной занятости ресурсов, а не по времени, которое комната провисела открытой.
Про кэш стоит помнить отдельно. Разница между 32 долларами и 40 центами — это разница между «системный промпт отправляется заново каждый ход» и «не отправляется». В выборе модели под проект такие вещи решают бюджет сильнее, чем позиция модели в рейтинге.
Что из GPT-Live можно купить, а что нет
Здесь придётся уточнить то, что в новостях слиплось в один продукт.
Расшифровка речи под брендом GPT-Live в API есть: gpt-live-transcribe перечислена и в руководстве по realtime, и в прайсе. А вот полнодуплексная болталка из демо ChatGPT — та самая, что поддакивает и перебивает, — отдельной моделью для интеграции не выложена.
Забавная деталь: семейство для разработчиков вышло на два дня раньше потребительского. gpt-realtime-2.1 появилась 6 июля, GPT-Live — 8-го. Строить разговорные сценарии сегодня можно ровно на GPT-Realtime.
Мы во втором своём продукте пошли этим путём. Медиаплан на LiveKit, отдельный рабочий процесс, который держит разговор, и вся содержательная работа — в основном движке продукта, а не в голосовой модели. Голос там сознательно лишён права думать: он получает готовый ответ с источниками и ограничениями и озвучивает его. Иначе получается контур, где голосом клиенту сказали одно, а в истории записано другое.
Замолчать и остановиться — разные команды
Самое неочевидное правило голосового продукта выглядит мелочью интерфейса, а стоит дороже всего.
Когда человек перебивает бота, он останавливает речь. Он не отменяет работу. Если в этот момент система ищет товар, считает смету или пишет в CRM, перебивание не должно ничего откатывать. Мы вынесли это в контракт состояний прямо: прерывание останавливает озвучивание, а «остановить выполнение» — отдельная команда с отдельной формулировкой подтверждения. И пока идёт фоновая работа, интерфейс обязан показывать, что именно выполняется, вместо абстрактного индикатора загрузки.

Из того же разбора — ещё пять режимов отказа, которые мы выписали до начала работ:
- голос уверенно называет ответ, отличающийся от того, что записано в системе;
- клиент слышит фразу, которой потом нет в истории диалога: прерывание оборвало озвучивание, но не транскрипт;
- фоновая задача дублируется при переподключении или перестаёт отменяться;
- русские имена, названия и числа звучат неверно, и этого никто не замерил;
- сбой у поставщика голоса уносит весь диалог, включая текстовый.
Последний лечится проще остальных и забывается чаще: голос должен быть отключаемым, а текстовый разговор — продолжаться. Если голосовая часть единственная, её авария становится аварией всего сервиса.
Кому голосовой ИИ для бизнеса нужен уже сейчас
Голосовой ИИ для бизнеса окупается быстрее всего там, где голос уже есть, а обрабатывают его руками. Если клиенты присылают вам голосовые сообщения, а сотрудник их отслушивает и перепечатывает — начинать стоит сегодня. Сценарий понятный, цена расшифровки в пределах погрешности бюджета, окупаемость считается на салфетке через время менеджера.
Если хочется живого разговора, порядок другой. Сначала посчитайте, сколько раз за типичный разговор боту придётся сходить в ваши системы. Ноль или один — сценарий рабочий уже сейчас. Три и больше — сначала разберитесь с задержкой текстового контура, потому что голос поверх него сделает громким то же самое ожидание.
А ждать, пока «выйдет API и всё станет просто», смысла нет. Судя по разрыву в семьдесят два раза, дело не в том, что нужной модели ещё не выпустили.
Замеры, грабли и куски архитектуры голосовых и текстовых ботов я выкладываю в Telegram-канале: там же лежит разбор того, как мы дробим задержку на тринадцать фаз и что делать с каждой. Сравнение моделей по качеству и цене на русских задачах — в нашем открытом лидерборде, он обновляется по мере новых прогонов.
