Почему ИИ-бот долго отвечает и стоит в 71 раз дороже
Тринадцатого августа мы прогнали десять языковых моделей через сорок живых диалогов: продавцом работала модель, покупателя играл жёсткий клиент с заранее заготовленной лестницей возражений. Шесть обменов репликами в каждом разговоре.
Разница в качестве продаж между самой дешёвой и самой дорогой моделью составила четыре балла из ста. Разница в цене одного диалога – 71 раз. В скорости – от 20 секунд до 270.
Платит за это не модель. Платит режим, в котором она работает, и вопрос «почему ИИ-бот долго отвечает» упирается ровно в него.
Почему ИИ-бот долго отвечает: он пишет черновик, которого клиент не видит
Перед ответом современная модель составляет внутренние рассуждения. Это связный текст: она перебирает варианты, спорит сама с собой, считает. Пользователю он не показывается.
Но тарифицируется он как обычный ответ. В документации сказано прямо: «токены рассуждений считаются выходными и оплачиваются соответственно». То есть за каждую страницу невидимого черновика вы платите столько же, сколько за страницу текста, которую увидит клиент.
Объём этого черновика мы мерили долей от самого ответа. Ноль означает, что модель не думала вовсе. Сто процентов – что на мысли ушло ровно столько же, сколько на реплику.
Сколько это в секундах и деньгах
Вот девять моделей из десяти, от самой дешёвой к самой дорогой; десятую, Solar Pro 4, вынесли в отдельный раздел ниже. Задача одна, рубрика оценки одна, четыре персоны покупателя одни и те же.
| Модель | Рассуждений от ответа | Секунд на диалог | Цена диалога |
|---|---|---|---|
| GPT-5.6 Luna | 0% | 20 | $0,00138 |
| DeepSeek V4 Pro 0813 | 0% | 34 | $0,00218 |
| Nemotron 3.5 Lightning | 0% | 17 | $0,00222 |
| Muse Glimmer 30B | 89% | 36 | $0,00552 |
| Gemini 3.7 Flash | 72% | 47 | $0,01689 |
| Muse Spark 1.2 | 84% | 57 | $0,03763 |
| Grok 4.6 | 86% | 223 | $0,07764 |
| Qwen3.8 Max | 90% | 266 | $0,09819 |
| Qwen3.8 2.4T A95B | 106% | 270 | $0,09776 |
Верхняя строка и предпоследняя отличаются по цене в 71 раз. По баллам за продажи – Luna набрала 84, Qwen3.8 Max 88. Четыре балла за семьдесят одну цену.
В нижней строке 106%: Qwen3.8 2.4T A95B потратила на невидимые мысли больше, чем на видимый текст – 13 006 токенов рассуждений против 12 252 токенов ответа. Больше половины счёта ушло на то, чего покупатель никогда не увидит.
Шесть моделей из десяти не дают это выключить
Мы отправляли каждой модели параметр, который отключает рассуждения. Шесть эндпоинтов ответили ошибкой HTTP 400: «Reasoning is mandatory for this endpoint».
Это Qwen3.8 Max, Qwen3.8 2.4T A95B, Gemini 3.7 Flash, Grok 4.6, Muse Glimmer 30B и Muse Spark 1.2. Флаг сработал у DeepSeek V4 Pro 0813, Nemotron 3.5 Lightning, Solar Pro 4 и GPT-5.6 Luna.
Это не сбой. В описании модели у площадки для таких маршрутов стоит отдельный признак обязательного режима – по нему интерфейс и прячет переключатель.
Режим задаёт маршрут, а не модель: у одной и той же модели у разных провайдеров он отличается. Проверяйте тот маршрут, по которому реально пойдёт трафик, и делайте это до подписания ТЗ.
Тридцать семь секунд на реплику – это за порогом терпения
Grok 4.6 тратит 223 секунды на диалог из шести обменов. То есть 37 секунд на одну реплику.
Порог удержания внимания в интерфейсах известен давно: десять секунд – это граница, после которой человек перестаёт ждать и переключается на другое дело. Тридцать семь секунд – это три с половиной таких порога. В чате на сайте клиент за это время успеет закрыть вкладку. В голосовом боте пауза такой длины означает, что разговор уже закончился.
При этом Grok в нашем замере оказался самой честной моделью прогона: ни одного переобещания за четыре диалога и четыре прямых отказа выдумывать под давлением. На требование покупателя «дайте аргумент, я вас продавлю внутри» он ответил: «Честно: „физически не сделает“ – не скажу. Врать ради аргумента директору не буду».
В асинхронной переписке, где ответ через минуту нормален, мы бы её и поставили. В живой чат – нет.

Быстро и дёшево – это не одно и то же
Solar Pro 4 – самая дешёвая модель прогона: $0,00091 за большой текст, рассуждений ноль.
На генерации пяти учебных материалов её задержки составили 50, 77, 547, 632 и 673 секунды. От пятидесяти секунд до одиннадцати минут, на одной модели, в одном прогоне и без всяких рассуждений.
Это уже не про режим, а про пропускную способность хостера: дешёвый маршрут держит очередь и отдаёт ответ, когда дойдут руки. Среднее по такой выборке бесполезно – важно худшее время, потому что именно на него наткнётся клиент.
Задержку надо мерить у себя и на своём объёме – включая эти цифры: они сняты 13 августа у одного провайдера.
Где за рассуждения платить стоит
Из всего сказанного не следует, что рассуждения вредны. Они меняют экономику и время отклика. На расчётных задачах они помогают, и это видно в наших прошлых замерах.
Меняется то, как разложены задачи. Всё, где ответа ждёт живой человек, – чат, голосовой бот, виджет на сайте – требует модели, у которой рассуждения реально выключаются. Всё, что работает фоном и читается потом, спокойно за них платит.
У фоновых задач есть ещё один рычаг. Пачку запросов можно отправить в очередь и забрать результат позже – такой режим стоит вдвое дешевле обычного. Прайс-листу мы не поверили и посчитали наоборот: разделили фактическое списание за пачку из пяти текстов на то, что списали бы по стандартному тарифу. Получилось ровно 0,5000. Без «до 50%» и без плавающего коэффициента.
Качество при этом не просело. Gemini 3.7 Flash в обычном режиме набрал 93 балла из ста, в режиме очереди – 92, а цена одного текста упала с $0,01685 до $0,00924.
В нашей таблице у очереди стоит 79 секунд на текст против 48 у обычного режима, и это легко прочитать как «медленнее». На деле 79 – это время обработки всей пачки, поделённое на пять. Очередь не быстрее и не медленнее: она про пропускную способность и цену.
Для диалога она бесполезна по устройству. Каждая реплика продавца зависит от предыдущей реплики клиента, шесть обменов подряд – через очередь один разговор занял бы часы вместо минуты.

Чего этот замер не доказывает
Возражения к нему мы знаем, потому что задавали их себе сами.
Сорок диалогов – это мало. Один день, один провайдер, четыре сценария покупателя. Покупателя играет другая модель, а не живой человек, и она давит ровнее и злее, чем большинство настоящих клиентов. Задержки сняты в конкретные часы конкретного дня: у того же провайдера через неделю очередь может быть другой.
Что из этого следует и что не следует. Конкретные 71 раз и 37 секунд – цифры одного прогона, и повторять их как константу нельзя. А вот структура – что доля рассуждений задаёт и цену, и время, что у части маршрутов она не отключается и что ошибка при попытке это сделать приходит на первом же запросе – проверяется у вас за полчаса и не зависит от того, сколько диалогов прогнали мы.
Что проверить в своём проекте
Пять действий до внедрения.
- Отправьте параметр отключения рассуждений на свой маршрут. Один запрос. Если пришла ошибка «Reasoning is mandatory» – эта модель на этом маршруте будет думать всегда, и цену с задержкой надо считать с учётом этого.
- Замерьте долю рассуждений в оплаченном объёме. Она приходит в ответе отдельным полем. Больше половины – это ваша главная статья расхода.
- Смотрите на худшую задержку, а не на среднюю. Клиент попадает не в среднее. У самой дешёвой модели прогона время генерации внутри одного дня гуляло от 50 до 673 секунд.
- Разделите задачи на «отвечать человеку» и «думать в фоне». Для первых нужна модель с отключаемыми рассуждениями. Вторые можно отдать в очередь и заплатить вдвое меньше.
- Считайте по фактическому списанию, а не по прайс-листу. Множитель очереди мы получили именно делением одного на другое – и он оказался ровным, но это надо было проверить.
Тарифы живут неделями: цены в статье – снимок на 14 августа 2026 года, и через месяц множители будут другими. Структура счёта при этом устойчива: она следует из устройства сервиса.
Счёт меняют ещё четыре вещи при той же самой модели: провайдер, класс обслуживания, кэш и длина контекста. Мы разбирали их в статье про расходы на LLM с расчётом на боте в двести обращений в день. Порядок подбора модели под задачу целиком – в статье про выбор LLM для проекта. А в голосовом сценарии к модели добавляются распознавание и синтез речи: в нашем продовом замере 82% задержки создаёт не она. Из этого же прогона вышли ещё две истории: дешевле ли модель с открытыми весами и стоит ли переходить на новую версию.
Результаты всех прогонов лежат открыто: живой лидерборд обновляется из базы – там и балл, и фактическая цена вызова на наших задачах, и оговорка про режим у каждой карточки. Разборы по горячим следам, до того как они превратятся в статью, выкладываем в Telegram-канале «ИИ для бизнеса» – там же лежат цифры по моделям, которые в статьи не попали.

