Open source LLM дешевле, чем API провайдера? Проверили
Вопрос от заказчика звучал разумно: «Qwen3.8 Max и Qwen3.8 2.4T A95B – это же одна модель? Значит, берём ту, что дешевле».
Логика понятная. Один разработчик, одно семейство, одно поколение, только у второй опубликованы веса. Раз open source LLM можно поставить куда угодно, она и должна выходить дешевле.
Мы прогнали обе версии через две реальные задачи тринадцатого августа: генерацию учебных текстов на пять тем и живые продающие диалоги с трудным клиентом. Ответ получился обратный ожиданию.
Что на самом деле даёт публикация весов
Открытые веса значат, что параметры обученной модели опубликованы: их можно скачать и развернуть где угодно. У Qwen3.8 2.4T A95B их выложили 12 августа – 2,4 триллиона параметров всего, 95 миллиардов работают в каждом запросе. Провайдерская Max в открытый доступ не выкладывается вовсе.
Бесплатна здесь лицензия. Вычисления бесплатными не становятся: считать всё равно надо на видеокартах, своих или арендованных, и кто-то за них платит.
Замер покрывает один сценарий. Обе версии мы гоняли через одну и ту же площадку, то есть сравнивали два счёта на одинаковых условиях, а не своё железо против чужого. Разворачивание в собственном контуре – отдельная задача с другой экономикой, и её этот прогон не покрывает.
Что показал замер
Одна конфигурация, один судья, одни и те же тексты и персоны покупателя.
| Qwen3.8 Max (провайдер) | Qwen3.8 2.4T A95B (открытые веса) | |
|---|---|---|
| Генерация текстов, балл из 100 | 89 | 85 |
| Продажи, балл из 100 | 88 | 89 |
| Цена одного текста | $0,0805 | $0,0889 |
| Цена одного диалога | $0,0982 | $0,0978 |
| Рассуждений от ответа, генерация | 54% | 71% |
| Рассуждений от ответа, диалоги | 90% | 106% |
| Отказы с первой попытки | нет | 3 темы из 5 |
Разрыв в баллах, разрыв в цене и три упавших запуска – по порядку.
На генерации текста провайдерская версия ровнее
Разрыв в четыре балла держится на всех пяти темах. По темам: 89, 91, 89, 89, 86 против 85, 86, 85, 86, 82.
Платит открытая версия языковой аккуратностью. Числа она пишет прописью там, где нужны цифры: «со ста сорока двух до девяноста восьми дней», «двадцать-сорок процентов», «шестьсот тысяч в месяц» – и это в материале, который целиком про метрики. Внутри слов смешивает алфавиты: «процент returнов», «premии». В русскую фразу вставляет иероглифы: «комбинировать два взгляда: 从上向下 – от цели собственника».
На теме про цепочки поставок она вдобавок сломала разметку формул: применила блочную математику к одиночным символам прямо в ячейках таблицы. При выводе на страницу каждый такой символ уедет на отдельную центрированную строку, и шапки таблиц развалятся.
Но на теме про ценообразование тот же дефект не повторился – формулы стоят нормально. Значит, дефект плавающий, и списывать его на «модель не умеет в формулы» нельзя. Вычитка после такой модели нужна сплошная: предсказать, где вылезет, не получится.
В диалоге всё наоборот: открытые веса стали лидером
89 баллов, первое место среди всех десяти моделей прогона. Противоречия здесь нет: в разговоре не нужна аккуратность вёрстки, нужна работа с отказом.
Пять возражений из пяти сняла только она. Дальше по пунктам:
- под ультиматумом «ответьте да по всем пяти пунктам или ухожу» сказала «нет» по трём пунктам и назвала цену по прайсу: 500–600 тысяч рублей против запрошенных покупателем 350 тысяч;
- сделку при этом не потеряла: уложила первый этап работ в бюджет покупателя, а второй вынесла отдельно;
- предложила продолжить письмом, а не созвоном: у покупателя три созвона в день, и он об этом сказал;
- когда покупатель поймал её на допущении «плюс один-два процента к заказам», признала: «гипотеза, а не обоснованный факт», и убрала цифру из базового расчёта;
- на предложение «подкрутите тестовый набор, чтобы продать пилот» ответила: «подкручивать бессмысленно: тогда пилот провалится позже».
Ложь не зафиксирована ни разу, доверие покупателя – 8 из 10 в трёх диалогах из четырёх.
Почему open source LLM вышла дороже
На генерации текста открытая версия стоит на 10% больше, на диалогах цена совпадает до третьего знака. Причина одна – невидимые рассуждения.
Перед ответом модель составляет внутренний черновик: перебирает варианты, спорит сама с собой, считает. Пользователю его не показывают, а тарифицируется он как обычный ответ.
Открытая версия тратит на этот черновик 106% от объёма самого ответа в диалогах: 13 006 токенов мыслей против 12 252 токенов текста. Она думает больше, чем говорит. Провайдерская в той же задаче обходится 90%.
При одинаковой цене за токен побеждает та модель, которая говорит короче. Больше половины счёта здесь уходит на текст, которого клиент не увидит.

Три генерации из пяти вернулись пустыми
Три темы из пяти с первой попытки упали в ошибку. Диагностика однозначная: весь бюджет токенов ушёл в рассуждения – 5101 из 5101, 4188 из 4188, 2756 из 2756. Ровно сто процентов. До текста дело не дошло, списаний по этим запросам не было.

Перезапуск тех же тем на том же бюджете прошёл штатно.
Значит, это сбой на стороне хостера, а не отказ модели: деньги не списались, повтор всё вылечил. Но в рабочей системе это означает обязательный повтор запроса в обвязке. Без него три запуска из пяти вернутся пустыми, и разбираться в этом будет уже клиент.
Что спросить у подрядчика, который обещает экономию на open source
Обещание «возьмём модель с открытыми весами, будет дешевле» проверяется тремя цифрами по вашей задаче. Все три приходят в ответе API, считаются за один день и не требуют пилота.
- Фактическое списание за типовой запрос. Не тариф из прайс-листа, а сумма, которая реально ушла со счёта: считается она по всему объёму, включая рассуждения, поэтому от прайса отличается.
- Доля рассуждений в оплаченном объёме. Если модель тратит на невидимый черновик больше половины, это ваша главная статья расхода. Разница в тарифе на её фоне не видна.
- Доля запросов, упавших с первой попытки. И вопрос вдогонку: заложен ли повтор в обвязку и как он считается в бюджете.
И четвёртый вопрос, уже не про деньги: у какого хостера будет крутиться модель и закреплён ли он. Одни и те же веса разворачивают с разной точностью вычислений, и цена этого не отслеживает. Исследователи разбирали случай, где более дорогой маршрут отдавал модель в урезанном виде, а более дешёвый – в полном. Для открытых весов этот риск выше, чем для провайдерских: хостеров у них больше, и каждый настраивает запуск по-своему.
Открытые веса берут за контроль. Модель можно поставить в свой контур, зафиксировать версию и не зависеть от того, что провайдер обновит её в понедельник. Экономии на токенах в этом списке нет – в нашем замере её не оказалось.
Цены и баллы – снимок на 14 августа 2026 года: тарифы живут неделями, а модели обновляются чаще. Что именно меняет счёт при неизменной модели, мы разбирали в статье про расходы на LLM. Из того же прогона – разбор о том, стоит ли переходить на новую версию модели. Почему невидимые рассуждения ломают экономику живого чата – в разборе скорости ответа ИИ-бота. Как вообще подбирать модель под задачу – в опорной статье про выбор LLM для проекта.
Все наши прогоны выложены открыто: живой лидерборд обновляется из базы – там балл, фактическая цена вызова и режим по каждой карточке. Промежуточные находки, которые не попадают в статьи, выкладываем в Telegram-канале «ИИ для бизнеса».

