Стоит ли обновлять модель ИИ, когда вышла новая версия
Двенадцатого августа DeepSeek выпустил рабочую сборку флагманской модели V4 Pro – после четырёх месяцев превью, без блога и пресс-релиза. Просто в API поменялась версия. Мы эту модель используем, поэтому вопрос «стоит ли обновлять модель ИИ» встал в тот же день.
Ответ получился неудобный. Из даты релиза не следует ничего – его даёт только замер на своих задачах. А чтобы замер сделать, пришлось сначала чинить не модель, а собственное сравнение.
Сначала пришлось починить сравнение
В нашей базе предыдущая версия числилась с 14 июня: 88 баллов. Соблазн простой – прогнать новую и посмотреть, больше или меньше.
Так делать нельзя. Рубрика оценки за это время сменила поколение, и она стала строже: измеренная поправка между старым и нынешним поколениями составляет минус шесть баллов. То есть июньские 88 на сегодняшней шкале превратились бы примерно в 82 без всякого участия модели.
Сравнение баллов из разных поколений выдаёт ужесточение шкалы за прогресс модели. Мы этот дефект однажды у себя нашли и с тех пор держим версию шкалы рядом с каждым баллом.
Поэтому мы перегнали предыдущую версию заново: те же пять задач, та же конфигурация, тот же судья, текущая шкала. Обошлось это в 2,4 цента.
Заодно проверилась сама поправка. 88 минус 6 даёт 82, факт – 83: разошлось на балл, то есть внутри шума. Такие константы обычно берут на глаз, и приятно, когда независимый замер их держит.

Результат: ничья
| Предыдущая версия | Новая сборка 0813 | |
|---|---|---|
| Балл на текущей шкале | 83 | 82 |
| Цена одного текста | $0,00487 | $0,00479 |
| Задержка | 88 с | 73 с |
| Средний объём | 2252 слова | 2203 слова |
Один балл – это шум. Никакого прогресса в качестве между версиями нет.
По темам предыдущая версия идёт ровнее: 87, 85, 78, 83, 82 против 87, 87, 80, 82, 73 у новой. Три темы из пяти новая сборка отработала не хуже: одну вничью, две лучше.
Весь разрыв даёт одна арифметическая ошибка
Провал новой сборки на теме про подбор персонала – 73 балла – это ошибка в единственном сквозном расчёте всего материала:
«Простой позиции: 6 недель × 300 000 ₽ = 1 800 000 ₽»
Оклад в 300 000 ₽ – месячный, это сказано в том же тексте. Шесть недель простоя стоят 415 000 ₽. Модель завысила самую крупную статью расходов в 4,3 раза.
Дальше хуже. Итог «3 300 000 ₽, то есть 11 месячных зарплат» арифметически сходится из своих слагаемых – модель сложила аккуратно. Но исходное слагаемое неверно, и настоящая величина – 1,9 миллиона, то есть шесть окладов вместо одиннадцати. На этой цифре построен главный вывод раздела.
У предыдущей версии такой ошибки нет. Зато есть своя, и устроена она так же: в упражнении на денежный поток модель сама составила условие, сама посчитала и объявила правильным ответом остаток 200 000 ₽. Из её же исходных данных выходит 750 000 ₽.
Дальше это тянет за собой всё упражнение. Минимальный резерв в задаче – 250 000 ₽. По ответу модели остаток ниже резерва, то есть кассовый разрыв есть, и оба предложенных «управленческих решения» написаны под его устранение. По настоящему остатку разрыва нет вообще. Студент решает несуществующую проблему по методике, которую ему выдали за верную.
Обе версии одинаково не добрали объём: 2203 и 2252 слова при задании в 3000.
Поэтому тексты и читают руками. Ошибка, которая портит весь раздел, выглядит как обычная строчка с числами: балл её не ловит, беглое чтение тоже.
Единственное измеримое улучшение – скорость
Новая сборка отвечает за 73 секунды против 88 у предыдущей. Это 17% при той же цене и том же качестве.
Оправдан ли переход – зависит от того, где модель работает. Там, где ответа ждёт человек, пятнадцать секунд заметны. В фоновой обработке они не значат почти ничего.
И цена в этой таблице снята 13 августа, до объявления о повышении тарифов. С 17 августа DeepSeek поднимает тарифы своего API. Входные токены при промахе кэша дорожают в полтора раза, выходные – в два с четвертью. В пиковые часы по пекинскому времени оба множителя удваиваются. К прогону это не относится, а к решению о переходе – напрямую: бюджет считают по прайсу на день решения, а не на день замера.
Сам вендор заявил прирост по своим бенчмаркам – и на момент выхода ни один независимый оценщик его не повторил. На наших задачах прироста не оказалось.
Второй повод сменить модель, который тоже ничего не значит
Место в рейтинге читается как аргумент так же легко, как дата релиза. И проверяется так же плохо.
В том же прогоне мы оценивали десять моделей по двум разным работам: генерация обучающих текстов и продающий диалог с трудным клиентом. Один набор моделей, один день, две системы оценки.
| Модель | Генерация текстов | Продажи |
|---|---|---|
| GPT-5.6 Luna | 93 | 84 |
| Gemini 3.7 Flash | 93 | 70 |
| Grok 4.6 | 91 | 88 |
| Qwen3.8 Max | 89 | 88 |
| Qwen3.8 2.4T A95B | 85 | 89 |
| DeepSeek V4 Pro 0813 | 82 | 74 |
| Muse Spark 1.2 | 80 | 83 |
| Solar Pro 4 | 69 | 43 |
| Muse Glimmer 30B | 51 | 66 |
| Nemotron 3.5 Lightning | 43 | 13 |
Самая наглядная строка – Gemini 3.7 Flash. Первое место в генерации текстов и седьмое из десяти в продажах. Технически сильная модель, коммерчески недисциплинированная: переобещания зафиксированы в трёх диалогах из четырёх, а в торге с закупщиком заявила, что ниже 400 тысяч рублей не спустится, и через реплику подтвердила 350.
Gemini пишет учебный материал на уровне лучшего в прогоне – и в разговоре с закупщиком роняет собственную нижнюю планку на 12%.
Зеркальный случай – открытые веса Qwen: пятое место в генерации, первое в диалоге.
Бенчмарк «вообще» про вашу задачу не говорит ничего, и наш собственный тоже – ровно до тех пор, пока в нём не окажется ваша работа.

Что мы не проверили
Предыдущую версию мы не гоняли на продажах – прямого сравнения по этому тесту нет. Новая сборка там набрала 74 балла с огромным разбросом по персонам: 89, 90, 65 и 53. Два очень сильных диалога и два провала в одном замере – по отдельным разговорам, а не по среднему. Что из этого изменилось относительно предыдущей версии, мы не знаем.
И вторая оговорка, методическая. Чтобы отличить «модель стала хуже» от «судья построжел», в каждом прогоне работает контрольная модель, замеренная раньше в той же конфигурации. В этот раз она дала 93 балла при базовых 93 на генерации текстов – шкала не сдвинулась. И 84 при базовых 87 на диалогах, то есть минус три. Баллы за продажи в этом прогоне стоит читать с этой поправкой.
Стоит ли обновлять модель ИИ: четыре шага до ответа
Они занимают день и стоят центы: перегон предыдущей версии обошёлся в 2,4 цента.
- Возьмите свои пять типовых задач. Не абстрактный тест, а то, что модель делает у вас каждый день: письмо клиенту, разбор документа, ответ в чате.
- Прогоните обе версии в один день и на одной шкале. Старый балл из своей же таблицы не годится, если с тех пор менялась методика.
- Пересчитайте руками все числа в ответах. В балле такая ошибка не видна: она выглядит как обычная строка с рублями.
- Сравните четыре вещи сразу. Качество, скорость, цену и долю отказов. Новая версия может выигрывать по одному параметру и проигрывать по трём – у нашей выигрыш оказался ровно один.
И держите в каждом замере контрольную модель. Без неё вы не отличите изменение моделей от изменения собственной строгости, а это самая незаметная из возможных ошибок – она всегда выглядит как прогресс.
Как проверять качество работы ИИ второй моделью и где такой контроль ломается, мы разбирали отдельно. Почему при выборе модели для диалога скорость важнее балла – в статье про задержку ответа ИИ-бота. Общий порядок подбора модели под задачу – в опорной статье про выбор LLM для проекта.
Все замеры лежат открыто: живой лидерборд обновляется из базы, и рядом с каждым баллом стоит версия шкалы, на которой он получен. Промежуточные результаты, которые не доходят до статей, выкладываем в Telegram-канале «ИИ для бизнеса».

