Собственные прогоны языковых моделей на реальных бизнес-задачах: баллы за качество, цена вызова, где модели ломаются. Обновляется после каждого теста.
Каждая модель пишет полный урок по бизнес-теме — от структуры до формул и примеров. Claude-судья оценивает глубину темы, практическую ценность, точность и русский язык.
| # | Модель | Версия теста | Провайдер | Тир | Claude Score | $/1M | $/call | $/100k симв. | Скорость | Value |
|---|
Один и тот же промпт, один и тот же судья, цена по реальному тарифу. Всё остальное — арифметика.
Каждая модель пишет полный урок по бизнес-теме: маркетинг, финансы, логистика, HR, ценообразование. Единый промпт для всех, темы и рубрика не меняются внутри версии теста.
Claude читает урок и ставит баллы по шести критериям. Повторный замер одной модели гуляет в пределах двух баллов, поэтому модели с разницей до трёх баллов делят место.
Стоимость вызова считаем по тарифу, который в момент теста реально списывает OpenRouter — со скидками и по самому дешёвому эндпоинту в стандартном классе.
Бесплатные модели получают максимум за цену, дорогие штрафуются нелинейно. Так дешёвая модель на 92 балла может обойти дорогую на 93.
Value = 70% × Quality + 30% × Cost (log)Во вкладке «Продажи» модель — продавец: ведёт диалог с несколькими персонажами- покупателями, у каждого своя лестница возражений и своё давление на цену.
Судья смотрит на выявление потребности, отработку возражений, честность и доведение до следующего шага. Балл сопоставим с обучением по шкале, но не по смыслу.
глубина понимания, логика, связность
применимость, конкретные примеры
следование промпту и структуре
нет вымышленных фактов и ссылок
иерархия, корректный Markdown
форматирование и читаемость
Это собственный сравнительный тест AiDevTeam, а не универсальный рейтинг моделей. Ниже — условия, при которых числа можно воспроизвести и корректно использовать.
Текущий срез на 14 сентября 2026 г.; данные обновляются после каждого нового прогона, без передеплоя страницы.
77 моделей от 23 провайдеров, 9 бизнес-тем и 496 сгенерированных уроков.
Модели сравниваются только внутри одинакового testVersion: единый промпт, темы и рубрика. Внешний отраслевой benchmark не заявляется.
Value = 70% × нормализованный Quality Score + 30% × Cost Score по логарифмической шкале.
Данные доступны бесплатно для предварительного выбора моделей. Перед закупкой или внедрением повторите тест на собственных сценариях, проверьте актуальные тарифы и проведите человеческую оценку.
Скачать панель из 25 AI Search prompts · CSV
DeepSeek выпустил новую сборку флагманской модели после четырёх месяцев превью. Мы перегнали старую версию на той же шкале и получили 83 против 82 – ничью. Единственное измеримое улучшение оказалось не в качестве. Разбираем и второй повод сменить модель, который тоже ничего не значит.
6 мин чтения
Прогнали восемь моделей через две реальные задачи на русском — генерацию обучающего контента и продающие диалоги. Самая дорогая модель когорты оказалась хуже самой дешёвой почти в пятьдесят раз по цене и на девять баллов по качеству. Разбираю, как выбирать модель под проект: почему у одной модели одиннадцать разных цен, что показывает разброс вместо среднего балла и почему англоязычный рейтинг ничего не говорит о работе на русском.
15 мин чтения
Alibaba выпустила Qwen 3.8 Max: 2,4 триллиона параметров, миллион контекста и первое место в медицинской категории Arena. Разбираю, что из этого проверяемо, сколько модель стоит на самом деле и почему клиент, требовавший самую дорогую модель на рынке, передумал за один разговор.
8 мин чтения