Навигация
Тесты LLMОбновлено 14 сентября 2026 г.

Какая модель
лучше на русском

77
моделей протестировано
23
провайдера
496
уроков сгенерировано
9
бизнес-тем

Собственные прогоны языковых моделей на реальных бизнес-задачах: баллы за качество, цена вызова, где модели ломаются. Обновляется после каждого теста.

Листайте

Шкала судьи

загружаем
01 · Замер

Какая модель учит лучше

Каждая модель пишет полный урок по бизнес-теме — от структуры до формул и примеров. Claude-судья оценивает глубину темы, практическую ценность, точность и русский язык.

Фильтры
#
Модель
Версия теста
Провайдер
Тир
Claude Score
$/1M
$/call
$/100k симв.
Скорость
Value
Показано 1-0 из 0
02 · Методика

Как мы оцениваем модели

Один и тот же промпт, один и тот же судья, цена по реальному тарифу. Всё остальное — арифметика.

Одинаковое задание

Каждая модель пишет полный урок по бизнес-теме: маркетинг, финансы, логистика, HR, ценообразование. Единый промпт для всех, темы и рубрика не меняются внутри версии теста.

Один судья

Claude читает урок и ставит баллы по шести критериям. Повторный замер одной модели гуляет в пределах двух баллов, поэтому модели с разницей до трёх баллов делят место.

Реальная цена

Стоимость вызова считаем по тарифу, который в момент теста реально списывает OpenRouter — со скидками и по самому дешёвому эндпоинту в стандартном классе.

Value Score

Бесплатные модели получают максимум за цену, дорогие штрафуются нелинейно. Так дешёвая модель на 92 балла может обойти дорогую на 93.

Value = 70% × Quality + 30% × Cost (log)

Тест продаж

Во вкладке «Продажи» модель — продавец: ведёт диалог с несколькими персонажами- покупателями, у каждого своя лестница возражений и своё давление на цену.

Своя рубрика

Судья смотрит на выявление потребности, отработку возражений, честность и доведение до следующего шага. Балл сопоставим с обучением по шкале, но не по смыслу.

Шесть критериев судьибаллы нормализуются в Claude Score 0–100
  1. 01
    Семантика

    глубина понимания, логика, связность

  2. 02
    Практика

    применимость, конкретные примеры

  3. 03
    Соответствие

    следование промпту и структуре

  4. 04
    Галлюцинации

    нет вымышленных фактов и ссылок

  5. 05
    Структура

    иерархия, корректный Markdown

  6. 06
    Визуализация

    форматирование и читаемость

03 · Доказательная база

Период, выборка и ограничения

Это собственный сравнительный тест AiDevTeam, а не универсальный рейтинг моделей. Ниже — условия, при которых числа можно воспроизвести и корректно использовать.

Период
14.09.2026

Текущий срез на 14 сентября 2026 г.; данные обновляются после каждого нового прогона, без передеплоя страницы.

Выборка
77 · 23 · 9

77 моделей от 23 провайдеров, 9 бизнес-тем и 496 сгенерированных уроков.

Baseline
одна версия теста

Модели сравниваются только внутри одинакового testVersion: единый промпт, темы и рубрика. Внешний отраслевой benchmark не заявляется.

Формула
70 / 30

Value = 70% × нормализованный Quality Score + 30% × Cost Score по логарифмической шкале.

Ограничения
  • Claude — единственный судья, поэтому его предпочтения могут влиять на баллы.
  • Модели, тарифы и ответы провайдеров меняются; сравнивать срезы можно только с учётом даты и testVersion.
  • Результаты русскоязычных учебных и sales-задач не доказывают качество модели в другом домене.
Условия использования

Данные доступны бесплатно для предварительного выбора моделей. Перед закупкой или внедрением повторите тест на собственных сценариях, проверьте актуальные тарифы и проведите человеческую оценку.

Скачать панель из 25 AI Search prompts · CSV
04 · Читать по теме

Что цифры значат для проекта