LLM Бенчмарки

Детальное сравнение передовых моделей для генерации образовательного контента. Рейтинг основан на качестве, стоимости и экономической эффективности.

Последнее обновление: 3 августа 2026 г.

Протестировано
50 моделей
Создано
330 уроков
Бизнес-тем
5 направлений
Данные за
Август 2026 г.

Рейтинг обучения

Какая модель учит лучше

Каждая модель пишет полный урок по бизнес-теме — от структуры до формул, примеров и схем. Claude-судья оценивает глубину темы, практическую ценность, фактическую точность и качество русского языка.

Фильтры
#
Модель
Версия теста
Провайдер
Тир
Claude Score
$/1M
$/call
$/100k симв.
Скорость
Value
Показано 1-0 из 0

Методология

Как мы оцениваем модели

Каждая модель проходит battle-тест по 5 бизнес-темам. Генерируется реальный образовательный контент, который оценивает Claude по 6 критериям. Итоговый рейтинг учитывает качество и стоимость.

Семантика

Глубина понимания контекста, логика изложения и связность аргументации

Практика

Применимость рекомендаций, конкретность примеров и actionable-выводы

Соответствие

Точное следование промпту, структуре и всем требованиям задания

Галлюцинации

Фактологическая точность, отсутствие вымышленных данных и ссылок

Структура

Чёткая иерархия, правильный JSON/Markdown, корректная вложенность

Визуализация

Качество форматирования, эмодзи-маркеры, читаемость контента

Формула Value Score

Value = 70% x Quality + 30% x Cost (log-scale)

Quality Score — нормализованный Claude Score (0-100). Cost Score рассчитывается по логарифмической шкале: бесплатные модели получают максимальный балл, дорогие — штрафуются нелинейно.

Полная методика, выборка и ограничения

Battle-тест

  • 5 бизнес-тем: маркетинг, финансы, логистика, HR, ценообразование
  • Каждая модель генерирует полноценные уроки по единому промпту
  • Claude выступает единственным судьёй (Claude-only judge)
  • Результаты агрегируются по 6 критериям и нормализуются

Доказательная база

Период, выборка и ограничения

Это собственный сравнительный тест AI Dev Team, а не универсальный рейтинг моделей. Ниже зафиксированы условия, при которых числа можно воспроизвести и корректно использовать.

Период
Текущий срез на 3 августа 2026 г.; данные обновляются после каждого нового прогона.
Выборка
50 моделей от 17 провайдеров, 5 бизнес-тем и 330 сгенерированных уроков.
Baseline
Модели сравниваются только внутри одинакового testVersion: единый промпт, темы и рубрика. Внешний отраслевой benchmark не заявляется.
Формула
Value = 70% × нормализованный Quality Score + 30% × Cost Score по логарифмической шкале.

Ограничения

  • Claude — единственный судья, поэтому его предпочтения могут влиять на баллы.
  • Модели, тарифы и ответы провайдеров меняются; сравнивать срезы можно только с учётом даты и testVersion.
  • Результаты русскоязычных учебных и sales-задач не доказывают качество модели в другом домене.

Условия использования

Данные доступны бесплатно для предварительного выбора моделей. Перед закупкой или внедрением повторите тест на собственных сценариях, проверьте актуальные тарифы и проведите человеческую оценку.

Скачать панель из 25 AI Search prompts (CSV)

Читать по теме

Разборы этих замеров: что цифры значат для проекта и как выбирать модель не по месту в рейтинге.

Все статьи о бенчмарках