LLM Бенчмарки

Детальное сравнение передовых моделей для генерации образовательного контента. Рейтинг основан на качестве, стоимости и экономической эффективности.

Последнее обновление: 23 июля 2026 г.

Протестировано
45 моделей
Создано
270 уроков
Бизнес-тем
5 направлений
Данные за
Июль 2026 г.

Рейтинг моделей

Фильтры
#
Модель
Провайдер
Тир
Claude Score
$/call
$/100k симв.
Скорость
Value
Качество
Контент
Показано 1-0 из 0

Методология

Как мы оцениваем модели

Каждая модель проходит battle-тест по 5 бизнес-темам. Генерируется реальный образовательный контент, который оценивает Claude по 6 критериям. Итоговый рейтинг учитывает качество и стоимость.

Семантика

Глубина понимания контекста, логика изложения и связность аргументации

Практика

Применимость рекомендаций, конкретность примеров и actionable-выводы

Соответствие

Точное следование промпту, структуре и всем требованиям задания

Галлюцинации

Фактологическая точность, отсутствие вымышленных данных и ссылок

Структура

Чёткая иерархия, правильный JSON/Markdown, корректная вложенность

Визуализация

Качество форматирования, эмодзи-маркеры, читаемость контента

Формула Value Score

Value = 70% x Quality + 30% x Cost (log-scale)

Quality Score — нормализованный Claude Score (0-100). Cost Score рассчитывается по логарифмической шкале: бесплатные модели получают максимальный балл, дорогие — штрафуются нелинейно.

Battle-тест

  • 5 бизнес-тем: маркетинг, финансы, логистика, HR, ценообразование
  • Каждая модель генерирует полноценные уроки по единому промпту
  • Claude выступает единственным судьёй (Claude-only judge)
  • Результаты агрегируются по 6 критериям и нормализуются