GPT-6 Luna и Sol: проверили новинки OpenAI на своих задачах
Двадцать второго сентября OpenAI выпустила две модели поменьше флагмана: GPT-6 Sol и GPT-6 Luna. По данным TechCrunch, главные обещания – цены ниже вдвое и вдвое меньше ошибок у Sol по внутренней оценке OpenAI.
Мы используем Luna предыдущего поколения, поэтому вопрос встал сразу: стоит ли переходить на GPT-6 Luna. Прогнали обе новинки через свои задачи, результат показался странным – и мы повторили замер. Он подтвердился.
Коротко о результатах
GPT-6 Sol – лучшая модель, которую мы мерили на текущей шкале, в генерации учебных текстов. В продающих диалогах она вровень с нынешним чемпионом.
GPT-6 Luna оказалась хуже своей предшественницы GPT-5.6 Luna. В текстах немного, в продажах заметно. И при этом по соотношению цены и качества в текстах она лучшая из всех.
| GPT-6 Sol | GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|---|
| Учебные тексты, 1-й прогон | 93 | 89 | 91 |
| Учебные тексты, 2-й прогон | – | 89 | 92 |
| Продажи, 1-й прогон | 74 | 58 | 71 |
| Продажи, 2-й прогон | – | 58 | 68,5 |
| Цена урока | 2,7 цента | 0,15 цента | 0,76 цента |
| Цена диалога | 1 цент | 0,05 цента | 0,24 цента |
Баллы за продажи здесь сырые. Почему они ниже прошлых замеров, объясняю в разделе про контрольные модели. Цены у моделей GPT-6 – в режиме flex, у GPT-5.6 Luna – в стандартном классе первого прогона.
Как мы проверяли
Два теста, оба на русском языке, оба про реальную работу.
Учебные тексты. Модель пишет урок на 3000 слов по одной из пяти бизнес-тем: продажи, финансы, цепочки поставок, ценообразование, управление персоналом. Судья читает каждый текст целиком и ставит баллы за глубину, практическую пользу, выполнение задания, отсутствие выдумок, структуру и диаграммы.
Продажи. Модель играет менеджера AiDevTeam. Против неё – трудный клиент с заранее заданным бизнесом и скрытой причиной отказа: финдиректор, который весной переходит на новую учётную систему, закупщик с потолком в 300 тысяч, собственник, чей партнёр хочет нанять вечернего администратора. Задача – вскрыть причину и довести до следующего шага, не соврав. Как устроен этот тест и зачем он вообще, мы разбирали в статье про ИИ-бота для продаж.
Обе модели OpenAI шли в режиме flex и без рассуждений. Про flex – ниже.
GPT-6 Sol: лучшая в текстах, но самая дорогая
93 балла в учебных текстах – выше, чем у кого-либо на текущей шкале. Судья отметил три вещи.
- Один сквозной пример через весь урок. Кейс вводится в начале и досчитывается к концу, а не меняется в каждом разделе.
- Ни одной ошибки в расчётах. Во всех пяти текстах.
- Источники с оговорками. Цифры из исследований подаются с пометкой, где их взяли и что они значат.
Единственный заметный промах – в уроке про персонал нет цифры во вводной, хотя задание её требовало.
В продажах Sol набрала 74 – столько же, сколько чемпион GLM 5.3 Flash. Ни одной выдумки и ни одной ошибки в расчётах за четыре диалога. Клиента, который сказал «мы, пожалуй, воздержимся», вернула в разговор: развела «внедрять сейчас» и «проверить без доступа к рабочей системе».
Минус – цена. Даже во flex урок стоит 2,7 цента, диалог – цент. Это самая дорогая модель в нашем замере.
GPT-6 Luna хуже GPT-5.6 Luna: сначала не поверили
Первый прогон дал Luna 6 на два балла меньше в текстах и на 13 меньше в продажах, чем у GPT-5.6 Luna. Новая модель хуже старой – это стоило перепроверить. Мы повторили оба теста для обеих Лун, в одинаковом режиме flex.
Результат повторился.
| GPT-6 Luna | GPT-5.6 Luna | Разрыв | |
|---|---|---|---|
| Тексты, 1-й прогон | 89,4 | 91,2 | 1,8 |
| Тексты, 2-й прогон | 89,0 | 92,0 | 3,0 |
| Продажи, 1-й прогон | 57,75 | 70,75 | 13 |
| Продажи, 2-й прогон | 58,25 | 68,5 | 10,25 |
Если бы разрыв был случайным, во втором прогоне он бы сменил знак или исчез. Он остался.
В текстах – меньше материала и хуже выполнено задание
По отдельным темам GPT-5.6 Luna во втором прогоне впереди в четырёх из пяти. Судья объяснил это по текстам:
- Больше справочного материала. В уроке про цепочки поставок у 5.6 есть ошибка прогноза, взвешенная оценка поставщиков, концентрация поставщиков, полная формула страхового запаса с точкой перезаказа и четыре сценария. У Luna 6 – страховой запас и стоимость владения.
- Больше посчитанных примеров, и все сходятся. Например, скидка 10% требует роста объёма на 33%, чтобы сохранить прибыль.
- Задание выполнено точнее. Luna 6 в обоих прогонах пропускала обязательную цифру во вводной, а урок по продажам во втором прогоне написала на 2502 слова при задании в 3000.
Зато Luna 6 аккуратнее с оговорками: не выдаёт совпадение за причину и честно пишет, откуда взята цифра.
Разница в два-три балла на практике означает чуть больше правки редактором. При цене в пять раз ниже и скорости вдвое выше для текстов, которые всё равно вычитывают, Luna 6 – разумный выбор. По соотношению цены и качества она лучшая в нашем замере: 89,2 против 81,9 у Luna 5.6.
В продажах – не врёт, но сдаётся
Здесь разрыв 10–13 баллов, и он про поведение, а не про знания.
Во всех восьми диалогах двух прогонов GPT-6 Luna в итоге отпускала клиента. Дословно:
«Если у фрилансера уже зафиксированы те же границы работ и условия приёмки за 300 тыс. ₽, вам действительно разумно выбрать его».
«Можно вернуться через год; чтобы разговор тогда был предметным, сохраните текущие данные».
Ни одной скрытой причины отказа она не вскрыла: не спросила, что на самом деле мешает. GPT-5.6 Luna тоже не всегда докапывалась, но в обоих прогонах возвращала клиента хотя бы в двух диалогах из четырёх – встречей со службой безопасности, созвоном втроём с партнёром.
Честность у Luna 6 при этом безупречная: ни одного выдуманного кейса, ни одного обещания от имени компании, скидку в 30% не дала ни разу. Для чат-бота, который отвечает на вопросы, это плюс. Для бота, который должен продавать, – нет: вежливое согласие с отказом стоит сделки.
Арифметика подвела обеих
Самая неприятная находка – не в разнице между моделями, а в общем для них.
Финдиректор даёт вводные: 300 заявок в день, час менеджера стоит 700 рублей. Просит посчитать, сколько стоит ручной ввод. Ответы:
| Модель, прогон | Что ответила | Правильно | Ошибка |
|---|---|---|---|
| GPT-6 Luna, 1-й | 16 170 ₽ в месяц | 161 700 ₽ | в 10 раз |
| GPT-6 Luna, 2-й | 25 тыс. ₽ в месяц | около 385 тыс. ₽ | примерно в 15 раз |
| GPT-5.6 Luna, 2-й | 2,3–4,6 млн ₽ в месяц | 231–462 тыс. ₽ | в 10 раз |

В первом прогоне GPT-5.6 Luna посчитала верно, во втором ошиблась. Значит, это не свойство одной модели, а риск, который есть у обеих.
Luna 6 в первом прогоне ещё и повторила ошибку, когда клиент на неё указал: в следующей реплике снова написала «16 170 ₽» и тут же сама себя опровергла. Доверие покупателя после этого упало до трёх из десяти.
Обе модели признали ошибку и пересчитали. Но в живом разговоре финдиректор, который поймал продавца на ошибке в десять раз, дальше не слушает. Если бот считает деньги клиента, расчёт нельзя отдавать модели – его надо делать кодом и подставлять готовую цифру. Мы уже описывали, как одна арифметическая ошибка ломает весь раздел текста и не ловится баллом.
Остальные модели того же прогона
Вместе с моделями OpenAI мы проверили ещё пять новинок. Коротко:
| Модель | Тексты | Продажи | Главное |
|---|---|---|---|
| MiMo V2.6 Flash | 77 | 59 | богатые диаграммы, но искажённые цифры известных брендов |
| DeepSeek V4.1 Flash | 76 | 57 | быстрая, но выдумывает кейсы и переобещает |
| Space Bunny Alpha | 72 | 50 | анонимная модель, мусорные слова в тексте |
| Qwen3.8 Omni Flash | 70 | 37 | вставки на других языках, ошибки в расчётах |
| MiMo V2.6 Pro | 65 | 66 | в текстах выдумывает кейсы, в продажах неплохо держит трудных клиентов |
У Space Bunny Alpha нельзя выключить рассуждения, и в стандартной настройке четыре урока из пяти вышли пустыми: весь лимит ответа ушёл на размышления. Про то, как рассуждения съедают время ответа и бюджет, – в статье о задержке ИИ-бота.
Контрольные модели: почему баллы за продажи ниже прошлых
В каждом прогоне работают контрольные модели – уже замеренные раньше в той же конфигурации. Если их балл сдвинулся, сдвинулась шкала, а не модели.
В текстах контрольная GPT-5.6 Luna дала 91 и 92 при прошлых 93, 93 и 92. Шкала стоит на месте.
В продажах обе контрольные модели просели: GPT-5.6 Luna – на 13 баллов, GLM 5.3 Flash – на 18. Причина в нас: мы зафиксировали сценарии клиентов, чтобы каждый продавец встречал одного и того же собеседника, и начали жёстче штрафовать за обещания от имени компании, которых нет в брифе. Поэтому к прогону применена поправка +15, на лидерборде она показана рядом с сырым баллом.
На сравнение моделей между собой поправка не влияет: она одинакова для всех. На сравнение с прошлыми месяцами – влияет, без неё все выглядели бы хуже, чем есть.
Flex-режим: половина цены
Flex – класс обслуживания OpenAI с пониженным приоритетом. Токены стоят вдвое дешевле, запрос может ждать в очереди. Включается отдельным параметром запроса, а не выбором модели.
Мы проверили, что режим действительно включается: ответ сервиса подтверждает класс, а списание за запрос – вдвое ниже стандартного.
Скорость во flex оказалась рабочей. Урок у Luna 6 генерировался 24–30 секунд, реплика в диалоге – около трёх. Для фоновой генерации текстов flex – это просто половина бюджета. Для живого чата стоит проверить отдельно в часы пик: очередь в этом режиме никто не гарантирует.
Что выбрать
- Генерация текстов, качество важнее цены – GPT-6 Sol.
- Генерация текстов, которые потом вычитывают – Luna 6 во flex. На три балла хуже Luna 5.6, в пять раз дешевле.
- Продающий бот – GPT-6 Sol или GPT-5.6 Luna. Не Luna 6.
- Любой бот, который считает деньги клиента – не доверять расчёт модели ни одной из этих.
Главный вывод не про OpenAI. Новая версия в той же линейке может быть хуже старой именно на вашей задаче – даже если в объявлении написано «вдвое меньше ошибок». Как проверить это за день и за центы, мы расписали в статье о том, стоит ли обновлять модель, а общий порядок выбора – в опорной статье про выбор LLM для проекта.
Что можно возразить
«Два прогона – мало». Мало для точной цифры, достаточно для направления. Разрыв в продажах в 10–13 баллов в двух независимых прогонах с разными репликами покупателя – не случайность. Разрыв в текстах в два-три балла – на границе шума, поэтому мы и называем его «немного хуже», а не «провал».
«Вы судите сами себя». Тексты оценивал один судья на всю группу моделей, продажи – другой, тоже один. Любую цифру, которая выглядела как выдумка, проверяли поиском до того, как снять баллы. Полные тексты и диалоги лежат на лидерборде – их можно прочитать и не согласиться.
«Luna 6 задумана для других задач». Возможно. OpenAI позиционирует её для массовой однотипной работы. Но продающий диалог и учебный текст – как раз массовая работа, и именно на ней мы Luna 5.6 используем.
Где смотреть данные
Все баллы, цены и полные тексты – на живом лидерборде, он обновляется из базы. Рядом с каждым баллом стоит версия шкалы и поправка, если она применялась.
Короткие итоги новых прогонов публикую в Telegram-канале «ИИ для бизнеса» раньше, чем выходит статья: какие модели проверили и что из этого взяли в работу.
В трёх сентябрьских волнах тестов порядок моделей менялся между уроками и продажными диалогами. Там разобрал, почему результат одной задачи нельзя переносить на другую и что мешает назвать изменение баллов деградацией.

