GPT-6 Sol и Luna от OpenAI вдвое дешевле, но почти не влияют на производительность
С моделями GPT-6 Sol и Luna OpenAI добавляет в свою линейку две более дешёвые модели, которые обеспечивают производительность на уровне предшественников при вдвое меньшей стоимости токенов и призваны составить конкуренцию некоторым более дорогим моделям Anthropic.
Главное изменение — снижение цены на 50 процентов по сравнению с GPT-5.6 Sol и Luna. GPT-6 Sol теперь стоит 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, а Luna — 0,10 доллара за входные и 0,50 доллара за выходные токены.
OpenAI объясняет снижение цен улучшениями в кэшировании и инференсе, заявляя, что напрямую передаёт эту экономию пользователям. Благодаря этому цены компании находятся в том же диапазоне, что и у более дешёвых моделей с открытыми весами. Terra, ранее самая дешёвая модель в линейке, больше недоступна.
| Модель | Входные токены | Выходные токены |
|---|---|---|
| GPT-6 Sol по сравнению с GPT-5.6 Sol | $4 → $2 | $20 → $10 |
| GPT-6 Luna по сравнению с GPT-5.6 Luna | $0.20 → $0.10 | $1.20 → $0.50 |
По данным OpenAI, Sol предназначена для регулярного выполнения сложных задач, таких как разработка новых функций, проверка кода, отладка и анализ данных. Luna рассчитана на обработку больших объёмов чётко определённых задач при низкой стоимости — например, на составление кратких изложений документов, извлечение информации и ответы на короткие вопросы.
Помимо снижения цен на токены, OpenAI заявляет об улучшении кэширования промптов для GPT-6, предлагая скидку 90 процентов на кэшированные входные токены. Новая панель управления кэшированием промптов и инструмент диагностики должны помочь разработчикам оптимизировать использование кэша, а теперь они могут менять уровень рассуждений и доступность инструментов без сброса кэша.
На момент запуска обе модели доступны в ChatGPT Work и Codex для подписчиков Plus, Pro, Business, Enterprise и Edu. Пользователи тарифов Free и Go получают доступ к Luna через настольное приложение, но изначально ни одна из моделей недоступна в обычном чате. В API они представлены как gpt-6-sol и gpt-6-luna, а доступ к ним в ChatGPT постепенно расширяется.
Преимущество GPT-6 Sol и Luna в тестах сводится к стоимости
OpenAI позиционирует новые модели прежде всего на основе соотношения цены и производительности по сравнению с линейкой Claude от Anthropic. В OSWorld 2.0, тестирующем работу с компьютером, OpenAI заявляет, что GPT-6 показывает результаты, схожие с Claude Opus 5, при примерно на 80 процентов меньшей стоимости, хотя Astra по-прежнему лидирует в этой категории.
В AutomationBench, тестирующем выполнение бизнес-процессов с использованием 47 инструментов, GPT-6 Sol на максимальном уровне усилий, как сообщается, превосходит Claude Opus 5 на максимальном уровне усилий. OpenAI оценивает стоимость одной задачи для Sol всего в 9 процентов от стоимости Opus. Luna, тем временем, превосходит предшественницу на 5,4 процентного пункта, обходясь на 58 процентов дешевле.
Для задач программирования OpenAI приводит результаты двух тестов. FrontierCode 1.1 проверяет, создают ли ИИ-агенты код, который действительно можно интегрировать в существующую кодовую базу, оценивая качество тестов, стиль кода и соответствие требованиям. GPT-6 Sol набирает 49,3 процента на максимальном уровне усилий при стоимости 2,14 доллара за задачу, что примерно соответствует результату Claude Fable 5.1: 50,3 процента на максимальном уровне усилий, но при цене 12,83 доллара — в шесть раз дороже. Claude Opus 5 достигает 53,4 процента при стоимости 4,31 доллара на среднем уровне усилий, который дал модели лучший результат в этом тесте.
Уровни рассуждений OpenAI выходят из-под контроля
В DeepSWE v1.1 — тесте для сложных задач разработки программного обеспечения, выполняемых в течение длительного времени в реальных кодовых базах, — OpenAI сообщает о результате GPT-6 Sol в 68,8 процента на максимальном уровне усилий. Это всего на 1,1 процентного пункта меньше лучшего результата Claude Fable 5 — 69,9 процента на уровне «xhigh», тогда как Fable на уровне «max» набирает 69,7 процента при стоимости 21,63 доллара за задачу.
Разумеется, Sol здесь не претендует на лидерство. Claude Opus 5 достигает 73,7 процента на максимальном уровне усилий при стоимости 11,84 доллара за задачу, а собственная модель OpenAI GPT-5.6 Sol набирает 72,7 процента при цене 6,46 доллара. Смысл GPT-6 Sol в том, чтобы приблизиться к этим показателям за небольшую часть стоимости. На уровне «xhigh» модель выдаёт результат 66,6 процента при цене 1 доллар за задачу. Luna ещё дешевле: она достигает того же результата на максимальном уровне усилий всего за 0,22 доллара. OpenAI утверждает, что результат Luna сопоставим с Claude Opus 5 и Claude Fable 5 на среднем уровне усилий, при этом стоимость на 93 процента ниже, чем у Opus, и на 96 процентов ниже, чем у Fable.
Результаты DeepSWE также превращают выбор между собственными моделями OpenAI в головоломку. Luna на максимальном уровне усилий соответствует Sol на уровне «xhigh», обходясь на 78 процентов дешевле. Повышение Sol до максимального уровня усилий даёт результат лишь 68,8 процента — всего на 2,2 процентного пункта выше Luna. Кто вообще должен разбираться во всём этом при использовании в реальной работе?

В целом подбор тестов OpenAI выглядит избирательным. Отсутствуют такие метрики, как GDPval для интеллектуальной работы или Terminal-Bench 4.0 для агентного программирования, хотя обычно они входят в стандартный набор. Кроме того, OpenAI, похоже, пропустила выход Opus 5.5, который потенциально на 40 процентов дешевле Opus 5 и при этом значительно производительнее.
Независимый анализ не выявил существенного прогресса
Согласно Artificial Analysis, GPT-6 Sol и Luna вдвое снизили стоимость выполнения одной задачи по сравнению с предшественниками, но показатели интеллектуальности остались на уровне GPT-5.6: в одних тестах наблюдается рост, а в других — ухудшение. Согласно анализу, в индексе агентов для программирования Sol улучшила результат на 2 пункта, а Luna потеряла 2 пункта.

Artificial Analysis также обнаружила ухудшение результатов в двух ключевых тестах интеллектуальной работы. В GDPval-AA v2.1, проверяющем компьютерную интеллектуальную работу в 44 профессиональных областях, Sol теряет около 100 рейтинговых очков Elo, а Luna — около 75. Ручная проверка показала, что ухудшение в основном связано с более низким качеством презентаций и неполными результатами.
Artificial Analysis уже подвергалась критике, когда оценила модель Astra от OpenAI слишком низко из-за устаревших тестов. После этого последовали два обновления тестов, и Astra вновь оказалась на первом месте. Посмотрим, что произойдёт на этот раз.
В любом случае очевидно, что OpenAI делает в GPT-6 Sol и Luna большую ставку на цену. Теперь моделям предстоит доказать свою состоятельность в повседневной работе, поскольку тесты показывают лишь часть картины. Возможно, этим также объясняется, почему OpenAI исключила некоторые из них. В сочетании с различными уровнями рассуждений и результатами, иногда выглядящими оптимизированными под тесты — намеренно или нет, — вся эта игра с бенчмарками с каждым новым запуском модели кажется всё более нелепой.
Новости ИИ без хайпа — отобрано людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, наш эксклюзивный шесть раз в год выходящий отчёт о передовых разработках «AI Radar», полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.