OpenAI выпускает GPT-6 Sol и Luna: цены на API на 50% ниже, результаты бенчмарков
OpenAI выпустила GPT-6 Sol и GPT-6 Luna — 2 новые модели семейства GPT-6. Они находятся ниже GPT-6 Astra, запущенной ранее в этом месяце. OpenAI обучала обе модели методами, похожими на использованные для Astra. Цель — перенести достижения Astra в более быстрые и доступные модели.
Доступны для развертывания уже сегодня? Да. Обе модели доступны в API OpenAI под названиями gpt-6-sol и gpt-6-luna. Это модели, доступные только через API, поэтому разместить их самостоятельно невозможно.
Три уровня, один рецепт
Теперь семейство GPT-6 включает 3 уровня. Astra — топовая модель для самых сложных задач. Sol предназначена для сложного программирования и профессиональных задач при более низкой стоимости. Luna ориентирована на быструю повседневную работу в больших объемах.
Команда OpenAI заявляет, что улучшенное кэширование и инференс позволяют обслуживать эти модели дешевле. Компания снижает цены на API Sol и Luna на 50% по сравнению с промоценами GPT-5.6.
| Модель | Ввод (за 1 млн токенов) | Вывод (за 1 млн токенов) |
|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 |
| GPT-6 Sol | $2.00 (было $4) | $10.00 (было $20) |
| GPT-6 Luna | $0.10 (было $0.20) | $0.50 (было $1.20) |
Стоит отметить одну деталь. Цена вывода Luna снижается с $1.20 до $0.50 — примерно на 58%, а не на 50%.
Бенчмарки: что сообщает OpenAI
Профессиональная работа: в AutomationBench 1.0.6 Sol при максимальном уровне усилий набирает 33.2% при стоимости $0.27 за задачу. Claude Opus 5 при максимальном уровне усилий набирает 26.9% при стоимости, в 11.1 раза превышающей эту. Astra при низком уровне усилий набирает 30.3% при стоимости, в 3.9 раза превышающей стоимость Sol. Luna при высоком уровне усилий превосходит предшественницу на 5.4 процентного пункта при стоимости задачи на 58% ниже.
В Agents’ Last Exam Sol при максимальном уровне усилий набирает 56.4%. Это выше лучшего результата Claude Opus 5 при стоимости задачи на 60% ниже.
Программирование: в DeepSWE v1.1 Sol при максимальном уровне усилий набирает 68.8%. Это на 1.1 процентного пункта ниже результата Claude Fable 5 при очень высоком уровне усилий, но стоимость задачи примерно на 80% ниже. Luna при максимальном уровне усилий набирает 66.6% — сопоставимый результат с Opus 5 и Fable 5 при среднем уровне усилий. В этих сравнениях Luna обходится на 93% дешевле Opus 5 и на 96% дешевле Fable 5 за задачу.
В FrontierCode 1.1 Main, где оценивается готовность кода к слиянию, Sol соответствует Claude Fable 5.1 при очень высоком уровне усилий, но стоит значительно дешевле.
Работа с компьютером: в офлайн-версии OSWorld 2.0 Sol при очень высоком уровне усилий набирает 60.5% против 60.3% у Opus 5 при среднем уровне. Стоимость задачи для Sol примерно на 80% ниже. Luna при максимальном уровне превосходит GPT-5.6 Sol при среднем уровне, обходясь в 10 раз дешевле.
Фактическая точность: во внутреннем тесте OpenAI используются обезличенные диалоги ChatGPT, в которых пользователи отмечали ошибки моделей. Sol совершает примерно вдвое меньше ошибок, чем её предшественница. Luna при более высоком уровне усилий соответствует GPT-5.6 Sol, обходясь примерно в 100 раз дешевле.
OpenAI также перенесла стиль общения Astra. Ожидайте более ясных и немного более коротких ответов с меньшим количеством жаргона, особенно в разговорах о программировании.
Кэширование промптов для долго работающих агентов
Агенты повторно отправляют одни и те же инструкции, инструменты и историю при каждом обращении. GPT-6 поставляется с улучшенной системой кэширования промптов, которая по умолчанию обеспечивает более высокий процент попаданий в кэш. Для чтения кэшированных входных данных предоставляются скидки до 90%. Теперь подходящие общие префиксы, повторно используемые в течение 30-минутного окна, также получают эту скидку.
Новые элементы управления для разработчиков:
- Панель кэширования промптов отслеживает процент попаданий в кэш во времени.
- Инструмент диагностики объясняет причины промахов, например
"reason": "tools_changed". - Явные точки разрыва позволяют выбрать, где заканчивается кэшированный префикс.
- Уровень усилий для рассуждений можно менять в середине разговора с помощью
configuration_updateбез нарушения кэша. allowed_toolsограничивает доступные инструменты, сохраняя определения неизменными.- Предварительный прогрев подготавливает известный контекст до первого запроса пользователя.
В полном руководстве по кэшированию промптов рассмотрен каждый сценарий. GitHub сообщает, что эти изменения сократили долю токенов промпта, требующих обработки с нуля, более чем на 50%, помогая Copilot отвечать быстрее.
Доступность
- API:
gpt-6-solиgpt-6-luna. - ChatGPT Work и Codex: пользователи Plus, Pro, Business, Enterprise и Edu.
- Free и Go: Luna в настольном приложении ChatGPT.
- Пока недоступны в Chat. Развертывание ChatGPT постепенно проходит в течение дня запуска.
Интерактивное объяснение
Основные выводы
- Sol стоит $2/$10, а Luna — $0.10/$0.50 за 1 млн токенов.
- Sol при очень высоком уровне усилий превосходит Opus 5 при максимальном уровне в AutomationBench, составляя 9% от его стоимости.
- Luna набирает 66.6% в DeepSWE v1.1 и стоит на 93% дешевле Opus 5 за задачу.
- Стоимость чтения кэшированных входных данных снижается до 90%, появились новые элементы управления кэшем.
- Обе модели доступны в API, ChatGPT Work и Codex, но пока не в Chat.
Читайте технический блог. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.