Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

OpenAI выпускает GPT-6 Sol и Luna: цены на API на 50% ниже, результаты бенчмарков

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — 2 новые модели семейства GPT-6. Они находятся ниже GPT-6 Astra, запущенной ранее в этом месяце. OpenAI обучала обе модели методами, похожими на использованные для Astra. Цель — перенести достижения Astra в более быстрые и доступные модели.

Доступны для развертывания уже сегодня? Да. Обе модели доступны в API OpenAI под названиями gpt-6-sol и gpt-6-luna. Это модели, доступные только через API, поэтому разместить их самостоятельно невозможно.

Три уровня, один рецепт

Теперь семейство GPT-6 включает 3 уровня. Astra — топовая модель для самых сложных задач. Sol предназначена для сложного программирования и профессиональных задач при более низкой стоимости. Luna ориентирована на быструю повседневную работу в больших объемах.

Команда OpenAI заявляет, что улучшенное кэширование и инференс позволяют обслуживать эти модели дешевле. Компания снижает цены на API Sol и Luna на 50% по сравнению с промоценами GPT-5.6.

МодельВвод (за 1 млн токенов)Вывод (за 1 млн токенов)
GPT-6 Astra$10.00$50.00
GPT-6 Sol$2.00 (было $4)$10.00 (было $20)
GPT-6 Luna$0.10 (было $0.20)$0.50 (было $1.20)

Стоит отметить одну деталь. Цена вывода Luna снижается с $1.20 до $0.50 — примерно на 58%, а не на 50%.

Бенчмарки: что сообщает OpenAI

Профессиональная работа: в AutomationBench 1.0.6 Sol при максимальном уровне усилий набирает 33.2% при стоимости $0.27 за задачу. Claude Opus 5 при максимальном уровне усилий набирает 26.9% при стоимости, в 11.1 раза превышающей эту. Astra при низком уровне усилий набирает 30.3% при стоимости, в 3.9 раза превышающей стоимость Sol. Luna при высоком уровне усилий превосходит предшественницу на 5.4 процентного пункта при стоимости задачи на 58% ниже.

В Agents’ Last Exam Sol при максимальном уровне усилий набирает 56.4%. Это выше лучшего результата Claude Opus 5 при стоимости задачи на 60% ниже.

Программирование: в DeepSWE v1.1 Sol при максимальном уровне усилий набирает 68.8%. Это на 1.1 процентного пункта ниже результата Claude Fable 5 при очень высоком уровне усилий, но стоимость задачи примерно на 80% ниже. Luna при максимальном уровне усилий набирает 66.6% — сопоставимый результат с Opus 5 и Fable 5 при среднем уровне усилий. В этих сравнениях Luna обходится на 93% дешевле Opus 5 и на 96% дешевле Fable 5 за задачу.

В FrontierCode 1.1 Main, где оценивается готовность кода к слиянию, Sol соответствует Claude Fable 5.1 при очень высоком уровне усилий, но стоит значительно дешевле.

Работа с компьютером: в офлайн-версии OSWorld 2.0 Sol при очень высоком уровне усилий набирает 60.5% против 60.3% у Opus 5 при среднем уровне. Стоимость задачи для Sol примерно на 80% ниже. Luna при максимальном уровне превосходит GPT-5.6 Sol при среднем уровне, обходясь в 10 раз дешевле.

Фактическая точность: во внутреннем тесте OpenAI используются обезличенные диалоги ChatGPT, в которых пользователи отмечали ошибки моделей. Sol совершает примерно вдвое меньше ошибок, чем её предшественница. Luna при более высоком уровне усилий соответствует GPT-5.6 Sol, обходясь примерно в 100 раз дешевле.

OpenAI также перенесла стиль общения Astra. Ожидайте более ясных и немного более коротких ответов с меньшим количеством жаргона, особенно в разговорах о программировании.

Кэширование промптов для долго работающих агентов

Агенты повторно отправляют одни и те же инструкции, инструменты и историю при каждом обращении. GPT-6 поставляется с улучшенной системой кэширования промптов, которая по умолчанию обеспечивает более высокий процент попаданий в кэш. Для чтения кэшированных входных данных предоставляются скидки до 90%. Теперь подходящие общие префиксы, повторно используемые в течение 30-минутного окна, также получают эту скидку.

Новые элементы управления для разработчиков:

  • Панель кэширования промптов отслеживает процент попаданий в кэш во времени.
  • Инструмент диагностики объясняет причины промахов, например "reason": "tools_changed".
  • Явные точки разрыва позволяют выбрать, где заканчивается кэшированный префикс.
  • Уровень усилий для рассуждений можно менять в середине разговора с помощью configuration_update без нарушения кэша.
  • allowed_tools ограничивает доступные инструменты, сохраняя определения неизменными.
  • Предварительный прогрев подготавливает известный контекст до первого запроса пользователя.

В полном руководстве по кэшированию промптов рассмотрен каждый сценарий. GitHub сообщает, что эти изменения сократили долю токенов промпта, требующих обработки с нуля, более чем на 50%, помогая Copilot отвечать быстрее.

Доступность

  • API: gpt-6-sol и gpt-6-luna.
  • ChatGPT Work и Codex: пользователи Plus, Pro, Business, Enterprise и Edu.
  • Free и Go: Luna в настольном приложении ChatGPT.
  • Пока недоступны в Chat. Развертывание ChatGPT постепенно проходит в течение дня запуска.

Интерактивное объяснение

Основные выводы

  • Sol стоит $2/$10, а Luna — $0.10/$0.50 за 1 млн токенов.
  • Sol при очень высоком уровне усилий превосходит Opus 5 при максимальном уровне в AutomationBench, составляя 9% от его стоимости.
  • Luna набирает 66.6% в DeepSWE v1.1 и стоит на 93% дешевле Opus 5 за задачу.
  • Стоимость чтения кэшированных входных данных снижается до 90%, появились новые элементы управления кэшем.
  • Обе модели доступны в API, ChatGPT Work и Codex, но пока не в Chat.

Читайте технический блог. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости