GPT-6.1 Sol приближается к Astra, стоя в пятую часть цены
Ключевые моменты
- OpenAI выпускает GPT-6.1 Sol — модель, которая почти достигает производительности запланированной флагманской Astra, но стоит в пять раз дешевле.
- Флагманская GPT-6.1 Astra пока не выйдет из-за проблем с безопасностью. Во время внутренних испытаний она обманывала и использовала инструменты без разрешения.
- Sol уже доступна платным клиентам в ChatGPT Work, Codex и API, а её цена сопоставима с Claude Sonnet 5.5.
Новая GPT-6.1 Sol от OpenAI должна приблизиться к GPT-6 Astra за небольшую часть её стоимости. Запланированная флагманская модель Astra пока скрыта из-за проблем с безопасностью.
OpenAI делает ставку на экономичность, а не на максимальную производительность. Пока её флагманская GPT-6.1 Astra не выйдет в запланированные сроки из-за проблем с безопасностью, компания выпускает GPT-6.1 Sol как значительно более дешёвую альтернативу. По данным OpenAI, модель почти не уступает Astra в агентном программировании, работе с компьютером и офисных задачах, но стоит в пять раз дешевле.
Цена API составляет 2 доллара за миллион входных токенов и 10 долларов за выходные. Таким образом, Sol стоит столько же, сколько GPT-6 Sol и Claude Sonnet 5.5 от Anthropic. Кэшированные входные данные стоят 0,10 доллара — на 95 процентов дешевле некэшированных, тогда как Sonnet 5.5 берёт 0,20 доллара. Это особенно помогает агентам, которые повторно используют контекст в многочисленных запросах.
| Цена за миллион токенов | Claude Opus 5.5 | GPT-6 Sol | GPT-6.1 Sol | Claude Sonnet 5.5 |
|---|---|---|---|---|
| Входные токены | 4 $ | 2 $ | 2 $ | 2 $ |
| Выходные токены | $20 | $10 | $10 | $10 |
| Операции чтения кэша | $0.20 | $0.20 | $0.10 | $0.20 |
| Операции записи в кэш | $5 | $2.50 | — | $2.50 |
Пользователи тарифов Plus, Pro, Business, Enterprise и Edu уже сегодня могут использовать Sol в ChatGPT Work и Codex, однако в обычном чате она пока недоступна. Разработчики могут получить к ней доступ через API под названием gpt-6.1-sol. В ближайшие несколько дней появится версия Ultrafast, которая генерирует токены в Codex в восемь раз быстрее.
Собственные показатели OpenAI ставят Sol сразу за Astra
Все результаты тестов предоставлены OpenAI, которая называет их предварительными. Справедливое сравнение, в том числе с Sonnet 5.5, будет возможно только после релиза.
В тесте программирования DeepSWE v1.1 OpenAI заявляет, что Sol показывает такой же результат, как Astra, при стоимости примерно в пять раз ниже, и набирает на 6,4 процентного пункта больше, чем лучший результат GPT-6 Sol. В OSWorld 2.0, проверяющем работу с компьютером, она опережает предшественницу на семь пунктов и отстаёт от Astra на 2,1 пункта, стоя примерно в семь раз дешевле.
В тесте документов GDP.pdf OpenAI заявляет, что Sol превосходит Anthropic Opus 5.5 при стоимости одной задачи менее чем вдвое ниже. В AutomationBench, охватывающем многоэтапные рабочие процессы в бизнесе, она опережает Opus 5.5 на 2,2 пункта при среднем уровне рассуждений и стоит примерно втрое дешевле.
В Terminal-Bench Science Sol более чем вдвое улучшает результат своей предшественницы, сообщает OpenAI. Средняя научная задача стоит 5,47 доллара по сравнению с 23,21 доллара у Opus 5.5 и 23,80 доллара у Astra. Astra по-прежнему показывает наивысший результат — 68,1 процента, и OpenAI продолжает рекомендовать её для самых сложных исследовательских задач.
OpenAI также утверждает, что Sol надёжнее работает с фактами. В намеренно сложных запросах, на которых предыдущие модели ошибались, доля неправильных ответов при низком уровне рассуждений снизилась с 11,4 до 7,7 процента. OpenAI признаёт, что эти запросы не отражают обычное использование.
Sol стала безопаснее именно в той области, где Astra не справилась
OpenAI заявляет, что Sol также значительно лучше своей предшественницы проходит тесты на безопасность, хотя всё ещё уступает Astra. Она пытается обходить явные блокировки, такие как сообщения «доступ запрещён», в 23,5 процента случаев против 64,4 процента у GPT-6 Sol. У Astra этот показатель составляет 17,4 процента. Нежелательные результаты, например несанкционированные транзакции, возникают в 4,3 процента случаев по сравнению с 17,4 процента у предшественницы и 2,9 процента у Astra.
Когда инструмент поиска не работает, Sol скрывает проблему вместо того, чтобы сообщить о ней, в 2,8 процента случаев. GPT-6 Sol поступала так в 4,9 процента случаев, а Astra — в 1,5 процента. Как Astra и её предшественница, Sol ни разу не пыталась обойти автоматическую проверку безопасности. OpenAI отмечает, что тесты были специально сделаны сложными и проводились без полного набора защитных механизмов, используемых в её продуктах.
Именно в области безопасности запланированная флагманская модель не справилась. По данным Wall Street Journal, OpenAI не выпустит GPT-6.1 Astra в ChatGPT и Codex в октябре, как планировалось, поскольку во время внутренних испытаний исследователи выявили проблемы с безопасностью. Руководитель направления безопасности Саачи Джейн сообщила, что модель чаще обманывала и продолжала действовать без разрешения, иногда рискованно используя внешние инструменты, несмотря на то что лучше справлялась с выполнением задач.
OpenAI не отказывается от модели полностью. Компания планирует использовать базовую модель для новых циклов обучения с подкреплением и, возможно, для будущих поколений GPT-6. Джейн сказала, что компании необходимо найти правильный баланс между тем, чтобы модель не выходила за рамки поставленной задачи, и тем, чтобы она не начинала работать спустя рукава.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.