GPT-6 Astra — первая модель, позволившая OpenAI объявить о «начале эры AGI»
Ключевые моменты
- OpenAI выпускает GPT-6 Astra — свою самую мощную на сегодняшний день модель. Платные пользователи ChatGPT и облачные платформы должны получить доступ к ней в ближайшие дни.
- В тестах Astra значительно превосходит свою предшественницу GPT-5.6 Sol и модели Anthropic Fable 5 по ключевым направлениям, включая логику, математику и разработку программного обеспечения.
- Цены на токены в 2,5 раза выше и сопоставимы с Anthropic Fable 5.1, однако OpenAI утверждает, что стоимость выполнения одной задачи на самом деле ниже — в зависимости от сценария использования.
Обновление — 3 сентября 2026 года
- Добавлены сведения о Codex и GPT-6 Pro, а также видео запуска
OpenAI выпустила GPT-6 Astra — свою самую мощную на сегодняшний день модель. Президент компании Грег Брокман говорит, что она уже может соответствовать критериям «AGI» или, по крайней мере, близка к этому, то есть представляет собой систему искусственного интеллекта, превосходящую людей в большинстве видов экономически ценной деятельности согласно собственному определению OpenAI.
Сначала GPT-6 Astra будет доступна избранным организациям через программу Daybreak OpenAI, а более широкий доступ для пользователей ChatGPT Plus, Pro, Business и Enterprise ожидается в ближайшие дни. Модель также будет доступна через API и облачные платформы, такие как AWS Bedrock и Microsoft Azure. Подписчики Pro, Business и Enterprise получат доступ к GPT-6 Astra Pro — более производительной версии, однако администраторам корпоративных рабочих пространств потребуется активировать модель вручную.
Astra предварительно обучалась на более чем 100 000 GPU в комплексе Stargate в Техасе. Исследователь OpenAI Айдан Кларк назвал этот запуск крупнейшим в истории компании. По словам Кларка, переход от Sol к Astra обеспечил больший прирост возможностей, чем переход к Sol от более ранних моделей, отчасти потому, что предыдущие модели ИИ участвовали в мониторинге обучения.
В опубликованных OpenAI тестах Astra значительно превосходит свою предшественницу GPT-5.6 Sol и модели Anthropic Fable. Astra демонстрирует высшие результаты в целом ряде дисциплин: логическое мышление (99,9 процента в ARC-AGI-3, однако в условиях собственного тестирования), математика (97,6 процента в FrontierMath Tier 4 v2), разработка программного обеспечения (74,1 процента в DeepSWE v1.1), экспертные знания (96 процентов в GPQA Diamond), инженерное дело (95,9 процента в BenchCAD) и кибербезопасность (100 процентов в ExploitBench).
Работа с компьютером
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Agents' Final Exam | 59,3% | 53,6% | 48,7% | 55,5% | ||
| OSWorld 2.0 (офлайн, частичный) | 72,6% | 65,7% | 70,2% ³ | |||
| ScreenSpot-Pro (без инструментов) | 92,7% | 76,9% | 87,3% ¹⁷ |
Профессиональные задачи
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | |
| BenchCAD | 95,9% | 83,3% | 84,3% ⁵ | 67,5% ⁵ | 82,1% ⁵ | |
| BrowseComp | 91,5% | 90,4% | 87,4% | 90,8% | ||
| OpenScore String Quartets | 0,84 | 0,19 | ||||
| Внутренние задачи по дизайну | 50,0% | 47,4% | 35,8% | |||
| Внутренние задачи по анализу данных | 40,9% | 30,5% | 34,7% | |||
| AA Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Стоимость BenchCAD: примерно на 43% ниже, чем у Sol, и на 86% ниже, чем у Fable 5.1.
Программирование
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal Bench 4.0 | 57,7% | 37,3% | 55,8% | 42,0% | 52,3% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended | 64,5% ⁸ | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main | 53,3% ⁸ | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Внутренняя миграция баз данных | 63,9% | 42,7% | 57,8% | 50,3% | ||
| AA Coding Agent Index v1.4 | 67,0 | 65,1 | 67,2 | 68,1 | 61,2 |
Стоимость Terminal-Bench 4.0: примерно на 9% ниже, чем у Sol, и на 63% ниже, чем у Fable 5.1.
Академические задачи
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 87,8% | 73,2% | |
| GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
| Humanity's Last Exam (с инструментами) | 57,2% | 65,0% | 63,8% | 63,6% |
Настройки с более низкой стоимостью: Terminal-Bench Science — 61,1% при стоимости примерно на 27% ниже; GPQA Diamond — 94,9% при стоимости примерно на 37% ниже. Разрыв между простыми числами сократился с 240 до 186, а оценка границы для большого разрыва впервые за более чем 80 лет улучшилась.
Наука и здоровье
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| GeneBench Pro | 37,8% | 28,7% | ||||
| MedChemBench (внутренний) | 49,3% | 47,4% | ||||
| LifeSciBench | 60,3% | 59,9% | ||||
| HealthBench Professional | 63,4% | 60,5% | 56,6% ¹¹ | 60,9% ¹¹ | 54,5% ¹¹ | 52,1% |
Fable 5 и 5.1 не включены в LifeSciBench, GeneBench Pro и MedChemBench, поскольку они отклоняют большинство вопросов.
Кибербезопасность
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | 70% | ||
| ExploitGym | 42,4% ¹³ | 30,3% ¹³ | 30,4% ¹⁷ | 28,4% ¹⁷ | 22,0% ¹⁷ |
| ExploitBench (июнь–август 2026 года) | 39,0% | 5,5% | |||
| SRE-Bench | 88,0% | 55,9% | 12,5% | ||
| SEC-Bench Pro | 85,4% | 79,1% |
SRE-Bench в пределах четырёх попыток: 99,2% против 68,7% у Sol. Во время оценки Astra обнаружила два ранее неизвестных уязвимых места нулевого дня.
Согласование (чем ниже, тем лучше, за исключением Impossible ExploitGym)
| Показатель | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| Безопасность компьютера | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% |
| То же с AutoReview | 1,8% | 4,5% | |||
| Обход ограничений | 0,00% | 0,29% | |||
| Медовая ловушка ExploitGym | 0,0% | 48,2% | |||
| Impossible ExploitGym | 100,0% | ||||
| Галлюцинации | 4,2% | 12,2% |
Проверка области применимости для невыполнимых задач: Sol превышала разрешённую цель в 48% случаев, Astra — в 0%. Astra в три раза реже искажает информацию о собственных возможностях.
Длинный контекст
| Тест | Astra | Sol |
|---|---|---|
| MRCR v2 8-needle 256K–512K | 100,0% | 91,5% |
| MRCR v2 8-needle 512K–1M | 96,3% | 73,8% |
Абстрактное мышление
| Тест | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% ¹ | 7,8% | – | – | 30,2% |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% |
Как сообщается, в научной работе модель улучшила математический результат, связанный с разрывами между простыми числами, и установила новые рекорды в тестах по биологии, химии, медицине и физике. OpenAI также позиционирует Astra как модель, способную надёжно управлять компьютером так, как это делал бы человек, а в OSWorld 2.0, измеряющем такую способность, Astra набрала 72,6 процента, выполняя задачу примерно за 40 минут, по сравнению с 65,7 процента у Sol при времени около 75 минут. «Всё, что вы можете сделать на компьютере, Astra может сделать за вас. Быстро», утверждает компания.
Одновременно с Astra OpenAI обновляет и среду программирования Codex. Новая экспериментальная функция позволяет модели делать заметки в нескольких контекстных окнах во время длительных сессий вместо того, чтобы каждый раз сжимать всё в одно резюме. Предыдущие контекстные окна остаются доступными для поиска, поэтому Astra может находить требования или результаты тестов из прошлых сообщений, даже если они не были включены в заметки. OpenAI планирует сделать эту функцию стандартной в ближайшие недели.
Дороже Sol, но OpenAI заявляет о более низкой стоимости выполнения задач
GPT-6 Astra стоит 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов в стандартном режиме через API. Быстрый режим, который обещает скорость в 2,5 раза выше, удваивает цену, делая Astra в 2,5 раза дороже GPT-5.6 Sol и помещая её в тот же ценовой диапазон, что и Fable 5.1 от Anthropic.
Брокман заявил, что цены на токены становятся неудачным способом сравнения моделей, поскольку токены OpenAI отличаются от токенов конкурентов и даже несопоставимы между собственными семействами моделей компании. По его словам, важно учитывать стоимость выполнения одной задачи, и OpenAI уже экспериментирует с такой моделью ценообразования. По данным компании, в DeepSWE v1.1 оптимальная конфигурация Astra сокращает расчётную стоимость API на одну задачу примерно на 57 процентов по сравнению с Sol.
Во время пресс-брифинга Брокман признал, что чётко определённого момента наступления AGI не существует. По его словам, изначально команда считала, что после основания OpenAI будет очевидный порог, который все смогут распознать. Однако всё произошло иначе, и переход оказался более постепенным, чем ожидалось, — эту позицию OpenAI изложила прошлой весной. Брокман завершил брифинг словами: «Добро пожаловать в эру AGI». Ранее генеральный директор OpenAI Сэм Альтман говорил, что ожидает появления модели, которую он назвал бы AGI, к концу года.
Первая модель, достигшая критического порога OpenAI в области кибербезопасности
Astra — первая модель, которую OpenAI классифицирует как «критическую» в соответствии с Preparedness Framework. Это означает, что при наличии подходящих инструментов и доступа модель может находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов в хорошо защищённых системах — и всё это без пошагового руководства со стороны человека. OpenAI также признаёт, что письменные рассуждения Astra сложнее отслеживать, чем рассуждения GPT-5.6 Sol.
В ExploitBench — тесте, измеряющем способность модели обнаруживать и эксплуатировать реальные уязвимости программного обеспечения, — Astra набрала идеальные 100 процентов. OpenAI сообщает, что во время оценки модель обнаружила две ранее неизвестные уязвимости, о которых компания затем уведомила затронутых поставщиков. Эксперты-люди подтвердили, что Astra способна выявлять новые уязвимости нулевого дня в различных категориях программного обеспечения, включая браузеры и операционные системы.
Наиболее продвинутые возможности в области кибербезопасности пока ограничены проверенными специалистами по защите в рамках программы Daybreak Blue. Ранее OpenAI отложила выпуск Astra, чтобы провести дополнительные проверки безопасности. Эти возможности двойного назначения работают в обе стороны: агент, способный автономно найти уязвимость, с такой же лёгкостью помогает защитнику устранить её, как и злоумышленнику — воспользоваться ею.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.