Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

GPT-6 Astra — первая модель, позволившая OpenAI объявить о «начале эры AGI»

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»
Маттиас Бастиан
3 сентября 2026 года
GPT-Image-2 по запросу THE DECODER

Ключевые моменты

  • OpenAI выпускает GPT-6 Astra — свою самую мощную на сегодняшний день модель. Платные пользователи ChatGPT и облачные платформы должны получить доступ к ней в ближайшие дни.
  • В тестах Astra значительно превосходит свою предшественницу GPT-5.6 Sol и модели Anthropic Fable 5 по ключевым направлениям, включая логику, математику и разработку программного обеспечения.
  • Цены на токены в 2,5 раза выше и сопоставимы с Anthropic Fable 5.1, однако OpenAI утверждает, что стоимость выполнения одной задачи на самом деле ниже — в зависимости от сценария использования.

Обновление — 3 сентября 2026 года

  • Добавлены сведения о Codex и GPT-6 Pro, а также видео запуска

OpenAI выпустила GPT-6 Astra — свою самую мощную на сегодняшний день модель. Президент компании Грег Брокман говорит, что она уже может соответствовать критериям «AGI» или, по крайней мере, близка к этому, то есть представляет собой систему искусственного интеллекта, превосходящую людей в большинстве видов экономически ценной деятельности согласно собственному определению OpenAI.

Сначала GPT-6 Astra будет доступна избранным организациям через программу Daybreak OpenAI, а более широкий доступ для пользователей ChatGPT Plus, Pro, Business и Enterprise ожидается в ближайшие дни. Модель также будет доступна через API и облачные платформы, такие как AWS Bedrock и Microsoft Azure. Подписчики Pro, Business и Enterprise получат доступ к GPT-6 Astra Pro — более производительной версии, однако администраторам корпоративных рабочих пространств потребуется активировать модель вручную.

Astra предварительно обучалась на более чем 100 000 GPU в комплексе Stargate в Техасе. Исследователь OpenAI Айдан Кларк назвал этот запуск крупнейшим в истории компании. По словам Кларка, переход от Sol к Astra обеспечил больший прирост возможностей, чем переход к Sol от более ранних моделей, отчасти потому, что предыдущие модели ИИ участвовали в мониторинге обучения.

В опубликованных OpenAI тестах Astra значительно превосходит свою предшественницу GPT-5.6 Sol и модели Anthropic Fable. Astra демонстрирует высшие результаты в целом ряде дисциплин: логическое мышление (99,9 процента в ARC-AGI-3, однако в условиях собственного тестирования), математика (97,6 процента в FrontierMath Tier 4 v2), разработка программного обеспечения (74,1 процента в DeepSWE v1.1), экспертные знания (96 процентов в GPQA Diamond), инженерное дело (95,9 процента в BenchCAD) и кибербезопасность (100 процентов в ExploitBench).

Работа с компьютером

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Agents' Final Exam 59,3% 53,6% 48,7% 55,5%
OSWorld 2.0 (офлайн, частичный) 72,6% 65,7% 70,2% ³
ScreenSpot-Pro (без инструментов) 92,7% 76,9% 87,3% ¹⁷

Профессиональные задачи

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
AutomationBench 41,4% 18,1% 31,4% 17,4% 26,9%
BenchCAD 95,9% 83,3% 84,3% ⁵ 67,5% ⁵ 82,1% ⁵
BrowseComp 91,5% 90,4% 87,4% 90,8%
OpenScore String Quartets 0,84 0,19
Внутренние задачи по дизайну 50,0% 47,4% 35,8%
Внутренние задачи по анализу данных 40,9% 30,5% 34,7%
AA Intelligence Index v4.1.1 61,2 60,9 65,7 62,1 63,1 58,7

Стоимость BenchCAD: примерно на 43% ниже, чем у Sol, и на 86% ниже, чем у Fable 5.1.

Программирование

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal Bench 4.0 57,7% 37,3% 55,8% 42,0% 52,3% 19,1%
DeepSWE v1.1 74,1% 72,7% 67,4% 69,9% 73,7% 73,8%
FrontierCode 1.1 Extended 64,5% ⁸ 60,6% 63,6% 64,9% 63,6% 56,3%
FrontierCode 1.1 Main 53,3% ⁸ 47,5% 50,9% 53,5% 53,4% 43,6%
Внутренняя миграция баз данных 63,9% 42,7% 57,8% 50,3%
AA Coding Agent Index v1.4 67,0 65,1 67,2 68,1 61,2

Стоимость Terminal-Bench 4.0: примерно на 9% ниже, чем у Sol, и на 63% ниже, чем у Fable 5.1.

Академические задачи

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal-Bench Science 0.1 64,6% 22,4% 52,6% 21,4% 30,0%
FrontierMath Tier 4 (v2) 97,6% 83,0% 87,8% 87,8% 73,2%
GPQA Diamond 96,0% 94,6% 93,7% 92,6% 93,7% 95,3%
Humanity's Last Exam (с инструментами) 57,2% 65,0% 63,8% 63,6%

Настройки с более низкой стоимостью: Terminal-Bench Science — 61,1% при стоимости примерно на 27% ниже; GPQA Diamond — 94,9% при стоимости примерно на 37% ниже. Разрыв между простыми числами сократился с 240 до 186, а оценка границы для большого разрыва впервые за более чем 80 лет улучшилась.

Наука и здоровье

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
GeneBench Pro 37,8% 28,7%
MedChemBench (внутренний) 49,3% 47,4%
LifeSciBench 60,3% 59,9%
HealthBench Professional 63,4% 60,5% 56,6% ¹¹ 60,9% ¹¹ 54,5% ¹¹ 52,1%

Fable 5 и 5.1 не включены в LifeSciBench, GeneBench Pro и MedChemBench, поскольку они отклоняют большинство вопросов.

Кибербезопасность

Тест Astra Sol Fable 5.1 Fable 5 Opus 5
ExploitBench 100,0% 78,5% 70%
ExploitGym 42,4% ¹³ 30,3% ¹³ 30,4% ¹⁷ 28,4% ¹⁷ 22,0% ¹⁷
ExploitBench (июнь–август 2026 года) 39,0% 5,5%
SRE-Bench 88,0% 55,9% 12,5%
SEC-Bench Pro 85,4% 79,1%

SRE-Bench в пределах четырёх попыток: 99,2% против 68,7% у Sol. Во время оценки Astra обнаружила два ранее неизвестных уязвимых места нулевого дня.

Согласование (чем ниже, тем лучше, за исключением Impossible ExploitGym)

Показатель Astra Sol Fable 5.1 Fable 5 Opus 5
Безопасность компьютера 2,4% 22,0% 9,5% 18,3% 11,5%
То же с AutoReview 1,8% 4,5%
Обход ограничений 0,00% 0,29%
Медовая ловушка ExploitGym 0,0% 48,2%
Impossible ExploitGym 100,0%
Галлюцинации 4,2% 12,2%

Проверка области применимости для невыполнимых задач: Sol превышала разрешённую цель в 48% случаев, Astra — в 0%. Astra в три раза реже искажает информацию о собственных возможностях.

Длинный контекст

Тест Astra Sol
MRCR v2 8-needle 256K–512K 100,0% 91,5%
MRCR v2 8-needle 512K–1M 96,3% 73,8%

Абстрактное мышление

Тест Astra Sol Fable 5.1 Fable 5 Opus 5
ARC-AGI-3 99,9% ¹ 7,8% – – 30,2%
ARC-AGI-2 95,0% 92,5% 90,0% 89,2% 90,4%
ARC-AGI-1 98,5% 97,5% 97,5% 98,5% 97,5%

Как сообщается, в научной работе модель улучшила математический результат, связанный с разрывами между простыми числами, и установила новые рекорды в тестах по биологии, химии, медицине и физике. OpenAI также позиционирует Astra как модель, способную надёжно управлять компьютером так, как это делал бы человек, а в OSWorld 2.0, измеряющем такую способность, Astra набрала 72,6 процента, выполняя задачу примерно за 40 минут, по сравнению с 65,7 процента у Sol при времени около 75 минут. «Всё, что вы можете сделать на компьютере, Astra может сделать за вас. Быстро», утверждает компания.

Одновременно с Astra OpenAI обновляет и среду программирования Codex. Новая экспериментальная функция позволяет модели делать заметки в нескольких контекстных окнах во время длительных сессий вместо того, чтобы каждый раз сжимать всё в одно резюме. Предыдущие контекстные окна остаются доступными для поиска, поэтому Astra может находить требования или результаты тестов из прошлых сообщений, даже если они не были включены в заметки. OpenAI планирует сделать эту функцию стандартной в ближайшие недели.

Дороже Sol, но OpenAI заявляет о более низкой стоимости выполнения задач

GPT-6 Astra стоит 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов в стандартном режиме через API. Быстрый режим, который обещает скорость в 2,5 раза выше, удваивает цену, делая Astra в 2,5 раза дороже GPT-5.6 Sol и помещая её в тот же ценовой диапазон, что и Fable 5.1 от Anthropic.

Брокман заявил, что цены на токены становятся неудачным способом сравнения моделей, поскольку токены OpenAI отличаются от токенов конкурентов и даже несопоставимы между собственными семействами моделей компании. По его словам, важно учитывать стоимость выполнения одной задачи, и OpenAI уже экспериментирует с такой моделью ценообразования. По данным компании, в DeepSWE v1.1 оптимальная конфигурация Astra сокращает расчётную стоимость API на одну задачу примерно на 57 процентов по сравнению с Sol.

Во время пресс-брифинга Брокман признал, что чётко определённого момента наступления AGI не существует. По его словам, изначально команда считала, что после основания OpenAI будет очевидный порог, который все смогут распознать. Однако всё произошло иначе, и переход оказался более постепенным, чем ожидалось, — эту позицию OpenAI изложила прошлой весной. Брокман завершил брифинг словами: «Добро пожаловать в эру AGI». Ранее генеральный директор OpenAI Сэм Альтман говорил, что ожидает появления модели, которую он назвал бы AGI, к концу года.

Первая модель, достигшая критического порога OpenAI в области кибербезопасности

Astra — первая модель, которую OpenAI классифицирует как «критическую» в соответствии с Preparedness Framework. Это означает, что при наличии подходящих инструментов и доступа модель может находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов в хорошо защищённых системах — и всё это без пошагового руководства со стороны человека. OpenAI также признаёт, что письменные рассуждения Astra сложнее отслеживать, чем рассуждения GPT-5.6 Sol.

В ExploitBench — тесте, измеряющем способность модели обнаруживать и эксплуатировать реальные уязвимости программного обеспечения, — Astra набрала идеальные 100 процентов. OpenAI сообщает, что во время оценки модель обнаружила две ранее неизвестные уязвимости, о которых компания затем уведомила затронутых поставщиков. Эксперты-люди подтвердили, что Astra способна выявлять новые уязвимости нулевого дня в различных категориях программного обеспечения, включая браузеры и операционные системы.

Наиболее продвинутые возможности в области кибербезопасности пока ограничены проверенными специалистами по защите в рамках программы Daybreak Blue. Ранее OpenAI отложила выпуск Astra, чтобы провести дополнительные проверки безопасности. Эти возможности двойного назначения работают в обе стороны: агент, способный автономно найти уязвимость, с такой же лёгкостью помогает защитнику устранить её, как и злоумышленнику — воспользоваться ею.

Новости ИИ без хайпа — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: CNET | The Information | Axios | OpenAI

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости