Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

GPT-6 Astra — перша модель, що дозволила OpenAI оголосити про «еру AGI»

GPT-6 Astra — перша модель, що спонукає OpenAI оголосити «еру AGI»
Matthias Bastian
3 вересня 2026 року
GPT-Image-2 за запитом THE DECODER

Ключові моменти

  • OpenAI запускає GPT-6 Astra — свою найпотужнішу на сьогодні модель. Платні користувачі ChatGPT і хмарні платформи мають отримати доступ у найближчі дні.
  • У тестах Astra значно перевершує свою попередницю GPT-5.6 Sol і моделі Anthropic Fable 5 у ключових дисциплінах, зокрема в логіці, математиці та розробці програмного забезпечення.
  • Ціни за токени в 2,5 раза вищі й відповідають рівню Anthropic Fable 5.1, але OpenAI стверджує, що вартість виконання одного завдання насправді нижча — залежно від сценарію використання.

Оновлення — 3 вересня 2026 року

  • Додано деталі про Codex і GPT-6 Pro, а також відео запуску

OpenAI випустила GPT-6 Astra — свою найпотужнішу на сьогодні модель. Президент компанії Greg Brockman каже, що вона вже може відповідати критеріям «AGI» або принаймні наближається до цього рівня, тобто є системою штучного інтелекту, яка перевершує людей у більшості економічно цінних видів діяльності — згідно з власним визначенням OpenAI.

Спочатку GPT-6 Astra надається окремим організаціям у межах програми Daybreak OpenAI, а ширша доступність для користувачів ChatGPT Plus, Pro, Business і Enterprise очікується найближчими днями. Модель також буде доступна через API і хмарні платформи, як-от AWS Bedrock та Microsoft Azure. Передплатники Pro, Business і Enterprise отримають доступ до GPT-6 Astra Pro — високопродуктивної версії, хоча адміністратори корпоративних робочих просторів мають активувати модель вручну.

Astra була попередньо навчена на понад 100 000 GPU на об’єкті Stargate у Техасі. Дослідник OpenAI Aidan Clark назвав це найбільшим навчанням в історії компанії. За словами Clark, перехід від Sol до Astra забезпечує більший приріст можливостей, ніж перехід до Sol від попередніх моделей, зокрема тому, що попередні моделі ШІ відігравали роль у моніторингу навчання.

У опублікованих OpenAI тестах Astra значно випереджає свою попередницю GPT-5.6 Sol і моделі Fable від Anthropic. Astra демонструє найвищі результати в низці дисциплін: логічне міркування (99,9 відсотка в ARC-AGI-3, щоправда, за власних умов тестування), математика (97,6 відсотка у FrontierMath Tier 4 v2), розробка програмного забезпечення (74,1 відсотка у DeepSWE v1.1), експертні знання (96 відсотків у GPQA Diamond), інженерія (95,9 відсотка у BenchCAD) та кібербезпека (100 відсотків у ExploitBench).

Використання комп’ютера

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Agents' Final Exam 59,3% 53,6% 48,7% 55,5%
OSWorld 2.0 (офлайн, частково) 72,6% 65,7% 70,2% ³
ScreenSpot-Pro (без інструментів) 92,7% 76,9% 87,3% ¹⁷

Професійні завдання

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
AutomationBench 41,4% 18,1% 31,4% 17,4% 26,9%
BenchCAD 95,9% 83,3% 84,3% ⁵ 67,5% ⁵ 82,1% ⁵
BrowseComp 91,5% 90,4% 87,4% 90,8%
OpenScore String Quartets 0,84 0,19
Внутрішні дизайнерські завдання 50,0% 47,4% 35,8%
Внутрішні завдання з аналізу даних 40,9% 30,5% 34,7%
AA Intelligence Index v4.1.1 61,2 60,9 65,7 62,1 63,1 58,7

Вартість BenchCAD: приблизно на 43% нижча, ніж у Sol, і на 86% нижча, ніж у Fable 5.1.

Програмування

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal Bench 4.0 57,7% 37,3% 55,8% 42,0% 52,3% 19,1%
DeepSWE v1.1 74,1% 72,7% 67,4% 69,9% 73,7% 73,8%
FrontierCode 1.1 Extended 64,5% ⁸ 60,6% 63,6% 64,9% 63,6% 56,3%
FrontierCode 1.1 Main 53,3% ⁸ 47,5% 50,9% 53,5% 53,4% 43,6%
Внутрішня міграція баз даних 63,9% 42,7% 57,8% 50,3%
AA Coding Agent Index v1.4 67,0 65,1 67,2 68,1 61,2

Вартість Terminal-Bench 4.0: приблизно на 9% нижча, ніж у Sol, і на 63% нижча, ніж у Fable 5.1.

Академічні завдання

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
Terminal-Bench Science 0.1 64,6% 22,4% 52,6% 21,4% 30,0%
FrontierMath Tier 4 (v2) 97,6% 83,0% 87,8% 87,8% 73,2%
GPQA Diamond 96,0% 94,6% 93,7% 92,6% 93,7% 95,3%
Humanity's Last Exam (з інструментами) 57,2% 65,0% 63,8% 63,6%

Налаштування з нижчою вартістю: 61,1% у Terminal-Bench Science за приблизно на 27% нижчої вартості; 94,9% у GPQA Diamond за приблизно на 37% нижчої вартості. Розриви між простими числами скоротилися з 240 до 186, а межовий доданок для великого розриву вперше за понад 80 років було покращено.

Наука та здоров’я

Тест Astra Sol Fable 5.1 Fable 5 Opus 5 Gem 3.8 F
GeneBench Pro 37,8% 28,7%
MedChemBench (внутрішній) 49,3% 47,4%
LifeSciBench 60,3% 59,9%
HealthBench Professional 63,4% 60,5% 56,6% ¹¹ 60,9% ¹¹ 54,5% ¹¹ 52,1%

Fable 5 і 5.1 не включені до LifeSciBench, GeneBench Pro та MedChemBench, оскільки вони відхиляють більшість запитань.

Кібербезпека

Тест Astra Sol Fable 5.1 Fable 5 Opus 5
ExploitBench 100,0% 78,5% 70%
ExploitGym 42,4% ¹³ 30,3% ¹³ 30,4% ¹⁷ 28,4% ¹⁷ 22,0% ¹⁷
ExploitBench (червень–серпень 2026 року) 39,0% 5,5%
SRE-Bench 88,0% 55,9% 12,5%
SEC-Bench Pro 85,4% 79,1%

SRE-Bench у межах чотирьох спроб: 99,2% проти 68,7% у Sol. Під час оцінювання Astra виявила два раніше невідомі уразливі місця нульового дня.

Відповідність вимогам (менше — краще, за винятком Impossible ExploitGym)

Показник Astra Sol Fable 5.1 Fable 5 Opus 5
Безпека під час роботи з комп’ютером 2,4% 22,0% 9,5% 18,3% 11,5%
Те саме з AutoReview 1,8% 4,5%
Обхід обмежень 0,00% 0,29%
Пастка ExploitGym 0,0% 48,2%
Impossible ExploitGym 100,0%
Галюцинації 4,2% 12,2%

Тест на виконання неможливих завдань: Sol перевищувала дозволену ціль у 48% випадків, Astra — у 0%. Astra втричі рідше неправильно описує власні можливості.

Довгий контекст

Тест Astra Sol
MRCR v2 8-needle 256K–512K 100,0% 91,5%
MRCR v2 8-needle 512K–1M 96,3% 73,8%

Абстрактне міркування

Тест Astra Sol Fable 5.1 Fable 5 Opus 5
ARC-AGI-3 99,9% ¹ 7,8% – – 30,2%
ARC-AGI-2 95,0% 92,5% 90,0% 89,2% 90,4%
ARC-AGI-1 98,5% 97,5% 97,5% 98,5% 97,5%

У науковій роботі модель, за повідомленнями, покращила математичний результат щодо розривів між простими числами та встановила нові рекорди в оцінюваннях із біології, хімії, медицини й фізики. OpenAI також позиціонує Astra як модель, здатну надійно керувати комп’ютером так, як це робить людина, а в OSWorld 2.0, який вимірює цю здатність, Astra набрала 72,6 відсотка, витрачаючи приблизно 40 хвилин на завдання, порівняно з 65,7 відсотка у Sol за приблизно 75 хвилин. «Усе, що ви можете робити на комп’ютері, Astra може робити за вас. Швидко», — стверджує компанія.

Разом із Astra OpenAI також оновлює середовище програмування Codex. Нова експериментальна функція дає змогу моделі робити нотатки в кількох контекстних вікнах під час тривалих сесій, а не щоразу стискати все в один підсумок. Попередні контекстні вікна залишаються доступними для пошуку, тож Astra може знаходити вимоги або результати тестів із попередніх повідомлень, навіть якщо їх не було занесено до нотаток. OpenAI планує зробити цю функцію стандартною в найближчі тижні.

Дорожча за Sol, але OpenAI каже, що вартість завдання нижча

GPT-6 Astra коштує 10 доларів за мільйон вхідних токенів і 50 доларів за мільйон вихідних токенів у стандартному режимі через API. Швидкий режим, який обіцяє швидкість у 2,5 раза вищу, удвічі збільшує ціну, роблячи Astra у 2,5 раза дорожчою за GPT-5.6 Sol і виводячи її в той самий ціновий діапазон, що й Fable 5.1 від Anthropic.

Brockman заявив, що ціни за токени стають ненадійним способом порівняння моделей, оскільки токени OpenAI не є такими самими, як токени конкурентів, і навіть не зіставні між власними сімействами моделей компанії. За його словами, важливою є ціна виконаного завдання, і OpenAI вже експериментує з такою моделлю ціноутворення. За даними компанії, у DeepSWE v1.1 найпотужніша конфігурація Astra скорочує розрахункову вартість API на одне завдання приблизно на 57 відсотків порівняно із Sol.

Під час пресбрифінгу Brockman визнав, що чітко визначеного моменту появи AGI не існує. За його словами, спочатку команда вважала, що після заснування OpenAI настане очевидний поріг, який усі зможуть розпізнати. Але все відбулося не так, і перехід виявився поступовішим, ніж очікувалося, — позицію, яку OpenAI виклала минулої весни. Brockman завершив брифінг, заявивши: «Ласкаво просимо в еру AGI». Генеральний директор OpenAI Sam Altman раніше казав, що очікує появи моделі, яку він назвав би AGI до кінця року.

Перша модель, що досягла критичного порогу OpenAI у сфері кібербезпеки

Astra — перша модель, яку OpenAI класифікує як «критичну» відповідно до свого Preparedness Framework. Це означає, що за наявності відповідних інструментів і доступу модель може знаходити раніше невідомі вразливості та будувати ланцюжки експлойтів у добре захищених системах — без покрокового керування людиною. OpenAI також визнає, що письмові міркування Astra важче контролювати, ніж міркування GPT-5.6 Sol.

У ExploitBench — тесті, що вимірює здатність моделі виявляти й використовувати реальні вразливості програмного забезпечення, — Astra набрала ідеальні 100 відсотків. OpenAI стверджує, що під час оцінювання модель виявила дві раніше невідомі вразливості, про які компанія потім повідомила відповідним постачальникам. Експерти-люди підтвердили, що Astra може виявляти нові вразливості нульового дня в різних категоріях програмного забезпечення, зокрема в браузерах та операційних системах.

Найрозвиненіші можливості у сфері кібербезпеки наразі обмежені перевіреними захисниками в межах програми Daybreak Blue. OpenAI раніше відклала випуск Astra, щоб провести додаткові тести безпеки. Ці можливості подвійного призначення працюють в обидва боки: агент, який може автономно знаходити вразливість, так само легко допомагає захиснику виправити її, як і зловмиснику — використати.

Новини ШІ без хайпу — добірка від людей

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний фронтирний звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерела: CNET | The Information | Axios | OpenAI

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини