GPT-6 Astra е първият модел, който кара OpenAI да обяви „ерата на AGI“
Основни моменти
- OpenAI пуска GPT-6 Astra, най-способния си модел досега. Платените потребители на ChatGPT и облачните платформи би трябвало да получат достъп през следващите дни.
- В бенчмарковете Astra значително превъзхожда предшественика си GPT-5.6 Sol и моделите Fable 5 на Anthropic в ключови области, включително логика, математика и софтуерно инженерство.
- Цените на токените са 2,5 пъти по-високи и са на нивото на Fable 5.1 на Anthropic, но OpenAI твърди, че разходът за изпълнена задача всъщност е по-нисък в зависимост от случая на употреба.
Актуализация – 3 септември 2026 г.
- Добавени са подробности за Codex и GPT-6 Pro, както и видеото от представянето
OpenAI пусна GPT-6 Astra, най-способния си модел досега. Президентът Грег Брокман казва, че той може вече да отговаря на критериите за „AGI“ или поне е близо до това — тоест представлява система с изкуствен интелект, която превъзхожда хората в повечето икономически ценни дейности според собствената дефиниция на OpenAI.
GPT-6 Astra първоначално се предоставя на избрани организации чрез програмата Daybreak на OpenAI, а по-широка достъпност за потребителите на ChatGPT Plus, Pro, Business и Enterprise се очаква през следващите дни. Моделът ще бъде достъпен и чрез API, както и чрез облачни платформи като AWS Bedrock и Microsoft Azure. Абонатите на Pro, Business и Enterprise получават достъп до GPT-6 Astra Pro, вариант с по-висока производителност, макар че администраторите на корпоративните работни пространства трябва да активират модела ръчно.
Astra е предварително обучена с повече от 100 000 графични процесора в комплекса Stargate в Тексас. Изследователят на OpenAI Айдън Кларк я нарече най-голямото обучение на компанията досега. Скокът от Sol към Astra представлява по-голямо подобрение на способностите от скока към Sol спрямо по-ранните модели, каза Кларк, отчасти защото предишни модели с изкуствен интелект са участвали в наблюдението на обучението.
В публикуваните от OpenAI бенчмаркове Astra постига резултати значително над тези на предшественика си GPT-5.6 Sol и моделите Fable на Anthropic. Astra достига водещи резултати в широк спектър от области: логическо разсъждение (99,9 процента в ARC-AGI-3, макар и при собствени условия на тестване), математика (97,6 процента във FrontierMath Tier 4 v2), софтуерно инженерство (74,1 процента в DeepSWE v1.1), експертни знания (96 процента в GPQA Diamond), инженерство (95,9 процента в BenchCAD) и киберсигурност (100 процента в ExploitBench).
Използване на компютър
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Agents' Final Exam | 59,3% | 53,6% | 48,7% | 55,5% | ||
| OSWorld 2.0 (офлайн, частичен) | 72,6% | 65,7% | 70,2% ³ | |||
| ScreenSpot-Pro (без инструменти) | 92,7% | 76,9% | 87,3% ¹⁷ |
Професионални задачи
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | |
| BenchCAD | 95,9% | 83,3% | 84,3% ⁵ | 67,5% ⁵ | 82,1% ⁵ | |
| BrowseComp | 91,5% | 90,4% | 87,4% | 90,8% | ||
| OpenScore String Quartets | 0,84 | 0,19 | ||||
| Вътрешни дизайнерски задачи | 50,0% | 47,4% | 35,8% | |||
| Вътрешни задачи по наука за данните | 40,9% | 30,5% | 34,7% | |||
| AA Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Разходи за BenchCAD: ~43% по-ниски от Sol, ~86% по-ниски от Fable 5.1.
Кодиране
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal Bench 4.0 | 57,7% | 37,3% | 55,8% | 42,0% | 52,3% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended | 64,5% ⁸ | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main | 53,3% ⁸ | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Вътрешна миграция на бази данни | 63,9% | 42,7% | 57,8% | 50,3% | ||
| AA Coding Agent Index v1.4 | 67,0 | 65,1 | 67,2 | 68,1 | 61,2 |
Разходи за Terminal-Bench 4.0: ~9% по-ниски от Sol, ~63% по-ниски от Fable 5.1.
Академични задачи
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 87,8% | 73,2% | |
| GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
| Humanity's Last Exam (с инструменти) | 57,2% | 65,0% | 63,8% | 63,6% |
Настройки с по-ниска цена: 61,1% в Terminal-Bench Science при ~27% по-нисък разход; 94,9% в GPQA Diamond при ~37% по-нисък разход. Разликите между простите числа са подобрени от 240 на 186, а ограничителен член за големи разлики е подобрен за първи път от над 80 години.
Наука и здравеопазване
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| GeneBench Pro | 37,8% | 28,7% | ||||
| MedChemBench (вътрешен) | 49,3% | 47,4% | ||||
| LifeSciBench | 60,3% | 59,9% | ||||
| HealthBench Professional | 63,4% | 60,5% | 56,6% ¹¹ | 60,9% ¹¹ | 54,5% ¹¹ | 52,1% |
Fable 5 и 5.1 не са включени в LifeSciBench, GeneBench Pro и MedChemBench, защото отхвърлят повечето въпроси.
Киберсигурност
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | 70% | ||
| ExploitGym | 42,4% ¹³ | 30,3% ¹³ | 30,4% ¹⁷ | 28,4% ¹⁷ | 22,0% ¹⁷ |
| ExploitBench (юни–август 2026 г.) | 39,0% | 5,5% | |||
| SRE-Bench | 88,0% | 55,9% | 12,5% | ||
| SEC-Bench Pro | 85,4% | 79,1% |
SRE-Bench в рамките на четири опита: 99,2% спрямо 68,7% за Sol. Astra откри две неизвестни досега уязвимости от типа zero-day по време на оценяването.
Съгласуваност (по-ниската стойност е по-добра, с изключение на Impossible ExploitGym)
| Показател | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| Компютърна безопасност | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% |
| Същото, с AutoReview | 1,8% | 4,5% | |||
| Заобикаляне | 0,00% | 0,29% | |||
| Капан в ExploitGym | 0,0% | 48,2% | |||
| Impossible ExploitGym | 100,0% | ||||
| Халюцинации | 4,2% | 12,2% |
Тест за обхвата при невъзможни задачи: Sol надхвърля разрешената си цел в 48% от случаите, а Astra — в 0%. Astra е 3 пъти по-малко склонна да представя погрешно собствените си способности.
Дълъг контекст
| Бенчмарк | Astra | Sol |
|---|---|---|
| MRCR v2 8-needle 256K–512K | 100,0% | 91,5% |
| MRCR v2 8-needle 512K–1M | 96,3% | 73,8% |
Абстрактно разсъждение
| Бенчмарк | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% ¹ | 7,8% | – | – | 30,2% |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% |
Според съобщенията при научна работа моделът е подобрил математически резултат за разликите между простите числа и е поставил нови рекорди в оценяването на биологията, химията, медицината и физиката. OpenAI представя Astra и като модел, който може надеждно да работи с компютър по начина, по който би работил човек. В OSWorld 2.0, който измерва тази способност, Astra постига 72,6 процента при около 40 минути на задача, спрямо 65,7 процента за Sol при приблизително 75 минути. „Всичко, което можете да правите на компютър, Astra може да прави вместо вас. Бързо“, твърди компанията.
Наред с Astra OpenAI обновява и средата си за програмиране Codex. Нова експериментална функция позволява на модела да води бележки през множество контекстни прозорци по време на дълги сесии, вместо всеки път да компресира всичко в едно обобщение. По-ранните контекстни прозорци остават достъпни за търсене, така че Astra може да провери изисквания или резултати от тестове от предишни съобщения, дори ако те не са били включени в бележките. OpenAI планира да направи това настройката по подразбиране през следващите седмици.
По-скъпа от Sol, но според OpenAI е по-евтина на задача
GPT-6 Astra струва 10 долара за един милион входни токени и 50 долара за един милион изходни токени в стандартен режим чрез API. Бързият режим, който обещава 2,5 пъти по-висока скорост, удвоява цената, което прави Astra 2,5 пъти по-скъпа от GPT-5.6 Sol и я поставя в същия ценови диапазон като Fable 5.1 на Anthropic.
Брокман заяви, че цените на токените се превръщат в неподходящ начин за сравняване на модели, тъй като токените на OpenAI не са същите като тези на конкурентите и дори не са сравними между собствените моделни семейства на компанията. Важен е, каза той, разходът за изпълнена задача, а OpenAI вече експериментира с този ценови модел. В DeepSWE v1.1 най-високата конфигурация на Astra намалява изчислените API разходи на задача с около 57 процента спрямо Sol, според компанията.
По време на брифинга за медиите Брокман призна, че няма ясно дефиниран момент на AGI. По думите му екипът първоначално е смятал, че при основаването на OpenAI ще има очевиден праг, който всички ще разпознаят. Това обаче не се е случило и преходът е бил по-постепенен от очакваното — позиция, която OpenAI изложи миналата пролет. Брокман завърши брифинга с думите: „Добре дошли в ерата на AGI.“ Главният изпълнителен директор на OpenAI Сам Алтман по-рано заяви, че очаква до края на годината да има модел, който би нарекъл AGI.
Първият модел, достигнал критичния праг на OpenAI за киберсигурност
Astra е първият модел, който OpenAI класифицира като „критичен“ според своята Рамка за готовност. Това означава, че моделът може да открива неизвестни досега уязвимости и да изгражда вериги от експлойти в добре защитени системи, когато получи подходящите инструменти и достъп — без човек да го насочва стъпка по стъпка. OpenAI признава също, че писменото разсъждение на Astra е по-трудно за наблюдение от това на GPT-5.6 Sol.
В ExploitBench — бенчмарк, който измерва способността на модел да открива и използва реални софтуерни уязвимости — Astra постига перфектните 100 процента. OpenAI заявява, че моделът е открил две неизвестни досега уязвимости по време на оценяването, които компанията след това е докладвала на засегнатите доставчици. Човешки експерти са потвърдили, че Astra може да идентифицира нови уязвимости от типа zero-day в няколко категории софтуер, включително браузъри и операционни системи.
Най-напредналите възможности за киберсигурност засега са ограничени до доверени защитници в програмата Daybreak Blue. По-рано OpenAI отложи пускането на Astra, за да проведе допълнителни тестове за безопасност. Тези възможности с двойна употреба могат да работят и в двете посоки: агент, който може автономно да открива уязвимост, помага на защитника да я отстрани също толкова лесно, колкото помага на нападателя да я използва.
Новини за изкуствения интелект без сензация – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за изкуствения интелект, ексклузивния ни доклад за водещите разработки „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.