OpenAI пуска GPT-6 Astra: модел за работа с компютър с контекст от 1,05 млн. токена, достъпен след „критичен“ киберпраг
Днес OpenAI представи GPT-6 Astra. Компанията го определя като своя най-интелигентен и най-добре съгласуван модел и го позиционира предимно като система за работа с компютри, а не като чат модел. Идеята е, че Astra работи със софтуер по начина, по който го прави човек — в браузъри, електронни таблици, настолни приложения и терминали — и изпълнява многоетапни задачи, вместо само да обяснява как да бъдат изпълнени.
Може ли да бъде внедрен? Отчасти, но не на собствен хардуер. Astra е затворен, хостван модел без публикувани тегла, така че самостоятелното му хостване не е възможно. Днес той е достъпен само за организации в програмите на OpenAI Trusted Access и Daybreak.
Какво всъщност е новото
Основната промяна за разработчиците е обработката на контекста. Преди Codex използваше компресиране, като обобщаваше по-ранните реплики, когато контекстът се запълнеше. Този процес премахва детайлите, от които един агент по-късно може да се нуждае: защо дадена поправка е неуспешна, кои тестове са стартирани и кое изискване е било добавено в началото. Вместо това Astra съхранява бележки между отделните контекстови прозорци и търси в по-ранните съобщения и изхода от инструментите. Функцията се предоставя експериментално чрез настройка в config.toml и през следващите седмици ще стане стандартна за Codex.
Astra може също да зададе въпрос на потребителя, докато продължава работа, която не зависи от отговора. Това премахва често срещан проблем при агентите, при който едно нерешено решение блокира цялата задача.
На страницата на модела Astra е посочен с контекстов прозорец от 1 050 000 токена, максимум 128 000 изходни токена и дата на прекъсване на знанията 30 април 2026 г. Входът може да бъде текст и изображение, а изходът — само текст. reasoning.effort добавя две нови нива над high: xhigh и max. Поддръжката на инструменти включва работа с компютър, хостван shell, apply patch, skills, MCP и търсене на инструменти. Дообучаването не се поддържа.
Картината от бенчмарковете
OpenAI отчита 72,6% на OSWorld V2-Offline спрямо 65,7% за GPT-5.6 Sol, като средното време за задача е намаляло от приблизително 75 на 40 минути. Anthropic отчита 77,9% за Claude Fable 5.1, но посочва, че е използвала различна версия на OSWorld и резултатите не трябва да се сравняват директно.
Astra постига 98,6% на ARC-AGI-3. Този резултат е получен с harness за Responses API, който запазва разсъжденията между отделните ходове и използва компресиране за дълги контексти, а OpenAI вече е показвала, че тези настройки значително повишават резултатите на ARC-AGI-3, без да променят модела. Резултатът измерва модела заедно с агентната система.
Други отчетени резултати: 97,6% на FrontierMath Tier 4, 95,9% на BenchCAD Vision2Code спрямо 84,3% за Fable 5.1 и 64,6% на Terminal-Bench Science спрямо отчетените от Anthropic 52,6%. Epoch AI отбелязва, че OpenAI е финансирала FrontierMath и има изключителен достъп до част от него.
Програмирането е слабата страна в тази история. Astra постига 74,1% на DeepSWE v1.1 спрямо 70,8% за Sol. Meta отчете 75,4% за Muse Spark 1.3 при максимално ниво на разсъждение, а публичната класация поставя Gemini 3.8 Flash и Claude Opus 5 близо до 74%. При бенчмарк от 113 задачи тези разлики се равняват на една или две задачи.
Киберспособностите определят модела за достъп
Astra е първият модел, който OpenAI определя като достигнал критичния праг за киберсигурност в своята Рамка за готовност. При тестове той е разработил експлойти за защитени браузъри и операционни системи и е открил две неизвестни досега уязвимости във V8, за които OpenAI заявява, че уведомява поддържащите екипи.
Последиците са практически. Стандартният достъп отказва усъвършенствани задачи по киберсигурност, включително откриване на експлойти. За разработчиците на API проверката за безопасност при задачи по киберсигурност прекратява задачата изцяло, вместо да я поставя на пауза за одобрение. Миа Глейз от OpenAI предупреди, че потребителите извън програмите за доверен достъп могат да се сблъскат със забавяния, паузи или блокирания, понякога и по време на несвързана работа.
OpenAI отчита 100% на ExploitBench — обобщен резултат за покритие на способностите, а не процент на успешно преминалите тестове — и 42,4% на ExploitGym спрямо 30,3% за Sol, като обичайното шестчасово ограничение за двата модела е премахнато.
Ценообразуване
Astra струва 10 долара на милион входни токени и 50 долара на милион изходни токени, а кешираните входни токени струват 1,00 долар. Заявките с над 272 хил. входни токена се таксуват с 2 пъти по-висока цена за входа и 1,5 пъти по-висока цена за изхода за цялата заявка. Batch и Flex работят на 50% от цената, а Fast режимът — на двойна цена. Потребителите на Pro, Business и Enterprise получават и Astra Pro.
Основни изводи
- Astra е преди всичко модел за работа с компютри: 72,6% на OSWorld V2-Offline, като времето за задача е намаляло от около 75 на около 40 минути.
- Бележките заменят компресирането в Codex, така че при дълги изпълнения на агента вече не се губят подробности за неуспехите.
- Подобренията при програмирането са минимални: резултатът от 74,1% на DeepSWE v1.1 е в рамките на групата в класацията.
- Първият модел, достигнал критичния киберпраг на OpenAI; стандартният достъп отказва работа с експлойти.
- Няма отворени тегла, цената е 10/50 долара на милион токена, контекстът е 1,05 млн. токена, а API и AWS ще бъдат достъпни през следващите дни.
Вижте съобщението на OpenAI, OpenAI в X и страницата на модела GPT-6 Astra. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, представяне на продукт, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.