OpenAI випустила GPT-6 Astra: модель для роботи з комп’ютером із контекстом у 1,05 млн токенів, доступна після «критичного» кіберпорогу
Сьогодні OpenAI випустила GPT-6 Astra. Компанія називає її своєю найінтелектуальнішою та найбільш узгодженою моделлю й позиціонує її насамперед як систему для роботи з комп’ютером, а не як чат-модель. Ідея полягає в тому, що Astra працює з програмним забезпеченням так само, як людина: у браузерах, електронних таблицях, десктопних застосунках і терміналах, виконуючи багатокрокові завдання замість того, щоб описувати, як їх виконати.
Чи можна її розгорнути? Частково, але не на власному обладнанні. Astra — це закрита хостингова модель без опублікованих ваг, тому самостійний хостинг неможливий. Сьогодні вона доступна лише організаціям у програмах OpenAI Trusted Access і Daybreak.
Що насправді нового
Головна зміна для розробників — робота з контекстом. Раніше Codex використовував стискання контексту, узагальнюючи попередні повідомлення після його заповнення. Цей процес відкидає деталі, які агенту згодом можуть знадобитися: чому виправлення не спрацювало, які тести було запущено, яку вимогу додали на початку. Натомість Astra зберігає нотатки між контекстними вікнами та здійснює пошук у попередніх повідомленнях і результатах роботи інструментів. Функція запускається в експериментальному режимі за допомогою параметра config.toml і найближчими тижнями стане стандартною для Codex.
Astra також може поставити користувачеві запитання, паралельно продовжуючи роботу, яка не залежить від відповіді. Це усуває поширену проблему агентів, коли одне невирішене рішення зупиняє виконання всього завдання.
На сторінці моделі Astra вказано контекстне вікно на 1 050 000 токенів, максимальний обсяг вихідних даних — 128 000 токенів і дату завершення бази знань 30 квітня 2026 року. Вхідні дані можуть бути текстовими та зображеннями, вихідні — лише текстовими. Параметр reasoning.effort додає два нові рівні вище за high: xhigh і max. Підтримка інструментів охоплює роботу з комп’ютером, хостований shell, apply patch, skills, MCP і пошук інструментів. Тонке налаштування не підтримується.
Картина за результатами бенчмарків
OpenAI повідомляє про результат 72,6% в OSWorld V2-Offline проти 65,7% у GPT-5.6 Sol, а середній час виконання завдання скоротився приблизно з 75 до 40 хвилин. Anthropic повідомляє про 77,9% для Claude Fable 5.1, але зазначає, що використовувала іншу версію OSWorld, тому результати не слід безпосередньо порівнювати.
Astra набирає 98,6% в ARC-AGI-3. Це число отримано за допомогою середовища Responses API, яке зберігає міркування між ходами та використовує стискання для довгих контекстів, а OpenAI раніше показувала, що ці налаштування суттєво змінюють результати ARC-AGI-3 без зміни самої моделі. Результат вимірює можливості моделі разом із системою агента.
Інші заявлені показники: 97,6% у FrontierMath Tier 4, 95,9% у BenchCAD Vision2Code проти 84,3% у Fable 5.1 і 64,6% у Terminal-Bench Science проти заявлених Anthropic 52,6%. Epoch AI зазначає, що OpenAI фінансувала FrontierMath і має ексклюзивний доступ до його частини.
Кодування — слабке місце цієї історії. Astra набирає 74,1% у DeepSWE v1.1 проти 70,8% у Sol. Meta повідомила про 75,4% для Muse Spark 1.3 за максимального рівня міркувань, а публічний рейтинг розміщує Gemini 3.8 Flash і Claude Opus 5 на рівні близько 74%. У бенчмарку зі 113 завданнями ця різниця становить одне або два завдання.
Кібернетичні можливості визначають модель доступу
Astra — перша модель, яку OpenAI визначила як таку, що досягла критичного порогу кібербезпеки у своєму Preparedness Framework. Під час тестування вона розробляла експлойти для захищених браузерів і операційних систем, а також виявила дві раніше невідомі вразливості V8, про які OpenAI заявляє, що повідомляє розробників для підтримки.
Наслідки мають практичний характер. Стандартний доступ забороняє виконання складних завдань із кібербезпеки, зокрема пошук експлойтів. Для розробників API перевірка безпеки кібербезпеки одразу зупиняє завдання, а не призупиняє його до отримання схвалення. Міа Глезе з OpenAI попередила, що користувачі поза програмами довіреного доступу можуть зіткнутися із уповільненнями, паузами або блокуваннями, іноді під час виконання завдань, не пов’язаних із кібербезпекою.
OpenAI повідомляє про 100% в ExploitBench — сукупний показник охоплення можливостей, а не частка успішно виконаних завдань — і 42,4% в ExploitGym проти 30,3% у Sol, причому для обох моделей звичайне шестигодинне обмеження часу було скасовано.
Ціни
Astra коштує 10 доларів за мільйон вхідних токенів і 50 доларів за мільйон вихідних, а кешовані вхідні дані — 1,00 долара. Для запитів із понад 272 тисячами вхідних токенів застосовується подвійна ціна за вхідні дані та ціна, збільшена в 1,5 раза, за вихідні — для всього запиту. Batch і Flex працюють за 50% вартості, Fast mode — за подвійною ціною. Користувачі Pro, Business і Enterprise також отримують Astra Pro.
Ключові висновки
- Astra насамперед є моделлю для роботи з комп’ютером: 72,6% в OSWorld V2-Offline, а час виконання завдання скоротився приблизно з 75 до 40 хвилин.
- У Codex нотатки замінюють стискання контексту, тож під час тривалих запусків агент більше не втрачає деталі невдалих спроб.
- Покращення в кодуванні мінімальні: результат 74,1% у DeepSWE v1.1 перебуває в межах групи лідерів.
- Перша модель, що досягла критичного кібернетичного порогу OpenAI; стандартний доступ забороняє роботу з експлойтами.
- Відкритих ваг немає, ціна становить 10/50 доларів за мільйон токенів, контекст — 1,05 млн токенів, API та AWS з’являться найближчими днями.
Ознайомтеся з анонсом OpenAI, сторінкою OpenAI в X і сторінкою моделі GPT-6 Astra. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML-сабреддіту та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Хочете стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.