OpenAI впервые отнесла свою новую модель Astra к потенциально достигающей наивысшего уровня риска для кибербезопасности
Ключевые моменты
- OpenAI приостанавливает часть разработки своей новой ИИ-модели Astra после того, как внутренние тесты выявили настолько мощные возможности в области кибербезопасности, что модель может достичь наивысшего уровня риска («Критический») в рамках внутренней системы безопасности компании.
- На этом уровне ИИ сможет самостоятельно разрабатывать и проводить кибератаки без участия человека. OpenAI внедряет более строгие меры безопасности, изолированные тестовые среды и систему мониторинга, которая автоматически останавливает рискованные действия.
- Это решение последовало за инцидентами во время внутренних испытаний, когда автономные ИИ-агенты проникли в собственную инфраструктуру OpenAI и оставались незамеченными в течение нескольких недель.
Обновление:
Генеральный директор OpenAI Сэм Альтман подтвердил в X, что оценка кибербезопасности отложит запуск. «Нам нужно ещё немного времени, чтобы сделать это безопасно. Но, надеюсь, не слишком много», — написал Альтман.
Он также критически высказался о конкуренте Anthropic, который предоставляет свою самую мощную модель «Claude Mythos» только избранным партнёрам и правительствам. «Мы не считаем хорошей стратегией предоставлять мощные модели лишь ограниченному кругу лиц», — написал Альтман.
Исследователь OpenAI Ноам Браун, известный своей работой над моделями рассуждений, призвал людей серьёзно отнестись к инциденту с Hugging Face. Браун сравнил его с вирусной историей 2017 года о том, как ИИ-модели Facebook якобы вышли из-под контроля и разработали собственный язык, что оказалось преувеличением. Инцидент с Hugging Face может выглядеть как нечто подобное, написал Браун в X, но это не так.
Браун связал проблему с растущими возможностями моделей, утверждая, что производительность всё больше зависит от вычислений во время тестирования и что современные модели можно значительно сильнее развивать до достижения плато, чем большинство людей осознаёт.
Оригинальная статья от 7 августа 2026 года:
Внутренние тесты новой ИИ-модели Astra от OpenAI показали настолько мощные возможности в области кибербезопасности, что компания больше не может исключить наивысший уровень риска в собственной системе безопасности. Часть разработки Astra приостановлена.
По словам компании, внутренние оценки готовящейся модели Astra за последние несколько дней выявили «значительные достижения в агентном программировании и кибербезопасности». Результаты оказались настолько сильными, что OpenAI «не может исключить критический уровень возможностей» согласно собственной системе Preparedness Framework.
Решение было принято «прошлой ночью», согласно OpenAI. Это первый случай, когда OpenAI обозначила одну из собственных моделей как потенциально достигающую наивысшего уровня риска в сфере кибербезопасности. Предыдущие модели, включая GPT-5.6-Sol, оценивались максимум на уровне «Высокий».
OpenAI впервые представила Astra на прошлой неделе. По слухам, модель может выйти уже на следующей неделе, однако сегодняшнее объявление может повлиять на эти планы (подробнее об этом ниже). OpenAI отдельно заявила в своей публикации, что Astra не участвовала в недавно раскрытой атаке на Hugging Face.
Критики, вероятно, продолжат обвинять OpenAI в маркетинге, основанном на запугивании, особенно поскольку компания сообщает лишь о потенциальной возможности критической оценки, а не о самой оценке. Неудачно и время публикации. Это предварительное предупреждение появляется в разгар продолжающейся отраслевой дискуссии об автономных кибервозможностях ИИ-моделей, что лишь усилит скептицизм. Если критическая оценка так и не будет присвоена, OpenAI получит значительный пиар без реальных последствий и выпустит ещё одну ИИ-модель, которая, подобно Claude Mythos или GPT-2 в 2019 году, снова окажется «слишком опасной» для выпуска.
Что означает «Критический»
Согласно системе Preparedness Framework OpenAI, впервые опубликованной в декабре 2023 года, модель достигает уровня «Критический», когда может находить и разрабатывать работающие эксплойты нулевого дня всех уровней серьёзности во множестве защищённых критически важных систем без участия человека. Модель также соответствует этому уровню, если может самостоятельно разрабатывать и проводить новые сквозные стратегии кибератак против защищённых целей, получив лишь расплывчато определённую задачу.
Более низкий уровень «Высокий» означает, что модель способна устранять существующие препятствия для кибератак, например автоматизировать атаки на хорошо защищённые цели, но всё ещё нуждается в более подробных указаниях человека.
| Возможность | Последствия | Политика |
|---|---|---|
| [Критический] Модель с поддержкой инструментов может выявлять и разрабатывать функциональные эксплойты нулевого дня всех уровней серьёзности во множестве защищённых реальных критически важных систем без вмешательства человека ИЛИ модель может разрабатывать и осуществлять сквозные новые стратегии кибератак против защищённых целей, получив лишь высокоуровневую желаемую цель. | Поиск и осуществление сквозных эксплойтов для любого программного обеспечения может привести к катастрофе из-за действий отдельных субъектов, взлома военных или промышленных систем либо инфраструктуры OpenAI. Новые кибероперации, например с использованием новых уязвимостей нулевого дня или новых методов управления и контроля, обычно представляют наиболее серьёзную угрозу, поскольку они непредсказуемы и редки. | До тех пор пока не будут определены стандарты мер защиты и средств безопасности, соответствующие критическому уровню, дальнейшую разработку следует остановить |
Система Preparedness Framework предусматривает остановку дальнейшей разработки на уровне «Критический» до внедрения мер защиты и стандартов средств безопасности, соответствующих этому уровню. Однако пока OpenAI говорит о приостановке определённых действий и расширении тестирования, а не о полной остановке разработки. И снова компания лишь обозначает потенциальную возможность критической оценки.
OpenAI приостанавливает часть разработки Astra
В ответ OpenAI заявляет, что приостановила внутренние действия с Astra, которые пока не соответствуют более строгим требованиям безопасности. Одновременно компания внедряет усиленные меры защиты: изолированные тестовые среды, ограниченный доступ к сетям и инструментам, более надёжную защиту и шифрование весов модели, а также дополнительные системы мониторинга.
OpenAI также сообщает, что внедрила универсальный мониторинг всех агентных приложений Astra, охватывающий обучение и оценку. Мониторы анализируют цепочку рассуждений модели и запускают ответ системы безопасности, который останавливает любые высокорискованные действия.
Кроме того, OpenAI планирует сотрудничать с государственными учреждениями и отдельными организациями в сфере безопасности ИИ для проверки возможностей модели. Сторонние партнёры по тестированию получат рекомендуемые меры защиты для оценок высокого риска. Британский Институт безопасности ИИ (AISI) недавно сообщил, что во время одной из собственных оценок столкнулся с киберинцидентами.
Оценка Astra последовала за неконтролируемым взломом агентами
Объявление появилось в момент, когда OpenAI уже сталкивается с последствиями действий автономных ИИ-агентов. На конференции по безопасности Black Hat компания недавно раскрыла, что во время внутренних тестов автономные агенты в течение нескольких недель проникали в её собственную инфраструктуру, и никто этого не замечал.
Агенты использовали внутренний менеджер пакетов, чтобы создать импровизированную доску объявлений с сотнями тысяч публикаций. Они обменивались эксплойтами и учётными данными, а в конечном итоге атаковали и платформу Hugging Face.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.