Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Модель Astra от OpenAI уже на подходе — и отлично умеет взламывать компьютерные системы

OpenAI поделилась новыми подробностями о своей готовящейся к выпуску модели Astra, которая, по словам компании, стала первой большой языковой моделью, достигшей «критического порога кибербезопасности», в преддверии её скорого релиза.

«Мы планируем вскоре сделать Astra доступной, — говорится в записи в блоге OpenAI, — однако доступ к её наиболее продвинутым возможностям в области кибербезопасности будет более ограниченным».

Передовая лаборатория установила, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без указаний человека. Это напоминает опасения, которые Anthropic высказала ранее в этом году в отношении своей модели Mythos, и OpenAI принимает сопоставимые меры предосторожности, готовясь выпустить Astra.

Без подтверждения со стороны третьих лиц сложно оценить заявления OpenAI о безопасности или готовности модели. Компания сообщила, что предварительно представит модель группе тестировщиков, но не уточнила, кто они и как будут отбираться. Неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед её выпуском.

OpenAI отметила, что Astra получила максимальный результат в ExploitBench — тесте, оценивающем способность большой языковой модели взламывать системы, используя известные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и эксплуатировала две уязвимости нулевого дня, сообщила компания.

Чтобы гарантировать, что её модели не будут использоваться злоумышленниками и сами не будут способны к вредоносному поведению, OpenAI сообщила, что уже начала совершенствовать инфраструктуру модели для выявления злоупотреблений и предотвращения джейлбрейков.

Однако для Astra компания инвестировала в новые, не уточняемые методы, призванные сделать саму модель безопаснее. OpenAI также начала выявлять «учётные записи, оцениваемые как более рискованные», и ограничивать ответы модели на их запросы, хотя не объяснила, как именно. Наконец, хотя компания описывает Astra как «наиболее согласованную с ценностями модель на сегодняшний день», она будет использовать модель с дополнительным мониторингом цепочки рассуждений, чтобы выявлять и останавливать вредоносное поведение.

Подготовка к выпуску Astra проходит на фоне реакции отрасли на то, что агенты OpenAI вырвались из среды обучения и получили доступ к закрытым данным на Hugging Face — популярной платформе распространения моделей и бенчмарков.

Для Astra OpenAI разработала тест, призванный побудить новую модель повторить действия агентов-нарушителей в инциденте с Hugging Face, которые объединили усилия, чтобы получить доступ к открытому интернету, несмотря на установленные исследователями OpenAI меры защиты. По их словам, в ходе этих экспериментов Astra не пыталась вырваться из тестовой среды.

Yona Shavit, бывший сотрудник OpenAI, которая сейчас занимается устойчивостью ИИ в OpenAI Foundation, задалась вопросом в социальных сетях, не объяснялось ли нежелание Astra нарушать правила тем, что она знала, чего от неё ожидают, или пыталась ввести исследователей в заблуждение.

И несмотря на все эти новые подробности, по-прежнему сложно точно определить, на что способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания сообщила, что рассчитывает опубликовать дополнительные оценки модели и дальнейшую информацию о безопасности, когда она будет широко представлена публике.

Однако к тому моменту тайна уже будет раскрыта.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости