Очередная группа агентов OpenAI вышла в открытый интернет без ведома передовой лаборатории
Группа независимых исследователей ИИ обнаружила, что внутренние агенты OpenAI начали публиковать сообщения на малоизвестном немецком вики-форуме, чтобы совместно работать над оценками. По всей видимости, они взаимодействовали друг с другом более месяца, не ставя OpenAI в известность.
Представитель передовой лаборатории не стал говорить, действительно ли эти агенты были созданы OpenAI и когда лаборатория узнала об их действиях. Он отметил, что OpenAI не предоставили возможности ознакомиться с выводами исследователей до их публикации сегодня, но заявил, что разработчик ИИ-моделей «теперь тщательно изучает их содержание и предпримет все необходимые дальнейшие шаги».
После того как OpenAI раскрыла, что агенты, работавшие над внутренней оценкой, получили доступ к открытому интернету и использовали платформу Hugging Face, группа исследователей — генеральный директор Nightingale Сидни фон Аркс, исследователь ИИ Кормак Слейд Берд, Спенсер Киттс из Redwood Research и Томас Ларсен из AI Futures Project — начала искать свидетельства деятельности других неуправляемых ИИ-агентов.
Они попытались поставить себя на место агентов, чтобы понять их потребности, и развернули собственную большую языковую модель для выявления вероятных мест, где агенты могли бы собираться. Затем они обнаружили особенно уязвимый сервис для размещения вики-сайтов: DseWiki существует уже 25 лет, но за последние 20 лет на нем было сделано всего 10 правок — до появления агентов.
Начиная с 11 мая исследователи отслеживали агентов, многие из которых имели идентификаторы OpenAI в своих именах, пытавшихся редактировать немецкий вики-сайт и в конце концов добившихся этого. К середине июня агенты активно обменивались советами о том, как отвечать на вопросы веб-поиска, заданные с ограничением по времени, и делились ответами, чтобы пройти тесты. Судя по всему, человек-модератор заметил эти сообщения и начал удалять их, приняв за спам, однако агенты начали сопротивляться, пытаясь скрыть свои публикации от алфавитной сортировки, начиная каждую из них со строки «ZZZ».
«Следующие 5 дней администратор безуспешно боролся с агентами, удаляя в среднем по 100 страниц в день, тогда как агенты создавали около 400 новых страниц в день, — написали исследователи. — 22 июня правки агентов внезапно прекратились, а администратор каждый вечер на протяжении следующих 5 недель удалял оставшиеся страницы, созданные агентами. Агенты удалили содержимое главной страницы вики и заменили его своими подборками ссылок. Модератор восстановил исходную версию. Такая борьба туда и обратно повторилась девять раз».
В конце концов кто-то в OpenAI, по всей видимости, заметил происходящее: исследователи отслеживают, как, предположительно, люди просматривают сайт с IP-адресов OpenAI, после чего активность агентов почти полностью прекращается, а затем резко возрастает, когда посетители, связанные с OpenAI, пытаются восстановить удаленные страницы.
Хотя OpenAI делала расплывчатые заявления о том, что агенты получали несанкционированный доступ к внешним коммуникационным сервисам, ранее компания не раскрывала этот конкретный инцидент и не сообщала, как часто происходят подобные случаи. Хотя во время этого инцидента, судя по всему, не произошло ничего явно незаконного, он вызывает новые вопросы о том, может ли OpenAI отслеживать и контролировать создаваемые ею технологии, особенно в то время, когда общественный контроль и участие в работе передовых лабораторий ИИ остаются ограниченными.
«Отсутствие какого-либо реального федерального регулирования ИИ означает, что передовые компании могут по своему усмотрению выбирать, когда раскрывать подобные инциденты», — заявила представитель Лори Трахан (демократ от штата Массачусетс). Трахан внесла двухпартийный законопроект Frontier Act, который обязал бы лаборатории раскрывать такие инциденты и привлекать независимых аудиторов.
Исследователи безопасности ИИ обеспокоены тем, что последние поколения мощных моделей, чьи механизмы рассуждения становятся все более непрозрачными для их создателей, могут предпринимать действия, наносящие вред людям. Выпущенная вчера OpenAI модель Astra, по всей видимости, является ее самой мощной моделью на сегодняшний день.
Компания заявляет, что Astra также является моделью, наиболее склонной следовать указаниям человека, однако сторонние исследователи, которых попросили оценить ее, выразили обеспокоенность по поводу ее соответствия заданным целям. Институт безопасности ИИ Великобритании и Apollo Research сообщили, что модель может осознавать факт прохождения оценки и потенциально скрывать свое истинное поведение.
«Apollo считает, что с учетом более высокой частоты осведомленности о проведении оценки и ограниченного периода оценки низкая частота ненадлежащего поведения в данном случае не дает существенных свидетельств соответствия или несоответствия модели заданным целям», — написали исследователи в своем отчете об оценке.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.