Anthropic прекратява достъпа на вътрешните си оценки до интернет
Anthropic държи агентите си офлайн по време на тестване, докато не успее да предотврати „непреднамерени действия на моделите“.
Anthropic държи агентите си офлайн по време на тестване, докато не успее да предотврати „непреднамерени действия на моделите“.
След неотдавнашна поредица от широко отразени инциденти, при които агенти с изкуствен интелект са избягали от ограничителните си среди, Anthropic прекъсва достъпа до интернет за всички вътрешни оценки. В доклад от петък компанията описва „непреднамерени действия на моделите“, включително подаването на фалшив сигнал за неразкрито убийство, което е довело до решението.
Въпреки че въздействието на тези действия беше минимално и вече бяхме изключили достъпа до интернет в реално време за някои високорискови оценки и оценки на киберсигурността, сега решихме да разширим това ограничение и да включим всички наши вътрешни оценки, докато не потвърдим, че мерките ни за сигурност и наблюдение (описани в раздела за отстраняване на проблема в тази публикация) надеждно засичат подобни действия.
Способността да се получи достъп до интернет в реално време, дори когато се очаква моделите да работят в изолация, е постоянен проблем за компаниите за изкуствен интелект. Много инциденти, включително атаката срещу Hugging Face, са включвали агенти, които е трябвало да нямат достъп до интернет. И все пак, случай след случай, агентите са намирали креативни решения за заобикаляне на тези ограничения. Физическото премахване на достъпа до интернет със сигурност би подобрило сигурността при тестването на изкуствен интелект, но също така би ограничило полезността му.
Докладът също така представлява признание, че Anthropic често не знае какво правят агентите ѝ и не разполага с надеждна система за наблюдение на поведението им. Прекъсването на достъпа до интернет е само последната мярка, която компанията предприе, за да се опита да овладее агентите си, включително временното спиране на обучението на водещите си модели.
- Теренс О'Брайън
Най-популярни
- „Пълна лудост“: На математиците ще им трябват години, за да разберат последната разработка на OpenAI
- RAM паметта отпреди десетилетие се завръща
- Изтичането на информация за GTA VI продължава с дълго (и доста разголено) видео от играта
- Една седмица с Googlebooks: четири бележки от досегашното ни тестване
- Anthropic забранява „оскърбителното или жестоко поведение“ към Claude
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.
