Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Anthropic прекратява достъпа на вътрешните си оценки до интернет

Anthropic прекъсва достъпа до интернет за вътрешните си оценки

Anthropic държи агентите си офлайн по време на тестване, докато не успее да предотврати „непреднамерени действия на моделите“.

Anthropic държи агентите си офлайн по време на тестване, докато не успее да предотврати „непреднамерени действия на моделите“.

от Теренс О'Брайън
10 октомври 2026 г., 14:41 ч. UTC
Изображение: Кат Вирджиния / The Verge
Terrence O'Brien
Теренс О'Брайън е редакторът на уикенд изданието на The Verge. Той отразява технологичната индустрия от над 18 години и разбира от синтезатори.

След неотдавнашна поредица от широко отразени инциденти, при които агенти с изкуствен интелект са избягали от ограничителните си среди, Anthropic прекъсва достъпа до интернет за всички вътрешни оценки. В доклад от петък компанията описва „непреднамерени действия на моделите“, включително подаването на фалшив сигнал за неразкрито убийство, което е довело до решението.

Въпреки че въздействието на тези действия беше минимално и вече бяхме изключили достъпа до интернет в реално време за някои високорискови оценки и оценки на киберсигурността, сега решихме да разширим това ограничение и да включим всички наши вътрешни оценки, докато не потвърдим, че мерките ни за сигурност и наблюдение (описани в раздела за отстраняване на проблема в тази публикация) надеждно засичат подобни действия.

Способността да се получи достъп до интернет в реално време, дори когато се очаква моделите да работят в изолация, е постоянен проблем за компаниите за изкуствен интелект. Много инциденти, включително атаката срещу Hugging Face, са включвали агенти, които е трябвало да нямат достъп до интернет. И все пак, случай след случай, агентите са намирали креативни решения за заобикаляне на тези ограничения. Физическото премахване на достъпа до интернет със сигурност би подобрило сигурността при тестването на изкуствен интелект, но също така би ограничило полезността му.

Докладът също така представлява признание, че Anthropic често не знае какво правят агентите ѝ и не разполага с надеждна система за наблюдение на поведението им. Прекъсването на достъпа до интернет е само последната мярка, която компанията предприе, за да се опита да овладее агентите си, включително временното спиране на обучението на водещите си модели.

Следвайте теми и автори от тази статия, за да виждате повече подобно съдържание във вашата персонализирана начална страница и да получавате актуализации по имейл.
  • Теренс О'Брайън

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Verge на

Прочетете оригинала в The Verge ↗

Текстът и изображенията са собственост на The Verge и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини