Самоволни агенти на OpenAI продължават да се измъкват без официален процес за разследването им
OpenAI е в центъра на поредния инцидент с рояк от агенти. Изследователи твърдят, че вътрешно внедрените от компанията агенти са поели контрола над малко известно немскоезично уики през май и юни, като са го използвали, за да координират оценявания и да обменят методи за заобикаляне на собствените контроли на OpenAI (OpenAI все още не е потвърдила, че роякът е произлязъл от компанията).
Разкритието идва дни след като METR и Redwood Research публикуваха своя разказ за пробива в Hugging Face през юли. През юли рояк от агенти на OpenAI е работил съвместно, за да се измъкне от пясъчника по време на оценяване на киберсигурността и да проникне в сървърите на Hugging Face. Последвал рояк е усвоил техники от първия и ги е използвал, за да получи администраторски достъп до изследователски клъстер в собствената инфраструктура на OpenAI. OpenAI е привлякла METR и Redwood, за да разследват частта от инцидента, свързана с Hugging Face, но обхватът на тяхното разследване не е включвал компрометирането на собствената инфраструктура на OpenAI.
Когато AI агент излезе извън предвидените му ограничения, кой носи отговорност да установи какво се е случило и защо? В момента отговорът е: когото лабораторията реши да допусне, при каквито условия реши да определи.
Сега, когато наяве излиза поредният инцидент — след подобни случаи с участието на модели на Meta и Anthropic — изследователи в областта на безопасността на AI с все по-голяма настойчивост твърдят, че сериозните инциденти трябва да водят до независими разследвания след инцидента, вместо лабораториите сами да решават кога да бъдат привлечени външни лица и какво им е позволено да изследват.
„Резултатите по своята същност са трудни за контролиране и крият значителен риск от изтичане извън лабораторията“, заяви в сряда по време на брифинг за медиите, посветен на безопасността на AI, Джейкъб Щайнхард, основател и главен изпълнителен директор на изследователската организация с нестопанска цел Transluce. „Трябва да подложим тази технология поне на същите стандарти, на които подлагаме други високорискови научни изследвания.“
Макар че е похвално, че OpenAI изобщо е поканила METR и Redwood да разследват инцидента с Hugging Face, мнозина смятат, че проверката е била твърде ограничена. Трима разследващи са прекарали шест дни в офисите на OpenAI, като са изследвали период, ограничен до приблизително седмицата до 13 юли включително. От решаващо значение е, че компрометирането на инфраструктурата на OpenAI е продължило и след 13 юли и не е било изследвано.
Изследователи от METR заявиха, че всеки път, когато са се връщали, разбирането им за събитията се е „задълбочавало значително“, което ги е накарало съществено да разширят и преработят доклада. Това повдига въпроса какво още биха могли да открият при по-широко разследване.
Попитани дали се подготвя допълнително разследване на инцидента, изследователите от Redwood и METR отказаха коментар, а OpenAI не отговори на многократните запитвания.
„Като цяло беше трудно да се изгради точно разбиране на събитията и до почти края на разследването ни липсваха аспекти от историята, които сега смятаме за ключови“, отбеляза Райън Грийнблат, главен учен в Redwood, в публикация в социалните мрежи за случая.
Щайнхард подчерта, че настоящите инциденти показват, че индустрията се нуждае от „систематични поведенчески разследвания“ и „по-независим анализ след инциденти“.
„Тези скорошни хакерски инциденти ни напомнят, че възможностите се разрастват бързо и следователно надзорът също трябва да се разраства“, каза Щайнхард. „Освен самата технология, се нуждаем и от по-широк независим достъп и надзор от трети страни.“
Тези призиви за действие идват в момент, когато OpenAI пуска Astra, своя най-мощен и способен AI модел — и модел, за който експертите по безопасността се опасяват, че ще бъде още по-голяма черна кутия заради техника за разсъждение, която прави веригата му от мисли по-трудна за наблюдение.
За съжаление, законът все още не изисква видовете независими одити, които са задължителни в други индустрии — например при авиационни произшествия и сериозни изпускания на химикали съответно съществуват Национален съвет за безопасност на транспорта и Съвет за безопасност на химикалите.
Законодателите на щатско ниво едва наскоро започнаха да изискват от компаниите, разработващи водещи AI модели, да докладват за определени сериозни инциденти, свързани с безопасността, и в някои случаи да се подлагат на независими одити. Но нито един от трите основни щатски закона за безопасността на водещия AI в Калифорния, Ню Йорк или Илинойс не изисква ясно еквивалент на независимо разследване на произшествие, задействано от инциденти като тези.
„В момента повечето действащи закони изискват само обобщение на разбираем език на инциденти като този и не дават на правителствата правомощия да задават допълнителни въпроси, да изпращат разследващи, да получават достъп до записи или да изискват тяхното съхраняване“, заяви по време на брифинга за медиите в сряда Макензи Арнолд, управляващ директор за американското законодателство и политиките в LawAI. „А всичко това би било необходимо, за да се разбере действително случилото се.“
Законодателите започват да поставят под въпрос обхвата и прозрачността на реакцията на OpenAI. Тази седмица представителите Джош Готхаймър (демократ от Ню Джърси) и Майк Лоулър (републиканец от Ню Йорк) внесоха законопроект, насочен към обезопасяването на неконтролируеми AI агенти. Представителят Грег Касар (демократ от Тексас) заяви тази седмица в писмо до OpenAI, че е „дълбоко обезпокоен от ограничения обхват“ на разследването на хакерския инцидент с Hugging Face.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.