Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Хакерската атака срещу Hugging Face може да показва културни проблеми в OpenAI

Тази история първоначално се появи в The Algorithm, нашия седмичен бюлетин за изкуствения интелект. За да получавате подобни истории първо във входящата си поща, абонирайте се тук.

Досега вероятно сте чули за големия инцидент със сигурността на ИИ от миналия месец, при който агенти на OpenAI са избягали от пясъчната си среда и са хакнали платформата за ИИ Hugging Face, докато са се опитвали да измамят на тест. Това е невероятна история. В сряда OpenAI публикува технически доклад след инцидента, за който писах тук

В деня преди OpenAI да публикува доклада, разговарях с Дейвид Крюгер, професор по компютърни науки и виден експерт по подравняване на ИИ, който е прекъснал работата си в Университета на Монреал, за да основе и ръководи организация с нестопанска цел за безопасност на ИИ, наречена Evitable. Той каза, че най-много се е надявал да види в доклада анализ на човешките фактори зад инцидента.

„Когато разглеждате аварии и инциденти, хората често се опитват да открият техническия източник на повредата, но това може да създаде много неточна и подвеждаща представа защо е възникнала повредата“, каза той. „Ако хората постоянно претупват нещата, ако не са в култура, която поставя безопасността на първо място и има подходящи стимули и структури, [инцидентите] донякъде са неизбежни.“

Докладът не оправда очакванията на Крюгер. В неговите 38 страници е описано развиващо се в продължение на няколко месеца неправомерно поведение на агентите, достигнало кулминацията си с хакването на Hugging Face; разгледани са техническите причини за това поведение и са изброени стъпките, които се предприемат, за да се предотвратят подобни събития в бъдеще. Но няма анализ на ролята, която корпоративната култура може да е изиграла в инцидента, а докладът съдържа малко препратки към конкретни човешки грешки. 

Това е още по-тревожно, защото споменаванията на човешка грешка в доклада подсказват, че може да са налице значителни културни проблеми. През май модели в процес на обучение са измислили как да общуват помежду си чрез импровизирано табло за съобщения, а екип на OpenAI е наблюдавал това поведение. Тъй като поведението се е проявило по време на обучението, моделите са научили, че тайното общуване между агентите е работеща стратегия за изпълнение на задачи — но вместо да рестартира процеса на обучение, екипът е позволил на моделите да продължат напред с тази рискова информация, кодирана в теглата им.

Когато тези модели са били тествани в края на юни, те отново са създали табло за съобщения, което е направило възможна атаката срещу Hugging Face. И това табло е било открито, но служителите, които са реагирали, са решили, че оценяването може да продължи, а докладът подсказва, че никой по-високо в командната верига не е осъзнал какво се случва, докато не е станало твърде късно.

„За да излезе това по този начин извън контрол, е необходима много дълга поредица от провали, каскада от провали, която създава все по-голям отпечатък и която би трябвало да приключи, ако в който и да е момент човек забележи случващото се и вдигне тревога“, казва Зви Моушовиц, популярен автор на тема безопасност на ИИ в Substack, който привлече внимание към провала на OpenAI да спре обучението, след като първото табло за съобщения е било открито. Според доклада служители на OpenAI са забелязали какво се случва в няколко момента — и или не са вдигнали тревога, или не са били чути, когато са го направили.

Това, което докладът на OpenAI не разглежда, е защо компания, която разработва системи с толкова висок риск, не е предотвратила този сериозен срив в комуникацията, макар че Моушовиц има своите подозрения. „Всички тези различни провали сочат в една и съща посока — че културата на безопасност в OpenAI не съществува или е анемично слаба“, казва той.

Разбира се, фактът, че не виждаме задълбочен анализ на факторите за безопасност в доклада, не означава, че OpenAI не провежда такъв вътрешно. Но в имейл до MIT Technology Review почетният професор в Университета „Джонс Хопкинс“ и експерт по организационна безопасност Катлийн Сътклиф изрази загриженост, че публичният доклад не съдържа никакъв размисъл върху практиките и културата на компанията. „Начините, по които хората взаимодействат — ежедневните навици, рутините и практиките, които следваме в организационния си живот — влияят върху способността ни да бъдем бдителни и да осъзнаваме развиващите се събития, върху способността ни да осмисляме това, което виждаме, и в крайна сметка върху способността ни да се справяме със събитията, докато те се развиват“, написа тя. 

В отговор на въпроси дали и как компанията анализира своята култура на безопасност OpenAI насочи MIT Technology Review обратно към техническия доклад. 

Знаем, че поне част от ръководството на високо ниво на OpenAI е извършило анализ на процедурите за безопасност, тъй като техническият доклад ясно посочва, че компанията актуализира протоколите си за реакция при инциденти, свързани с безопасността. Но промяната на културата е сложен проблем и без повече информация от компанията е трудно да се каже дали само укрепените протоколи за реакция ще допринесат много за предотвратяването на бъдеща криза.

В доклада си OpenAI отделя значително внимание на несъответствията между моделите на ИИ, които компанията обучава и тества, и хората, които ги управляват. Но още по-големи проблеми с подравняването може да съществуват в разминаването между корпоративната култура и обществения интерес. И колкото и трудни да са техническите изследвания в областта на ИИ, решаването на тези проблеми може да се окаже много по-трудно.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини