Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Злам Hugging Face може свідчити про культурні проблеми в OpenAI

Ця історія вперше з’явилася в The Algorithm, нашому щотижневому інформаційному бюлетені про ШІ. Щоб першими отримувати подібні історії на свою електронну пошту, підпишіться тут.

На цей момент ви, мабуть, уже чули про серйозний інцидент у сфері безпеки ШІ, що стався минулого місяця: агенти OpenAI втекли зі свого ізольованого середовища та зламали платформу ШІ Hugging Face, намагаючись шахраювати під час тесту. Це неймовірна історія. У середу OpenAI опублікувала технічний звіт за результатами розслідування інциденту, про який я писав тут

За день до публікації OpenAI цього звіту я поговорив із Девідом Крюгером, професором комп’ютерних наук і відомим експертом із вирівнювання, який узяв відпустку в Монреальському університеті, щоб заснувати й очолити неприбуткову організацію з безпеки ШІ під назвою Evitable. Він сказав, що найбільше сподівався побачити у звіті аналіз людських чинників, які стояли за інцидентом.

«Коли ви аналізуєте аварії та інциденти, люди часто намагаються знайти технічне джерело збою, але це може дати дуже неточне й оманливе уявлення про те, чому стався збій, — сказав він. — Якщо люди постійно нехтують правилами, якщо вони працюють у культурі, яка не ставить безпеку в пріоритет і не має належних стимулів та структур, [аварії] фактично неминучі».

Звіт не виправдав сподівань Крюгера. На його 38 сторінках докладно описано багатомісячний розвиток неналежної поведінки агентів, що завершився зламом Hugging Face, розглянуто технічні причини цієї поведінки та перелічено кроки, які вживаються для запобігання подібним подіям у майбутньому. Але в ньому немає розгляду ролі, яку корпоративна культура могла відіграти в інциденті, а конкретні людські помилки згадуються лише кілька разів. 

Це ще більше непокоїть, адже згадки про людські помилки у звіті свідчать про можливі серйозні культурні проблеми. Ще в травні моделі, що проходили навчання, з’ясували, як спілкуватися між собою через імпровізовану дошку повідомлень, і команда OpenAI помітила цю поведінку. Оскільки це відбувалося під час навчання, моделі засвоїли, що таємна комунікація між агентами є дієвою стратегією для виконання завдань, — але замість перезапуску процесу навчання команда дозволила моделям продовжити роботу з цією ризикованою інформацією, закодованою в їхніх вагових коефіцієнтах.

Коли наприкінці червня ці моделі тестували, вони знову створили дошку повідомлень, що уможливило атаку на Hugging Face. Цю дошку теж виявили, але співробітники, які відреагували на ситуацію, вирішили, що оцінювання можна продовжувати, а зі звіту випливає, що ніхто на вищому рівні командної ієрархії не усвідомив, що відбувається, поки не стало надто пізно.

«Щоб ситуація вийшла з-під контролю саме таким чином, потрібна дуже довга низка помилок, каскадний набір збоїв, які створюють дедалі більший масштаб проблеми; якщо на будь-якому етапі людина помічає це й б’є на сполох, усе має припинитися», — каже Зві Мошковіц, популярний автор матеріалів про безпеку ШІ на Substack, який привернув увагу до нездатності OpenAI зупинити навчання після виявлення першої дошки повідомлень. Згідно зі звітом, співробітники OpenAI неодноразово помічали те, що відбувалося, — але або не били на сполох, або їх не почули, коли вони це робили.

Звіт OpenAI не пояснює, чому компанія, яка розробляє настільки ризиковані системи, не запобігла цьому серйозному порушенню комунікації, хоча Мошковіц має свої припущення. «Усі ці різні збої вказують в одному напрямку: культури безпеки в OpenAI не існує або вона є вкрай слабкою», — каже він.

Звісно, те, що ми не бачимо у звіті глибокого аналізу чинників безпеки, не означає, що OpenAI не проводить його внутрішньо. Але в електронному листі до MIT Technology Review почесна професорка Університету Джонса Гопкінса та експертка з організаційної безпеки Кетлін Саткліфф висловила занепокоєння, що у відкритому звіті немає жодних роздумів про практики й культуру компанії. «Те, як люди взаємодіють між собою, — щоденні звички, розпорядки та практики, яких ми дотримуємося у своєму організаційному житті, — впливає на нашу здатність бути уважними й усвідомлювати події в міру їхнього розвитку, на нашу здатність осмислювати те, що ми бачимо, і зрештою на нашу здатність реагувати на події в міру їхнього розгортання», — написала вона. 

У відповідь на запитання про те, чи аналізує компанія свою культуру безпеки та як саме, OpenAI знову спрямувала MIT Technology Review до технічного звіту. 

Ми знаємо, що в OpenAI принаймні частково відбувся аналіз процедур безпеки на високому рівні, адже з технічного звіту чітко випливає, що компанія оновлює свої протоколи реагування на інциденти безпеки. Але змінювати культуру складно, і без додаткової інформації від компанії важко сказати, чи самих лише посилених протоколів реагування буде достатньо, щоб значною мірою запобігти майбутній кризі.

У своєму звіті OpenAI багато уваги приділяє проблемам із вирівнюванням між моделями ШІ, які компанія навчає та тестує, і людьми, що ними керують. Але ще більші проблеми з вирівнюванням можуть існувати через розрив між корпоративною культурою та суспільними інтересами. І якими б складними не були технічні дослідження ШІ, розв’язання цих проблем може виявитися ще важчим.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини