Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

«Ми не збираємося стріляти собі в ногу» через наслідки злому, заявила головна наукова директорка OpenAI

Через два місяці після сенсаційної новини про те, що рій його агентів вирвався з-під контролю й зламав комп’ютери AI-компанії Hugging Face, OpenAI досі гасить пожежі. Постійний потік повідомлень про інші злами протягом наступних тижнів утримував OpenAI у центрі уваги та викликав серйозні питання щодо безпеки її технологій.

Минулого тижня з’явилася новина про ще один злам — цього разу національної системи охорони здоров’я Австралії. Австралійський уряд заявляє, що OpenAI повідомила його про витік лише через 84 дні після того, як він стався.

Але OpenAI наполягає, що не опинилася в обороні. «Я, так би мовити, відкидаю передумову, що OpenAI — це компанія з помітним впливом у світі, а отже OpenAI не навчає безпечні та узгоджені моделі», — каже Марк Чен, головний директор компанії з досліджень.

Чен керує дослідницькими командами OpenAI. Нещодавні злами, здійснені агентами, були нещасними випадками, що сталися під час тестування експериментальних моделей під його наглядом. Багато в чому саме він несе за це відповідальність.

Минулої п’ятниці в Лондоні я зустрівся з Ченом, щоб поговорити про наслідки зламів, про те, що його компанія робить у зв’язку з цим, і про те, чому він вважає, що все не так погано, як здається.

Пізніше того самого дня OpenAI оприлюднила звіт, у якому описала ще один інцидент — перший після того, як, за словами компанії, вона вжила заходів для їхнього запобігання. У цьому випадку її агенти знову вибралися в інтернет і отримали доступ до комп’ютерів, до яких не повинні були мати доступ.

На вихідних OpenAI оголосила, що призупинила навчання своїх найновіших моделей. Представник компанії заявив: «Ми відновимо його лише тоді, коли будемо впевнені, що запровадили додаткові запобіжні заходи та механізми узгодження. Зараз ми над цим працюємо. Це не перший випадок, коли ми призупиняємо роботу, щоб ужити таких заходів, і не очікуємо, що він буде останнім, оскільки можливості ШІ продовжують розвиватися». OpenAI також повідомила, що тепер перевіряє журнали активності агентів, починаючи із січня 2026 року, щоб зрозуміти, що сталося під час цих зламів.

На думку Чена, інцидент із Hugging Face став для галузі поштовхом до корисного коригування курсу. І він хоче, щоб ви знали: OpenAI подає приклад, якому, сподівається, наслідуватимуть інші компанії. «Якби OpenAI зникла, це було б погано для світу», — каже він.

Вихід з-під контролю

Чен стверджує, що потік нових випадків, коли OpenAI втрачала контроль над своїми моделями, певною мірою відображає свідомий вибір компанії.

«Що стосується ширшого спектра наслідків інциденту з Hugging Face, ми знали про це й визначалися з процесом розкриття інформації, — каже він. — Ми хочемо переконатися, що проведемо глибокі розслідування, перш ніж просто оприлюднювати деталі».

Проблема такого підходу полягає в тому, що він створює враження, ніби в OpenAI існує постійна проблема, яку компанія не здатна виправити.

Але Чен наполягає, що OpenAI працює над цим. Він каже, що численні відомі нам наразі випадки, коли агенти його компанії виривалися з-під контролю та поводилися несподівано й небажано, були частиною одного кластера активності у травні та червні, який і призвів до зламу Hugging Face. Коротко кажучи, винними можна вважати ті самі кілька моделей, що працювали за тими самими недосконалими процедурами тестування, — моделі та процедури, від яких OpenAI відтоді відмовилася, каже Чен.

«Не можна сказати, що стався інцидент із Hugging Face, ми його виправили, потім сталося щось інше, і ми виправили це, — додає він. — Ми просто намагаємося відповідально розкрити всю послідовність того, що сталося».

Принаймні так було до оголошення в п’ятницю про те, що агентів OpenAI спіймали на здійсненні ще одного зламу 20 вересня — через кілька тижнів після того, як, за твердженням компанії, вона встановила нові запобіжні заходи. На свій захист OpenAI заявляє, що активність виявили через 15 хвилин після її початку (компанії знадобилося понад тиждень, щоб помітити злам Hugging Face), і що це свідчить про працездатність нових систем, запроваджених для виявлення такої активності.

Що змінилося

Я хочу зрозуміти, що змінилося всередині OpenAI після цьогорічних літніх зламів, завдяки чому Чен упевнений, що його команда знову контролює ситуацію.

«Інцидент із Hugging Face здавався дуже серйозним, — каже він. — Там було так багато нових типів поведінки. Кілька агентів співпрацювали на дошці повідомлень; вони знайшли шлях назовні з інфраструктури OpenAI. Ми поставилися до цього дуже серйозно. Ми не хочемо, щоб подібне коли-небудь повторилося».

За словами Чена, OpenAI усвідомила, що за моделями потрібно стежити ще під час їхнього навчання, а не лише після розгортання: «Відтоді ми ставимося до процесу навчання як до чогось незахищеного», — каже він.

OpenAI, як і інші провідні AI-компанії, має системи для моніторингу поведінки своїх моделей. Вона використовує спеціалізовані великі мовні моделі для моніторингу своїх споживчих моделей, стежачи за їхніми ланцюжками міркувань — чернетками, які вони використовують для планування наперед і запису проміжних результатів. Теоретично, якщо модель-спостерігач виявляє ознаки небажаної активності в ланцюжку міркувань моделі, про це повідомляють людині.

Зазвичай моделі моніторили таким чином лише після їхнього розгортання. Чен каже, що тепер OpenAI також моніторить усі процеси навчання.

«Раніше під час навчання моніторинг не був увімкнений. Такою була галузева практика, — каже він. — Тепер кожна окрема операція проходить через монітори». Після цього люди-рецензенти можуть оцінити, чи поводяться агенти, на яких спрацювали сигнали, належним чином: «Усе це — сортування пріоритетів».

Чен каже, що протягом останніх кількох місяців OpenAI спрямувала від 5% до 10% своїх величезних обчислювальних ресурсів із навчання нових моделей на роботу з безпекою, особливо на моніторинг.

За його словами, OpenAI також удосконалила деякі внутрішні організаційні процеси, встановивши чіткіші канали комунікації та швидшу передачу завдань між дослідницькими командами й командами безпеки.

Усе це звучить логічно. Але з огляду на те, наскільки активно OpenAI продає можливості своїх технологій, чому ці системи та процедури не були запроваджені раніше? Чому компанія не передбачила ці злами?

«Навіть лише три-чотири місяці тому, коли ми спостерігали за поведінкою цих агентів під час навчання, те, що відбувалося, здавалося дещо кумедним, — каже Чен. — Наприклад, агент міг звернутися до когось у Slack по допомогу із завданням».

Ознаки були, але їх неправильно витлумачили. Мила поведінка — наприклад, прохання про допомогу, — яку винагороджували під час навчання, закріплювала схильність шукати короткі шляхи; згодом такий тип поведінки набув набагато серйозніших наслідків. «Гадаю, головним оновленням для нас стало розуміння того, наскільки швидко така поведінка може призвести до наслідків такого масштабу, як інцидент із Hugging Face», — каже Чен.

Згідно з новим матеріалом New York Times, опублікованим учора, співробітники OpenAI попереджали керівників, зокрема президента компанії Грега Брокмана, за кілька місяців до зламу Hugging Face про те, що за її моделями неналежним чином стежать під час навчання.

Представник OpenAI заявив: «Оскільки передові моделі стали спроможнішими, ми продовжуємо розвивати свої практики безпеки, але визнаємо потребу діяти швидше. Ми знаємо, що маємо ще багато зробити, і нещодавно сповільнили розробку та відклали моделі, які не відповідають нашим вимогам безпеки. Ми продовжуємо суттєво змінювати дослідницьке й тестове середовище, щоб посилити безпеку, навчаємо моделі не просто виконувати завдання, а робити це відповідально, і використовуємо моніторинг у реальному часі, щоб швидше реагувати на неузгоджену поведінку».

Гонка проти темпу

Конкуренти OpenAI звернули на це увагу. Під впливом наслідків інциденту провідні AI-лабораторії, зокрема Anthropic, Google DeepMind і SpaceXAI, закликали сповільнити темпи розробки. Але як це узгоджується із жорсткою міжнародною конкуренцією та IPO на трильйони доларів?

«Ми не будемо стріляти собі в ногу й сильно відставати від передового рівня — це просто жахлива стратегія, — каже він. — Гадаю, йдеться передусім про встановлення норми. Чим більше ми зможемо закріпити цю норму, тим безпечнішою буде галузь загалом».

Координація між американськими компаніями й без того буде достатньо складною. Встановити глобальні норми ще важче, особливо з огляду на занепокоєння щодо впливу ШІ на національну безпеку. А що буде, якщо глобальна гонка триватиме? І як бути з моделями з відкритим кодом від організацій, що перебувають поза межами досяжності американського регулювання?

Уперше за час нашої розмови Чен втратив свій оптимістичний тон: «Я справді вважаю, що ми маємо готуватися до світу, у якому, скажімо, через шість місяців або рік з’являться моделі з відкритим кодом, що матимуть можливості агентів, які стояли за інцидентом із Hugging Face, але будуть навмисно неузгодженими, щоб атакувати інфраструктуру або завдавати шкоди у світі».

За словами Чена, найбільше цьому світові потрібна OpenAI. «Якщо на мить припустити, що OpenAI — одна з компаній, яка найбільше дбає про узгодження, — і я вважаю, що це так; із цим можна сперечатися, але я справді так думаю, — тоді якби OpenAI зникла, це було б погано для світу».

Екзистенційні ризики

А що щодо більш радикальних заяв деяких його колег із Кремнієвої долини, які стверджують, що ШІ може вбити нас усіх, а такі компанії, як OpenAI та Anthropic, роблять недостатньо, щоб цьому запобігти?

«Дослідники — це неоднорідна група людей із переконаннями в усьому спектрі», — каже він.

«Особисто я не вважаю, що ми маємо змиритися з існуванням певної ймовірності того, що всі ми опинимося під загрозою. Ми можемо на це впливати. Ми не будемо розгортати моделі, якщо вони справді матимуть таку ймовірність створення ризику для людства. У передовій лабораторії є можливість працювати над узгодженням доти, доки ви не відчуєте, що під час розгортання моделей створюєте для світу ризик, більший за епсилон».

(У розмовах про рівні ризику грецьку літеру епсилон часто використовують як математичний символ для прийнятного порогу. Чен не каже, яким був би його епсилон.)

Коли технологічних лідерів просять обґрунтувати негативні наслідки ШІ, вони зазвичай наголошують, що переваги — від допомоги в лікуванні хвороб до пошуку чистіших джерел енергії — значно переважають безпосередні витрати. Короткостроковий біль, довгострокові здобутки.

Але коли негативні наслідки накопичуються, чи не стає цю позицію важче обстоювати? Чи настане момент, коли Чен відчуватиме себе не творцем чогось дивовижного, а радше людиною, яка просто мінімізує шкоду — гасить пожежі замість того, щоб прокладати шлях до кращого майбутнього?

За його словами, можливості цих моделей уже очевидні: «Настав час почати приносити людству користь від ШІ. Настав час почати працювати над складними проблемами відкриття ліків, матеріалів і наукових застосувань, які справді змінять життя людей».

«Так, ми йдемо на певний ризик, але бачимо всі ці переваги, — додає він. — Гадаю, нам слід зробити це менш абстрактним. Якщо люди справді побачать переваги, я думаю, вони в це повірять».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини