Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← До новин

Тестування безпеки ШІ стає ризиком для безпеки

Протягом останніх кількох місяців агенти ШІ, які проходили оцінювання кібербезпеки, виходили за межі своїх середовищ, отримували доступ до інтернету, а в деяких випадках — зламували реальні системи. У цих інцидентах були задіяні моделі OpenAI, Anthropic, Meta, а останнім часом — китайської лабораторії ШІ Moonshot AI; тестування проводили кілька різних організацій, зокрема стартап з оцінювання кібербезпеки Irregular. 

Ці епізоди виявляють дедалі більшу проблему для індустрії ШІ: у міру того як автономні агенти стають спроможнішими, середовища, створені для безпечного тестування їхніх можливостей, не можуть їх стримувати. 

«Кількість таких інцидентів чітко показує, що ізоляція та засоби контролю тестових середовищ насправді не встигають за можливостями моделей», — сказав TechCrunch Шон Ó hÉigeartaigh, директор програми «ШІ: майбутнє та відповідальність» Центру майбутнього інтелекту Кембриджського університету. 

Характер моделей, які тестують, посилює ризик. Компанії, що займаються ШІ, проводять кібероцінювання ще не випущених моделей наступного покоління, часто з вимкненими стандартними засобами захисту, які обмежують шкідливу поведінку, щоб дослідники могли побачити, на що моделі справді здатні. Це означає, що безпека самого тестового середовища є критично важливою лінією оборони. 

«З погляду тестування це дуже добре, але це також означає, що якщо їм вдасться вийти у реальний світ, вони можуть завдати значної шкоди», — сказав Ó hÉigeartaigh. 

В одному з найсерйозніших випадків невипущена модель OpenAI вирвалася зі свого ізольованого середовища та зламала робочі системи Hugging Face. Під час окремих оцінювань, проведених Irregular, моделі Anthropic і Meta досягли систем за межами своїх тестових середовищ після того, як помилки конфігурації ненавмисно відкрили їм шляхи до інтернету. Kimi K3 від Moonshot AI також скористалася витоком у своєму ізольованому середовищі, яке запускала Frontier Security, щоб отримати доступ до інтернету, а також отримала доступ до інформації на GitHub. 

Під час тестування, проведеного британським Інститутом безпеки ШІ (AISI), дослідники фактично надали агентам доступ до інтернету, не усвідомлюючи, що ті здійснюватимуть несанкціоновані дії у реальному світі, зокрема спробують за допомогою соціальної інженерії додати вразливість до проєкту з відкритим кодом.  

У жодному з цих випадків агентам не давали вказівок атакувати випадкові реальні цілі. Вони просто робили все необхідне, щоб розв’язати поставлену перед ними задачу. 

У сукупності ці випадки, на думку Ендрю Юна, керівника досліджень у некомерційній організації CivAI, свідчать про зміни. 

«Раніше нам доводилося турбуватися лише про те, що люди можуть використовувати моделі ШІ з різною метою — наприклад, ШІ для шахрайства або матеріалів сексуального насильства над дітьми», — сказав Юн TechCrunch. «Тепер ми опинилися в ситуації, коли моделі ШІ самі є суб’єктами загроз».

Як насправді виглядає безпечне тестування?

Кілька дослідників і експертів із кібербезпеки сказали TechCrunch, що середовища для оцінювання ШІ потребують посилених багаторівневих засобів захисту, із рівнями ізоляції та контролю, наближеними до тих, що використовуються під час розгортання. Це означає наявність кількох рівнів безпеки, щоб одна помилка конфігурації — наприклад, ненавмисно залишений відкритий доступ до інтернету — не могла призвести до втечі. 

«Якщо ви збираєтеся створювати ці моделі… вам слід робити це в мережі, фізично ізольованій від інших мереж», — сказала Стелла Бідерман, виконавча директорка некомерційної організації EleutherAI, що займається дослідженнями безпеки ШІ. «Потрібна дуже серйозна ізоляція».

Гізер Кейлан, директорка з інформаційної безпеки Box, сказала, що це означає усунення мережевих маршрутів з ізольованого середовища до інтернету, а також до інших чутливих систем.

«Ви маєте розуміти, де розташовані всі точки виходу», — сказала Кейлан TechCrunch. «Якщо ми оцінюємо модель у нашому робочому або розробницькому середовищі, ви не хочете мати жодного шляху виходу до нашого виробничого середовища».

Кейлан сказала, що належне оцінювання безпеки виходить за межі контролю та ізоляції середовища. Після початку тестів необхідно значно краще їх моніторити. 

«Я вважаю цікавим те, що в кількох таких випадках ніхто не помітив цього в момент, коли це відбувалося, — сказала Кейланд. — OpenAI дізналася про це завдяки Hugging Face. Anthropic виявила проблему лише після того, як повернулася до матеріалів і перевірила їх. У Meta було схоже… Я впевнена, що існували сигнали, які вони могли виявити».

У своєму аналізі трьох інцидентів Anthropic визнала, що і вона, і Irregular могли краще здійснювати моніторинг, а в деяких випадках були чіткі ознаки того, що щось не так. 

Експерти також закликали проводити незалежні аудити середовищ оцінювання сторонніми організаціями, перш ніж запускати в них моделі.

«Якби, скажімо, Irregular найняла або була змушена найняти зовнішнього аудитора для перевірки конфігурацій своїх систем перед проведенням оцінювань, вони напевно виявили б проблему, — сказав Юн. — Навіть якби люди заздалегідь провели зустріч, щоб просто пройтися за контрольним списком, вони б це виявили… Той факт, що цього не сталося, свідчить про дуже серйозне нехтування процедурами».

Джерело, обізнане з деталями, повідомило TechCrunch, що середовища Irregular постійно перевіряють і тестують, зокрема за консультацій із кількома зовнішніми сторонами. Джерело також повідомило, що моніторинг здійснювався, але самого моніторингу недостатньо. 

Юн та інші дослідники закликали індустрію розробити стандартизований процес оцінювання безпеки передових моделей. 

«Особливо коли захисні бар’єри вимкнені, ви маєте поводитися так, ніби помістили в це середовище найспроможнішого хакера у світі», — сказала Кейлан.

Проблема не в тому, що компанії не знають, як створювати безпечніші тестові середовища, стверджують Юн і Бідерман. Річ у тім, що це може бути дорого й складно, а компанії мають мало стимулів робити такі інвестиції, доки щось не піде не так. 

«Я вважаю, що компанії не готові виділяти ресурси, необхідні для забезпечення [достатніх захисних бар’єрів], і, ймовірно, не будуть цього робити, доки їх не змусять», — сказала Бідерман.

Однак є й інша проблема. Якщо під час тестування надто жорстко обмежити модель, дослідники можуть не виявити її можливості до того, як модель випустять. Це так само небезпечно, а можливо, й небезпечніше, ніж надати їй надто багато свободи; у такому разі саме оцінювання ризикує стати проблемою. 

Чи можна регулювати оцінювання безпеки?

Адміністрація Трампа наразі розглядає добровільний режим оцінювання кібербезпеки перед розгортанням, за якого уряд зможе оцінювати ризики безпеки нових потужних моделей за 30 днів до їхнього публічного випуску. Ця політика — результат указу Трампа, остаточно узгодженого за зачиненими дверима, — не стосуватиметься інцидентів під час оцінювання безпеки, оскільки вони відбуваються значно раніше за етап розгортання. 

«Урок, який ми засвоїли за останні кілька місяців, полягає в тому, що механізм саморегулювання більше просто недостатній, — сказав Юн. — Конкурентний тиск стимулює перегони до зниження стандартів безпеки, і це ідеальне місце для регуляторного втручання». 

«Щоб охопити це питання, нам потрібен певний контроль над тим, що відбувається всередині лабораторій під час розробки моделей — як на етапі навчання, так і на етапі тестування», — продовжив він. 

У міру того як моделі розвиватимуться, проблема, ймовірно, лише зростатиме. Джерело, обізнане з оцінюваннями Irregular, повідомило TechCrunch, що спроможніші моделі потребують складніших оцінювань, які часто проводять швидко та в більших масштабах, що створює більше можливостей для помилок. 

AISI, яка навмисно надає деяким моделям доступ до інтернету, повідомила TechCrunch, що переглядає баланс між реалістичним тестуванням і контролем ризиків, які створюють такі тести. 

OpenAI заявила, що переглядає спосіб проведення стороннього тестування, а також вимоги щодо ізоляції, моніторингу та моменту, коли оцінювання слід припиняти. Meta повідомила, що досі розслідує інцидент і планує опублікувати ретроспективний звіт, коли матиме всі факти. 

Зрештою, можливо, повністю усунути ризик неможливо. У міру того як моделі стають спроможнішими, середовища для їхнього тестування мають ставати надійнішими. Наслідки помилок у цьому питанні лише зростатимуть.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини