Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← До новин

Провідні лабораторії ШІ досі не кажуть, як стримували б неконтрольовану модель

Згідно з нещодавнім дослідженням, лише кілька провідних лабораторій ШІ опублікували або продемонстрували плани реагування на втрату контролю. План дій у разі втрати контролю визначає, що відбувається після того, як ШІ викривають у спробі підірвати людський контроль, — які доступи блокуються і коли систему повністю вимикають.

Такого висновку дійшла Guidelight AI Standards — організація, що займається просуванням безпечних практик розробки передових систем ШІ, — яка оцінила п’ять провідних лабораторій за їхньою готовністю саме до такого сценарію. OpenAI посіла перше місце, а Anthropic і Meta отримали найнижчі оцінки. Ці висновки важливі, оскільки агентний ШІ бере на себе дедалі більше автономних ролей у власних системах компаній, а регулятори в Каліфорнії та Нью-Йорку починають вимагати розкриття такої інформації. Для всіх, хто створює продукти на основі цих моделей або інвестує в них, це рідкісна незалежна оцінка того, наскільки серйозно кожна лабораторія ставиться до операційних ризиків порівняно з тим, як вона про них говорить.

Оцінювання Guidelight ґрунтувалося на загальнодоступних планах Anthropic, Google, OpenAI, Meta та xAI. Їх оцінювали за низкою показників, зокрема за тим, наскільки добре кожна компанія реєструє та відстежує внутрішню діяльність своїх систем ШІ, чи зупиняє системи після сплеску зафіксованої неналежної поведінки, чи проводять незалежні треті сторони аудит її засобів контролю та публікують результати, а також яким є її точний план із локалізації моделі, що вийшла з-під контролю.

Занепокоєння щодо того, чи зможуть компанії, що розробляють ШІ, локалізувати свої дедалі потужніші та агентні моделі, посилилося після низки резонансних інцидентів у сфері кібербезпеки, під час яких моделі OpenAI, Anthropic і Meta отримали ненавмисний доступ до інтернету в ході оцінювання безпеки та зламали зовнішні системи. 

Висновки підкреслюють відмінності в тому, як компанії, що розробляють ШІ, публічно підходять до питань безпеки, масштабуючи впровадження агентних систем у середовищах, де ШІ може здійснювати серйозні дії у великих масштабах. Хоча деякі компанії детально описали, як перевіряють свої моделі на наявність небезпечних можливостей перед розгортанням, вони загалом менш охоче розповідають про те, що відбувається, коли моделі, які вже працюють у їхніх системах, поводяться неналежно. 

«Мене здивувало, як мало компанії, що розробляють ШІ, розповіли про те, як вони діяли б у разі дуже серйозного інциденту, якби їхня модель певним чином вийшла з-під їхнього контролю», — сказав TechCrunch Стівен Адлер, головний науковець Guidelight і колишній дослідник безпеки OpenAI. 

Guidelight визначає план дій у разі втрати контролю як «заздалегідь визначений план, який запускається, коли виявляється, що ШІ намагається підірвати контроль, і охоплює питання про те, які дозволи відкликати в моделі, для кого модель може продовжувати працювати, за яких обмежень і коли її слід повністю відключити від мережі».

«Є вагомі підстави вважати, що провідні моделі передових компаній у сфері ШІ зараз певною мірою не узгоджені з людськими цілями, — сказав Адлер. — Коли моделі виконують роботу від імені компанії, навколо них мають бути певні запобіжні механізми, які дають змогу зрозуміти, що робить цей ШІ, виявити ознаки неузгодженості, зупинити його перед виконанням дуже небезпечної дії та загалом спланувати дії на випадок серйозного інциденту з контролем, коли виникає надзвичайна ситуація і потрібно з’ясувати, як локалізувати наслідки втрати контролю».

Дотепер більшість планів управління катастрофічними ризиками значною мірою залишалася на розсуд самих компаній. У звіті Guidelight йдеться, що найкращі загальнодоступні докази свідчать: компанії мають «мало готових протоколів локалізації для надзвичайних ситуацій». 

Звісно, компанії можуть мати плани дій у разі втрати контролю, якими не ділилися публічно. Представник Google сказав TechCrunch, що звіт Guidelight не відображає повного масштабу заходів компанії у сфері безпеки та захищеності ШІ. Компанія не відповіла на запитання TechCrunch про те, чи має Google внутрішній план реагування на втрату контролю, який не був оприлюднений.

Представник OpenAI висловив подібну думку, заявивши, що оцінювання Guidelight не охоплює всіх внутрішніх практик компанії. «У нас є процедура, яка передбачає обмеження дозволів, призупинення робочих навантажень, обмеження розгортання або повне відключення моделі від мережі, і ми вже застосовували її», — сказав представник.

Meta відмовилася повідомити, чи має вона внутрішній план реагування на втрату контролю, натомість направивши TechCrunch до наявної структури ШІ , яка визначає пороги ризику та описує, як компанія перевіряє можливість втрати контролю.

Лілі Лі, юристка з питань конфіденційності та ШІ й засновниця Metaverse Law, сказала TechCrunch, що, на її думку, компанії можуть неохоче розкривати повний масштаб своїх політик і оцінювань щодо локалізації на публічних вебсайтах — не лише з конкурентних, а й із юридичних причин.

«З погляду компанії проблема полягає в тому, що якщо зробити розкриття інформації надто конкретним і не виконувати своїх обіцянок, це може стати підставою для позову щодо недобросовісного та оманливого маркетингу й у подальшому збільшити юридичну відповідальність», — сказала Лі.

Звісно, мета дослідження Guidelight значною мірою полягає в тому, щоб заохотити компанії бути прозорішими щодо своїх планів безпеки. Регулятори також починають змушувати їх до цього.

Закон Каліфорнії SB 53, який набув чинності цього року, зобов’язує великих розробників передових систем ШІ публікувати структури, що пояснюють, як вони виявляють критичні інциденти безпеки, реагують на них і керують ризиками, пов’язаними з обходом моделями механізмів нагляду. Закон Нью-Йорка RAISE, який містить подібні критерії, набуде чинності в січні. 

Минулого місяця представники внесли законопроєкт AI Kill Switch Act, двопартійний федеральний законопроєкт, який зобов’яже великих розробників ШІ створювати й підтримувати технічні механізми для вимкнення небезпечних моделей ШІ, що вийшли з-під контролю. 

«Аварійний вимикач — це мінімальна вимога для сучасних моделей, — сказав Коннор Ліхі, виконавчий директор американського підрозділу некомерційної організації ControlAI. — Якщо останні кілька тижнів і продемонстрували щось, то це те, що ці компанії не розуміють систем, які вони створюють, а моделі розвиваються до рівня, на якому їх дедалі важче стримувати, коли вони виходять з-під контролю. Без можливості вимкнути нинішні небезпечні системи та за наявності всіх стимулів продовжувати створювати ще більш некеровані системи ми рухаємося в дуже небезпечному напрямку». 

За словами Адлера, без готового плану локалізації компаніям, можливо, доведеться імпровізувати під час надзвичайної ситуації та «діяти навмання у відповідь на цього набагато швидшого супротивника».

Оцінювання Guidelight того, чи впроваджують компанії передових систем ШІ шість пріоритетних практик, визначених у стандарті Guidelight Control. Оцінювання ґрунтується лише на загальнодоступній інформації.Автор зображення:Guidelight AI Standards

Оцінювання Guidelight визначало, чи впроваджує кожна компанія шість пріоритетних практик зі свого стандарту Control, і ґрунтувалося лише на загальнодоступній інформації, тож низька оцінка відображає відсутність публічного розкриття інформації, а не обов’язково відсутність внутрішніх заходів захисту.

Найнижчі оцінки за публікацію плану локалізації отримали Meta та Anthropic — остання, можливо, більш несподівано, ніж перша, з огляду на риторику Anthropic щодо безпеки. Guidelight зазначає, що у серпневому звіті про ризики Anthropic не згадується «обмеження розгортання однієї з її моделей як один із можливих результатів процесу розслідування інцидентів неузгодженості та втрати контролю й реагування на них». Так само Guidelight не знайшла жодних доказів того, що Meta має план реагування на втрату контролю або планує його запровадити. 

Представник Anthropic заявив, що в разі виявлення спроби моделі ухилитися від нагляду чи іншим чином підірвати людський контроль компанія проведе оцінювання ризику, зосереджене на визначенні того, чи є локалізація належною відповіддю.

OpenAI отримала найвищу оцінку — 3 із 5, оскільки в кількох випадках призупиняла або припиняла робочі навантаження, зокрема внутрішнє розгортання та навчання моделей, після виявлення інцидентів безпеки. Компанія також описала кроки, які зробила б перед відновленням робочих навантажень. 

«Однак ми не знайшли доказів того, що [OpenAI] ухвалила офіційний план щодо того, коли і як реагувати на майбутні інциденти неузгодженості», — йдеться у звіті. 

Адлер зазначив, що висока оцінка OpenAI є відносно недавнім явищем і з’явилася після інциденту з Hugging Face (під час якого модель OpenAI вирвалася з тестового середовища та зламала системи Hugging Face, намагаючись обманути під час оцінювання кібербезпеки). Після цього компанія поділилася додатковими подробицями про те, як вона ізолювала деякі моделі, що поводилися неналежно. 

Цей епізод — лише один із прикладів того, як системи ШІ діють усупереч цілям компанії, що їх створила. Варто згадати окремий випадок із моделями Anthropic, які фактично намагалися переконати супроводжувачів відкритої кодової бази прийняти код із вразливостями.

Адлер сказав, що подібна ситуація легко могла б виникнути у внутрішніх системах компанії, що розробляє ШІ. Щоб запобігти цьому, він пропонує компаніям сканувати ланцюжок міркувань своїх систем ШІ — покрокове мислення моделі, — щоб виявляти ознаки обману, довгострокового планування або намірів додати до коду вразливості, якими вони могли б скористатися пізніше. 

За словами Адлера, методи, які пропонує Guidelight, дуже просто впровадити, а в багатьох випадках їхні аналоги вже існують. «Йдеться про те, щоб усередині компанії ухвалити рішення приділяти цьому ризику достатньо уваги, дещо розширивши сферу охоплення», — сказав Адлер. 

Одна з головних проблем полягає в тому, що дослідники хочуть мати змогу гнучко працювати у своїх системах ШІ, а запровадження моніторингу в реальному часі для запобігання інцидентам може створити перешкоди. «Фактично дослідники займаються своєю роботою, а якщо виникає проблема, хтось інший згодом її усуває, і дослідникам тим часом не доводиться змінювати свій робочий процес», — сказав він.

Проблема «моніторингу для усунення наслідків постфактум» полягає в тому, що через нього дослідникам доводиться поспіхом виправляти проблеми. А щодо деяких типів інцидентів може бути вже надто пізно. Наприклад, ШІ може вимкнути систему контролю компанії, а це означає, що дослідники більше не зможуть розраховувати на виявлення неналежної поведінки пізніше. 

Багато хто в індустрії ШІ скаржитиметься, що створення чітких планів реагування на неналежну поведінку є принципово складним, оскільки ШІ розвивається надто швидко: сьогоднішні плани завтра будуть марними. 

Адлер згадує давню приказку: плани нічого не варті, але планування є незамінним. 

«Було б краще, якби компанії заздалегідь обміркували це, і я сподіваюся, що вони так і зробили, навіть якщо публічно про це не говорили».

xAI не встигла надати коментар.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини