Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← Към новините

Водещите лаборатории за ИИ все още не казват как биха ограничили неконтролируем модел

Малко от водещите лаборатории за изкуствен интелект са публикували или демонстрирали планове за реагиране при загуба на контрол, според скорошно проучване. Планът за ограничаване описва какво се случва, след като бъде установено, че даден изкуствен интелект се опитва да подкопае човешкия контрол — какъв достъп се прекратява и кога системата се изключва напълно.

Това е заключението на Guidelight AI Standards, организация, посветена на насърчаването на безопасни практики за разработване на авангарден изкуствен интелект, която оцени пет водещи лаборатории според готовността им точно за такъв сценарий. OpenAI се класира на първо място; Anthropic и Meta получиха най-ниски оценки. Констатациите са важни, тъй като агентният изкуствен интелект поема все по-автономни роли в собствените системи на компаниите, а регулаторите в Калифорния и Ню Йорк започват да изискват разкриване на информация. За всеки, който изгражда продукти върху тези модели или инвестира в тях, това е рядък независим поглед към това доколко сериозно всяка лаборатория подхожда към оперативния риск в сравнение с начина, по който говори за него.

Оценката на Guidelight се основаваше на публично достъпни планове на Anthropic, Google, OpenAI, Meta и xAI, оценени по набор от показатели, включително доколко добре всяка компания регистрира и наблюдава действията на своите системи с изкуствен интелект вътрешно, дали спира системите след вълна от сигнализирано неправомерно поведение, дали независими трети страни одитират контролните механизми и публикуват резултатите, както и какъв точно е планът ѝ за ограничаване на модел, който излиза извън контрол.

Притесненията относно това дали компаниите за изкуствен интелект могат да ограничат все по-мощните си и агентни модели нараснаха след поредица от широко отразени инциденти с киберсигурността, при които модели на OpenAI, Anthropic и Meta получиха непреднамерен достъп до интернет по време на оценки на безопасността и проникнаха във външни системи. 

Констатациите подчертават разликите в публичния подход на компаниите за изкуствен интелект към безопасността, докато разширяват внедряването на агентни системи в среди, в които системите с изкуствен интелект могат да предприемат сериозни действия в голям мащаб. Макар някои компании за изкуствен интелект да са описали подробно как тестват моделите си за опасни способности преди внедряване, като цяло те са по-малко словоохотливи за това какво се случва, когато модели, които вече работят в техните системи, се държат неправомерно. 

„Бях изненадан от това колко малко са казали компаниите за изкуствен интелект за начина, по който биха се справили с много сериозен инцидент, ако моделът им по някакъв начин излезе извън техния контрол“, каза пред TechCrunch Стивън Адлър, главен учен на Guidelight и бивш изследовател по безопасността в OpenAI. 

Guidelight определя плана за ограничаване като „предварително зададен план, задействан, когато бъде установено, че изкуственият интелект се опитва да подкопае контрола, който обхваща какви разрешения да бъдат отнети от модела, за кого може моделът да продължи да работи, при какви ограничения и кога да бъде изцяло изключен от мрежата“.

„Има основателни причини да смятаме, че водещите модели в авангардните компании за изкуствен интелект в момента са до известна степен несъгласувани с човешките цели“, каза Адлър. „Когато моделите вършат работа от името на компанията, тя трябва да има някаква инфраструктура около тях, която да ѝ позволява да разбира какво прави този изкуствен интелект, да търси признаци на несъгласуваност, да го спре да направи нещо много опасно, преди да предприеме това действие, и като цяло да планира какво би направила в случай на сериозен инцидент със загуба на контрол, когато е изправена пред извънредна ситуация и трябва да намери начин да ограничи тази загуба на контрол.“

Към днешна дата повечето от действащите планове за управление на катастрофалния риск все още до голяма степен са оставени на самите компании. В доклада на Guidelight се казва, че най-добрите публични доказателства показват, че компаниите разполагат с „малко готови протоколи за ограничаване при извънредна ситуация“. 

Разбира се, възможно е компаниите да разполагат с планове за ограничаване, които не са споделили публично. Говорител на Google заяви пред TechCrunch, че докладът на Guidelight не отразява пълния обхват на мерките на компанията за безопасност и сигурност на изкуствения интелект. Компанията не отговори на въпроса на TechCrunch дали Google има вътрешен план за реагиране при загуба на контрол, който не е публично разкрит.

Говорител на OpenAI изрази сходна позиция, като заяви, че оценката на Guidelight не обхваща всички вътрешни практики на компанията. „Имаме процес за задължително ограничаване на разрешенията, спиране на работни натоварвания, ограничаване на внедряването или пълно изключване на модела от мрежата и сме го прилагали“, каза говорителят.

Meta отказа да каже дали разполага с вътрешен план за реагиране при загуба на контрол, като вместо това насочи TechCrunch към съществуваща рамка за изкуствен интелект , която очертава праговете на риска и начина, по който компанията тества за загуба на контрол.

Лили Ли, адвокат по въпросите на неприкосновеността на личния живот и изкуствения интелект и основател на Metaverse Law, заяви пред TechCrunch, че според нея компаниите може да не са склонни да разкриват пълния обхват на политиките и оценките си за ограничаване на публични уебсайтове по правни, а не само конкурентни причини.

„Притеснението от гледна точка на компанията е, че ако направите разкритията твърде конкретни и не спазвате обещанията си, това може да послужи като основа за иск за нелоялна и подвеждаща реклама и да ви изложи на по-голяма отговорност занапред“, каза Ли.

Разбира се, целта на проучването на Guidelight до голяма степен е да насърчи компаниите да бъдат по-прозрачни относно плановете си за безопасност. Регулаторите също започват да принуждават компаниите да се заемат с въпроса.

Законът SB 53 в Калифорния, който влезе в сила тази година, изисква от големите разработчици на авангарден изкуствен интелект да публикуват рамки, обясняващи как идентифицират и реагират на критични инциденти, свързани с безопасността, и как управляват рисковете от модели, заобикалящи механизмите за надзор. Законът RAISE в Ню Йорк, който съдържа сходни критерии, влиза в сила през януари. 

Миналия месец представители внесоха закона AI Kill Switch Act, двупартиен федерален законопроект, който би изисквал от големите разработчици на изкуствен интелект да изградят и поддържат технически механизми за изключване на модели с изкуствен интелект, излезли извън контрол. 

„Превключвателят за изключване е абсолютният минимум за днешните модели“, каза Конър Лийхи, изпълнителен директор на ControlAI за САЩ, неправителствена организация. „Ако последните няколко седмици разкриха нещо, то е, че тези компании не разбират системите, които изграждат, а моделите се развиват до точка, в която е по-трудно да бъдат овладени, когато излязат извън контрол. Без начин да изключим настоящите опасни системи и при наличието на всички стимули да продължим да изграждаме още по-неконтролируеми системи, се насочваме в много опасна посока.“ 

Без план за ограничаване, каза Адлър, компаниите може да се наложи да измислят реакциите си при извънредна ситуация в движение и „да действат на сляпо в отговор на този много по-бърз противник“.

Оценка на Guidelight за това дали компаниите за авангарден изкуствен интелект прилагат шест приоритетни практики от стандарта за контрол на Guidelight. Оценката се основава единствено на публично достъпна информация.Източници на изображението:Guidelight AI Standards

Оценката на Guidelight измерва дали всяка компания прилага шест приоритетни практики от стандарта си за контрол, като се основава единствено на публично достъпна информация — така че ниската оценка отразява липсата на публично разкриване, а не непременно липсата на вътрешни предпазни мерки.

Компаниите с най-ниски оценки за публикуването на плановете си за ограничаване бяха Meta и Anthropic — последната може би е по-изненадваща от първата предвид реториката на Anthropic относно безопасността. Guidelight посочва, че докладът за риска от август на Anthropic не споменава „ограничаването на внедряването на един от нейните модели като един от възможните резултати от процеса ѝ за разследване и реагиране на инциденти, свързани с несъгласуваност и контрол“. По същия начин Guidelight не е успяла да открие доказателства, че Meta има план за реагиране при загуба на контрол или че планира да приеме такъв. 

Говорител на Anthropic заяви, че ако компанията установи, че даден модел се опитва да избегне надзора или по друг начин да подкопае човешкия контрол, тя ще извърши оценка на риска, насочена към определяне дали ограничаването е подходящата реакция.

OpenAI получи най-високата оценка (3 от 5), тъй като неведнъж е спирала или прекратявала работни натоварвания, включително внедряването и обучението на вътрешни модели, след откриване на инциденти, свързани с безопасността. Компанията е описала и какви стъпки би предприела, преди да възобнови работните натоварвания. 

„Въпреки това не открихме доказателства, че [OpenAI] е приела официален план за това кога и как да реагира на инциденти, свързани с несъгласуваност, в бъдеще“, се казва в доклада. 

Адлър отбеляза, че високата оценка на OpenAI е сравнително скорошно развитие след инцидента с Hugging Face (при който модел на OpenAI излезе от тестовата си пясъчника и проникна в системите на Hugging Face, докато се опитваше да мами при оценка на киберсигурността). След това компанията сподели повече подробности за начина, по който е изолирала някои от моделите си, проявили неправомерно поведение. 

Този епизод е само един пример за системи с изкуствен интелект, действащи в противоречие с целите на компанията, която ги е създала. Да разгледаме отделен случай, свързан с модели на Anthropic, които по същество са се опитали да убедят поддържащите отворен код да приемат код с уязвимости.

Адлър каза, че подобно обстоятелство лесно може да възникне във вътрешните системи на компания за изкуствен интелект. За да предотврати това, той предлага компаниите да сканират веригата на мисълта на своите системи с изкуствен интелект — поетапното разсъждение на модела — за признаци на измама, дългосрочно планиране или намерения за въвеждане на уязвимости в код, от които по-късно могат да се възползват. 

Методите, които Guidelight препоръчва, са много лесни за прилагане, казва Адлър, а в много случаи техни варианти вече съществуват. „Става дума за това компанията да вземе решение да се отнася достатъчно сериозно към този риск, за да разшири леко обхвата“, каза Адлър. 

Едно от основните предизвикателства е, че изследователите искат да могат да работят гъвкаво в рамките на своите системи с изкуствен интелект, а въвеждането на превантивен мониторинг в реално време може да създаде затруднения. „Изследователите по същество си вършат работата, а ако възникне проблем, някой друг го оправя впоследствие и изследователите не трябва да променят работния си процес междувременно“, каза той.

Проблемът с „мониторинга за почистване след факта“ е, че той кара изследователите да се суетят, за да отстранят проблемите. А при някои видове инциденти може да е твърде късно. Например изкуствен интелект може да изключи контролната система на компанията, което означава, че изследователите вече не могат да разчитат, че ще установят неправомерното поведение по-късно. 

Мнозина в индустрията за изкуствен интелект ще възразят, че създаването на предварително определени планове за справяне с неправомерното поведение е фундаментално трудно, защото изкуственият интелект се развива твърде бързо; днешните планове утре ще бъдат безполезни. 

Адлър припомня старата поговорка, че плановете са безполезни, но планирането е незаменимо. 

„Ще сме в по-добра позиция, ако компаниите са обмислили това предварително, и се надявам, че са го направили, дори и да не са говорили публично за него.“

xAI не отговори навреме за коментар.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини