Anthropic и OpenAI искат да внедрят оценители на безопасността. Наистина ли ще бъдат независими?
В пространно есе, публикувано през уикенда, главният изпълнителен директор на Anthropic Дарио Амодей направи предложение, което AI индустрията би отхвърлила незабавно дори само преди година: да се вградят независими оценители във всички компании, разработващи авангардни AI модели, като им се даде правомощието да докладват за инциденти, свързани с безопасността, да оценяват дали AI моделите действително са съобразени с човешките намерения и да споделят неподправените си заключения със света.
Амодей заяви, че Anthropic ще се ангажира да предостави на независими оценители като METR и Redwood Research безпрецедентен достъп до системите на компанията. Главният изпълнителен директор Сам Алтман заяви, че OpenAI също ще се ангажира с тази практика, което сигнализира за потенциално дълбока промяна в начина, по който индустрията работи с външни изследователски групи.
Оценителите от трети страни, разговаряли с TechCrunch, като цяло приветстваха предложението, но заявиха, че детайлите трябва да бъдат уточнени — и в идеалния случай подкрепени със законодателство — за да знаят дали ще функционират като действително независими наблюдатели или като доставчици, работещи според условията на AI компаниите.
Този по-задълбочен достъп става все по-важен, тъй като моделите се подобряват в разпознаването на моментите, когато са оценявани, което увеличава риска да се държат добре по време на тестовете, като същевременно прикриват проблемно поведение. Изследователи твърдят, че уликите за подобно поведение могат да бъдат пропуснати при тестването на готовия модел, но да бъдат открити чрез проучване на поведението му по време на целия процес на обучение.
„AI компаниите би трябвало да могат да отговорят на някои съвсем основни въпроси за процеса си на обучение, например: Опитвал ли се е AI някога активно да подкопае собственото си обучение за съобразяване с човешките намерения, докато е преминавал през обучението?“ Александър Майнке, ръководител на изследванията в Apollo Research, заяви пред TechCrunch. „Отговорът на това трябва да бъде категорично „не“, а в момента разчитаме изцяло на AI компаниите както сами внимателно да проверят това, така и честно да го съобщят на обществеността. А от последните инциденти видяхме, че по подразбиране те няма да направят нито едното, нито другото. Като вградени оценители бихме могли действително да проверим.“
Исторически AI компаниите привличаха външни проверители, които да тестват готовите модели малко преди пускането им. Сега оценителите, с които разговаря TechCrunch, предлагат да получат достъп не само до крайния модел, но и до междинните му версии, или „контролни точки“, от целия период на обучение. Адам Глийв, главен изпълнителен директор на Far.AI, заяви, че оценителите биха могли да сравняват тези контролни точки, за да установят кога се е появило обезпокоително поведение, да проверяват средата след обучението, която възнаграждава моделите за определени поведения, както и да преглеждат стенограмите и регистрационните файлове от оценяването, за да потвърдят твърденията на компанията за представянето на модела.
Не е ясно дали и кога Anthropic и OpenAI планират да предоставят такъв тип достъп. Нито една от двете компании не е споделила с кои оценители ще работи, кога те ще бъдат вградени, колко ще бъдат привлечени, точно до какви системи и информация ще имат достъп или какво може да бъде разкрито пред обществеността, въпреки многократните въпроси на TechCrunch.
Това да се надникне под капака е важно, защото моделите, които се представят добре на тестове за безопасност, не са непременно безопасни, ако са научили конкретно как да преминат този тест. Стайдли посочи пример с „тест за устойчивост при изключване“, който измерва дали AI ще се противопостави на изключването си при определени обстоятелства.
„Изключително важно е дали AI е бил обучен специално да се представя добре на този тест“, каза Стайдли, сравнявайки го със скандала Dieselgate на Volkswagen, при който автомобилите са били програмирани да разпознават тестовете за емисии и да се държат по различен начин в условията на тестване.
Глийв отбеляза, че смисленият достъп може да се простира отвъд самите модели, като на оценителите бъде даден достъп до интервюта със служители, за да проверят дали документацията и публичните описания на практиките на компанията за безопасност съответстват на случилото се вътрешно.
Амодей очерта сравнително всеобхватно предложение, което може да предостави на оценителите достъпа, който те смятат за необходим, включително правото да „публикуват ключови заключения относно нивата на риска, инцидентите, практиките и достъпа, който са получили или не са получили — без редакционен контрол от Anthropic“.
Но оценителите заявяват, че подобна система ще работи само ако AI компаниите действително са готови да се откажат от контрола върху процеса. Предишните опити за независими оценки показват, че този отказ ще бъде трудно извоюван, тъй като третите страни често са се сблъсквали с напрежение около достъпа, времето, поверителността и това какво могат да кажат публично.
Глийв заяви, че Far.AI е трябвало да откаже договори с няколко разработчици на авангардни модели, които са искали прекалено голям контрол върху процеса на оценяване, застрашавайки независимостта на фирмата. По думите му по подразбиране към оценителите се отнасят като към обикновени изпълнители: те са обвързани с ограничителни споразумения за неразкриване на информация и договори, които дават на разработчиците значителен контрол върху това какво в крайна сметка може да бъде публикувано.
Ограничението във времето
Съществува и въпросът дали проверителите ще получат достатъчно време и достъп, за да извършат работата, която се очаква от тях. При разследването на инцидента с Hugging Face OpenAI предостави на METR и Redwood приблизително седмица на място за разследване, а по-късно и двете организации заявиха, че не са могли да направят уверени заключения, отчасти заради ограниченията в обхвата и времето.
Подобен проблем възникна по време на тестването преди пускането на GPT-6 Astra, който OpenAI представя като най-съобразения с човешките намерения модел досега. Според приноса на Apollo Research към картата на модела фирмата е получила само три дни, за да тества Astra, което е затруднило правенето на категорични заключения.
„Apollo смята, че предвид по-високите нива на осъзнаване на оценяването и ограничения времеви прозорец за оценяване, ниските нива на неправомерно поведение тук не предоставят съществени доказателства за съобразяването или несъобразяването на модела с човешките намерения“, пише фирмата в своята оценка.
Тази история оставя оценителите с един основен въпрос: Защо този път трябва да е различно?
„Със сигурност е възможно Дарио и Сам просто да са променили мнението си и да бъдат много открити по този въпрос“, каза Глийв. „Но интелектуалната собственост на тези компании е толкова невероятно ценна за тях, че според мен по подразбиране те ще бъдат много внимателни относно това какво може да бъде споделено.“
Няколко изследователи, разговаряли с TechCrunch, призоваха за прозрачна рамка, с която всички те публично да се съгласят. Според Джон Стайдли, ръководител на стратегията в Palisades Research, част от рамката трябва да включва стандарти за това на какви видове одитори могат да разчитат компаниите, за да не се опитат да заобиколят проблема, като избират оценители, които или не са квалифицирани, или не проявяват интерес към оценяването на най-тревожните рискове.
Хенри Пападатос, изпълнителен директор на Safer AI, казва, че проблемът дори при публична рамка е, че доброволните мерки винаги зависят от добрата воля на компанията.
„В идеалния случай бихме имали добро регулиране, което да направи това задължително… защото тогава компаниите няма да могат да променят мнението си утре, ако се окажат в голяма PR криза“, заяви Пападатос пред TechCrunch, отбелязвайки, че това е и добър начин да се насърчат всички компании да спазват правилата, а не само най-склонните.
Не всички са се присъединили. Засега Meta, SpaceXAI и Google DeepMind не са се ангажирали с вграждането на оценители от трети страни, макар че главният изпълнителен директор на DeepMind Демис Хасабис е предложил отделен орган за индустриални стандарти, който независимо да тества авангардните модели. Google, OpenAI и Anthropic също обсъждат частно планове за безопасността на AI от седмици.
Вече се създават някои закони, свързани с идеята за оценители от трети страни. Калифорнийският закон SB 53, подписан миналата година, изисква от големите разработчици на авангардни AI модели да публикуват рамки за безопасност и да докладват за критични инциденти, свързани с безопасността. Нов закон, SB 813, подписан този месец, създава рамка за признати от щата „независими организации за проверка“, които имат експертиза в оценяването на рисковете от AI.
В Европа Законът на ЕС за изкуствения интелект изисква от разработчиците на авангардни модели да извършват и документират оценки на моделите и състезателни тестове, както и да докладват за сериозни инциденти. Службата на ЕС за изкуствения интелект също може да извършва собствени оценки и да назначава независими експерти.
Засега законодателството остава по-ограничено от това, което предлага Амодей, като оставя лабораториите, разработващи авангардни модели, до голяма степен отговорни за решението колко независим контрол ще приемат. Пападатос заяви, че доброволното саморегулиране е по-добро от нищо, но в крайна сметка компаниите не могат да настояват за свободата да контролират собствените си правила за безопасност, като същевременно искат от обществеността да им се довери, че ги спазват.
„Не можете да получите и двете — да няма никаква външна отчетност, а след това да кажете: „Просто ще имам свои гъвкави правила“, заяви Пападатос.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.