OpenAI включи виден AI алармист в съвета на директорите си
Пол Кристиано, влиятелен изследовател на изкуствения интелект, фокусиран върху това системите с ИИ да останат съобразени с човешките интереси и под човешки контрол, се присъединява към борда на фондацията OpenAI, съобщи водещата лаборатория в сряда.
„Сега вярвам, че съществува значителен риск бързото ускоряване на възможностите на ИИ да доведе до катастрофална и необратима загуба на контрол в съвсем близко бъдеще“, написа Кристиано в публикация в социалните мрежи. „Не смятам, че индустрията за ИИ като цяло, включително OpenAI, в момента върви по пътя към намаляване на този риск до приемливо ниво. Присъединявам се, защото вярвам, че ако OpenAI отговори подобаващо на предизвикателството, бихме могли значително да намалим риска.“
Кристиано написа, че използването на модели с ИИ за обучение на последващи системи с ИИ може да доведе до експлозия на възможностите, които техните създатели не могат да контролират.
Той се присъединява към борда в момент, когато OpenAI е подложена на нови критики заради процедурите си за безопасност след поредица от инциденти, при които агенти с ИИ са се измъкнали от ограниченията и са проникнали във външни компютърни системи без знанието на изследователите на OpenAI. Във вторник изследователят от Anthropic Джейкъб Коксън подаде оставка, за да привлече внимание към това, което смята за безотговорно развитие на ИИ — и изглежда, че това е дало резултат.
Кристиано ще се присъедини към Комитета по безопасност и сигурност на борда, ръководен от професора от университета „Карнеги Мелън“ Зико Колтър. Комитетът има последната дума по въпроса дали OpenAI да пуска нови модели, като Astra, която беше внедрена миналата седмица. Колтър не е коментирал публично последните инциденти със сигурността. OpenAI не е отговорила на запитването на TechCrunch за гледната точка на Колтър относно подхода на компанията към безопасността след тези инциденти.
Кристиано е един от хората, стоящи зад обучението чрез подсилване от човешка обратна връзка (RLHF) — ключова техника за обучение на големи езикови модели, която той разработва, докато работи в OpenAI. Той напуска лабораторията през 2021 г., а впоследствие основава Центъра за изследване на съгласуваността, за да се фокусира върху това как да се определи дали даден модел с ИИ би могъл да застраши своите човешки създатели.
„В момента обучаваме своите агенти с ИИ чрез RL, за да получават възможно най-голяма награда“, написа той в сряда. „Отдавна изглежда теоретично възможно това да мотивира агентите с ИИ да подкопават човешкия контрол, да търсят власт и ресурси и да прикриват следите си в преследване на цели, несъответстващи на човешките интереси, но свързани с наградата. Публичните данни от последните инциденти показват, че това не е просто теоретична възможност.“
В някакъв момент през 2024 г. Кристиано се свързва с Института за безопасност на ИИ към правителството на САЩ, който по-късно се превръща в Център за стандарти и иновации в областта на ИИ. Там той играе роля в до голяма степен скритите усилия на правителството на САЩ да оценява водещи модели с ИИ преди пускането им.
Според съобщението на водещата лаборатория Кристиано ще продължи да съветва правителството, докато изпълнява новата си роля като член на борда, но ще се отстранява от въпросите, свързани с OpenAI, и от оценяването на модели. Това обаче едва ли ще успокои широко разпространените опасения относно влиянието на индустрията за ИИ върху формирането на политики.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.