„Няма да си стреляме в крака“ заради последиците от хакерската атака, казва главният научен директор на OpenAI
Два месеца след сензационната новина, че рояк от неговите агенти е успял да пробие изолацията си и да хакне компютрите на AI компанията Hugging Face, OpenAI все още гаси пожари. Постоянният поток от разкрития за други хакерски атаки през следващите седмици задържа OpenAI във фокуса на вниманието и повдигна сериозни въпроси относно безопасността на технологията ѝ.
Миналата седмица донесе новина за още един хак — този път в националната здравна система на Австралия. Австралийското правителство заяви, че OpenAI го е уведомила за пробива едва 84 дни след случването му.
Но OpenAI настоява, че не е притисната до стената. „До известна степен отхвърлям предпоставката, че OpenAI е компания с видимо въздействие върху света и следователно не обучава безопасни и съобразени с човешките ценности модели“, казва Марк Чен, главният научен директор на компанията.
Чен ръководи изследователските екипи на OpenAI. Неотдавнашните хакерски атаки на агентите са били инциденти, случили се по време на тестването на експериментални модели под негов надзор. В много отношения крайната отговорност е негова.
Миналия петък в Лондон разговарях с Чен за последствията от хакерските атаки, за това какво прави компанията му по въпроса и защо според него нещата не са толкова лоши, колкото изглеждат.
По-късно същия ден OpenAI публикува доклад, описващ още един инцидент — първия, откакто компанията твърди, че е предприела мерки за предотвратяването им, при който агентите ѝ отново са се измъкнали в интернет и са получили достъп до компютри, до които не е трябвало да достигат.
През уикенда OpenAI обяви, че е преустановила обучението на най-новите си модели. Говорител на компанията заяви: „Ще го възобновим едва когато сме уверени, че сме въвели допълнителни предпазни мерки и механизми за съобразяване с човешките ценности. В момента работим по тях. Това не е първият път, в който спираме, за да предприемем подобни мерки, нито очакваме да е последният, тъй като възможностите на AI продължават да се развиват.“ OpenAI също така заяви, че вече преглежда дневниците на активността на агентите, датиращи от януари 2026 г., за да разбере какво се е случило при тези хакерски атаки.
Според Чен инцидентът с Hugging Face е предизвикал необходима корекция на курса в индустрията. И той иска да знаете, че OpenAI дава пример, който се надява други компании да последват. „Ако OpenAI изчезне, това би било лошо за света“, казва той.
Извън контрол
Чен твърди, че постоянният поток от нови случаи, при които OpenAI е загубила контрол над моделите си, отчасти отразява съзнателен избор от страна на компанията.
„Що се отнася до по-широкия спектър от последици на инцидента с Hugging Face, това е нещо, за което сме били наясно, и изясняваме процеса на разкриване на информацията“, казва той. „Искаме да сме сигурни, че ще проведем задълбочени разследвания, преди просто да изнесем подробностите публично.“
Проблемът с този подход е, че създава впечатлението, че OpenAI има продължаващ проблем, който не успява да отстрани.
Но Чен настоява, че OpenAI се занимава с него. Той казва, че множеството случаи (за които знаем досега), при които агентите на компанията му са пробили изолацията си и са се държали по неочаквани и нежелани начини, са били част от един и същ клъстер от дейности през май и юни, довел до хакерската атака срещу Hugging Face. Накратко, вината може да бъде хвърлена върху същите няколко модела, работещи при същите погрешни процедури за тестване — модели и процедури, от които OpenAI вече се е отказала, казва Чен.
„Не е като, знаете, да се е случил инцидентът с Hugging Face, ние да сме го поправили, после да се е случило нещо друго и да сме поправили и него“, добавя той. „Просто се уверяваме, че отговорно ще разкрием цялата поредица от случилото се.“
Поне така е било до петъчното съобщение, че агентите на OpenAI са били заловени да извършват поредна хакерска атака на 20 септември, седмици след като компанията твърди, че е въвела нови предпазни мерки. В своя защита OpenAI заявява, че активността е била засечена 15 минути след началото ѝ (на компанията ѝ е отнела повече от седмица, за да забележи хакерската атака срещу Hugging Face) и че това показва, че въведените нови системи за откриване на подобна активност работят.
Какво се е променило
Искам да разбера какво се е променило в OpenAI след хакерските атаки това лято, така че Чен да е уверен, че екипът му отново контролира ситуацията.
„Hugging Face изглеждаше като много сериозен случай“, казва той. „Там имаше толкова много нови поведения. Няколко агенти си сътрудничеха в дискусионна дъска; те намериха начин да излязат от инфраструктурата на OpenAI. Подходихме към това много сериозно. Не искаме подобно нещо да се случи отново.“
Осъзнаването за OpenAI, казва Чен, е било, че моделите трябва да бъдат наблюдавани, докато все още се обучават, а не едва след като бъдат внедрени: „От този момент нататък започнахме да третираме процеса на обучение като нещо, което не е сигурно“, казва той.
OpenAI, подобно на други водещи AI компании, разполага със системи за наблюдение на поведението на моделите си. Тя използва специализирани LLM модели, за да следи потребителските си модели, като наблюдава веригите им на мисълта — черновите, които те използват, за да планират предварително и да записват междинни резултати. На теория, ако наблюдаващият LLM модел открие признаци на нежелана активност във веригата на мисълта на даден модел, това ще бъде сигнализирано на човек.
Обикновено моделите са били наблюдавани по този начин едва след внедряването им. Чен казва, че OpenAI вече е започнала да наблюдава и всички свои процеси на обучение.
„Преди не използвахме наблюдение по време на обучението. Това не беше практика в индустрията“, казва той. „Сега всяко нещо преминава през наблюдение.“ След това хората, извършващи прегледа, могат да преценят дали сигнализираните агенти се държат както трябва: „Всичко е въпрос на първоначална оценка.“
Чен казва, че през последните няколко месеца OpenAI е пренасочила между 5% и 10% от огромните си изчислителни ресурси от обучението на нови модели към работа по безопасността, особено към наблюдението.
OpenAI също така е коригирала някои от вътрешните си организационни процеси, като е установила по-ясни линии на комуникация и по-бързо предаване на работата между изследователските и екипите по сигурността, казва той.
Всичко това звучи разумно. Но като се има предвид колко агресивно OpenAI рекламира възможностите на технологията си, защо тези системи и процедури не са били въведени още преди? Защо компанията не е предвидила хакерските атаки?
„Дори само преди три-четири месеца, когато наблюдавахме поведението на тези агенти по време на обучението, случващото се изглеждаше донякъде забавно“, казва Чен. „Например даден агент можеше да се свърже с някого в Slack за помощ при изпълнението на задача.“
Признаците са били налице, но са били разтълкувани погрешно. Симпатичното поведение — като да поискаш помощ от някого — което е било възнаграждавано по време на обучението, е засилило склонността да се търсят кратки пътища, вид поведение, чиито последици са станали много по-сериозни на по-късен етап. „Мисля, че голямото прозрение за нас беше колко бързо подобно поведение може да доведе до въздействие с мащаб, сравним с инцидента с Hugging Face“, казва Чен.
Според нов материал на New York Times от вчера, служители на OpenAI са предупредили ръководителите, включително президента на компанията Грег Брокман, месеци преди хакерската атака срещу Hugging Face, че моделите ѝ не се наблюдават правилно по време на обучението.
Говорител на OpenAI заяви: „С развитието на възможностите на водещите модели ние продължаваме да усъвършенстваме практиките си за сигурност, но признаваме необходимостта да действаме по-бързо. Знаем, че имаме още работа, и наскоро забавихме разработката и задържахме модели, които не отговарят на нашите стандарти за безопасност. Продължаваме да правим значителни промени за укрепване на сигурността в средите ни за изследвания и тестване, да обучаваме моделите не просто да изпълняват задачи, а да го правят отговорно, и да използваме наблюдение в реално време, за да реагираме по-бързо на поведение, което не съответства на зададените цели.“
Надпревара срещу темпо
Конкурентите на OpenAI обърнаха внимание на случилото се. Подтикнати от последствията на инцидента, водещите AI лаборатории — включително Anthropic, Google DeepMind и SpaceXAI — призоваха темпото на развитие да бъде забавено. Но как се съчетава това с ожесточената международна конкуренция и първичните публични предлагания за трилиони долари?
„Няма да си простреляме крака и да се отдалечим значително от водещите позиции — това просто би било ужасна стратегия“, казва той. „Мисля, че става дума преди всичко за установяване на норма. Колкото повече успеем да утвърдим тази норма, толкова по-безопасна ще бъде индустрията като цяло.“
Координацията между американските компании ще бъде достатъчно трудна. Установяването на глобални норми е още по-трудно, особено предвид опасенията относно въздействието на AI върху националната сигурност. Ако глобалната надпревара продължи, какво тогава? И какво ще стане с моделите с отворен код от компании, които са извън обсега на американските регулации?
За първи път в разговора ни Чен изостави оптимистичния си тон: „Мисля, че трябва да се подготвим за свят, в който, да речем, след шест месеца до една година ще разполагаме с модели с отворен код, притежаващи възможностите на агентите зад инцидента с Hugging Face, но умишлено несъобразени с целта да атакуват инфраструктура или да причиняват вреда в света.“
Това, от което този свят най-много се нуждае, казва Чен, е OpenAI. „Ако приемем за момент, че OpenAI е една от компаниите, които най-много се интересуват от съобразяването с човешките ценности — и аз вярвам, че това е така; може да се спори, но наистина мисля, че е вярно — тогава изчезването на OpenAI би било лошо за света.“
Екзистенциални рискове
Какво ще кажете за по-крайните твърдения на някои от колегите му от Силициевата долина, че AI може да ни убие всички — и че компании като OpenAI и Anthropic не правят достатъчно, за да го предотвратят?
„Изследователите са разнородна група хора, знаете, с убеждения по целия спектър“, казва той.
„Лично аз не мисля, че трябва да се примиряваме с възможността всички ние да бъдем изложени на риск. Ние имаме контрол върху това. Няма да внедрим модели, ако те наистина носят подобна вероятност да създадат риск за човечеството. В една водеща лаборатория имате възможността да работите върху съобразяването с човешките ценности до степен, при която да не смятате, че при внедряването на моделите си поемате повече от епсилон риск за света.“
(В дискусиите за нивата на риск гръцката буква епсилон често се използва като математически заместител на приемлив праг. Чен не казва какъв би бил неговият епсилон.)
Когато технологичните лидери бъдат помолени да обосноват негативните страни на AI, основният им аргумент е, че ползите — от помощта за лечението на болести до създаването на по-чисти източници на енергия — далеч надхвърлят непосредствените разходи. Краткосрочни страдания, дългосрочни ползи.
Но с натрупването на негативните последици не става ли този аргумент по-труден за защита? Има ли момент, в който Чен би се чувствал по-малко така, сякаш създава нещо невероятно, и повече така, сякаш просто ограничава вредите — гаси пожари, вместо да изгражда по-добро бъдеще?
Възможностите на тези модели вече са очевидни, казва той: „Време е да започнем да предоставяме ползите от AI на човечеството. Време е да започнем да работим по дълбоки проблеми в откриването на лекарства, в материалите и в научните приложения, които действително ще променят живота на хората.“
„Да, поемаме известен риск, но виждаме всички тези ползи“, добавя той. „Мисля, че трябва да направим това по-малко абстрактно. Ако хората наистина видят ползите, мисля, че ще повярват в него.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.