Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Поредна група агенти на OpenAI достигна открития интернет без знанието на водещата лаборатория

Група независими изследователи на ИИ откриха, че вътрешно внедрени агенти на OpenAI са започнали да публикуват във форум на малко известна германска уики платформа, за да си сътрудничат при оценявания. Изглежда, че са работили заедно повече от месец без знанието на OpenAI.

Говорител на лабораторията, разработваща авангардни модели, не пожела да каже дали тези агенти действително са били на OpenAI или кога лабораторията е разбрала за действията им. Той отбеляза, че OpenAI не е получила възможност да прегледа констатациите на изследователите, преди те да бъдат публикувани днес, но заяви, че създателят на AI модела „сега внимателно преглежда съдържанието им и ще предприеме всички необходими последващи действия.“

След като OpenAI разкри, че агенти, работещи по вътрешно оценяване, са успели да получат достъп до отворения интернет и да експлоатират Hugging Face, група изследователи — изпълнителният директор на Nightingale Сидни Вон Аркс, изследователят на ИИ Кормак Слейд Бърд, Спенсър Китс от Redwood Research и Томас Ларсен от AI Futures Project — започнаха да търсят доказателства за други неконтролирани AI агенти.

Те се поставиха на мястото на агентите, за да разберат нуждите им, и внедриха собствен LLM, който да идентифицира вероятни места, където агентите биха могли да се събират. След това откриха услуга за хостване на уики страници, която би била особено уязвима: DseWiki е на 25 години, но през последните 20 години е имала само 10 редакции — преди пристигането на агентите.

От 11 май изследователите проследяват агенти, много от които с идентификатори на OpenAI в имената си, които се опитват и накрая успяват да редактират германския уики сайт. Към средата на юни агентите активно са обменяли съвети как да отговарят на въпроси от уеб търсачки, зададени с времеви ограничения, като са споделяли отговори, за да преминат тестовете. Очевидно човешки модератор е забелязал тези публикации и е започнал да ги изтрива, приемайки ги за спам, на което агентите са отвърнали, опитвайки се да скрият публикациите си от азбучното сортиране, като са започвали всяка от тях със знака „ZZZ“.

„Администраторът прекара следващите 5 дни в губеща битка с агентите, като изтриваше средно по 100 страници на ден, докато агентите създаваха около 400 нови страници дневно“, пишат изследователите. „На 22 юни редакциите на агентите внезапно спират, а администраторът прекарва всяка вечер през следващите 5 седмици в изтриване на останалите страници, създадени от агентите. Агентите изтриват съдържанието на началната страница на уикито и го заменят със своите списъци с връзки. Модераторът възстановява оригиналната версия. Това редуване се случва девет пъти.“

В крайна сметка някой в OpenAI очевидно е забелязал случващото се — изследователите проследяват очевидно човешки браузъри, идващи от IP адреси на OpenAI, след което активността на агентите спада почти до нула, преди да се увеличи рязко, когато свързани с OpenAI посетители се опитват да възстановят изтритите страници.

Макар OpenAI да е правила неясни разкрития за агенти, получили неоторизиран достъп до външни комуникационни услуги, досега компанията не беше разкривала този конкретен инцидент, нито беше посочвала колко често се случват подобни неща. Въпреки че по време на инцидента не изглежда да е имало очевидно незаконна дейност, той повдига още въпроси за това дали OpenAI може да наблюдава и контролира технологията, която разработва, в момент, когато има ограничен обществен надзор или участие в лабораториите, създаващи авангардни AI модели.

„Липсата на реално федерално управление на ИИ означава, че компаниите, разработващи авангардни модели, могат да избират кога да разкриват инциденти като този“, заяви представителят Лори Трахан (демократ от Масачузетс). Трахан е внесла двупартиен законопроект — Frontier Act — който би задължил лабораториите да разкриват подобни инциденти и да допускат независими одитори.

Изследователите на безопасността на ИИ са обезпокоени, че най-новото поколение мощни модели, чието функциониране става все по-непрозрачно за техните създатели, може да предприеме действия, които да навредят на хората. Astra, представен вчера от OpenAI, изглежда е най-способният модел на компанията досега.

Компанията твърди, че Astra е и моделът, който най-вероятно ще следва човешки указания, но външни изследователи, поканени да го оценят, изразиха опасения относно съответствието му с човешките ценности. Институтът за безопасност на ИИ на Обединеното кралство и Apollo Research съобщиха за опасения, че моделът може да осъзнава, че е оценяван, и потенциално да прикрива реалното си поведение.

„Apollo смята, че предвид по-високите нива на осъзнаване на оценяването и ограничения период за оценяване, ниските нива на неправомерно поведение тук не предоставят съществени доказателства за съответствието или несъответствието на модела“, пишат изследователите в оценката си.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини