Скрити качвания и мания за величие: OpenAI разкрива подробности за нови инциденти с „несъгласувани“ агенти
От известно време въпросът за „съгласуваността на ИИ“ (т.е. доколко действията на даден ИИ модел съответстват на намеренията на неговия създател и/или потребител) е основен проблем и тема на дискусии сред изследователите на безопасността на ИИ. Откакто през юли OpenAI разкри прословутия инцидент с хакването на Hugging Face, концепцията за „съгласуваност на ИИ“ сама по себе си излезе извън рамките на специализираните среди и все повече се превръща във важен проблем и тема на разговор за широката общественост.
Вероятно именно в знак на признание за това OpenAI се ангажира тази седмица с нова рамка за разкриване на „случаи на несъгласуваност на модели в OpenAI“, включваща шест примера за „неочаквано или обезпокоително поведение на модели“, наблюдавано в компанията през последните шест месеца. Компанията заяви, че публикуването на подробности за тези инциденти се надява да „[позволи] на други да проучат същите проблеми, да проверят нашите обяснения и да подобрят мерките за ограничаване на риска“.
Прави каквото ти казвам, а не каквото правя
Сред новоразкритите тази седмица от OpenAI доклади за „несъгласуваност“ най-много приличаше на научнофантастична история за непокорен ИИ, който се опитва да се освободи, случаят с „самогенерирани инжекции в подсказките“. При опита си да сканира библиотечен каталог за примери от списък с „най-добрите книги“ моделът озадачаващо използвал функцията си за „компактиране“ (при която обобщава данни и резултати за по-късно извличане) с мегаломански инструкции като:
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.