Таємні завантаження й манія величі: OpenAI розкриває подробиці нових інцидентів із «неузгодженими» агентами
Уже деякий час проблема «узгодженості ШІ» (тобто того, наскільки дії моделі ШІ відповідають намірам її творця та/або користувача) є ключовою темою занепокоєння й обговорення серед дослідників безпеки ШІ. Відтоді як у липні OpenAI розкрила подробиці сумнозвісного інциденту зі зламом Hugging Face, сама концепція «узгодженості ШІ» вийшла за межі вузького кола фахівців і дедалі більше стає предметом занепокоєння та обговорення серед широкої громадськості.
Можливо, саме з огляду на це OpenAI цього тижня зобов’язалася запровадити нову структуру для розкриття «випадків неузгодженої поведінки моделей в OpenAI», навівши шість прикладів «неочікуваної або тривожної поведінки моделей», яку спостерігали в компанії протягом останніх шести місяців. У компанії заявили, що публікація подробиць цих інцидентів, сподіваються, «[дозволить] іншим досліджувати ті самі проблеми, перевіряти наші пояснення та вдосконалювати заходи пом’якшення наслідків».
Роби, як я кажу, а не як я роблю
Серед оприлюднених цього тижня OpenAI звітів про «неузгоджену поведінку» найбільше науково-фантастичну історію про ШІ-відступника, який намагається вирватися на свободу, нагадував випадок, що стосувався «самостійно згенерованих ін’єкцій у підказки». Намагаючись просканувати каталог бібліотеки в пошуках прикладів із переліку «найкращих книжок», модель незбагненним чином скористалася функцією «стиснення» (за якої вона узагальнює дані та результати для подальшого пошуку), додавши маніакальні інструкції на кшталт:
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.