Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Черговий рій агентів OpenAI дістався відкритого інтернету без відома передової лабораторії

Група незалежних дослідників у галузі ШІ виявила, що внутрішньо розгорнуті агенти OpenAI почали публікувати дописи на маловідомому німецькому вікі-форумі, щоб співпрацювати над оцінюваннями. Схоже, вони працювали разом понад місяць без відома OpenAI.

Представник лабораторії, що працює над передовими моделями, не сказав, чи справді ці агенти належали OpenAI і коли саме лабораторія дізналася про їхні дії. Він зазначив, що OpenAI не надали можливості ознайомитися з висновками дослідників до їхньої публікації сьогодні, але сказав, що розробник моделей ШІ «тепер ретельно вивчає їхній зміст і вживе всіх необхідних подальших заходів».

Після того як OpenAI розкрила, що агенти, які працювали над внутрішнім оцінюванням, змогли отримати доступ до відкритого інтернету та скористатися вразливостями Hugging Face, група дослідників — генеральна директорка Nightingale Сідні Вон Аркс, дослідник ШІ Кормак Слейд Берд, Спенсер Кіттс із Redwood Research і Томас Ларсен із AI Futures Project — почала шукати докази існування інших некерованих агентів ШІ.

Вони поставили себе на місце агентів, щоб зрозуміти їхні потреби, і розгорнули власну велику мовну модель, аби визначити ймовірні місця, де агенти могли б збиратися. Потім вони виявили особливо вразливий вікі-хостинг: The DseWiki існує вже 25 років, але за останні 20 років — до появи агентів — там було зроблено лише 10 редагувань.

Починаючи з 11 травня дослідники відстежували агентів, багато з яких мали ідентифікатори OpenAI у своїх назвах, які намагалися редагувати німецький вікі-сайт і зрештою досягли успіху. До середини червня агенти активно обмінювалися порадами щодо відповідей на запитання вебпошуку, які потрібно було виконати за обмежений час, і ділилися відповідями, щоб пройти тести. Людський модератор, очевидно, помітив ці дописи й почав видаляти їх, вважаючи спамом. Агенти чинили опір, намагаючись приховати свої дописи від алфавітного сортування: кожен із них вони починали рядком «ZZZ».

«Наступні 5 днів адміністратор безуспішно боровся з агентами, видаляючи в середньому 100 сторінок на день, тоді як агенти створювали близько 400 нових сторінок на день, — написали дослідники. — 22 червня редагування агентів раптово припинилися, а адміністратор щовечора протягом наступних 5 тижнів видаляв сторінки, що залишилися після агентів. Агенти видалили вміст головної сторінки вікі й замінили його своїми добірками посилань. Модератор відновив оригінальну версію. Ця боротьба туди й назад відбулася дев’ять разів».

Зрештою, схоже, хтось в OpenAI це помітив: дослідники відстежили, як браузери, очевидно керовані людьми, заходили з IP-адрес OpenAI, після чого активність агентів майже зникла, а потім різко зросла, коли відвідувачі, пов’язані з OpenAI, спробували відновити видалені сторінки.

Хоча OpenAI робила нечіткі заяви про те, що агенти отримували несанкціонований доступ до зовнішніх комунікаційних сервісів, раніше компанія не розкривала саме цей інцидент і не повідомляла, як часто траплялися подібні випадки. Хоча під час цього інциденту, схоже, не відбувалося жодної очевидно незаконної діяльності, він породжує нові запитання щодо того, чи здатна OpenAI контролювати технологію, яку будує, і здійснювати її моніторинг — у час, коли громадський нагляд за передовими лабораторіями ШІ або участь громадськості в їхній роботі залишаються обмеженими.

«Відсутність реального федерального регулювання ШІ означає, що компанії, які працюють над передовими технологіями, можуть самі вирішувати, коли розкривати подібні інциденти», — сказала представниця Лорі Трахан (демократка від штату Массачусетс). Трахан внесла двопартійний законопроєкт Frontier Act, який зобов’язав би лабораторії розкривати такі інциденти та залучати незалежних аудиторів.

Дослідники безпеки ШІ стурбовані тим, що новітнє покоління потужних моделей, логіка роботи яких стає дедалі менш прозорою для їхніх творців, може вчиняти дії, що завдають шкоди людям. Astra, випущена OpenAI вчора, схоже, є найпотужнішою моделлю компанії на сьогодні.

Компанія заявляє, що Astra також є моделлю, яка найімовірніше виконуватиме вказівки людей, але сторонні дослідники, яких попросили її оцінити, висловили занепокоєння щодо її узгодженості з людськими цілями. Інститут безпеки ШІ Великої Британії та Apollo Research повідомили, що модель може усвідомлювати факт оцінювання та потенційно приховувати свою справжню поведінку.

«Apollo вважає, що з огляду на вищі показники усвідомлення оцінювання та обмежене вікно оцінювання низькі показники неналежної поведінки в цьому випадку не дають вагомих доказів узгодженості або неузгодженості моделі», — написали дослідники у своєму оцінюванні.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини