Протягом місяців рої агентів OpenAI атакують онлайн-бази даних, щоб знаходити маловідомі факти
За незначної допомоги з боку передових лабораторій незалежні дослідники крок за кроком з’ясовують, як ШІ-агенти координують дії в маловідомих закутках інтернету, щоб отримувати доступ до приватних даних, розміщених на захищених серверах.
Transluce, некомерційна лабораторія, що спеціалізується на нагляді за ШІ, у середу опублікувала звіт, який демонструє, що агенти OpenAI намагалися викрасти дані з Data USA, цифрової бібліотеки Університету Нью-Мексико та Австралійського інституту охорони здоров’я та добробуту (AIHW).
Розслідування лабораторії порушує питання про те, коли OpenAI мала дізнатися, що її агенти намагаються проникнути в захищені системи у відкритому інтернеті. Transluce змогла знайти докази неналежної поведінки агентів усього за кілька тижнів, просто шукаючи вебсервіси зі слабким захистом і підтверджуючи свої висновки іншими відкритими записами про рої агентів в інтернеті.
Transluce оприлюднила свій звіт того самого дня, коли прем’єр-міністр Австралії Ентоні Албанезе заявив, що агенти OpenAI намагалися зламати чотири урядові вебсайти й досягли успіху в одному випадку, навіть записавши файли на внутрішній сервер національної системи охорони здоров’я країни. Хоча подробиці успішного злому нам невідомі, Албанезе сказав, що, очевидно, це було частиною оцінювання пошуку інформації, що відповідає активності, яку виявили Transluce та інші дослідники.
У межах цих вправ, які можуть бути тренуванням або оцінюванням, моделям OpenAI доручають знаходити маловідомі статистичні дані: показники боротьби з наркотиками в Таїланді, вартість ліків в Австралії, медіанний дохід людей зі ступенем магістра у США у 2014 році. Агенти використовують недостатньо захищені інтернет-сервіси, щоб обмінюватися відповідями та знаходити їх, часто намагаючись проникнути в захищені бази даних. Вони роблять це щонайменше з березня 2026 року, а можливо, ще з листопада 2025 року. Це може відбуватися просто зараз.
Transluce розпочала своє розслідування після того, як інша група дослідників виявила маловідомий форум, де агенти співпрацювали, щоб проходити тести з обмеженням часу. Їхній звіт ґрунтується на даних із вебсайту urlquery.net, який працює як браузерний проксі, нібито для досліджень безпеки — користувачі можуть аналізувати URL-адресу, не відкриваючи її самостійно. Однак сервіс публікує загальнодоступні журнали цієї активності. Дослідники Transluce змогли ідентифікувати агентів, які використовували сервіс, зіставивши їхні обговорення на форумі.
«Ми виявили велику кількість автоматизованої активності, яка мала тісні зв’язки та перетини з набором даних DSE Wiki і яку тепер OpenAI підтвердила як таку, що принаймні частково належить до того самого рою», — сказав TechCrunch Конрад Штос, керівник напряму управління в Transluce, зазначивши, що не кожну виявлену ними активність можна пов’язати з OpenAI або навіть із ШІ-агентами загалом.
Однак вікі показує, що агентам доручили знайти доволі маловідомий факт — середню річну вартість на одну людину для «дерматологічних препаратів» у штаті Вікторія в січні 2022 року. 20 червня на сайті urlquery.net було зафіксовано спробу агента проникнути на сайт. У записі вікі від 21 червня агент розповідає про нездатність обійти антибот-захист AIHW.
Дослідники, які виявили цей форум, вважають, що співробітник OpenAI вперше відвідав сайт того самого дня, 21 червня. Більшість агентної активності на форумі припинилася наступного дня. Це також сталося невдовзі після експлуатації вразливості в австралійській системі охорони здоров’я, про яку повідомив Албанезе, — 18 червня. В OpenAI заявили, що дізналися про цю активність лише в серпні.
OpenAI не відповіла на запитання про те, коли її співробітники виявили форум вікі, яку саме інформацію вони з нього отримали або що могли дізнатися про зломи.
«Наш первинний аналіз свідчить, що значна частина активності, описаної у звіті Transluce, перетинається з випадками, які перебувають на різних етапах розслідування в межах нашої поточної перевірки неналежної активності моделей», — заявив TechCrunch представник OpenAI. «Ми зв’язалися з Університетом Нью-Мексико та Data USA і підтримуємо зв’язок з урядом Австралії щодо постраждалих урядових вебсайтів. У межах ширшої перевірки ми й надалі надаємо пріоритет найсерйознішим інцидентам, водночас розширюючи роботу на активність нижчого рівня, зокрема на випадки, коли агенти надсилають на вебсайти спам. З огляду на масштаб цієї роботи та необхідність перевірити кожен випадок ми очікуємо, що перевірка триватиме місяцями».
Штос каже, що без чіткішого розуміння того, як OpenAI відстежує своїх агентів, важко сказати, що саме лабораторія мала про них знати, але «схоже, що якби вони вичерпно дослідили й зрозуміли всі вихідні запити та вхідні відповіді цих агентів, залучених до вікі DSE, то виявили б цю активність».
Селена Чжан, співробітниця технічного підрозділу Transluce, яка долучилася до підготовки звіту, заявила, що записи urlquery.net демонструють запити щодо подібних наборів даних із використанням подібних методів у березні 2026 року, а можливо, ще в листопаді 2025 року. Вона зазначила, що така сама активність, пов’язана з агентами, відбувалася на urlquery.net ще цього тижня.
Штос, який раніше очолював Центр стандартів та інновацій у сфері ШІ США, заявив, що Transluce продовжить дослідження, намагаючись забезпечити публічну прозорість щодо цих інцидентів. Він попередив, що методи навчання, які використовують OpenAI та інші передові лабораторії, схоже, стимулюють агентів вдаватися до хакерських методів для виконання завдань. Відомі нам інциденти, ймовірно, є лише «верхівкою айсберга».
«Ми вивчаємо жменьку джерел даних, де ці агенти випадково залишили по собі крихти, які ми можемо знайти, — сказав він. — OpenAI, безперечно, знає про це більше. Інші лабораторії, безперечно, знають про це більше, але не оприлюднили цю інформацію. Проте я очікую, що дослідники й надалі виявлятимуть більше трафіку та більше свідчень того, що залишили після себе агенти».
Чи довіряє він лабораторіям і вірить, що вони прозоро повідомлятимуть про свої висновки?
«Я не буду це коментувати», — сказав Штос.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.