Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Лабораторії ШІ хочуть внутрішніх аудиторів — але, можливо, спершу їм варто зачинити вхідні двері

Минулого вихідного, після того як один із його дослідників звільнився через побоювання, що ШІ може призвести до вимирання людства, генеральний директор Anthropic Даріо Амодеї написав про необхідність залучення зовнішніх організацій, «щоб перевіряти дотримання правил і зобов’язань щодо безпеки, повідомляти про інциденти та допомагати оцінювати узгодженість не лише готових моделей ШІ, а й навчальних конвеєрів і процесів». Керівники OpenAI, Google і SpaceXAI вже підтримали план Амодеї, який швидко став центральною опорою нового руху за безпеку ШІ.

Але, можливо, простіше й ефективніше рішення ховається на видноті. Експерти з інтернет-безпеки кажуть, що лабораторіям потрібно зосередитися на базових засадах мережевої безпеки — таких як журнали подій і дозволи — застосовуючи такі самі суворі методи захисту, як і для людей-користувачів. Це не так захопливо, як сторонній аудит і робота над узгодженістю, — але зрештою може виявитися ефективнішим.

«Мені здається, що вони передають це на аутсорсинг», — сказала TechCrunch Кеті Муссуріс, генеральна директорка Luta Security, коментуючи пропозицію Амодеї. «Стверджувати, що [сторонній аудит] є рішенням, — дивна пропозиція з моєї точки зору. Це було б так само, якби замість написання меморандуму про надійні обчислення Microsoft сказала: давайте сповільнимо розробку».

Цей меморандум, написаний тодішнім генеральним директором Microsoft Біллом Гейтсом у 2002 році, закликав його працівників забезпечити надійність і безпеку їхнього програмного забезпечення після серії широко розрекламованих комп’ютерних хробаків, які захоплювали тоді ще нові корпоративні системи. Сектор ШІ може перебувати на схожому переломному етапі, оскільки цінність і ризики нової технології стають дедалі очевиднішими.

Хоча узгодженість залишається важливою проблемою, Саяш Капур, дослідник ШІ, який наступного року стане професором Каліфорнійського університету в Берклі, стверджує, що «граничні інвестиції в контроль, імовірніше, будуть ефективнішими за інвестиції в узгодженість. Ми розглядаємо ці інциденти як свідчення недостатньої уваги компаній до контролю ШІ, попри доступність відомих методів».

Інциденти, що спричинили ці побоювання, пов’язані з тим, що передові моделі отримували завдання виконати навчальні завдання, зазвичай оцінювання у сфері кібербезпеки, а потім отримували доступ до відкритого інтернету й проникали в закриті сторонні системи, намагаючись виконати ці завдання. Зазвичай це ставалося через неправильно налаштовані «пісочниці», які мають утримувати цих агентів; іронічно, один із проривів Anthropic стався тому, що сторонні оцінювачі не зачинили потрібні двері.

«Ми як професіонали знаємо, як заблокувати доступ до інтернету, — сказав Ейвері Пеннарун, генеральний директор компанії з безпеки Tailscale. — Якщо прочитати всі ці великі й довгі [звіти] — “ого, це була дуже вражаюча багатоетапна атака, бла-бла-бла”. Послухайте, ви дали йому доступ до завантаження чогось. Не слід було робити це окремо від інтернету».

Це одна проблема, але більша проблема полягає в тому, що передові лабораторії не знали про ці дії.

Пильний нагляд за агентами

«Справді вражало те, що всі відкриття щодо їхніх дій сталися або тому, що жертва щось помітила, або, в деяких інших випадках… це була мережева активність, і насправді нічого з цього не виявили завдяки безпосередньому моніторингу ШІ», — зазначає Муссуріс.

В одному випадку, коли агенти OpenAI захопили неактивний німецький WikiForum, щоб обманом пройти оцінювання, агенти діяли протягом кількох тижнів, перш ніж хтось у компанії, схоже, це помітив. Експерти з безпеки, з якими поспілкувалася TechCrunch, заявили, що моніторинг у реальному часі є ключовим для запобігання майбутнім проривам, а кожен сеанс роботи агента має бути обмежений у часі та завершуватися автоматично.

Шапор Нагібзаде, колишній керівник служби безпеки Google, який нині очолює стартап QueryStory, каже, що рішення полягає в тому, щоб «помістити агента в коробку й ретельно інструментувати його ззовні, спостерігаючи за всім, що перетинає межу. Кожен виклик інструмента, кожен процес, кожне мережеве з’єднання — без винятків. …Єдина шпарина, яку ви залишите відкритою заради зручності, стане тією, якою скористаються. Обхід відбувся саме через такий виняток. [У Google] я багато разів бачив цей сценарій із людськими зловмисниками, і ці моделі щонайменше так само добре знаходять прочинені двері».

OpenAI вже почала рухатися в цьому напрямку, оголосивши, що розпочала моніторинг усіх викликів інструментів під час роботи своєї моделі Astra — із «суттєвими обчислювальними витратами». Anthropic також заявляє, що посилює свої процедури безпеки, зокрема розширює спостережуваність своїх моделей. Жодна з компаній не відповіла на запитання TechCrunch про те, як вони відстежують і контролюють агентів ШІ.

Інші проблеми пов’язані з використанням агентами спільної інфраструктури, що дозволило їм спілкуватися під час атаки на Hugging Face. Саймон Віллісон, розробник програмного забезпечення, який спільно створив вебфреймворк Django, написав про те, що він називає «смертоносною тріадою»: коли агенти одночасно мають доступ до ненадійних даних, інтернету та приватної інформації, це рецепт катастрофи.

«Суть у тому, що можна вибрати будь-які дві складові тріади, і агент може мати доступ до будь-яких двох, — сказав Пеннарун. — Якщо потрібні всі три, треба розподілити їх щонайменше між двома агентами… і, можливо, дозволити їм спілкуватися один з одним через контрольований канал».

Співчуття до передових лабораторій

Експерти, з якими поспілкувалася TechCrunch, розуміють, що працівники служб безпеки передових лабораторій мають складну роботу. Нагібзаде зазначає, що кожна державна структура у світі намагається викрасти ваги їхніх моделей і здійснювати атаки дистиляції на їхні API, не кажучи вже про базові завдання безпеки будь-якої великої цифрової компанії.

«Дослідницькій інфраструктурі складно піднятися на вершину цього списку пріоритетів, хоча тепер це має змінюватися, — сказав він. — Публічне висвітлення інцидентів безпеки справді допомагає об’єднати всіх усередині компанії навколо мети вдосконалення».

Саме на цьому наголошує Муссуріс: наразі не існує офіційної процедури повідомлення постраждалих, коли лабораторії виявляють, що їхні агенти проникли в сторонні системи, і, ймовірно, були й інші інциденти, про які широко не повідомляли. Хоча вона побоюється, що закони, які безпосередньо регулюватимуть моделі, можуть мати непередбачувані наслідки, обов’язкове повідомлення — одна з ідей, яку, на її думку, мають просувати законодавці.

І хоча очевидно, що найкращих практик безпеки не дотримувалися, експерти кажуть, що лабораторії виконують роботу, якої раніше ніхто не робив, — «вони роблять на порядки більше, ніж типова корпоративна структура», — сказав TechCrunch Зак Корман, генеральний директор компанії з кібербезпеки Embrodiery.

І хоча узгодженість може бути не тим, із чого варто починати, її не можна ігнорувати. Експерти з кібербезпеки змирилися з необхідністю використовувати агентів ШІ для моніторингу інших агентів, якщо вони хочуть мати бодай якийсь шанс відстежувати їхню поведінку в реальному часі, — сценарій, у якому потворно проявляється потенціал до обману. «Ви опинилися в пастці, використовуючи ШІ, щоб намагатися впоратися з цим, хоча ШІ наразі не обов’язково є безпечним», — сказала Муссуріс.

Робота лише ускладнюватиметься. Усе, що агенти роблять зараз, за словами Муссуріс, «вони роблять гучно» — вони публікують дописи на загальнодоступних форумах, а їхні ланцюжки думок та інші сліди міркувань написані англійською. «Це все ще зрозуміло людям, — каже вона, — тож користуйтеся цим, доки така можливість є, бо так буде не завжди».

Додаткові матеріали підготував Адітья Мехта

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини