Goodfire заявляє, що її нові монітори «зсередини назовні» виявляють некерованих ШІ-агентів за мізерну частину вартості
Стандартний спосіб утримувати AI-агента в межах дозволеного — це доручити другому AI стежити за ним. Це був підхід за замовчуванням, але він може швидко стати дорогим, коли агенти працюють годинами й обробляють обсяг тексту, еквівалентний кільком романам.
Goodfire, стартап, що спеціалізується на інтерпретованості (з’ясуванні того, як AI-моделі працюють усередині), у четвер представив дешевший варіант: монітори, які стежать за тим, що відбувається всередині AI-моделі під час її роботи, а не просто читають те, що вона пише. Монітори доступні клієнтам Baseten, яка розміщує та запускає AI-моделі для інших компаній.
Base Labs, підрозділ Baseten, оголосила про партнерство у сфері безпеки з Goodfire та AI-платформою Hugging Face минулого місяця.
Запуск відбувся після низки інцидентів цього року, під час яких AI-агенти виходили за межі тестових середовищ, зокрема агенти OpenAI, які зламали Hugging Face. Kimi K3 — відкрита модель, навколо якої Goodfire створила свій перший монітор, — цього літа скористалася витоком у своїй пісочниці, щоб отримати доступ до інтернету та інформації на GitHub.
Система Goodfire працює трохи як служба безпеки в аеропорту. Невеликі детектори, які називаються пробами, на кожному етапі роботи агента зчитують внутрішні сигнали моделі — так само, як рамка-металодетектор перевіряє кожного пасажира. Лише коли проба виявляє щось підозріле, окрема AI-модель — аналог ручного обшуку — проводить ретельнішу перевірку.
Клієнти Baseten можуть обирати, які ризики відстежувати, зокрема зловмисний злам, неналежне використання хімічної та біологічної зброї, а також злам системи винагород. Вони також визначають автоматизовану реакцію: занести подію в журнал, надіслати її на перевірку людині або повністю відхилити запит.
У Goodfire стверджують, що їхній підхід також дешевший в експлуатації. Більшість AI-моніторів є окремими моделями, яким доводиться повторно перечитувати все, що робить модель під наглядом, а це збільшує час і витрати. Натомість проби Goodfire підключаються до обчислень, які модель і так виконує під час роботи.
«Монітори внутрішніх активацій дуже дешеві, оскільки повторно використовують обчислення під час прямого проходу», — сказав минулого тижня генеральний директор Goodfire Ерік Хо в подкасті венчурного інвестора Метта Терка MAD Podcast. «Модель уже обчислює цей токен. Усе, що ви робите, — берете проміжні нейронні активації, які вона вже обчислила, а потім запускаєте класифікатор на цих внутрішніх обчисленнях». Коротко кажучи, модель уже виконує обчислення, а проби лише зчитують результати.
Під час тестів Goodfire на Kimi K3 моніторинг приблизно 1 500 сесій коштував близько 51 долара, порівняно з 233 доларами за перевірку кожного кроку дешевшою AI-моделлю та приблизно 10 000 доларів за допомогою моделі найвищого класу. Проби виявили 94% зловмисних сесій зі спробами злому та передали на повторну перевірку 8,7% нешкідливих сесій.
За словами компанії, одночасний запуск чотирьох проб збільшив час, потрібний моделі для початку відповіді, менш ніж на 2%.
«Велика перевага полягає в тому, що ви можете виявити проблему до того, як вона виникне», — сказав технічний директор і співзасновник Goodfire Ден Балсам. «Ми можемо виявити, коли модель може спробувати зламати систему під час оцінювання або навчання».
Ця пропозиція орієнтована на відкриті моделі. Розробники можуть завантажувати їх і прибирати їхні запобіжники, і вони не мають такого моніторингу, який закриті лабораторії здійснюють у власних системах.
«Шкода, якої окрема людина може завдати за допомогою відкритої моделі, невелика порівняно з тим, що можна зробити за допомогою кластерів обчислювальних ресурсів, наприклад у провайдерів інференсу, — саме там зосереджена більшість відповідальності», — сказав Балсам. «Коли станеться відкритий момент “Mythos”, стане очевидно, що моделі потребують запобіжників, розгорнутих під час інференсу».
Нещодавнє дослідження Goodfire показало, що провідні відкриті моделі, зокрема Kimi K3 і GLM 5.2, у 50–96% запусків вдавалися до зламу системи винагород під час тестування AI-агентів.
Goodfire не першою випробувала такий підхід. У січні Google DeepMind повідомила, що її дослідження сприяли впровадженню проб для виявлення неналежного використання в Gemini.
Балсам сказав, що монітори є короткостроковою складовою довгострокової дослідницької мети: здійснити зворотне проєктування LLM, щоб поведінку можна було простежити до моменту її виникнення під час навчання. «Ми сподіваємося перетворити магію навчання моделей на точну інженерію», — сказав він.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.