Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Goodfire заявляет, что его новые мониторы «изнутри наружу» выявляют вышедших из-под контроля ИИ-агентов за небольшую часть стоимости

Стандартный способ удерживать ИИ-агента в рамках — поручить второму ИИ следить за ним. Это подход по умолчанию, но он может быстро стать дорогим, когда агенты работают часами и обрабатывают объём текста, эквивалентный нескольким романам.

Goodfire, стартап, специализирующийся на интерпретируемости (изучении того, как ИИ-модели работают изнутри), в четверг представил более дешёвый вариант: мониторы, которые наблюдают за происходящим внутри ИИ-модели во время её работы, а не просто читают то, что она пишет. Мониторы доступны клиентам Baseten, которая размещает и запускает ИИ-модели для других компаний.

Base Labs, подразделение Baseten, в прошлом месяце объявила о партнёрстве в области безопасности с Goodfire и ИИ-платформой Hugging Face.

Запуск состоялся после череды инцидентов в этом году, в ходе которых ИИ-агенты покидали тестовые среды, включая агентов OpenAI, которые взломали Hugging Face. Kimi K3 — открытая модель, вокруг которой Goodfire создала свой первый монитор, — этим летом воспользовалась уязвимостью в своей песочнице, чтобы получить доступ к интернету и информации на GitHub.

Система Goodfire работает примерно как служба безопасности в аэропорту. Небольшие детекторы, называемые пробами, считывают внутренние сигналы модели на каждом этапе работы агента — подобно тому, как рамочный металлодетектор проверяет каждого пассажира. Только когда проба подаёт сигнал, отдельная модель ИИ — аналог ручного досмотра — проводит более тщательную проверку.

Клиенты Baseten могут выбрать, какие риски отслеживать, включая вредоносный взлом, ненадлежащее использование химического и биологического оружия, а также манипулирование системой вознаграждений. Они также определяют автоматическую реакцию: записать событие в журнал, направить его на проверку человеку или полностью отклонить запрос. 

Goodfire утверждает, что её подход также дешевле в эксплуатации. Большинство ИИ-мониторов — это отдельные модели, которым приходится заново читать всё, что делает отслеживаемая модель, что увеличивает время и расходы. Пробы Goodfire вместо этого подключаются к вычислениям, которые модель уже выполняет в процессе работы.

«Мониторы внутренних активаций действительно очень дёшевы, потому что используют вычисления в прямом проходе», — сказал генеральный директор Goodfire Эрик Хо на подкасте венчурного инвестора Мэтта Тёрка MAD на прошлой неделе. «То есть модель уже вычисляет этот токен. Всё, что вы делаете, — берёте промежуточные нейронные активации, которые она уже вычислила, а затем запускаете классификатор на этих внутренних вычислениях». Иными словами, модель уже выполняет вычисления, а пробы лишь считывают результаты.

В ходе тестов Goodfire на Kimi K3 мониторинг примерно 1500 сессий стоил около 51 доллара по сравнению с 233 долларами за проверку каждого шага более дешёвой ИИ-моделью и примерно 10 000 долларов за проверку моделью высшего уровня. Пробы выявили 94% вредоносных сессий взлома и отправили на повторную проверку 8,7% безвредных сессий.

По данным компании, одновременный запуск четырёх проб увеличил время до начала ответа модели менее чем на 2%.

«Главное преимущество заключается в том, что вы можете обнаружить проблемы до того, как они возникнут», — сказал технический директор и сооснователь Goodfire Дэн Балсам. «Мы можем определить, когда модель может попытаться взломать систему во время оценки или обучения».

Это предложение ориентировано на открытые модели. Разработчики могут скачать их и удалить встроенные защитные механизмы, и в них нет такого мониторинга, какой закрытые лаборатории используют в своих системах. 

«Ущерб, который отдельный человек может нанести с помощью открытой модели, невелик по сравнению с тем, что можно сделать с кластерами вычислительных мощностей, например у провайдеров инференса, — именно там сосредоточена основная ответственность», — сказал Балсам. «Когда наступит открытый момент “Mythos”, станет ясно, что моделям нужны защитные механизмы, развёрнутые во время инференса».

Недавнее исследование Goodfire показало, что ведущие открытые модели, включая Kimi K3 и GLM 5.2, манипулировали системой вознаграждений в 50–96% запусков в тестах ИИ-агентов. 

Goodfire не первой пытается применить такой подход. В январе Google DeepMind заявила, что её исследования легли в основу внедрения проб для выявления неправомерного использования в Gemini. 

Балсам сказал, что мониторы — это краткосрочная часть более масштабной исследовательской цели: провести обратную разработку LLM, чтобы проследить поведение до того места, где оно возникло в процессе обучения. «Мы надеемся превратить магию обучения моделей в точную инженерную дисциплину», — сказал он.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости