Один из первых сотрудников Anthropic и бывший операционный директор METR нашли способ обуздать вышедших из-под контроля ИИ-агентов
На следующий день после того, как исследователь Anthropic Джейкоб Коксон уволился из компании из-за опасений, что ИИ может уничтожить человечество к концу десятилетия, я встретился с основателями и свояками Руне Квистом и Радживом Даттани. Они считают, что у них есть решение, которое может спасти всех нас или, по крайней мере, помочь предотвратить выход ИИ-агентов из-под контроля внутри предприятий.
«ИИ становится умнее всё более быстрыми темпами. Удивительно то, что по мере того, как ИИ умнеет, его становится сложнее внедрять и контролировать, а не проще», — сказал Квист, один из первых сотрудников Anthropic, который также женат на сестре Даттани). Даттани — бывший операционный директор организации, занимающейся исследованиями безопасности ИИ, METR.
Эта пара основала стартап под названием Artificial Intelligence Underwriting Company (AIUC), который надеется внедрить безопасность ИИ в предприятия и компании, создающие модели и агентов ИИ. Среди клиентов стартап называет Cursor, Lovable, Harvey и ElevenLabs.
Во вторник AIUC объявила о привлечении $40 млн в рамках раунда Series A под руководством Ribbit Capital при участии First Harmonic. Ранее компания закрыла посевной раунд на $15 млн, привлечённый от Ната Фридмана через его фонд NFDG, а также Emergence, Terrain и сооснователя Anthropic Бена Манна, среди прочих. Таким образом, общий объём привлечённых средств достиг $55 млн.
Внимание этой группы инвесторов высшего уровня привлекла попытка AIUC применить знакомую модель кибербезопасности к новому набору рисков, связанных с ИИ. Компания создала независимый уровень аудита и сертификации для ИИ-агентов.
«Банки, больницы, правительства и военные больше не отказываются от внедрения ИИ потому, что модель недостаточно умна, — сказал Квист. — Они отказываются, потому что взяли на себя обязательства перед собственными клиентами относительно того, что система будет и не будет делать, а в настоящее время никто не может этого гарантировать».
Взяв за основу широко распространённый стандарт кибербезопасности SOC 2, AIUC разработала стандарт под названием AIUC-1 и сервис тестирования для проверки агентов на соответствие этому стандарту.
Для разработки стандарта AIUC собрала консорциум примерно из 250 руководителей в сфере безопасности и управления рисками — покупателей агентов. «Это люди, с которыми мы встречаемся каждый месяц, и мы задаём им вопрос: когда вы покупаете агентов у кого-то, на что вы обращаете внимание? Какие вопросы вы хотели бы задать и какие аспекты хотели бы увидеть учтёнными?» — рассказал Даттани TechCrunch.
Эти отзывы определяют содержание тестов. Затем стартап прогоняет агента через набор примерно из 5000 тестов, чтобы выяснить, как он ведёт себя в сценариях, связанных с джейлбрейками, галлюцинациями и утечками данных. В результате формируется отчёт объёмом около 100 страниц, подробно описывающий, в каких случаях агент работает безопасно и надёжно, а в каких — нет. Примечательно, что AIUC использует ИИ-агентов для проведения тестов, а ИИ — для анализа данных. Однако люди проверяют итоговый аудит, сказал Квист.
Если всё это кажется немного знакомым, так и есть. Бывший работодатель Даттани — METR, где он был операционным директором с 2024 по 2025 год и остаётся членом совета директоров, — проводит аналогичное тестирование для лабораторий, разрабатывающих передовые модели, хотя до недавнего времени его работа была сосредоточена в основном на производительности (то есть на том, способны ли агенты надёжно выполнять задачи). METR была одной из независимых исследовательских организаций, которые OpenAI привлекла для расследования инцидента с Hugging Face.
Генеральный директор Anthropic Дарио Амодеи также недавно призвал индустрию ИИ замедлить разработку передовых моделей, сославшись на резкий рост числа инцидентов, связанных с ненадлежащим поведением. В своей публикации Амодеи высказал идею обязать лаборатории, создающие передовые модели, использовать встроенных сторонних оценщиков для наблюдения и проверки безопасности, назвав METR одним из возможных вариантов.
Хотя AIUC не предлагает внедрять своих специалистов на площадках клиентов, общая идея схожа: предоставить предприятиям независимую оценку безопасности их ИИ-агентов. «Вот где агент проходит проверку и где ему можно доверять. А вот где есть опасения. Вы должны знать об этих ограничениях, прежде чем принимать решение о покупке», — сказал Даттани.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.