Один із перших співробітників Anthropic і колишній операційний директор METR знайшли спосіб приборкати некерованих ШІ-агентів
Через день після того, як дослідник Anthropic Джейкоб Коксон звільнився через побоювання, що ШІ може знищити всіх нас до кінця десятиліття, я зустрівся із засновниками та свояками Руне Квістом і Радживом Даттані. Вони вважають, що мають рішення, яке може врятувати всіх нас або принаймні допомогти запобігти тому, щоб агенти ШІ вийшли з-під контролю всередині підприємств.
«ШІ стає розумнішим дедалі швидшими темпами. Дивовижно, що ШІ стає важче впроваджувати й контролювати в міру того, як він розумнішає, а не легше», — сказав Квіст, колишній співробітник Anthropic, який також одружений із сестрою Даттані). Даттані — колишній операційний директор організації з досліджень безпеки ШІ METR.
Пара заснувала стартап під назвою Artificial Intelligence Underwriting Company (AIUC), який прагне поширити практики безпеки ШІ на підприємства та компанії, що створюють моделі й агентів ШІ. Серед клієнтів стартап називає Cursor, Lovable, Harvey та ElevenLabs.
У вівторок AIUC оголосила про залучення 40 мільйонів доларів у раунді Series A під керівництвом Ribbit Capital за участю First Harmonic. Раніше компанія закрила посівний раунд на 15 мільйонів доларів від Ната Фрідмана через його фонд NFDG, а також за участю Emergence, Terrain і співзасновника Anthropic Бена Манна та інших інвесторів, довівши загальний обсяг залученого фінансування до 55 мільйонів доларів.
Увагу цієї групи інвесторів найвищого рівня привернула спроба AIUC застосувати знайому модель кібербезпеки до нового набору ризиків, пов’язаних із ШІ. Компанія створила рівень стороннього аудиту та сертифікації для агентів ШІ.
«Банки, лікарні, уряди та військові більше не відмовляються від впровадження ШІ через те, що модель недостатньо розумна, — сказав Квіст. — Вони відмовляються, бо взяли на себе зобов’язання перед власними клієнтами щодо того, що система робитиме, а чого — ні, і наразі ніхто не може цього гарантувати».
Взявши за основу широко поширений стандарт кібербезпеки SOC 2, AIUC розробила стандарт під назвою AIUC-1 і сервіс тестування для перевірки відповідності агентів цьому стандарту.
Для розробки стандарту AIUC зібрала консорціум із приблизно 250 керівників напрямів безпеки та ризиків — покупців агентів. «Це люди, з якими ми зустрічаємося щомісяця, і ми ставимо їм запитання: коли ви купуєте агентів у когось, на що ви звертаєте увагу? Які запитання ви хотіли б поставити і які питання хотіли б бачити розглянутими?» — розповів Даттані TechCrunch.
Ці відгуки формують тести. Потім стартап проганяє агента через набір приблизно з 5 000 тестів, щоб перевірити його поведінку в сценаріях, пов’язаних із джейлбрейками, галюцинаціями та витоками даних. Результати формують звіт обсягом близько 100 сторінок, у якому детально описано, де агент працює безпечно й надійно, а де — ні. Цікаво, що AIUC використовує агентів ШІ для проведення тестів, а ШІ — для аналізу даних. Однак фінальний аудит перевіряють люди, сказав Квіст.
Якщо це звучить дещо знайомо, то так і є. Колишній роботодавець Даттані METR, де він був операційним директором із 2024 до 2025 року й досі залишається членом ради директорів, проводить подібне тестування для лабораторій, що розробляють передові моделі, хоча донедавна його робота здебільшого зосереджувалася на продуктивності — на тому, чи можуть агенти надійно виконувати завдання. METR була однією з незалежних дослідницьких організацій, які OpenAI залучила для розслідування інциденту з Hugging Face.
Генеральний директор Anthropic Даріо Амодеї також нещодавно закликав індустрію ШІ уповільнити темпи розробки передових моделей, посилаючись на стрімке зростання кількості інцидентів із неналежною поведінкою. У своїй публікації Амодеї висунув ідею зобов’язати лабораторії, що розробляють передові моделі, використовувати вбудованих сторонніх оцінювачів для спостереження та перевірки безпеки, і назвав METR одним із можливих варіантів.
Хоча AIUC не пропонує вбудовувати своїх фахівців у роботу на майданчиках клієнтів, загальна ідея схожа: надати підприємствам незалежну оцінку безпеки їхніх агентів ШІ. «Ось у чому він проходить перевірку і де йому можна довіряти. А ось тут є занепокоєння. Вам слід знати про ці моменти, перш ніж ухвалювати рішення про купівлю», — сказав Даттані.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.