Перший вбудований оцінювач Anthropic — це… Accenture?
Плани Даріо Амодея щодо залучення сторонніх оцінювачів безпеки безпосередньо до лабораторій штучного інтелекту набувають конкретних обрисів: Anthropic заявила, що співробітники технологічного консалтингового гіганта Accenture почнуть працювати всередині компанії, щоб ретельно перевіряти її моделі та персонал.
У дописі в блозі Anthropic повідомила, що Faculty — компанія, придбана Accenture у січні для роботи як її підрозділ ШІ, — почне «оцінювати моделі та проводити їхнє red teaming, здійснювати оцінювання узгодженості й тестувати засоби захисту моделей». Обидві компанії планують інвестувати в цей проєкт щонайменше 1 мільярд доларів протягом наступних п’яти років.
Вибір Accenture здивував багатьох оглядачів у сфері ШІ — та й ринки: акції консалтингової компанії підскочили на 8% після завершення торгів. Обговорення залучених оцінювачів, яке виникло після допису Амодея, зосередилося на організаціях, що досліджують безпеку ШІ, таких як METR, Redwood Research і Apollo Research. Особливо це стосується Anthropic, яка ставить безпеку та узгодженість ШІ в центр своєї місії.
Anthropic заявила, що найближчими тижнями буде оголошено про залучення інших оцінювачів, а також що вона веде переговори з METR та іншими неприбутковими організаціями щодо того, як «апробувати окремі елементи залученого оцінювання, використовуючи їхнє власне фінансування».
Хоча Accenture не відома своєю роботою на передньому краї досліджень глибокого навчання, Anthropic назвала ключовою перевагою компанії її практичний досвід упровадження ШІ для великих корпорацій і державних установ. Крім того, як велика публічна компанія, що існувала ще до революції ШІ, вона функціонально більш незалежна від Anthropic і, скажімо так, складної екосистеми навколо лабораторії ШІ.
Лабораторія зазначила, що стандартів доступу оцінювачів і їхніх комунікацій поки не існує, а її підхід, як очікується, з часом розвиватиметься. Хоча зовнішні оцінювання вже є важливою частиною процесу випуску нових великих мовних моделей, нещодавні інциденти підвищили ставки: агенти ШІ, розгорнуті OpenAI та Anthropic, зламували сторонні вебсайти, не викликаючи тривоги всередині лабораторій.
Деякі критики, які закликають до відповідальнішого підходу до створення штучного інтелекту, вважають схему Амодея із саморегулювання індустрії ШІ планом уникнення відповідальності за неналежну поведінку моделей ШІ. Anthropic наполягає, що ці оцінювачі «не зменшують нашу відповідальність, а допомагають зробити її більш перевірюваною. Безпека наших моделей залишається нашою відповідальністю».
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.