Первый встроенный оценщик Anthropic — это… Accenture?
Планы Дарио Амодеи разместить сторонних специалистов по оценке безопасности внутри лабораторий ИИ приобретают конкретные очертания: Anthropic сообщила, что сотрудники технологического консалтингового гиганта Accenture начнут работать внутри компании, тщательно проверяя её модели и сотрудников.
В сообщении в блоге Anthropic сообщила, что Faculty — компания, приобретённая Accenture в январе для работы в качестве её подразделения по ИИ, — начнёт «оценивать модели и проводить их стресс-тестирование, выполнять оценки согласованности и тестировать защитные механизмы моделей». Обе компании рассчитывают инвестировать в этот проект не менее 1 миллиарда долларов в течение следующих пяти лет.
Выбор Accenture удивил многих наблюдателей за сферой ИИ — и рынки, где акции консалтинговой компании после закрытия торгов подскочили на 8%. Обсуждение встроенных оценщиков, начавшееся после публикации в блоге Амодеи, было сосредоточено на организациях, занимающихся исследованиями безопасности ИИ, таких как METR, Redwood Research и Apollo Research. Особенно это актуально для Anthropic, которая ставит безопасность и согласованность ИИ во главу угла своей миссии.
Anthropic сообщила, что в ближайшие недели будут объявлены новые оценщики, а также что ведёт переговоры с METR и другими некоммерческими организациями о том, как «опробовать отдельные элементы встроенной оценки, используя собственное финансирование».
Хотя Accenture не известна передовыми исследованиями в области глубокого обучения, Anthropic указала на практический опыт компании по внедрению ИИ в крупных корпорациях и государственных учреждениях как на ключевое преимущество. Кроме того, будучи крупной публичной компанией, существующей ещё до начала революции ИИ, Accenture в функциональном отношении более независима от Anthropic и, скажем так, сложной экосистемы вокруг лаборатории ИИ.
Лаборатория отметила, что стандартов, регулирующих доступ оценщиков и их коммуникации, пока не существует, и что со временем её подход будет развиваться. Хотя внешние оценки уже являются важной частью процесса выпуска новых больших языковых моделей, недавние инциденты повысили ставки: агенты ИИ, развёрнутые OpenAI и Anthropic, взламывали сторонние веб-сайты, не вызывая тревоги внутри лабораторий.
Некоторые критики, призывающие к более ответственному подходу к созданию искусственного интеллекта, видят в схеме Амодеи по саморегулированию индустрии ИИ план по уходу от ответственности за ненадлежащее поведение моделей ИИ. Anthropic настаивает, что эти оценщики «не снижают нашу ответственность, а помогают сделать её более проверяемой. Безопасность наших моделей остаётся нашей ответственностью».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.