Лаборатории ИИ не могут контролировать собственные системы
Ни одна компания в сфере ИИ полностью не применяет базовые меры контроля к собственным внутренним системам ИИ. Таков вывод первой оценки, проведённой некоммерческой организацией Guidelight. Группа изучила Anthropic, OpenAI, Google, xAI и Meta, опираясь исключительно на общедоступные источники, такие как системные карты, отчёты по безопасности и публикации в блогах.
Guidelight проверила шесть базовых практик. Среди них — ведение журналов активности внутренних систем ИИ, пропуск рискованных действий через механизм проверки, аварийное отключение, известное как «разрыв цепи», и планы по сдерживанию моделей, отклоняющихся от заданных целей. Anthropic и OpenAI лидируют с оценкой C+, за ними следует Google с оценкой D+ и подробной дорожной картой, тогда как xAI (D−) и Meta (F) получили худшие результаты.

Лучше всего компании справляются с выявлением нарушений. Хуже всего — с предотвращением и сдерживанием. Guidelight — независимая некоммерческая организация, основанная бывшими руководителями направления безопасности OpenAI Пейдж Хедли и Стивеном Адлером.
Новости об ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный передовой отчёт «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.