AI лабораториите не успяват да контролират собствените си системи
Нито една компания за ИИ не прилага изцяло основните мерки за контрол на собствените си вътрешни системи за ИИ. Това е изводът от първата оценка на неправителствената организация Guidelight. Групата е проучила Anthropic, OpenAI, Google, xAI и Meta, като се е позовала единствено на публични източници като системни карти, доклади за безопасност и публикации в блогове.
Guidelight е проверила шест основни практики. Те включват регистриране на вътрешната активност на ИИ, подлагане на рисковите действия на преглед чрез механизъм за одобрение, аварийно изключване, известно като „прекъсване на веригата“, и планове за ограничаване на модели, които се отклоняват от зададените цели. Anthropic и OpenAI водят с оценка C+, следвани от Google с D+ и подробна пътна карта, докато xAI (D−) и Meta (F) получават най-ниските оценки.

Компаниите се справят най-добре с откриването на неправомерно поведение. Най-зле се справят с предотвратяването и ограничаването му. Guidelight е независима неправителствена организация, основана от бившите ръководители по безопасността в OpenAI Page Hedley и Steven Adler.
Новини за ИИ без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен шест пъти годишно доклад за водещите разработки „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.