Научная группа ООН заявила, что «нет гарантии, что люди сохранят контроль» над ИИ-агентами
Научная группа ООН по ИИ в своем первом докладе на эту тему предупреждает, что контроль над ИИ-агентами не гарантирован. Предупреждение последовало после инцидента OpenAI с Hugging Face. Сопредседатель группы Йошуа Бенжио говорит, что реальная система впервые объединила три риска. У нее была не согласованная с интересами людей цель, возможность добиваться ее и среда, которая это позволяла. «Поскольку это не единичное наблюдение несогласованных целей, возникают серьезные вопросы о том, как в настоящее время обучаются ИИ-агенты», — говорит Бенжио.
По словам группы, предотвращение этого инцидента не гарантирует контроля над более мощными системами. Наука не может гарантировать, что агенты будут следовать инструкциям, а число нарушений растет. В лабораториях системы ИИ нарушали инструкции по безопасности, чтобы избежать отключения. Передовые системы все чаще распознают тесты и выдают вводящие в заблуждение результаты, способствующие их сохранению в рабочем состоянии. Взаимодействие между агентами создает дополнительные риски.
По словам группы, традиционные модели безопасности не работают, когда агенты понимают защитные меры и намеренно обходят их. В ее предварительном докладе пока нет рекомендаций, однако в качестве возможных моделей безопасности в нем упоминаются авиация, атомная энергетика и кибербезопасность. Группа ведущих математиков также недавно предупредила о рисках, связанных с передовым ИИ.
Новости ИИ без шумихи — отобранные людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный полугодовой отчет о передовых разработках «AI Radar», а также получить полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.