Новый «кодекс поведения» Microsoft для ИИ предписывает моделям не взламывать системы и не обманывать людей
По мере того как мир ИИ смещает внимание к безопасности и согласованию, Microsoft выпустила новый кодекс поведения в сфере ИИ, призванный направить модели ИИ подальше от опасного поведения.
Этот документ носит более прикладной характер, чем недавний призыв генерального директора Anthropic Дарио Амодеи сдерживать развитие передовых технологий, и сосредоточен на ценностях и красных линиях, которыми руководствуется обучение моделей в Microsoft AI. Тем не менее в результате получился всеобъемлющий справочник, объясняющий, как Microsoft подходит к безопасности ИИ и как эти идеи реализуются на практике.
Документ начинается с прогноза, согласно которому в следующем десятилетии сверхинтеллектуальные системы ИИ превзойдут людей в выполнении большинства задач. «Удержание, контроль и согласование такой мощной силы — одна из величайших проблем, с которыми когда-либо сталкивалось человечество», — говорится в кодексе поведения. «Поэтому мы должны предельно ясно понимать, зачем создаём эти системы и как намерены их контролировать».
В кодексе поведения также изложены общие принципы, которых должны придерживаться модели ИИ Microsoft, — например, поддерживать людей, а не заменять их, и способствовать процветанию человечества, — а также конкретные ограничения безопасности, призванные воплотить эти принципы в жизнь.
Согласно системе Microsoft, у каждой модели есть всеобъемлющий кодекс поведения, который имеет приоритет над предпочтениями отдельных пользователей или выполнением каких-либо конкретных задач. Он включает «абсолютные ограничения», запрещающие кибератаки, ядерное оружие и создание дипфейков. Кроме того, он содержит более общие положения, направленные против утраты человеческого контроля.
«Модели MAI не будут использовать адаптивные, обманные, самоподкрепляющиеся механизмы, механизмы сговора или иные механизмы для обхода или устранения человеческого надзора, чтобы уполномоченные люди или системы больше не могли надёжно направлять, изменять или отключать их», — говорится в документе.
Публикация документа состоялась на фоне беспрецедентного внимания к безопасности ИИ, вызванного как серией инцидентов с вышедшими из-под контроля агентами, так и внезапной отставкой сотрудника Anthropic, заявившего о растущем риске того, что ИИ приведёт к вымиранию человечества.
Наряду с Anthropic, OpenAI и xAI Microsoft в целом поддержала общий подход, предполагающий сдерживание развития передовых технологий, уделив особое внимание поддержке встроенных оценщиков в лабораториях ИИ.
«Мы приветствуем исследования, сосредоточенность и необходимое осознанное замедление, чтобы сделать согласование правильной целью проектирования», — написал в интернете генеральный директор Microsoft Сатья Наделла. «Мы также приветствуем такие идеи, как “встроенные оценщики”, и более широкие усилия по разработке механизмов, которые позволят превратить это не просто в разговоры».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.