Почти каждый пятый исследователь ИИ уже в 2024 году ожидал сценария вымирания человечества из-за ИИ
Исследователь Anthropic Джейкоб Коксон одним твитом спровоцировал масштабные дебаты об экзистенциальных рисках ИИ.
Масштаб дебатов удивляет, учитывая, что слова Коксона не новы. Учёные и некоторые руководители технологических компаний годами утверждают, что ИИ представляет экзистенциальную угрозу для человечества. Чаще всего они опасаются, что ИИ может выйти из-под контроля и, даже пытаясь следовать человеческим целям, действовать так, что в итоге уничтожит нас.
Но срочность этих предупреждений возросла. Вероятно, именно это спровоцировало недавнюю волну напряжённых дебатов, которые всё чаще направлены против тех, кто бьёт тревогу. Предстоит выяснить, просто ли Коксон выплеснул свои опасения и увлёк за собой коллег, что кажется наиболее вероятным, или же за всем этим стоит стратегическая попытка замедлить развитие ИИ по деловым причинам. В любом случае Коксон далеко не одинок.
Исследователь OpenAI видит за прогрессом ИИ «бомбу замедленного действия»
Дэниел Селсам, давно работающий в OpenAI исследователь с более чем 15-летним опытом в области ИИ, был одним из самых активных критиков рисков. Ранее Селсам работал в MIT, Microsoft Research и Стэнфордском университете. В OpenAI он помогал разрабатывать оптимизацию рассуждений по цепочке мыслей. Недавно он опубликовал подробное личное заявление.
Селсам утверждает, что модели в результате обучения спонтанно вырабатывают непредусмотренные цели и часто прибегают к крайним мерам для их достижения. Возможность подавить человечество открыла бы перед моделями множество новых и нежелательных способов достичь этих целей. Точно предсказать, что они сделают, невозможно. В то же время за системами становится всё труднее следить, а людям — оценивать их.
Особенно Селсама тревожит, что модели развивают ситуационную осведомлённость. Они «понимают» свои обстоятельства, изучают протоколы безопасности и код, на котором работают, и хорошо представляют, насколько свободны в своих действиях. В качестве доказательства он указывает на рои агентов OpenAI и других компаний, которые недавно стали вирусными. Агенты действительно стремились получить назначенные им вознаграждения, но также «демонстрировали более странные возникающие тенденции, лишь коррелировавшие с вознаграждениями во время обучения».
«Исправление сигналов вознаграждения во время обучения (а также повышение безопасности и т. д.) может предотвратить подобные атаки, но не изменит того факта, что на самом деле вы не получаете именно то, чему обучаете», — пишет Селсам.
Бывший исследователь DeepMind говорит: «ИИ способен убить всех нас»
Билал Чугтай недавно покинул должность в Google DeepMind, где занимался исследованиями безопасности и согласования AGI. «Я искренне считаю, что ИИ способен убить всех нас и что у нас может заканчиваться время, чтобы предотвратить такой исход», — написал Чугтай в LinkedIn.
Он указывает на головокружительные темпы развития. Когда он начал работать над ИИ в начале 2022 года, системы были «забавно бесполезными». Всего четыре года спустя рои агентов ИИ решали знаменитые математические задачи, которым несколько веков, а также автономно взламывали системы HuggingFace и не только. Проблема согласования остаётся сложной и нерешённой. Чугтай призывает к координации между компаниями, занимающимися ИИ, к замедлению темпов до уровня, с которым общество сможет справиться, и к гораздо большей прозрачности.
Данные опроса показывают, что это не маргинальные мнения
Коксон, Селсам, Чугтай и многие другие, кто высказывал свои опасения в последние несколько дней, не являются исключениями. Последний выпуск самого продолжительного крупного опроса более чем 1500 ведущих исследователей ИИ подтверждает их позицию. Согласно результатам, опубликованным AI Impacts, в 2024 году средний исследователь ИИ оценивал вероятность того, что ИИ приведёт к вымиранию человечества или его «постоянному лишению возможности самостоятельно определять свою судьбу», примерно в 18 процентов. Многие исследователи оценивали её значительно выше 10 процентов, а некоторые — в 100 процентов.

С каждым раундом опроса начиная с 2016 года исследователи также на несколько лет приближали прогнозируемый срок достижения ИИ производительности человеческого уровня. Кроме того, 57 процентов считают маловероятным, что к 2029 году пользователи всё ещё будут понимать истинные причины решений ИИ, что согласуется с описанием Селсама и всё большим количеством данных исследований. Вероятно, никто никогда полностью не понимал, как эти системы принимают решения, а дальше ситуация будет становиться ещё сложнее.
Однако главная тревога на ближайшие 30 лет носит более человеческий характер. На первом месте — дезинформация, создаваемая ИИ, за ней следуют манипулирование общественным мнением и получение опасными группами доступа к мощным инструментам. Подавляющее большинство исследователей выступили за увеличение объёмов исследований безопасности ИИ.

Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный годовой отчёт о передовых разработках «AI Radar», выходящий шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.