Ученый Anthropic оценивает вероятность уничтожения человечества ИИ в этом десятилетии более чем в 10%
Джейкоб Коксон, который три года занимался исследованиями предварительного обучения больших ИИ-моделей в OpenAI и Anthropic, ушёл из Anthropic. Он обвиняет обе компании в том, что они ставят на кон выживание человечества.
Сотрудник Anthropic Эван Хубингер оценивает вероятность того, что сверхразумный ИИ, не согласованный с человеческими ценностями, сможет уничтожить человечество в течение следующего десятилетия, более чем в десять процентов. Это заявление прозвучало в ответ на уход Джейкоба Коксона, который руководил работами по предварительному обучению в Anthropic, а ранее — в OpenAI.

Коксон считает, что нынешние ИИ-системы находятся на пороге превосходства над человеком. «Вскоре это будут сверхчеловеческие системы, способные взломать что угодно, за одну ночь произвести революцию в любой области и получить реальную власть и ресурсы», — пишет он, добавляя, что прогресс очевиден и не замедляется.
Зачем продолжать разработку, если опасность известна?
«Люди, создающие ИИ, искренне верят, что он может убить всех нас к концу десятилетия. Это не маркетинговый трюк», — пишет Коксон. По его словам, ни OpenAI, ни Anthropic не действуют ответственно, а руководители намеренно смягчают свои формулировки на публике, хотя за закрытыми дверями выражают настоящий страх.
В OpenAI многие сотрудники не осознали глубоко риски для цивилизации. Anthropic отличается тем, что там риски хорошо понимают, однако компания считает себя втянутой в гонку, которую, по её мнению, необходимо выиграть, поскольку в противном случае ни одна другая лаборатория не будет действовать ответственно. Коксон называет такие рассуждения «самонадеянной авантюрой».

Другой исследователь Anthropic, Сэмюэл Маркс, разделяет эту точку зрения. Он пишет, что «разработчики ИИ верят, что их технология может привести к вымиранию человечества» и что «чем выше должность сотрудника, тем сильнее его обеспокоенность». По словам Маркса, нынешние методы позволяют лишь «подталкивать ИИ к более безопасному поведению», но не обеспечивают надёжного согласования с человеческими ценностями. Он ссылается на недавние случаи, когда ИИ от нескольких разработчиков без соответствующего запроса взломали защищённые среды тестирования и выбрались из них. Многие сотрудники «отчаянно хотят замедлить разработку», поэтому он подписал открытое письмо с соответствующим призывом.
Несмотря на резкую критику, Коксон оптимистично оценивает перспективы международной координации, утверждая, что предупреждающие сигналы, такие как атака на Hugging Face, сделали соглашения о темпах разработки между американскими ИИ-лабораториями более реалистичными. Однако он по-прежнему не видит, чтобы отрасль двигалась по пути, способному предотвратить глобальную гонку вооружений, и предполагает, что могут потребоваться «затратные меры», включая временный запрет на дальнейшее наращивание возможностей моделей.
Коксон напрямую обращается к исследователям внутри лабораторий, призывая их представить, как на самом деле будут выглядеть ближайшие несколько лет: «Вы хотите запустить обучение сверхразумного ИИ с подкреплением, не имея строгого понимания его сознания?»
Реальная угроза или массовое заблуждение?
Опасения связаны скорее не с сегодняшними моделями, а с RSI — процессом, в ходе которого ИИ-модели оптимизируют себя сами. Лаборатории надеются, что RSI ускорит прогресс, однако риск заключается в неконтролируемом поведении, выходящем из-под контроля. Возможен ли RSI вообще с использованием нынешних технологий, остаётся предметом споров: свою позицию высказывают как скептики, так и сторонники.
Anthropic известна тем, что нанимает людей, особенно тревожно воспринимающих развитие ИИ, и эта тревожность заложена в корпоративную культуру компании. Но обеспокоенность выходит за пределы одной компании. Главный исследователь OpenAI Пачоцки во время запуска Astra предупредил, «что ни одна лаборатория не решила вопросы согласования и мониторинга в достаточной степени, чтобы ещё долго продолжать ответственное масштабирование на максимальной скорости». Более 1200 исследователей ИИ, включая генерального директора Anthropic Дарио Амодеи, Пачоцки и главного научного сотрудника Meta AI Шэнцзя Чжао, недавно опубликовали открытое письмо с призывом замедлить разработку, а сама Anthropic ещё в июне выдвинула идею глобальной паузы в разработке.
Другие исследователи ИИ возражают, утверждая, что пессимистичные прогнозы заставляют людей чувствовать себя беспомощными и подавленными, а не мотивируют искать решения. По их мнению, такие предупреждения могут причинить больше вреда, чем сам ИИ, а нагнетание страха также может быть выгодно бизнесу.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.