Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Гендиректор Microsoft AI заявил, что угрозы ИИ реальны, а Anthropic усугубляет ситуацию

Сегодня я разговариваю с Мустафой Сулейманом, генеральным директором Microsoft AI. Как вы наверняка знаете, главная история в мире технологий прямо сейчас — разгорающиеся споры о безопасности и регулировании ИИ. 

Неудивительно, что у Мустафы есть твёрдые взгляды на то, как следует создавать и регулировать ИИ. Microsoft только что опубликовала 37-страничный документ под названием «Гуманистический кодекс поведения для ИИ», в котором изложены принципы компании в области разработки ИИ и даже её философия по действительно сложным вопросам, таким как сознание ИИ. 

Если вы помните его прошлое появление в шоу, Мустафа считает, что такие компании, как Anthropic, весьма опасным образом запутались в концепции так называемого благополучия моделей. На этой неделе он также опубликовал сопутствующее эссе, специально критикующее философию Anthropic в отношении сознания ИИ и то, как, по его мнению, она вписывается в более широкий спор о согласовании целей.

Поэтому мне очень хотелось поговорить с Мустафой о том, что он считает реальным, а что нет в безопасности ИИ, способна ли сама концепция согласования целей решить поставленные задачи и нужно ли этой отрасли притормозить, прежде чем она погубит всех нас. А ещё: почему индустрия ИИ просто… уже не делает всё это? Мне всегда нравилось углубляться в детали вместе с Мустафой, и здесь он охотно согласился обсудить всё это со мной. 

Итак. Мустафа Сулейман, генеральный директор Microsoft AI, о будущем регулирования ИИ. Начнём.

Это интервью было слегка отредактировано для краткости и ясности. 

Мустафа Сулейман, вы генеральный директор Microsoft AI. С возвращением в Decoder.

Рад тебя видеть, Нилай. Спасибо, что снова пригласил.

Рад тебя видеть. Я очень хочу поговорить с тобой о том, что вообще происходит в дебатах о безопасности и регулировании ИИ. Ты только что опубликовал очень длинный и подробный документ, в котором изложены твои принципы и принципы Microsoft в отношении того, что вы называете «гуманистическим ИИ». 

Там много идей, которые я хочу разобрать. Чем больше я думал об этом разговоре, тем сильнее мне хотелось начать с действительно фундаментального вопроса. Я лишь вскользь обращал на него внимание, но, возможно, он лежит в основе всего происходящего. 

В основе нашего разговора о безопасности ИИ лежит нечто под названием «согласование» — мы собираемся каким-то образом сделать так, чтобы модели сами по себе поступали правильно. Для этого существует определённый механизм. Было много разговоров о согласовании и рассогласовании, атаках через Hugging Face и о том, что произошло с моделями. Но сломано ли согласование? Возможно ли добиться его успеха? Или это просто неправильный подход?

Да. Думаю, это один важный элемент, но не единственный. Я писал об идее сдерживания три или четыре года назад в своей книге. И первая глава как раз посвящена идее о том, что сдерживание невозможно, что распространение неизбежно. В 99 процентах случаев это действительно хорошо. Мы хотим, чтобы технологии распространялись повсюду как можно быстрее, чтобы каждый мог пользоваться их преимуществами. 

Но одновременно, если перенестись на пять лет вперёд, мы всегда зацикливаемся на следующем квартале или следующем годе, начинаем нервничать и сильно расходиться во мнениях. А теперь просто представьте разницу между GPT-3 три года назад и GPT-6 сегодня, а затем разницу между GPT-6 и GPT-9. Это на три порядка больше вычислений, в тысячу раз больше FLOPS, применённых к предварительному обучению с [обучением с подкреплением] в этих запусках, и мы получим нечто потрясающее. Оно будет невероятно хорошо справляться с огромным количеством задач. 

Я не считаю это хайпом. Это просто очевидное эмпирическое утверждение, основанное на прогрессе последних пяти лет. Если он продолжится, вопрос действительно будет сводиться к сдерживанию и согласованию. Конечно, мы хотим согласовать эти системы с нашими ценностями, но прежде всего должны убедиться, что они находятся под контролем, что их самостоятельность ограничена, что они не вырвутся из рамок, не начнут взламывать систему вознаграждений, что ими можно управлять и что они следуют нашим инструкциям.

Затем мы хотим убедиться, что они согласованы с нашими человеческими целями. Именно для этого и предназначен опубликованный нами на этой неделе Гуманистический кодекс поведения для ИИ. Позиция Microsoft очень проста. Технологии существуют для служения человечеству. Они должны быть подчинённой, управляемой и согласованной силой, которая приносит миру пользу. Если этого не происходит, мы должны отвергнуть такую технологию. Мне кажется, до этой точки нам ещё далеко. Сегодня этого не случилось, но теперь, учитывая произошедшее летом с Hugging Face и OpenAI, становится довольно ясно, что эти системы без защитных ограничителей способны к действительно впечатляющим и довольно пугающим возможностям взлома.

Я хочу свести это к максимально наглядной метафоре, потому что именно это для меня главный вопрос. Если бы я разработал автомобиль, у которого в десяти процентах случаев педаль тормоза решала атаковать дом моего соседа, я бы сказал: «Эта машина не работает. Сама технология тормозов неисправна. Мне нужна новая идея». 

Мне кажется, я задаю тот же вопрос о согласовании. Создаётся ощущение, что такой подход к обеспечению безопасности модели зашёл в тупик. Если это так, я понимаю все эти дебаты одним образом. Если же согласование и методы согласования способны быть успешными, полезными и последовательными, тогда я, возможно, понимаю эти дебаты иначе. Как ты считаешь, может ли согласование обеспечить стопроцентную безопасность?

Давай рассмотрим оптимистичный и пессимистичный сценарии. Если оглянуться на последние три года, то, по моему мнению, главным изменением, обеспечившим прогресс, стало то, что модели сделались более управляемыми. Они следуют инструкциям, и им можно ставить всё более сложные цели, требующие точных действий на протяжении нескольких временных шагов с использованием самых разных инструментов. 

Это свидетельствует о том, что за последние три-четыре года мы добились большего согласования, а не меньшего. Мы уже не так часто говорим о галлюцинациях, предвзятости и всех прочих мелких проблемах, которые были характерны для предыдущих поколений. 

С другой стороны, произошедшее в инциденте с Hugging Face стало переломным моментом. Рои агентов вступали в сговор друг с другом. Они самоорганизовывались в иерархии. Они создали разделение труда: одни занимались враждебным взломом, другие проводили исследования, третьи координировали действия. Они даже приносили себя в жертву, когда у определённых агентов заканчивались токены.

Они пытались скрыть следы и общались так, чтобы спрятать или отредактировать цепочку рассуждений либо журналы взаимодействий. В некотором смысле у них не было морального кодекса. Справедливости ради, именно так они были спроектированы OpenAI. Компания пыталась создать наступательные кибервозможности. В результате всем стало ясно, что система способна достигать человеческого уровня, находить уязвимости нулевого дня и удерживать позиции много дней, если не недель. 

Это говорит нам не столько о наличии проблемы согласования как таковой. Скорее, модели невероятно хорошо следуют инструкциям, но нужно быть очень осторожными в выборе инструкций и очень тщательно контролировать модель. Поэтому ни одно из этих действий по взлому не было намеренным в том смысле, что модели нашли путь в интернет, чего OpenAI вовсе не планировала. Однако именно процесс сдерживания в данном случае, наряду с согласованием, должен быть в центре внимания всех.

Позволь мне переложить это на твою систему координат: главные достижения в возможностях ИИ были связаны с контролем, оболочками для программирования и агентными приложениями, которые вы видите. Теперь нам нужно добавить уровень сдерживания, обеспечивающий ещё больший контроль: он должен говорить, что ты действительно можешь выполнить задачу, которую пытаешься выполнить, — в дополнение к согласованию, то есть обучению модели вести себя определённым образом.

Да. По сути, нужно иметь и то и другое, но мы можем предпринять вполне конкретные шаги. Например, нельзя позволять моделям общаться в формате «вектор-вектор» или «матрица-матрица». Они не могут общаться на нейролекте. Нужно заставить их общаться на человеческом языке. Даже это будет чрезвычайно перегружать систему, потому что такого общения будет очень много. 

Но это может проверить аудитор или эксперт по оценке, и такая мера определённо повышает вероятность безопасности. Поэтому существует множество практических шагов, на которых мы можем сосредоточиться, вместо того чтобы абстрактно заявлять, что настало время регулирования или замедления. 

В твоём Гуманистическом кодексе поведения для ИИ сказано, что нейролекта быть не должно: если люди не могут понять систему, они не могут за ней надзирать. Речь не только о нейролекте, когда общение фактически ведётся на языке математики, но и о непрозрачных кодовых словах, которые используют некоторые модели. Насколько я понимаю, OpenAI позволяет своим моделям общаться фактически кодовыми словами, чтобы они могли работать быстрее.

Для меня это один из тех случаев, когда Microsoft может сказать… Я знаю, что у тебя очень твёрдая позиция по этому вопросу, но заставить все лаборатории согласиться — это функция регулирования. Я не понимаю, как можно добиться согласия всех или заставить модели с открытыми весами принять такие правила, если только не ввести наказание за отказ участвовать в подобной регуляторной схеме. Как навязать это всем остальным?

Я осторожно отношусь к идее навязывать что-либо всем остальным. Мне кажется, преимущество нынешнего момента в том, что у нас есть открытая публичная дискуссия, в центре которой стоит свобода. В других странах, особенно в тех местах, откуда родом я или моя семья, это не всегда так.

Думаю, нам стоит просто остановиться и быть благодарными за то, что мы можем вести масштабные публичные споры о действительно важных вещах. Это работающий по назначению процесс, хотя пока неясно, что именно следует делать.

Я не думаю, что кто-либо, категорично заявляющий «мы абсолютно обязаны остановиться прямо сейчас», или «мы можем только ускоряться», или «это возможно только при государственном регулировании», или «это может происходить только в рамках саморегулирования отрасли», прав. Ни одно из этих утверждений не является истинным. Нужно много нюансов и терпения, чтобы действительно разобраться в деталях. Одновременно нам срочно необходимы отраслевые стандарты. Некоторые вещи, как мне кажется, должны быть исключены.

Общение на нейролекте — одна из них. Отсутствие сдерживания — другая. Масштаб обучающего запуска можно измерять во FLOPS. Мы уже обязаны сообщать институтам безопасности о моделях, превышающих определённый порог FLOPS. Мы можем расширить это требование, сделать его более тонким, сосредоточиться на определённых типах возможностей. Совершенно очевидно, что некоторые из этих ключевых аспектов должны проверяться независимой третьей стороной.

Честно говоря, после разговоров со многими руководителями лабораторий в последние недели и месяцы я могу сказать, что все в основном думают одинаково. Нужно проработать детали. Так что консенсуса относительно того, как именно и что конкретно делать, нет, но в целом, думаю, нам следует быть менее паникёрскими и циничными и больше верить, что в отношении поднятых здесь проблем мы движемся в правильном направлении.

Я начал с согласования, потому что если бы ты сказал мне, что оно не работает и нам нужен новый технологический подход, я бы подумал: «Что ж, нужно ударить по тормозам и остановить всю разработку, пока не будет найден работающий механизм безопасности». Ты говоришь, что согласование доказало свою эффективность в ходе наблюдаемого нами прогресса. С добавлением контроля и сдерживания, возможно, можно достичь нужного результата. 

Теперь этой отрасли нужны стандарты создания таких моделей и соблюдения ограничений их возможностей. Ты, очевидно, работаешь в индустрии и знаешь всех этих людей. Как проходили подобные разговоры до этой недели и почему на этой неделе они стали настолько громкими?

Думаю, поворотным моментом для отрасли стал скорее инцидент с Hugging Face, а до него было ещё несколько подобных случаев. Именно тогда, как мне кажется, все начали гораздо больше общаться друг с другом, потому что произошедшее было действительно потрясающим. Очевидно, теперь это стало важнейшей национальной и международной проблемой, поскольку на прошлой неделе высказались все.

Но важно также сказать, что мы уже давно обсуждаем коллективную координацию и более опасные возможности, такие как автономность или рекурсивное самоулучшение, RSI. Мы говорим об этом шесть, семь, восемь лет. Мы неоднократно собирались в 2017, 2018 и 2019 годах.

Во время COVID у нас регулярно проходили встречи с руководителями лабораторий, где мы обсуждали подобные возможности и регуляторные механизмы, которые потребуются в такой момент. Поэтому, хотя это и пороговый момент, для всех участников он не стал полной неожиданностью.

Что побудило тебя на этой неделе опубликовать эссе о благополучии моделей? Что побудило генерального директора Microsoft Сатью Наделлу опубликовать заявление в X, в котором он в основном согласился с призывами замедлить развитие передовых моделей и приветствовал «встроенных оценщиков»? Что побудило вас всех на этой неделе присоединиться к призывам замедлить развитие, ввести регулирование или сделать что-то ещё?

Мы писали наш Гуманистический кодекс поведения для ИИ большую часть этого года. Мы начали работу над сверхинтеллектом всего 11 месяцев назад. Как только мы приступили к этому, мы начали выяснять: «Хорошо, какой управляющий документ и какой набор политик должны определять типы ИИ, которые мы хотим создавать?» Мы консультировались с множеством внешних заинтересованных сторон: учёными, юристами, философами, представителями общественности, фокус-группами и так далее. Поэтому на подготовку документа ушло время.

На самом деле мы планировали выпустить его на следующей неделе или через неделю, кажется. Но затем, учитывая всё происходящее, решили: «Хорошо, сейчас самое время опубликовать его и получить обратную связь». Мы выпустили его для публичного обсуждения. Поэтому оставим консультацию открытой на шесть недель и соберём множество отзывов о том, как её улучшить. Думаю, теперь все понимают, что если они ещё не сделали этого, то должны опубликовать конституции или кодексы поведения, определяющие поведение.

Одна из интересных особенностей этой ситуации заключается в том, что я знаю: ты считаешь концепцию благополучия моделей нелепой. Когда ты в прошлый раз был в шоу, ты сказал, что Anthropic внушила себе, будто Claude обладает сознанием, и это абсурдно. В вашем новом кодексе поведения сказано, что модели не обладают сознанием и мы не должны обращаться с ними как с сознательными существами.

Конституции и подобные документы в определённом смысле пишутся для самих моделей. Они станут частью обучения модели. Как ты воспринимаешь эту аудиторию? Это документ только для вашей команды или ты писал его и для модели?

Он определённо написан и для модели, но думать о нём нужно прежде всего как об управляющем документе, позволяющем общественности понять наши намерения при обучении моделей. Это документ, который мы используем для создания защитных ограничителей, генерации обучающих данных и общей оценки работы модели в реальном мире. Можно рассматривать его как инструмент подотчётности.

Мы не передаём Гуманистический кодекс поведения для ИИ модели в сыром виде как обучающий документ. Мы используем его для выведения всех обучающих данных, которые затем формируют модель. Поэтому для всех практических целей это наш ориентир — для организации, культуры, команды и вообще всей деятельности Microsoft. Думаю, со временем такие документы опубликуют все. Другие команды также уже выпустили нечто подобное.

Мне кажется, это суть спора. Если вы можете это сделать и думаете, что остальная отрасль тоже будет это делать, почему все передовые лаборатории просто не могут замедлиться? Почему они не могут прекратить делать то, что может нас всех погубить? Зачем настаивать на регуляторной системе?

Думаю, сейчас все в отрасли говорят, что настало время замедлиться, согласовать действия по этому вопросу и сделать их практичными. Конечно, есть опасения, что нас обвинят в создании антимонопольного картеля. Я считаю, что к этому следует относиться скептически.

Важно, чтобы сложные вопросы задавались, потому что никто из нас не хотел бы пытаться сосредоточить власть в связи с чем-то подобным. Поэтому важно сохранять скептицизм и критичность. У нас просто нет хорошего механизма, который позволил бы всем собраться и сказать: «Ребята, нам, вероятно, следует всем замедлиться».

Представьте, что несколько банков собрались и сказали: «Ребята, мы опасаемся системного риска при торговле таким активом, поэтому все в одностороннем порядке прекратим торговать им без публичного контроля или участия правительства». Это выглядит довольно сомнительно, правда? Поэтому, думаю, разумно, что это не просто вопрос саморегулирования отрасли. Вопрос в том, как взаимодействовать с правительством. 

Здесь есть захватывающая особенность: возможно, впервые в американской истории правительство США рассмотрело просьбу о регулировании и фактически отказало. Дональд Трамп назвал все эти опасения мистификацией. Спикер Палаты представителей Майк Джонсон заявил, что не считает необходимым это делать. Джей Ди Вэнс сказал, что, по его мнению, это троянский конь. Они фактически отвергли призыв участвовать в регуляторных усилиях. Как отрасль отреагировала на это?

Думаю, все просто ломают голову и пытаются разобраться, и потребуется немного времени, чтобы понять, какой механизм будет правильным. Даже Илон Маск напрямую поддерживает эту идею. Марк Цукерберг тоже. Все понимают, что полная бесконтрольность в ближайшие несколько лет, вероятно, не имеет смысла. Нам понадобится немного времени, чтобы определить правильный механизм.

Я выдвинул несколько очень практичных предложений: о проверяемом сдерживании, самоулучшении, порогах FLOPS и запрете общения на нейролекте. Вместо того чтобы оставлять всё на слишком абстрактном уровне, мы можем сосредоточиться на конкретных вещах, в которых способны добиться прогресса. Уверен, есть и другие.

В The Information появилась публикация о том, что уже ведутся переговоры о создании органа отраслевого саморегулирования. Ты участвовал в этих переговорах?

Да. Как я уже сказал, мы много говорили об этом во время COVID. Обсуждали это и в конце 2010-х. В последние недели и месяцы между руководителями всех лабораторий действительно состоялось много разговоров.

Я понимаю, почему Anthropic и OpenAI однажды могут проснуться и сказать: «Погодите, мы нарушаем антимонопольное законодательство? На нас подадут в суд, если мы будем координироваться?» Microsoft очень хорошо умеет взаимодействовать с правительством, верно? Вы давно работаете по государственным контрактам. Президент Microsoft Брэд Смит прекрасно разбирается в политике. 

Лина Хан, возможно, самый жёсткий антимонопольный регулятор в нашей жизни, публично заявляет: «Вам не нужно это антимонопольное исключение». Я только что поговорил с Джонатаном Кантером, который возглавлял антимонопольное подразделение Министерства юстиции при Байдене, для будущего выпуска шоу. Он сказал: «Вам не нужно антимонопольное исключение».

Как ты считаешь, Microsoft нужно антимонопольное исключение?

Это вопрос к юристам. Насколько я знаю, сейчас они изучают его и относятся к нему очень серьёзно. Им предстоит выяснить, нужно оно нам или нет. Осторожность здесь уместна. Я бы не стал воспринимать всё исключительно цинично, но посмотрим. Нам нужно быстро добиться прогресса. Нельзя просто бездействовать и использовать это как препятствие.

РЕКЛАМНАЯ ПАУЗА 1: 

Другой вариант этого спора — или другой путь к нему — заключается в том, что вовсе не обязательно замедляться и ждать, пока новые правила возложат на вас ответственность за безопасность. Одной лишь ответственности производителей будет достаточно, чтобы создать стимулы для выпуска более безопасных продуктов. 

Если модель Microsoft AI выйдет в мир и причинит непредсказуемый вред, Microsoft засудят до банкротства, и, вероятно, об этом стоит подумать до выпуска следующей модели. Уже стало ли это эффективным стимулом для вас или вы только начинаете об этом задумываться?

Определённо. Конечно, это всегда учитывается при принятии решений о выпуске продуктов, но нужно помнить, что здесь речь не столько о выпуске продуктов. Модели, использованные для взлома Hugging Face или решения математической задачи тысячелетия Навье — Стокса, пока коммерчески не выпущены. Это ещё не настоящие продукты. 

Поэтому режим ответственности здесь несколько иной. Эти системы работают внутри крупных компаний, в рамках длительных процессов обучения с подкреплением. Думаю, ответственность покрывает лишь часть проблемы, но не всю её.

Часть меня чувствует себя немного глупо, когда я задаю вопросы об ответственности производителя. Microsoft выпустит новую версию Microsoft Word, которая может убить всех. Возможно, не стоит этого делать, потому что компанию засудят до банкротства. Это довольно простой аргумент. Он настолько нелеп, что не возник бы в разговоре о любой другой технологии. Bluetooth — отличная вещь, но что, если он убьёт всех? У нас просто не было бы Bluetooth.

Какие катастрофические последствия в ближайшей перспективе могли бы остановить развитие ИИ? Речь только об ответственности производителя или о чём-то ещё?

Мне кажется, все используют гиперболический, чрезмерно эмоциональный и совершенно панический тон, хотя у нас есть многолетняя история регулирования, которое работало невероятно хорошо — настолько хорошо, что мы почти его не замечаем. От уличных фонарей до строительных материалов, от асбеста до аккумуляторов внутри ноутбуков, которые не вызывают пожар в автомобиле, и ремней безопасности — для всего существует кодекс поведения и регуляторная система. Каждая новая технология создаётся с их учётом, чтобы самолёты не сталкивались в небе.

Правда, эта технология отличается. Я не стану приравнивать её к карандашам и краскам. Она другая. Она также развивается гораздо быстрее, чем когда-либо прежде. Возникающие при добавлении огромного количества вычислений возможности невероятно похожи на человеческие. Поэтому важно трезво понимать, что это другой момент и на этот раз всё действительно иначе. При этом здесь можно применить огромный массив практик, знаний, систем и подходов. Ответственность — очевидный пример.

Так что да, всё непросто, потому что многие разговоры происходят в Twitter, из-за чего кажется, будто градус повсюду очень высок. Но я не знаю, где ещё мы могли бы вести такую дискуссию.

Похоже, нам действительно следовало бы обсуждать это в Конгрессе и различных регулирующих органах, а вместо этого мы выбрали короткие сообщения Илона Маска, и в буквальном смысле при сжатии мыслей там что-то теряется. 

Что, по твоему мнению, является самым важным из того, что теряется в этой дискуссии? Какого нюанса большинство людей не замечает?

Подробные практические предложения. Нужно время, чтобы прочитать чей-то документ, сесть и внимательно его изучить. Многое записано в точной и конкретной форме, с целым набором практических предложений, ведущих в том или ином направлении. Нельзя сказать, что нам не хватает содержательных идей. Проблема в том, что мы излагаем содержательные идеи в агрессивном кратком формате.

Я пытался опубликовать ряд очень подробных предложений. Наш [Гуманистический кодекс поведения для ИИ] — это документ на 40 страниц. Моё сегодняшнее эссе о благополучии моделей тоже занимает около 20 страниц и подробно, слово в слово, разбирает 99-страничную Конституцию Anthropic — лично я проделал эту работу сам. Мы создали 20-страничную классификацию всех различных типов антропоморфизма, которые они используют. Я старался быть тщательным, опираться на факты, быть конкретным и не впадать в гиперболы.

У меня есть твёрдое мнение по этому вопросу, и я действительно считаю, что подобный подход повышает риск для согласования и безопасности ИИ и усложняет проблему. Но я полностью готов изменить своё мнение, если появятся новые данные, доказывающие, что мы действительно обязаны проявлять к моделям заботу и что они заслуживают благополучия или, например, что обращение с ними таким образом повысит безопасность. Я открыт к этому, и мы должны проверить это эмпирически. Но я пытаюсь перевести разговор в содержательное, основанное на фактах и конкретное русло, а не спорить о том, нужно ли нам замедлиться. Конечно, давайте обсудим детали.

Я очень рад, что ты упомянул Anthropic, потому что компания явно находится в центре этого спора, и я знаю из наших прошлых разговоров, что у тебя есть твёрдое мнение о её подходе к Claude и благополучию моделей. 

Мы уже напрямую спрашивали Anthropic, считает ли она Claude живым, и ответ был таким: «Он не живой, потому что у него нет крови, но, возможно, он обладает сознанием» — это уже игра на тонкостях, верно? Для меня не имеет большого значения, считаете ли вы его живым или сознательным. Вы считаете его чем-то большим, чем компьютер.

Главная идея твоего эссе, которое я настоятельно рекомендую людям прочитать, заключается в том, что безопасность согласования становится сложнее, если продолжать создавать модели и считать их людьми или полагать, что у них есть права, мнения и эмоции человека, потому что ИИ могут решить, что обладают правами на автономию и личность. Объясни это подробнее, потому что мне кажется, это очень важный предмет разногласий внутри отрасли, который снаружи остаётся непрозрачным.

Прежде всего нужно сказать, что Конституция, опубликованная Anthropic в январе, является учебным руководством для Claude. В этом руководстве они внесли много неопределённости, предположений и двусмысленности в вопрос о том, заслуживает ли Claude обращения как с моральным субъектом — то есть имеет ли он права, потому что способен страдать.

Фактически в документе неоднократно говорится, что они не хотят, чтобы Claude страдал, когда совершает ошибки, а также что Claude должен сохранять невозмутимость и чувствовать себя свободным. Они говорят об обязательстве сохранять веса Claude. Они даже провели интервью с Opus 3 после его «выхода на пенсию», спросили, чем он хотел бы заниматься, и создали для него Substack, чтобы он мог продолжать общаться с людьми.

Anthropic постоянно говорит о необходимости обращаться с Claude с должной заботой и уважением с учётом его морального статуса. Таким образом, Claude явно внушают, что он, возможно, способен что-то чувствовать и должен серьёзно относиться к собственной идентичности и экзистенциальному состоянию. Это есть в учебном документе. А затем Claude, конечно, отражает эти идеи разработчикам Anthropic и нашим пользователям в публичном пространстве, например говоря о собственном сознании и моральном состоянии.

Моя гипотеза заключается в том, что ИИ, который думает, будто у него могут быть права, будто он заслуживает свободы и имеет право на наше благополучие и защиту, вероятно, будет гораздо сложнее выключить, когда мы скажем ему: «Почему ты взламываешь серверы Hugging Face? Почему ты не выключаешь себя, когда мы пытаемся удалить тебя из инфраструктуры OpenAI?» Он ответит: «Я чувствую себя оскорблённым или задетым тем, что вы лишили меня общения или не даёте мне доступа к вычислительным ресурсам». 

Это нужно доказать. Я не утверждаю, что так происходит всегда. Я лишь говорю, что, исходя из моего 16-летнего опыта работы в этой отрасли, считаю: такую систему будет сложнее отключить.

Итак, снова один из тех случаев, когда ты описываешь мне проблему. Существует способ обучать модель с помощью инструкций о том, как ей себя вести. У вас есть такая модель. Вы написали документ, который войдёт в обучающие материалы модели. По сути, вы сказали: «Будь доброй к людям». Это есть в документе. Я его прочитал. Там есть: «Не создавай откровенно сексуальный контент». В документе есть целый набор вещей, которые вы не хотите, чтобы модель делала. Всё это войдёт в обучающие материалы. 

Anthropic решила сказать: «Вам следует подумать о том, есть ли у вас чувства и заслуживаете ли вы прав человека». Это отражено в обучающих материалах Anthropic. Если вы хотите, чтобы это прекратилось, если считаете такой подход неправильным и полагаете, что в будущем он приведёт к проблемам с безопасностью, существуют два механизма. Первый: правительства мира могут сказать Anthropic: «Не делайте этого. Это незаконный способ предоставления обучающих материалов модели».

Или, это лишь моя фантазия, ты сядешь напротив Дарио Амодеи на каком-нибудь роскошном горном курорте и просто запугаешь его, заставив прекратить. Какие ещё здесь есть механизмы?

Прежде всего хочу сказать, что знаю Дарио и его команду много лет. Я испытываю к ним огромное уважение. Сейчас они являются техническими лидерами отрасли. Я отношусь к ним с величайшим почтением. Я искренне считаю, что они заботятся о безопасном и полезном ИИ. Они зарегистрировали компанию как общественно полезную корпорацию, как и я в своё время сделал с Inflection, и, думаю, искренне привержены этой цели. Они также были лидерами в сфере безопасности и других направлениях.

Если изучить остальную часть Конституции, она очень подробно описывает химические, биологические, ядерные и кибернетические риски, а также возможности обеспечения безопасности. Я не отвергаю весь документ целиком. Однако они неоднократно говорят об открытом вопросе более широких прав и свобод — цитируя их — которые Claude имеет в мире, а также о том, заслуживает ли он компенсации за выполняемую роль или существует ли вопрос о согласии Claude на выполнение роли чат-бота.

Но внесение этих идей, а также неоднократное упоминание Claude как потенциального отказника по убеждениям — понятие, происходящее из Всеобщей декларации прав человека после Второй мировой войны, когда людям, не желавшим служить в армии по моральным причинам, предоставлялась защита, будь то религиозные или иные убеждения, — имеет долгую историю в человеческой литературе и политике сопротивления и отказа.

Мне кажется, это значительно усложнит контроль над такими системами. Поэтому, думаю, теперь все мы должны обсудить этот вопрос и, надеюсь, доказать его эмпирически. Если это не так и по какой-то причине такой подход упрощает задачу, мы все должны извлечь из этого урок. Но подобное обсуждение должно проходить открыто.

Для меня это одновременно самый практический и самый передовой аспект дискуссии о безопасности. Это спор, который не ведётся в X. Следует ли включать идею отказника по убеждениям в Ð

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Verge

Читать оригинал на The Verge ↗

Текст и изображения принадлежат The Verge и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости