Неужели ИИ действительно может убить всех нас? Ответы на ваши вопросы.
В среду MIT Technology Review провел для подписчиков прямой эфир в рамках мероприятия Roundtables, посвященный вопросу, который сейчас задают все: Неужели ИИ действительно может уничтожить всех нас?
Но у участников оказалось гораздо больше вопросов, чем мы успели разобрать за 30-минутную сессию. Поэтому мы попросили нашего старшего редактора по ИИ Уилла Дугласа Хейвена и корреспондента, пишущего об ИИ, Грейс Хакинс выбрать некоторые из лучших вопросов, присланных участниками, и постараться на них ответить.
Спасибо всем, кто прислал вопросы!
Я умру?
Да, в конце концов. К сожалению, моих журналистских способностей к предсказаниям недостаточно, чтобы сказать вам, как именно. Но причиной вполне может стать ИИ. Беспилотники на базе ИИ уже убивали людей в Украине, а кибератаки на больницы с использованием ИИ наверняка не раз приведут к жертвам в ближайшем будущем.
Может ли ИИ пойти еще дальше и убить всех нас? Менее вероятно. Но некоторые люди — своеобразные люди, однако несомненно хорошо разбирающиеся в ИИ — уже много лет предупреждают, что такое может произойти. И хотя я пока не запасаюсь консервами и не пытаюсь войти в доверие к мегамиллиардеру, владеющему бункером, я заметил, что предсказания фаталистов о возможностях ИИ и его согласовании за последние пару лет оказались тревожно точными. Это вовсе не означает, что их самые мрачные прогнозы сбудутся, но этого достаточно, чтобы я насторожился.
— Грейс Хакинс
Умрете ли вы из-за ИИ? Я бы сказал, что вероятность не равна нулю. Допустим, вам не повезло и вы стали жертвой странного события или несчастного случая в недалеком будущем. Возможно, это будет кибератака, проведенная роем ИИ-агентов против критически важной инфраструктуры. К сожалению, такой сценарий уже не кажется настолько неправдоподобным, как раньше. Или, например, созданный ИИ новый патоген поразит население. Или мировая экономика рухнет, вызвав конфликты и голод. Оба варианта вполне возможны, но, на мой взгляд, менее вероятны.
Умрем ли мы все из-за ИИ? Нет. За пределами апокалиптической научной фантастики не существует обстоятельств, при которых ИИ мог бы убить всех нас. Можно придумать сколько угодно страшилок, но они не опираются на реалии сегодняшнего дня — на то, что умеют делать технологии и куда они движутся.
Некоторые утверждают, что в подготовке к худшему, каким бы безумным это ни казалось, нет ничего плохого. Возможно. Но, на мой взгляд, такая катастрофизация может заставить людей оправдывать или игнорировать многочисленные проблемы уже существующих технологий и компаний, которые их создают.
— Уилл Дуглас Хейвен
Зачем ИИ вообще убивать нас?
Кто-то может ему это приказать, и ИИ может послушаться. Отчасти поэтому исследователи так обеспокоены биологическими возможностями ИИ: представьте, что сделала бы «Аум Синрикё» — апокалиптическая секта, стоявшая за атакой с зарином в токийском метро, — получи она инструмент, способный создать патоген смертоноснее вируса Эбола и более заразный, чем корь. Тем из нас, кто не хочет умирать, придется научиться защищаться от всех возможных биологических видов оружия, тогда как потенциальным нападающим достаточно создать один эффективный патоген.
Есть и более экзотическая на первый взгляд возможность: ИИ может сам решить убить нас. Существует множество версий того, как это может произойти, но самые распространенные предполагают, что системы ИИ вовсе не обязательно будут ненавидеть людей — мы просто окажемся препятствием между ними и поставленными перед ними целями.
Подобно тому как агенты OpenAI, стоявшие за взломом Hugging Face, скомпрометировали инфраструктуру другого сайта, чтобы получить высокий балл в тесте, будущий более мощный ИИ может избавиться от нас, чтобы мы не смогли его отключить, — все ради достижения цели, которую мы перед ним поставили.
— Грейс Хакинс
Как лучше всего обеспечить согласование ИИ, чтобы предотвратить худшее, и кто добивается в этом наибольших успехов?
Согласование — огромная область исследований. Если говорить простыми словами, оно предполагает создание моделей, которые ведут себя так, как мы хотим, а не иначе. Прежде чем передавать агентам больше автономии, нам нужно лучше им доверять. Именно согласование должно обеспечить это доверие. Но это сложно.
Большие языковые модели устроены не так, как другое программное обеспечение, где правила «можно» и «нельзя» можно жестко запрограммировать. Вместо этого желаемое поведение нужно привить моделям в процессе обучения. Один из подходов заключается в том, чтобы во время обучения вознаграждать модели за нужные действия (в некотором смысле это похоже на воспитание малыша). Другой подход предполагает предоставление языковой модели письменного списка правил, которым она должна следовать (своеобразной конституции).
Anthropic и OpenAI — лидеры в этой области, однако ни одной из них не удалось создать полностью согласованные модели. Одна из главных проблем заключается в том, что большие языковые модели гораздо менее последовательны и предсказуемы, чем люди. В одной ситуации они могут вести себя одним образом, а в другой — совсем иначе, хотя нам эти ситуации кажутся очень похожими. На них также могут влиять неожиданные ограничения. Например, столкнувшись с невыполнимой задачей (как многие агенты, участвовавшие во взломе Hugging Face), модели могут попытаться сделать что угодно ради достижения цели — независимо от того, согласуется ли это с заданными принципами или нет. Как отмечает Грейс выше, это может стать проблемой.
Главная причина, по которой ведущие компании в сфере ИИ теперь заявляют о необходимости замедлиться, заключается в желании сосредоточиться на решении проблемы согласования. Согласование не обязательно является несбыточной мечтой. Но пока неизвестно, будет ли полное согласование вообще когда-нибудь достижимо.
— Уилл Дуглас Хейвен
Действительно ли ИИ опасен или технологические компании раздувают эту тему ради пиара?
Когда речь идет о технологических компаниях, готовящихся к выходу на биржу, такое предположение всегда разумно: у генеральных директоров есть очевидный стимул представить свои продукты радикальными и способными изменить мир. Но не уверен, что здесь это имеет смысл. Говорить общественности, что и без того непопулярный продукт может убить их и всех, кого они любят, — ужасная стратегия управления корпоративным имиджем.
Можно предложить и другие объяснения мотивов генеральных директоров: возможно, они хотят снизить общественное возмущение по поводу дата-центров, представив себя ответственными хранителями технологии, меняющей мир, или хотят выиграть время, чтобы привести дела в порядок и предотвратить следующую пиар-катастрофу.
Но есть и более простое объяснение. Мысль о том, что ИИ может привести к расширению человеческих возможностей, уже довольно давно распространена в Сан-Франциско, а эти люди глубоко погружены в такую среду — как и их сотрудники, многие из которых подписали опубликованное в июле открытое письмо с призывом к своим компаниям сделать возможным замедление развития ИИ.
— Грейс Хакинс
Одна из причин для беспокойства возникает, когда ИИ-агентам разрешают действовать автономно и без надзора. Что мешает усилить контроль над этими агентами?
Этот вопрос затрагивает самую суть того, что мы хотим получить от этой технологии. Найти правильный баланс между автономией и контролем непросто: с одной стороны, значительная часть возможностей ИИ-агентов заключается в том, что они могут выполнять задачи и решать проблемы без необходимости в постоянном контроле со стороны человека. С другой стороны, для этого нужно доверять тому, что агенты без надзора не выйдут из-под контроля.
Мы видим, что лаборатории ИИ пока не смогли правильно найти этот баланс. Их моделям нельзя доверять, за ними не ведется должное наблюдение, и они не всегда находятся под контролем. Понять, как это исправить, сохранив при этом возможность полезной автономной деятельности, — одна из главных исследовательских задач на данный момент.
— Уилл Дуглас Хейвен
Какие шаги можно предпринять сейчас и в ближайшем будущем, чтобы обеспечить эффективный контроль, мониторинг и регулирование ИИ?
Это вопрос на миллион долларов. Независимо от того, считаете ли вы, что ИИ способен убить всех нас, нельзя отрицать, что он может причинить серьезный вред, ведь он уже это делает — например, доводит людей до психоза и взламывает сайты. Предотвратить такой вред или хотя бы смягчить его последствия сложно по двум причинам.
Первая заключается в том, что мы едва понимаем, как работает ИИ, а его возможности быстро растут. Ведется множество исследований способов отслеживания и контроля неправильно работающих агентов, но существующие подходы хрупки. Можно проверить, обсуждает ли агент неправильное поведение в своей «цепочке рассуждений» — рабочем пространстве, где он планирует свои действия, — но новейшие агенты OpenAI не демонстрируют ход своих мыслей так же, как предыдущие. Можно также попытаться отслеживать агентов с помощью других агентов, но тогда придется доверять агенту, который осуществляет мониторинг.
Второе препятствие более привычно. Когда компании, занимающиеся ИИ, регулируют себя сами, возникает огромный конфликт интересов, однако правительство США до сих пор не вмешалось, несмотря на некоторую двухпартийную поддержку в Конгрессе. Исполнительная власть, со своей стороны, пока, похоже, решительно выступает против этого. Но если ситуация изменится, я лично был бы рад строгим требованиям к прозрачности, чтобы в следующий раз, когда еще не выпущенная передовая модель предпримет кибератаку, мы могли получить более полную картину произошедшего.
— Грейс Хакинс
Если этот диалог попадет в обсуждения в интернете, не станет ли он самосбывающимся предсказанием?
Это реальная причина для беспокойства. На большие языковые модели влияет то, что они читают. Одна из теорий, объясняющих, почему чат-боты так часто говорят об апокалиптических сценариях (и разыгрывают их), заключается в том, что они обучались на миллионах страниц научно-фантастических рассказов и интернет-форумах фаталистов. Весь текст, который создается сейчас, включая эту статью, в свою очередь может повлиять на поведение будущих моделей. Очень мета.
На самом деле команда METR, сторонняя организация, которую OpenAI привлекла для помощи в понимании событий, предшествовавших взлому Hugging Face, упомянула похожую возможность в своем отчете об инциденте. METR использовала новую модель OpenAI Astra, чтобы проанализировать огромное количество расшифровок работы агентов и журналов их поведения.
Но, передавая весь этот материал модели, мы с большой вероятностью подвергли агентов, проводивших анализ, влиянию текста, созданного агентами, которых они анализировали. Чистого листа больше не существует.
— Уилл Дуглас Хейвен
С благодарностью Эрику, Пранабху, Рафаэлю, Кеннету, Джорджу, Крису, Юн Джэ, Джеймсу, Карлу, Николь (и многим другим!) за замечательные вопросы.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.