Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Не заблуждайтесь — LLM не рассуждают

Однажды мартовским днём 2016 года в Сеуле я наблюдал, как созданная при моём участии программа поставила камень на пятую линию доски для го — на вид в подарок своему противнику-человеку. 37-й ход во второй партии пятираундового матча выглядел настолько абсурдно, что некоторые комментаторы решили, будто это программный сбой. Но это было не так. В итоге AlphaGo выиграла партию, а затем одержала победу над Ли Седолем, одним из величайших профессиональных игроков в го всех времён, со счётом 4:1. «Я думал, что AlphaGo основана на вероятностных вычислениях и что это всего лишь машина», — сказал Ли впоследствии. «Но когда я увидел этот ход, я изменил своё мнение. Несомненно, AlphaGo способна к творчеству». 

Когда в 1997 году Deep Blue победила тогдашнего действующего чемпиона мира по шахматам Гарри Каспарова, она просчитывала на шесть-восемь ходов вперёд для каждого игрока и оценивала 200 миллионов шахматных позиций в секунду, используя правила, заранее заданные людьми. Го — гораздо более сложная игра. Ценность камня зависит от того, как на протяжении десятков ходов разворачивается положение удалённых друг от друга групп и территорий. На вычисление даже доли возможных исходов суперкомпьютеру потребовались бы миллиарды лет. Чтобы победить, AlphaGo должна была мгновенно определять, кто впереди, и даже изобретать ходы, которые ни один человек прежде не додумался бы сделать.

Именно поэтому во многих рассказах о матче AlphaGo с Ли 37-й ход представляют как вспышку чистой машинной интуиции. Но это заблуждение. На самом деле именно способность AlphaGo рассуждать сделала возможным этот творческий выбор — а таких способностей сегодняшнему ИИ недостаёт. Если мы хотим, чтобы будущие системы ИИ выдавали заслуживающие доверия результаты и действительно новые идеи в таких областях, как наука и медицина, мы должны наделить их настоящими способностями к рассуждению такого рода.

AlphaGo состоит из двух систем. Первая, её стратегическая сеть, была обучена угадывать, какой ход сделал бы сильный игрок-человек. Эта «интуитивная» часть не считала 37-й ход чем-то особенным — вероятность того, что его сделал бы профессиональный игрок-человек, составляла примерно один к десяти тысячам. AlphaGo выбрала его благодаря поисковому механизму программы, который выходил за пределы непосредственной правдоподобности и оценивал будущие последствия предлагаемых ходов. Он явно строил и исследовал игровое дерево с тысячами ветвей, каждая из которых представляла отдельное возможное будущее. 

Известная теория поведенческих наук, популяризированная Даниэлем Канеманом, различает два режима человеческого мышления: система 1 — быстрая, интуитивная и не требующая усилий; система 2 — медленная, пошаговая и рассудочная. AlphaGo продемонстрировала поразительную машинную аналогию этого разделения. Её нейронные сети выдвигали догадки — этот ход выглядит многообещающим, эта позиция кажется выигрышной, — а поисковый механизм обеспечивал рассуждение, проверяя эти догадки на возможных последующих ходах и контрходах. Как и в человеческом мышлении, ни одна из этих половин не работает в одиночку. Одна интуиция никогда не выбрала бы 37-й ход, а перебор всех вариантов с помощью поиска с трудом справился бы с множеством возможных ходов.

Это разительно отличается от того, как работают современные модели ИИ. Большая языковая модель снова и снова выбирает следующий токен. В сущности, это работа системы 1 — быстрая, ассоциативная и удивительно эффективная в распознавании закономерностей почти во всех темах, о которых пишут люди.

Вскоре после появления ChatGPT стало ясно, что одной беглости языка недостаточно для настоящей полезности. Очевидным решением было создать модели, способные рассуждать: вместо немедленного ответа они теперь могут генерировать промежуточные шаги, которые разбивают задачу на части, переносят вперёд частичные результаты и влияют на последующее рассуждение, — процесс, известный как цепочка рассуждений. Результаты действительно улучшились, прежде всего в математике и программировании. Но в отличие от поиска AlphaGo этот процесс не вводит по-настоящему отдельный механизм рассуждения: промежуточные рассуждения по-прежнему порождаются тем же процессом предсказания следующего токена, который просто выполняется дольше, прежде чем модель остановится на ответе.

Три недостатка не позволяют считать то, чем занимаются чат-боты, рассуждением (по крайней мере в смысле, который признал бы учёный). Во-первых, эти модели обычно не поддерживают явное, устойчивое и доступное для проверки эпистемическое состояние. Не существует открытого реестра, где были бы изложены гипотезы, рассматриваемые моделью, степень её уверенности в различных объяснениях, оцениваемые ею свидетельства и нерешённые вопросы, которые она продолжает держать в поле зрения, — всё то, что должно систематически пересматриваться по мере поступления новой информации. Во-вторых, им недостаёт чёткого разделения между тем, что система знает, и тем, как она манипулирует этими знаниями. Знания и рассуждение неразрывно переплетены в весах нейронной сети — отдельного, явно представленного набора убеждений не существует. В-третьих, хотя создаваемые чат-ботами цепочки рассуждений выглядят как обдумывание, исследования показали, что боты часто сочиняют их задним числом: приходят к ответу одним путём, а сообщают другой.

Это проблема, потому что в важных для всех нас сферах применения — таких как медицина, инженерное дело и научные исследования — имеет значение не только вывод системы, но и то, как она к нему пришла. Когда случаются ошибки — например, при медицинской диагностике и лечении, — нам необходимо понять, что именно пошло не так: ошиблась ли система в рассуждениях, опиралась ли она на недостоверные свидетельства или исходила из неверных предположений? 

Именно поэтому я недавно покинул должность в Google DeepMind. Я считаю, что нам нужен новый подход к машинному рассуждению — основанный на архитектуре AlphaGo. AlphaGo сохраняет сведения о том, что ей известно о данной позиции: игровое дерево. Эта структура данных содержит все рассмотренные AlphaGo варианты и возможные будущие ходы; каждый ход и позиция снабжены оценками, сделанными её нейронными сетями. По мере развития рассуждения AlphaGo обновляет игровое дерево и в конечном счёте синтезирует содержащуюся в нём информацию, чтобы решить, какой ход сделать. 

Аналогичным образом, при решении общих задач система должна поддерживать эпистемическое состояние, отражающее то, что система считает установленным, в чём сомневается, что исключила и какие вопросы остаются открытыми. Тогда рассуждение можно понимать как последовательность ходов, изменяющих эпистемическое состояние ради расширения знаний и уменьшения неопределённости: выведения следствий, разбиения задач на части и — что особенно важно — решения о том, какой вопрос задать, какое вычисление выполнить или какой эксперимент провести следующим.

Разумеется, рассуждение в открытом мире сложнее, чем игра в такую настольную игру, как го или шахматы. В реальном мире текущее положение дел известно лишь частично, набор доступных действий велик и изменчив, а последствия действий случайны или неизвестны. 

Но недавние достижения в области больших языковых моделей и других нейронных моделей теперь дают нам возможность браться за такие общие задачи рассуждения. Например, большие языковые модели могут предлагать способы решения задачи, исходя из известных фактов и доступных ресурсов. Они могут взаимодействовать с инструментами через API или код, а также помогать оценивать, подтверждается ли утверждение имеющимися свидетельствами.

Самое важное: чтобы система оставалась честной, независимая её часть должна оценивать каждый ход по тому, насколько он действительно уменьшает неопределённость, обновляя убеждения только тогда, когда изменение подтверждено свидетельствами. После введения этих правил модель сможет накапливать проверенные знания и совершенствовать свою стратегию рассуждения, обучаясь на прошлом опыте рассуждений. Такую систему можно представить как научный метод, усиленный многократно и предназначенный для производства знаний, способных выдержать проверку.

Я не думаю, что мы придём к надёжному машинному интеллекту, просто увеличивая систему 1. Масштабирование обостряет интуицию, но не делает её более рассудочной. 37-й ход имел значение потому, что машина удерживала позицию в уме, взвешивала возможные варианты будущего и выбирала ход, который её искусственные инстинкты, скорее всего, отвергли бы. Обществу нужны такие творческие ходы в разработке лекарств, создании материалов, исследовании климата и диагностике — в областях, где доска совсем не похожа на доску для го и никто не вручает нам правила. Такие идеи мы получим только от систем, способных рассуждать, — систем, чьи выводы возникают из проверяемой последовательности свидетельств, умозаключений и пересмотра убеждений, а не из убедительной истории, рассказанной задним числом. 

Тор Грепель — руководитель направления машинного обучения в Университетском колледже Лондона. Он был одним из ключевых участников команды AlphaGo в DeepMind и работает над тем, чтобы ИИ способствовал процветанию человечества.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости