Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Не дайте себе ошукати — LLM не міркують

Одного березневого дня 2016 року в Сеулі я спостерігав, як програма, до створення якої я долучився, поставила камінь на п’яту лінію дошки для ґо, що виглядало як подарунок її людському суперникові. 37-й хід у другій партії п’ятиматчевого поєдинку здавався настільки абсурдним, що деякі коментатори подумали, ніби це програмний збій. Але це був не збій. AlphaGo зрештою виграла партію й перемогла Лі Седоля з рахунком 4:1 — одного з найвидатніших професійних гравців у ґо всіх часів. «Я думав, що AlphaGo ґрунтується на розрахунку ймовірностей і є просто машиною», — сказав Лі згодом. «Але коли я побачив цей хід, то змінив свою думку. Безперечно, AlphaGo є творчою».

Коли Deep Blue переміг тодішнього чемпіона світу з шахів Гаррі Каспарова у 1997 році, він робив це, прораховуючи на шість-вісім ходів уперед за кожного гравця й оцінюючи 200 мільйонів шахових позицій за секунду, використовуючи правила, жорстко запрограмовані людьми. Ґо — набагато складніша гра. Цінність каменя залежить від того, як розвиватимуться віддалені групи й території протягом десятків ходів. Обчислення навіть частки можливих результатів зайняло б у суперкомп’ютера мільярди років. Щоб перемогти, AlphaGo мала миттєво відчувати, хто попереду, і навіть винаходити ходи, про які не думав жоден з людей.

Саме тому в багатьох описах матчу AlphaGo проти Лі хід 37 постає як спалах чистої машинної інтуїції. Але це хибне розуміння. Насправді саме здатність AlphaGo міркувати зробила можливим цей творчий вибір — а таких здібностей сучасному ШІ бракує. Якщо ми хочемо, щоб майбутні системи ШІ давали надійні результати й справді нові осяяння в таких галузях, як наука та медицина, нам потрібно наділити їх справжніми здатностями до міркування такого типу.

AlphaGo складається з двох систем. Перша — її мережа політики — була навчена вгадувати, який хід зробив би сильний гравець-людина. Ця «інтуїтивна» частина не вважала хід 37 чимось особливим — імовірність того, що його зробить професійний гравець-людина, становила приблизно один до 10 000. AlphaGo обрала його завдяки пошуковому механізму програми, який виходив за межі безпосередньої правдоподібності й оцінював майбутні наслідки запропонованих ходів. Він явно побудував і досліджував дерево гри з тисячами гілок, кожна з яких представляла інше можливе майбутнє.

Добре відома теорія в поведінкових науках, популяризована Даніелем Канеманом, розрізняє два режими людського мислення: система 1 — швидка, інтуїтивна й невимушена; система 2 — повільна, покрокова та обдумана. AlphaGo запропонувала яскравий машинний аналог цього поділу. Її мережі постачали здогадки — цей хід виглядає перспективним, ця позиція здається виграшною, — а пошук забезпечував обдумування, перевіряючи ці здогадки на можливих ходах і контрходах, які мали б відбутися далі. Як і в людському пізнанні, жодна з половин не працює самостійно. Сама інтуїція ніколи не обрала б хід 37, а повний перебір насилу впорався б із просіюванням усіх численних можливих ходів.

Це разюче відрізняється від того, як працюють сучасні моделі ШІ. Велика мовна модель знову й знову обирає наступний токен. Це і є система 1 у дії — швидка, асоціативна й напрочуд вправна у відтворенні закономірностей майже в кожній темі, про яку пишуть люди.

Невдовзі після появи ChatGPT галузь усвідомила, що самої мовної вправності недостатньо для справжньої корисності. Очевидним розв’язанням стало створення моделей, здатних обдумувати: замість того щоб відповідати одразу, вони тепер можуть генерувати проміжні кроки, які розкладають проблему на частини, переносять часткові результати далі й впливають на подальше міркування — процес, відомий як ланцюжок міркувань. Переваги виявилися реальними, передусім у математиці та програмуванні. Але, на відміну від пошуку AlphaGo, це не створює справді окремого механізму міркування: проміжні міркування все ще породжуються тим самим процесом передбачення наступного токена, який просто довше повторюється, перш ніж модель зупиниться на відповіді.

Три недоліки не дають змоги вважати те, що роблять чат-боти, міркуванням — принаймні в сенсі, який визнав би науковець. По-перше, ці моделі зазвичай не підтримують явного, сталого й доступного для перевірки епістемічного стану. Немає відкритого реєстру, у якому були б викладені гіпотези, що їх розглядає модель, її впевненість у різних поясненнях, докази, які вона зважує, і невирішені питання, яких вона дотримується, — усе те, що має систематично переглядатися з надходженням нової інформації. По-друге, їм бракує чіткого розмежування між тим, що система знає, і тим, як вона опрацьовує ці знання. Знання та міркування нерозривно переплетені у вагових коефіцієнтах нейронної мережі — незалежного, явно представленого набору переконань не існує. По-третє, хоча ланцюжки міркувань, які створюють чат-боти, виглядають як обдумування, дослідження показали, що боти часто вигадують їх постфактум, приходячи до відповіді одним шляхом, а повідомляючи про інший.

Це проблема, оскільки у важливих сферах застосування, які всіх нас турбують, — медицині, інженерії та наукових дослідженнях — важливо не лише те, якого висновку доходить система, а й те, як вона його доходить. Коли трапляються помилки — наприклад, у медичній діагностиці та лікуванні, — ми повинні мати змогу точно визначити, що пішло не так: помилковим було міркування системи, вона спиралася на недійсні докази чи зробила неправильні припущення?

Саме тому я нещодавно залишив посаду в Google DeepMind. Я вважаю, що нам потрібен новий підхід до машинного міркування — такий, що спирається на архітектуру AlphaGo. AlphaGo веде запис того, що їй відомо про певну позицію: дерево гри. Ця структура даних містить усі варіанти, усі можливі майбутні ходи, які розглянула AlphaGo, причому кожен хід і позиція мають позначки з оцінками, зробленими її нейронними мережами. У міру розвитку міркування AlphaGo оновлює дерево гри й зрештою синтезує наявну в ньому інформацію, щоб вирішити, який хід зробити.

Так само для загального міркування система повинна підтримувати епістемічний стан, який відображає, що система вважає встановленим, у чому сумнівається, що відкинула, а які питання залишаються відкритими. Тоді міркування можна розуміти як послідовність ходів, що змінюють епістемічний стан, розширюючи знання й зменшуючи невизначеність: виводять наслідки, розбивають проблеми на частини й — що особливо важливо — вирішують, яке питання поставити, яке обчислення виконати або який експеримент провести далі.

Звісно, міркування у відкритому світі складніше, ніж гра в настільну гру на кшталт ґо чи шахів. У реальному світі поточний стан речей відомий лише частково, набір доступних дій великий і змінний, а наслідки дій є стохастичними або невідомими.

Але нещодавні досягнення у сфері великих мовних моделей та інших нейронних моделей тепер дають нам змогу братися за такі загальні проблеми міркування. Наприклад, великі мовні моделі можуть пропонувати способи розв’язання проблеми на основі відомого та наявних ресурсів. Вони можуть взаємодіяти з інструментами через API або код і допомагати оцінювати, чи підтверджується твердження доступними доказами.

Найважливіше — щоб система залишалася чесною, незалежна її частина повинна оцінювати кожен хід за тим, наскільки він насправді зменшує невизначеність, оновлюючи переконання лише тоді, коли зміна підтверджена доказами. Коли ці правила дотримуються, модель може накопичувати сертифіковані знання й удосконалювати свою політику міркування, навчаючись на минулому досвіді міркувань. Таку систему можна уявити як науковий метод, помножений на стероїди, метою якого є створення знань, здатних витримати перевірку.

Я не думаю, що ми досягнемо надійного машинного інтелекту, просто зробивши систему 1 більшою. Масштаб загострює інтуїцію, але не робить її більш обдуманою. Хід 37 був важливим, тому що машина утримувала в голові позицію, зважувала можливі майбутні варіанти й обрала хід, який її штучні інстинкти, найімовірніше, відкинули б. Суспільству потрібні такі творчі ходи у відкритті ліків, створенні матеріалів, кліматичних дослідженнях і діагностиці — у сферах, де дошка зовсім не схожа на дошку для ґо і ніхто не дає нам правил. Такі осяяння ми отримаємо лише від систем, які міркують, — систем, чиї висновки випливають із доступної для аудиту послідовності доказів, умовиводів і перегляду переконань, а не з переконливої історії, вигаданої постфактум.

Тор Грепель — завідувач кафедри машинного навчання в Університетському коледжі Лондона. Він був одним із ключових членів команди AlphaGo в DeepMind і працює над тим, щоб ШІ сприяв людському добробуту.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини