Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Не се заблуждавайте — LLM не разсъждават

Един следобед в Сеул през март 2016 г. наблюдавах как програма, в чието създаване бях участвал, постави камък на петата линия на дъската за Го — ход, който изглеждаше като подарък за човешкия ѝ противник. Ход 37 във втората партия от мача в пет партии изглеждаше толкова абсурдно, че някои коментатори помислиха, че става дума за програмна грешка. Не беше. AlphaGo спечели партията и в крайна сметка триумфира с 4:1 срещу Ли Седол, един от най-великите професионални играчи на Го за всички времена. „Мислех, че AlphaGo се основава на изчисляване на вероятности и че е просто машина“, каза Ли по-късно. „Но когато видях този ход, промених мнението си. AlphaGo със сигурност е творчески.“ 

Когато Deep Blue победи тогавашния световен шампион по шах Гари Каспаров през 1997 г., той го направи, като разглеждаше шест до осем хода напред за всеки играч и оценяваше 200 милиона шахматни позиции в секунда, използвайки правила, предварително кодирани от хора. Го е несравнимо по-сложна игра. Стойността на един камък зависи от това как ще се развият отдалечените групи и територии в продължение на десетки ходове. Изчисляването дори на малка част от възможните изходи би отнело на суперкомпютър милиарди години. За да спечели, AlphaGo трябваше с един поглед да усети кой има предимство и дори да измисля ходове, за които никой човек не беше се сетил.

Ето защо много разкази за мача на AlphaGo срещу Ли представят ход 37 като проблясък на чиста машинна интуиция. Но това е недоразумение. Всъщност именно способностите на AlphaGo за разсъждение са направили възможен този творчески избор — а това са способности, които днешният изкуствен интелект не притежава. Ако искаме бъдещите системи с изкуствен интелект да дават надеждни резултати и наистина новаторски прозрения в области като науката и медицината, трябва да ги снабдим с истински способности за разсъждение от този вид.

AlphaGo се състои от две системи. Първата, неговата мрежа за политика, е обучена да отгатва какъв ход би направил силен човек. Тази „интуитивна“ част е възприела ход 37 като нещо обикновено — ход, който имал приблизително един на 10 000 шанс да бъде направен от човешки играч експерт. Това, което накара AlphaGo да го избере, беше механизмът за търсене на програмата, който надхвърли непосредствената правдоподобност и претегли бъдещите последици от предложените ходове. Той изрично изгради и претърси дърво на играта с хиляди разклонения, всяко от които представляваше различно възможно бъдеще. 

Добре позната теория в поведенческите науки, популяризирана от Даниел Канеман, разграничава два режима на човешкото мислене: Система 1 е бърза, инстинктивна и без усилие; Система 2 е бавна, поетапна и обмислена. AlphaGo предложи впечатляващ машинен аналог на това разделение. Неговите мрежи осигуряваха догадките — този ход изглежда обещаващ, тази позиция изглежда печеливша — а търсенето осигуряваше обмислянето, като проверяваше тези догадки спрямо ходовете и контраходовете, които щяха да последват. Както при човешкото познание, нито една от двете половини не работи сама. Самата интуиция никога не би избрала ход 37, а грубата сила на търсенето би се затруднила да пресява множеството възможни ходове.

Това е поразително различно от начина, по който работят днешните модели с изкуствен интелект. Големият езиков модел избира следващия токен отново и отново. Това е Система 1 в действие — бърза, асоциативна и изненадващо добра в завършването на модели в почти всяка тема, за която хората пишат.

Не след дълго след появата на ChatGPT областта осъзна, че самата езикова плавност не е достатъчна за истинска полезност. Привидното решение беше да се създадат модели, които разсъждават: вместо да отговарят незабавно, те вече могат да генерират междинни стъпки, които разделят проблема на части, пренасят частични резултати и влияят върху последващото разсъждение — процес, известен като верига на мисълта. Ползите се оказаха реални, преди всичко в математиката и програмирането. Но за разлика от търсенето на AlphaGo, това не въвежда действително отделен механизъм за разсъждение: междинното разсъждение все още се създава чрез същия процес на предвиждане на следващия токен, повтарян по-дълго, преди моделът да се ангажира с отговор.

Три недостатъка пречат на това, което правят чатботовете, да се определи като разсъждение (по начин, който един учен би разпознал). Първо, тези модели обикновено не поддържат изрично, устойчиво и подлежащо на проверка епистемично състояние. Няма открит регистър, който да излага хипотезите, разглеждани от модела, увереността му в различните обяснения, доказателствата, които претегля, и нерешените въпроси, които запазва — все неща, които би трябвало систематично да се преразглеждат с постъпването на нова информация. Второ, те не разполагат с ясно разделение между това, което системата знае, и начина, по който борави с това знание. Знанието и разсъждението са неразривно преплетени в теглата на невронната мрежа — няма независимо, изрично представено множество от убеждения. Трето, макар че веригите на мисълта, които чатботовете създават, изглеждат като обмисляне, изследванията показват, че ботовете често ги измислят постфактум, достигайки до отговор по един път, но съобщавайки друг.

Това е проблем, защото във важните приложения, които засягат всички нас, като медицината, инженерството и научните изследвания, значение има не само до какво заключение стига системата, но и как го достига. Когато възникнат грешки — например при медицинска диагностика и лечение — трябва да можем да установим точно какво се е объркало: погрешно ли е било разсъждението на системата, опирала ли се е на невалидни доказателства или е направила неправилни допускания? 

Именно затова наскоро напуснах позицията си в Google DeepMind. Смятам, че се нуждаем от нов подход към машинното разсъждение — такъв, който се основава на архитектурата на AlphaGo. AlphaGo поддържа запис на това, което знае за дадена позиция: дървото на играта. Тази структура от данни съдържа всички варианти, всички възможни бъдеща, които AlphaGo е разгледал, като всеки ход и всяка позиция са снабдени с оценки, направени от невронните му мрежи. С напредването на разсъждението AlphaGo обновява дървото на играта и в крайна сметка синтезира съдържащата се в него информация, за да реши кой ход да направи. 

По подобен начин, при общото разсъждение системата трябва да поддържа епистемично състояние, което представя какво системата смята за установено, в какво се съмнява, какво е отхвърлила и кои въпроси остават открити. Тогава разсъждението може да се разбира като поредица от ходове, които променят епистемичното състояние, за да разширят знанието и да намалят несигурността: извеждане на последици, разделяне на проблемите на части и — което е от решаващо значение — решаване кой въпрос да бъде зададен, какво изчисление да бъде извършено или какъв експеримент да бъде проведен след това.

Разбира се, разсъждението в отворен свят е по-трудно от играта на настолна игра като Го или шах. В реалния свят настоящото състояние на нещата е известно само частично, наборът от налични действия е голям и променлив, а последиците от действията са стохастични или неизвестни. 

Но последните постижения в областта на LLM и други невронни модели вече ни дават възможност да се заемем с такива общи проблеми на разсъждението. Например LLM могат да предлагат начини за решаване на даден проблем въз основа на известното и наличните ресурси. Те могат да взаимодействат с инструменти чрез API или код и да помагат при оценката дали дадено твърдение е подкрепено от наличните доказателства.

Най-важното е, че за да се поддържа честността на системата, независима нейна част трябва да оценява всеки ход според това доколко той действително намалява несигурността, като обновява убежденията само когато промяната е подкрепена от доказателства. След като тези правила бъдат наложени, моделът може да натрупва сертифицирано знание и да подобрява политиката си на разсъждение, като се учи от минали преживявания при разсъждение. Можем да мислим за такава система като за научния метод на стероиди, чиято цел е да създава знание, способно да издържи на проверка.

Не смятам, че ще достигнем до надежден машинен интелект, като направим Система 1 по-голяма. Мащабирането изостря интуицията, но не я прави по-обмислена. Ход 37 имаше значение, защото машината задържа една позиция, прецени възможните бъдеща и избра хода, който изкуствените ѝ инстинкти вероятно биха отхвърлили. Обществото се нуждае от такива творчески ходове при разработването на лекарства, материалите, климата и диагностиката — области, в които дъската не прилича ни най-малко на дъска за Го и никой не ни подава правилата. Ще получим такива прозрения само от системи, които разсъждават — системи, чиито заключения произтичат от подлежаща на одит последователност от доказателства, изводи и преразглеждане на убежденията, а не от убедителна история, разказана постфактум. 

Торе Грепел е ръководител на катедрата по машинно обучение в University College London. Той беше основен член на екипа на AlphaGo в DeepMind и работи за това изкуственият интелект да допринася за човешкото благоденствие.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини