Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← Към новините

Тези стартъпи се борят за следващия голям пробив при LLM

Поредицата What’s Next на MIT Technology Review разглежда различни индустрии, тенденции и технологии, за да ви даде първи поглед към бъдещето. Можете да прочетете останалите материали от нея тук.

В далечното лято на 2017 г. изследователи на изкуствения интелект в Google публикуваха статия, озаглавена „Attention Is All You Need“, в която описаха нов тип невронна мрежа, наречена трансформър. Тя се оказа много добра в обработването на дълги последователности от данни, особено текст. 

Девет години по-късно трансформърите са двигателите във всеки основен голям езиков модел на пазара. „Цялата индустрия на изкуствения интелект е изградена върху трансформъри“, казва Джъстин Дангъл, съосновател и главен изпълнителен директор на стартъпа за изкуствен интелект Subquadratic. „Те са едно от най-важните нововъведения в историята на компютърните науки и промениха света.“

Но трансформърите започват да показват възрастта си. Много от последните постижения при LLM, като разработването на така наречените модели за разсъждение и способността им да обработват големи количества входни данни наведнъж, не са елегантни разширения на тази основна технология, а заобиколни решения, които прикриват някои от фундаменталните ѝ недостатъци.

Все повече учени и инженери вече питат какво следва. LLM няма да изчезнат, но начинът, по който се създават, е отворен за промени. (MIT Technology Review нарече това бъдещо поколение модели LLM+ в тазгодишния си списък с 10-те неща, които имат значение в областта на изкуствения интелект.)

На сцената излиза вълна от стартъпи, които се надяват да разширят границите на тази бързо разрастваща се технология. Несъмнено някои ще се провалят, но те имат всичко за печелене и много по-малко за губене от компаниите, които днес са начело. 

Силата на числата

Но първо, проблемът. Основната сила на трансформърите се крие в механизъм, наречен плътно внимание, който кодира значението на текстов блок в поредица от числа. Процесът включва сравняване на всяка дума (или част от дума, известна като токен) в текста с всяка друга дума чрез форма на умножение.

Плътното внимание може да улови значението на текста със забележителна точност. Но с нарастването на дължината на текста броят на изчисленията, необходими за обработването му, се увеличава бързо. Документ от 10 000 думи може да изисква от трансформър да извърши 50 милиона умножения. Това е основната причина LLM да поглъщат толкова много енергия.

Разходите са огромни. Очаква се OpenAI да похарчи 50 милиарда долара за изчислителна мощ тази година, според президента на компанията Грег Брокман. А Международната агенция по енергетика прогнозира, че общото количество електроенергия, потребявано от центровете за данни, ще се удвои до 2030 г.

Нещо повече, трансформърите се затрудняват с това, за което са проектирани много от най-новите модели. Поради начина, по който обработват текста дума по дума, трансформърите не са особено добри в проследяването на голямо количество информация едновременно (с други думи, така нареченият им контекстен прозорец не може да бъде твърде голям). И все пак, ако LLM трябва да изпълняват по-трудни задачи, те ще трябва да приемат по-големи количества данни: цяла библиотека от документи, цяла кодова база или, в случая на агентите, изходни данни от други LLM.

Що се отнася до моделите за разсъждение, те работят, като си записват бележки (в своеобразен чернови блок, известен като верига на мисълта), а след това ги прочитат отново, което също увеличава количеството данни, което трябва да бъде проследявано.

С увеличаването и подобряването на LLM трансформърите се превърнаха в тясно място. Основната сила на технологията вече е ограничение.

Ето четири нови идеи как да бъде решен проблемът с трансформърите — нововъведения, които биха могли завинаги да променят LLM, правейки ги по-бързи, значително по-ефективни и (може би) дори по-интелигентни.

01: Преосмисляне на вниманието

Очевиден начин да направим LLM по-бързи и по-евтини е да атакуваме проблема директно и да променим начина, по който работи вниманието. Замяната на плътното внимание с механизъм, наречен разредено внимание, който извършва изчисления само върху някои съчетания от думи в текстов блок, вместо върху всички, може драстично да намали количеството изчисления, които LLM трябва да извършват.  

През годините изследователите са разработили множество механизми за разредено внимание. Проблемът е, че нито един от тях не беше толкова добър, колкото плътното внимание при улавянето на значението.

Това може да се е променило. Базираният в Маями стартъп Subquadratic твърди, че е изобретил първия механизъм за разредено внимание, който съперничи на водещите масови LLM при редица задачи, включително търсене и програмиране. Това е огромно твърдение (и някои хора в индустрията остават скептични).

От Subquadratic казват, че моделът им SubQ работи, като в движение определя — за всеки подаден му текстов фрагмент — кои думи имат значение и кои не. Компанията също твърди, че хиляди хора са се записали в списъка ѝ с чакащи и планира скоро да направи модела широко достъпен.

Междувременно Manifest AI, стартъп, базиран в Сан Франциско, подхожда към проблема от различен ъгъл. Вместо да променя начина, по който работи вниманието, компанията го заменя с нещо друго. 

Тя е разработила механизъм, който нарича задържане на степен, съхраняващ само най-релевантната информация за дадена задача и гарантиращ, че количеството данни, което един LLM трябва да проследява, няма да нарасне неконтролируемо.

Механизмите за внимание принуждават LLM да проследяват всичко в контекстния си прозорец. Моделът с разредено внимание (като SubQ) изхвърля много от отделните думи, но все пак запазва обща представа за всичко, което е видял. За разлика от него, задържането на степен работи, като предоставя на модела постоянно обновявано обобщение на контекстния му прозорец. С добавянето на нова информация по-малко релевантната информация отпада. 

Основният принцип на задържането съществува от десетилетие. От Manifest AI твърдят, че са обновили тези техники, за да създадат модели, които за първи път могат да се мерят с LLM, базирани на трансформъри.

Компанията казва, че е възможно трансформър модел да бъде адаптиран в модел със задържане на степен с минимално допълнително обучение. За да демонстрира това, тя е превърнала съществуващия отворен LLM за програмиране StarCoder във версия, която използва задържане на степен, наречена PowerCoder. Компанията също така е пуснала модел, наречен Brumby, който според нея съперничи на някои версии на популярния отворен модел Qwen на Alibaba. 

Manifest AI иска технологията ѝ за задържане на степен да се превърне в предпочитаното решение, когато LLM трябва да изпълняват задачи, включващи обработка на огромни количества данни. Има множество полезни приложения, твърди съоснователят и главен технически директор на Manifest AI Карлес Гелада във видеоклип, обявяващ технологията на компанията миналата година — от анализиране на видеоклипове с продължителност няколко часа до създаване на агенти, които могат да се придържат към дадена задача в продължение на седмици. 

02: По-малки и по-гъвкави модели

Liquid AI, отделил се от MIT стартъп, базиран в Кеймбридж, Масачузетс, не е променил или изоставил напълно трансформърите, но ги съчетава със собствената си технология — течни невронни мрежи — за да създаде това, което съоснователят и главен изпълнителен директор Рамин Хасани нарича LFM (течни фундаментални модели).

Моделите на Liquid AI са много по-малки и използват по-малко енергия от повечето LLM. Компанията създава модели за производители на автомобили, включително Mercedes, които работят върху малките чипове в превозните средства. Най-новите ѝ модели могат да работят на Raspberry Pi — малък компютър за любители, който струва 50 долара.

Моделите ѝ са безплатни за всяка организация с годишни приходи под 10 милиона долара. И са се оказали популярни: компанията е натрупала почти 34 милиона изтегляния, казва Хасани.

Течните невронни мрежи са вдъхновени от мозъците на червеите. Те са продължение на друг тип невронна мрежа, предхождаща трансформърите, наречена конволюционна мрежа. Основното нововъведение е механизъм, който позволява на модела да адаптира поведението си към нова информация, така че да може да се учи в движение. Това не е възможно при трансформърите: след като моделът бъде обучен, поведението му е фиксирано.

Първите модели на Liquid AI бяха сравнително базови, но можеха да управляват дронове или да шофират превозни средства. С LFM компанията се опитва да разшири технологията си, за да се конкурира с масовите LLM. Новите ѝ модели се представят наравно с четири пъти по-големи конкуренти, включително версии на Qwen на Alibaba и отворения LLM Gemma на Google.

Типичният LLM е изграден от свързана последователност от трансформъри. Последните LFM на Liquid AI са хибридни модели, съставени от 20% трансформъри и 80% течни невронни мрежи.

До това съотношение е стигнала друга система за изкуствен интелект, създадена от Liquid AI, която компанията използва, за да помага при проектирането на всичките си модели. „Това е основната технология на компанията ни в момента“, казва Хасани. Този изкуствен интелект за проектиране пресява множество различни комбинации от невронни мрежи — течни, конволюционни и други, както и трансформъри — и създава проекти, които свързват различни видове, за да постигнат идеалното съчетание от производителност и ефективност.

Хасани смята, че трансформърите са били само началото: „Вашият мозък е система за общ изкуствен интелект, знаете, и работи с 20 вата мощност. Как е възможно това? Можем да бъдем много по-иновативни.“

03: Генериране на текст наведнъж

Почти всички LLM генерират изхода си дума по дума. Това има смисъл, защото така говорят и пишат хората. Но за компютрите е много неефективно.

За LLM е по-бързо и по-евтино да генерират текста наведнъж — да изведат цели изречения или абзаци с един ход. Това е подходът на Inception, стартъп, базиран в Пало Алто, Калифорния, който създава LLM с помощта на техника, наречена дифузия. 

Дифузията е по-известна като технологията, която задвижва повечето модели за генериране на изображения и видеоклипове. Дифузионните модели са обучени да приемат случайна решетка от пиксели — като снежната картина на стар телевизор — и да я превърнат в изображение. Те правят това, като обработват всички пиксели едновременно и определят кои трябва да бъдат променени, за да изглежда снежната картина повече като снимка с висока разделителна способност.

Оказва се, че този процес работи и с текст. Inception е обучила своите LLM да приемат случаен низ от думи и да го превръщат в смислени изречения. Дифузионните LLM все още използват трансформъри за кодиране на значението, но като създават цели блокове текст наведнъж, карат трансформърите да вършат повече с по-малко. „Все още използвате голям трансформър модел, но можете да предсказвате много токени едновременно“, казва съоснователят и главен изпълнителен директор на Inception Стефано Ермон. „Ето защо тези модели са много по-бързи и по-ефективни от гледна точка на разходите в сравнение с това, което повечето други хора създават днес.“

Предизвикателството е било да се вземе технология, проектирана за генериране на изображения, и да се приложи към текста. При изображенията, ако трябва да промените син пиксел в червен, можете да преминете през междинни цветове, казва Ермон. Това не работи с текста: „Когато имате „котка“ и „куче“, всъщност няма нещо по средата.“ 

Ермон е и изследовател в Станфордския университет. През 2024 г. той и двама негови колеги от Станфорд са открили математиката, която позволява на дифузионните модели да работят с текст. Те са обучили дифузионен модел, който се е представил наравно с GPT-2 — LLM, създаден от OpenAI през 2019 г. — но е бил 10 пъти по-бърз. Това е било достатъчно за Ермон да отдели компания. 

Днес той се цели във висшата лига. Inception твърди, че най-новият ѝ модел, Mercury 2, се представя толкова добре, колкото някои от моделите GPT-4 на OpenAI, пуснати през 2023 г., но отново е 10 пъти по-бърз. „Оптимисти сме за този подход, защото именно той ще може да се мащабира“, казва Ермон. 

Единствените неща, които имат значение, са скоростта и цената, добавя той: „В крайна сметка валутата ще бъде интелигентност за долар.“

Inception не е единствената компания, която залага на дифузията. Google също експериментира с този подход и е създала прототип на LLM, наречен Diffusion Gemma. Но Ермон не се притеснява от конкуренцията. „Мисля, че това потвърждава подхода“, казва той. „Това е бъдещето.“

04: Отвъд думите

Pathway, друг стартъп, базиран в Пало Алто, може би е най-крайният представител на тази нова група. Компанията иска да освободи LLM от ограниченията на езика.

Фирмата е създала тип LLM, наречен Dragon Hatchling (кръстен на драконите от романа на Тери Пратчет Color of Magic, които се материализират, ако мислите достатъчно силно за тях). Най-забележителният му резултат досега е високият резултат в тест, който противопоставя LLM на повече от 250 000 изключително трудни судоку пъзела. Dragon Hatchling е решаваил повече от 97% от пъзелите; няколко водещи LLM от най-добрите лаборатории не са успели да решат нито един. 

Тезата, която Pathway иска да изтъкне, е, че въпреки забележителния си успех при множество различни задачи, LLM все още се провалят при важни класове проблеми. Судоку е само един пример. Ако искаме LLM да измислят истински, новаторски решения на реални проблеми, трябва да надхвърлим трансформърите, казва съоснователката и главна изпълнителна директорка на Pathway Зузана Стамировска. 

Причината е, че трансформърите принуждават LLM да правят всичко с текст. Но езикът не е най-добрият инструмент за определени видове разсъждение. „Много е трудно да представиш дъска за судоку дума по дума“, казва Стамировска.

Решението на Pathway е да промени математиката зад трансформъра, като замени механизма за внимание с математическа структура, наречена пространство на състоянията. Вместо да кодира информацията дума по дума, пространствата на състоянията я компресират в по-абстрактно представяне. Използвайки тази техника, Dragon Hatchling все още може да обработва и създава текст, но може също така да имитира форми на разсъждение, които не включват последователности от думи. Това не само прави модела на Pathway по-ефективен, но (на теория) му позволява да се заема със задачи, които други LLM не могат да изпълнят. 

Помислете за шаха или математиката — подобни пъзели не се съхраняват в главата ви като дълго изречение, казва Стамировска: „Моментът на прозрение, който се появява в мозъка ви, не е непременно на езика. Бихме казали, че ако трябва да разсъждавате на език, по някакъв начин сте ограничени.“ 

Стамировска признава, че един масов LLM може да прочете книга за това как се решава судоку и след това да напише код, който да го направи. Но ние искаме да създаваме модели, които притежават повече от знанията от книгите, казва тя: „Надеждата за изкуствения интелект не е да решава судоку, а да лекува рака. За това няма книга.“

„Трансформърите са инженерно удобство, на което попаднахме“, добавя тя. „Те поставиха началото на религия, но е нелепо да мислим, че друго пробивно постижение няма да се случи.“

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини