Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← До новин

Ці стартапи полюють за наступним великим проривом у LLM

Серія What’s Next від MIT Technology Review охоплює різні галузі, тенденції й технології, щоб дати вам перший погляд на майбутнє. Решту матеріалів цієї серії можна прочитати тут.

Ще влітку 2017 року дослідники штучного інтелекту з Google опублікували статтю під назвою «Attention Is All You Need», у якій описали новий тип нейронної мережі під назвою трансформер. Вона виявилася дуже добре пристосованою до обробки довгих послідовностей даних, особливо тексту. 

Через дев’ять років трансформери стали рушіями кожної великої мовної моделі, що є на ринку. «Уся індустрія ШІ побудована на трансформерах», — каже Джастін Денгел, співзасновник і генеральний директор стартапу в галузі ШІ Subquadratic. «Це одна з найважливіших інновацій в історії комп’ютерних наук, і вони змінили світ».

Але трансформери починають демонструвати свій вік. Багато нещодавніх досягнень у великих мовних моделях, як-от розробка так званих моделей міркування та їхня здатність одночасно працювати з великими обсягами вхідних даних, не є акуратними розширеннями цієї базової технології, а радше обхідними рішеннями, що усувають деякі її фундаментальні недоліки.

Дедалі більше науковців та інженерів тепер запитують, що буде далі. Великі мовні моделі нікуди не зникнуть, але спосіб їх створення відкритий для змін. (MIT Technology Review назвало це майбутнє покоління моделей LLMs+ у цьогорічному списку 10 речей, які мають значення у сфері ШІ.)

На сцену виходить хвиля стартапів, які сподіваються розширити межі цієї технології, що переживає бурхливий розвиток. Без сумніву, деякі з них зазнають невдачі, але їм є за що боротися і їм набагато менше що втрачати, ніж компаніям, які сьогодні очолюють перегони. 

Сила в кількості

Але спочатку — проблема. Головна сила трансформерів полягає в механізмі під назвою щільна увага, який кодує значення текстового блоку в низці чисел. Цей процес передбачає порівняння кожного слова (або частини слова, відомої як токен) у тексті з кожним іншим словом за допомогою певної форми множення.

Щільна увага може надзвичайно точно вловлювати значення тексту. Але зі збільшенням довжини тексту кількість обчислень, необхідних для його обробки, стрімко зростає. Для документа обсягом 10 000 слів трансформеру може знадобитися виконати 50 мільйонів операцій множення. Це головна причина, чому великі мовні моделі споживають так багато енергії.

Витрати величезні. За словами президента компанії Грега Брокмана, OpenAI планує витратити цього року 50 мільярдів доларів на обчислювальні потужності. А Міжнародне енергетичне агентство прогнозує, що загальна кількість електроенергії, яку споживають дата-центри, до 2030 року подвоїться.

Ба більше, трансформери погано справляються з тим, для чого призначено багато найновіших моделей. Через спосіб обробки тексту — слово за словом — трансформери не надто добре відстежують багато інформації одночасно (іншими словами, їхнє так зване контекстне вікно не може бути надто великим). І все ж, якщо великі мовні моделі мають виконувати складніші завдання, їм потрібно буде опрацьовувати більші обсяги даних: цілу бібліотеку документів, усю кодову базу або, у випадку агентів, результати роботи інших великих мовних моделей.

Що стосується моделей міркування, вони працюють, записуючи нотатки для самих себе (у своєрідному чернетковому блокноті, відомому як ланцюжок міркувань), а потім перечитуючи їх, що знову збільшує обсяг даних, які потрібно тримати в полі зору.

У міру того як великі мовні моделі стають більшими й потужнішими, трансформери перетворилися на вузьке місце. Ключова сила цієї технології тепер є її обмеженням.

Ось чотири нові ідеї щодо розв’язання проблеми трансформерів — інновації, які можуть назавжди змінити великі мовні моделі, зробивши їх швидшими, набагато ефективнішими і (можливо) навіть розумнішими.

01: Переосмислення механізму уваги

Очевидний спосіб зробити великі мовні моделі швидшими й дешевшими — взятися за проблему безпосередньо та змінити принцип роботи уваги. Заміна щільної уваги механізмом під назвою розріджена увага, який виконує обчислення лише для деяких пар слів у текстовому блоці, а не для всіх, може радикально зменшити обсяг обчислень, який мають виконувати великі мовні моделі.  

Протягом багатьох років дослідники розробили чимало механізмів розрідженої уваги. Проблема полягає в тому, що жоден із них не був таким же ефективним, як щільна увага, у вловлюванні значення.

Можливо, це змінилося. Subquadratic, стартап із Маямі, стверджує, що винайшов перший механізм розрідженої уваги, який може конкурувати з провідними мейнстримними великими мовними моделями в низці завдань, зокрема пошуку та програмуванні. Це грандіозна заява (і деякі представники індустрії залишаються скептично налаштованими).

У Subquadratic кажуть, що їхня модель SubQ працює, визначаючи на льоту — для кожного фрагмента наданого їй тексту — які слова важливі, а які ні. Компанія також стверджує, що тисячі людей уже записалися до списку очікування, і планує невдовзі широко представити модель.

Тим часом Manifest AI, стартап із Сан-Франциско, підходить до проблеми з іншого боку. Замість того щоб змінювати принцип роботи уваги, компанія замінює її чимось іншим. 

Вона розробила механізм, який називає утриманням потужності: він зберігає лише найрелевантнішу для конкретного завдання інформацію та не дає обсягу даних, який має відстежувати велика мовна модель, неконтрольовано зростати.

Механізми уваги змушують великі мовні моделі відстежувати все у своєму контекстному вікні. Модель розрідженої уваги (як-от SubQ) відкидає багато окремих слів, але все одно зберігає приблизне уявлення про все побачене. Натомість утримання потужності працює, надаючи моделі оновлюваний підсумок її контекстного вікна. У міру додавання нової інформації менш релевантна інформація вилучається. 

Базовий принцип утримання існує вже близько десяти років. У Manifest AI стверджують, що оновили ці методи, щоб уперше створити моделі, здатні конкурувати з великими мовними моделями на основі трансформерів.

У компанії кажуть, що трансформерну модель можна адаптувати до моделі з утриманням потужності за мінімального донавчання. Щоб продемонструвати це, компанія перетворила наявну відкриту мовну модель для програмування StarCoder на версію з утриманням потужності під назвою PowerCoder. Вона також випустила модель Brumby, яка, за її твердженням, може конкурувати з деякими версіями популярної відкритої моделі Alibaba Qwen. 

Manifest AI хоче, щоб її технологія утримання потужності стала стандартним рішенням, коли великим мовним моделям потрібно виконувати завдання, пов’язані з обробкою величезних обсягів даних. Співзасновник і технічний директор Manifest AI Карлес Гелада у відео, що презентувало технологію компанії минулого року, заявив, що корисних застосувань безліч: від аналізу відео тривалістю кілька годин до створення агентів, здатних не відволікатися від завдання протягом кількох тижнів. 

02: Зменшення моделей і підвищення їхньої гнучкості

Liquid AI, спін-аут MIT, що базується в Кембриджі, штат Массачусетс, не відмовилася від трансформерів повністю й не змінила їх, а поєднує їх із власною технологією — рідинними нейронними мережами — для створення того, що співзасновник і генеральний директор Рамін Хасані називає LFM (рідинними фундаментальними моделями).

Моделі Liquid AI набагато менші й споживають менше енергії, ніж більшість великих мовних моделей. Компанія створює моделі для автовиробників, зокрема Mercedes, які працюють на невеликих чипах усередині автомобілів. Її найновіші моделі можуть працювати на Raspberry Pi — малопотужному комп’ютері для ентузіастів, який коштує 50 доларів.

Її моделі безкоштовні для будь-якої організації з річним доходом менше ніж 10 мільйонів доларів. І вони виявилися популярними: за словами Хасані, кількість завантажень компанії сягнула майже 34 мільйонів.

Рідинні нейронні мережі були натхненні мозком черв’яків. Вони є розвитком іншого типу нейронних мереж, що з’явилися раніше за трансформери, — згорткових мереж. Ключова інновація полягає в механізмі, який дає моделі змогу адаптувати свою поведінку до нової інформації, тож вона може навчатися в процесі роботи. Для трансформерів це неможливо: після навчання моделі її поведінка фіксована.

Перші моделі Liquid AI були досить простими, але могли керувати дронами або автомобілями. За допомогою LFM компанія намагається масштабувати свою технологію, щоб конкурувати з мейнстримними великими мовними моделями. Її нові моделі відповідають за продуктивністю конкурентам, які вчетверо більші, зокрема версіям Qwen від Alibaba та відкритої мовної моделі Gemma від Google.

Типова велика мовна модель створюється зі стосу поєднаних між собою трансформерів. Нещодавні LFM від Liquid AI — це гібридні моделі, що на 20% складаються з трансформерів і на 80% — із рідинних нейронних мереж.

До такого співвідношення дійшла інша система ШІ, створена Liquid AI, яку компанія використовує для допомоги в розробці всіх своїх моделей. «Це головна технологія нашої компанії на сьогодні», — каже Хасані. Цей ШІ-дизайнер перебирає безліч різних комбінацій нейронних мереж — рідинних, згорткових та інших, а також трансформерів — і створює конструкції, які поєднують різні типи мереж, щоб досягти оптимального балансу продуктивності та ефективності.

Хасані вважає, що трансформери були лише початком: «Ваш мозок — це система загального штучного інтелекту, знаєте, і він працює на потужності 20 ватів. Як це можливо? Ми можемо бути набагато більш інноваційними».

03: Генерування тексту одразу цілком

Майже всі великі мовні моделі створюють результати по одному слову за раз. Це має сенс, адже саме так люди говорять і пишуть. Але для комп’ютерів це дуже неефективно.

Для великих мовних моделей швидше й дешевше генерувати текст одразу цілком — видавати цілі речення або абзаци за один раз. Саме такий підхід застосовує Inception, стартап із Пало-Альто, штат Каліфорнія, який створює великі мовні моделі за допомогою методу під назвою дифузія. 

Дифузія більш відома як технологія, що лежить в основі більшості моделей генерації зображень і відео. Дифузійні моделі навчають брати випадкову сітку пікселів — на кшталт перешкод на старому телевізорі — і перетворювати її на зображення. Вони роблять це, працюючи з усіма пікселями одночасно та визначаючи, які з них потрібно змінити, щоб перешкоди стали більш схожими на фотографію високої чіткості.

Виявилося, що цей процес працює і з текстом. Inception навчила свої великі мовні моделі брати випадковий набір слів і перетворювати його на змістовні речення. Дифузійні великі мовні моделі все ще використовують трансформери для кодування значення, але, створюючи цілі блоки тексту одночасно, змушують трансформери робити більше за менші ресурси. «Ви все ще використовуєте велику трансформерну модель, але можете передбачати багато токенів одночасно, — каже співзасновник і генеральний директор Inception Стефано Ермон. — Саме тому ці моделі набагато швидші та економніші, ніж те, що сьогодні створює більшість інших».

Складність полягала в тому, щоб узяти технологію, розроблену для генерації зображень, і застосувати її до тексту. У випадку із зображеннями, якщо потрібно змінити синій піксель на червоний, можна пройти через проміжні кольори, каже Ермон. З текстом це не працює: «Коли у вас є “кіт” і “собака”, між ними насправді немає чогось проміжного». 

Ермон також є дослідником Стенфордського університету. У 2024 році він разом із двома колегами зі Стенфорда вивів математичні формули, які дають змогу дифузійним моделям працювати з текстом. Вони навчили дифузійну модель, що відповідала за продуктивністю GPT-2 — великій мовній моделі, яку OpenAI створила у 2019 році, — але працювала в 10 разів швидше. Цього було достатньо, щоб Ермон заснував окрему компанію. 

Сьогодні він націлений на вищу лігу. Inception стверджує, що її найновіша модель Mercury 2 працює на рівні деяких моделей GPT-4 від OpenAI, випущених у 2023 році, але знову ж таки в 10 разів швидше. «Ми оптимістично оцінюємо цей підхід, тому що саме він масштабуватиметься», — каже Ермон. 

Він додає, що важливі лише швидкість і вартість: «Зрештою, валютою стане інтелект на долар».

Inception — не єдина компанія, яка робить ставку на дифузію. Google також експериментує з цим підходом і створила прототип великої мовної моделі під назвою Diffusion Gemma. Але Ермона не турбує конкуренція. «Я думаю, це підтверджує правильність підходу, — каже він. — За цим майбутнє».

04: Вихід за межі слів

Pathway, ще один стартап із Пало-Альто, можливо, є найрадикальнішим представником цієї нової групи. Він хоче звільнити великі мовні моделі від обмежень мови.

Компанія створила тип великої мовної моделі під назвою Dragon Hatchling (названої на честь драконів із роману Террі Пратчетта «Колір магії», які матеріалізуються, якщо достатньо сильно про них думати). Найпомітніший результат на цей момент — високий бал у тесті, що протиставляє великі мовні моделі понад 250 000 надзвичайно складних судоку. Dragon Hatchling розв’язала понад 97% головоломок; кілька провідних великих мовних моделей від найкращих лабораторій не змогли розв’язати жодної. 

Pathway хоче показати, що, попри надзвичайний успіх у виконанні багатьох різних завдань, існують важливі класи проблем, із якими великі мовні моделі не справляються. Судоку — лише один із прикладів. Якщо ми хочемо, щоб великі мовні моделі знаходили справжні, нові рішення реальних проблем, нам потрібно вийти за межі трансформерів, каже співзасновниця і генеральна директорка Pathway Зузанна Стаміровська. 

Це тому, що трансформери змушують великі мовні моделі робити все за допомогою тексту. Але мова не є найкращим інструментом для певних видів міркувань. «Дуже складно представити дошку судоку слово за словом», — каже Стаміровська.

Рішення Pathway полягає у зміні математики, що лежить в основі трансформера, — компанія замінює механізм уваги математичною структурою під назвою простір станів. Замість кодування інформації слово за словом простори станів стискають її в більш абстрактне представлення. Завдяки цій технології Dragon Hatchling усе ще може обробляти й створювати текст, але також може імітувати форми міркування, які не передбачають послідовностей слів. Це не лише робить модель Pathway ефективнішою, а й (теоретично) дає їй змогу братися за завдання, з якими інші великі мовні моделі не можуть упоратися. 

Подумайте про шахи чи математику — такі головоломки не зберігаються у вашій голові як довге речення, каже Стаміровська: «Осяяння, яке виникає у вашому мозку, не обов’язково є мовним. Ми б сказали, що якщо вам доводиться міркувати мовою, ви певним чином обмежені». 

Стаміровська визнає, що звичайна велика мовна модель могла б прочитати книжку про розв’язання судоку, а потім написати код для цього. Але ми хочемо створювати моделі, які мають не лише книжкові знання, каже вона: «Надія ШІ — не в тому, щоб розв’язувати судоку, а в тому, щоб вилікувати рак. Для цього немає книжки».

«Трансформери — це інженерна зручність, на яку ми натрапили, — додає вона. — Це започаткувало цілу релігію, але безглуздо думати, що новий прорив не станеться знову».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини