Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← К новостям

Эти стартапы охотятся за следующим большим прорывом в LLM

Серия What’s Next журнала MIT Technology Review рассматривает различные отрасли, тенденции и технологии, чтобы дать вам возможность заглянуть в будущее. Остальные материалы серии можно прочитать здесь.

Еще летом 2017 года исследователи ИИ из Google опубликовали статью под названием «Attention Is All You Need», в которой описали новый тип нейронной сети — трансформер. Она оказалась очень эффективной при обработке длинных последовательностей данных, особенно текста. 

Девять лет спустя трансформеры стали движками всех основных больших языковых моделей, представленных на рынке. «Вся индустрия ИИ построена на трансформерах, — говорит Джастин Дангел, сооснователь и генеральный директор ИИ-стартапа Subquadratic. — Это одна из важнейших инноваций в истории компьютерных наук, и она изменила мир».

Но трансформеры начинают проявлять свой возраст. Многие недавние достижения в области LLM, такие как разработка так называемых рассуждающих моделей и их способность одновременно обрабатывать большие объемы входных данных, представляют собой не аккуратные расширения этой базовой технологии, а обходные решения, устраняющие некоторые ее фундаментальные недостатки.

Все больше ученых и инженеров теперь задаются вопросом, что будет дальше. LLM никуда не исчезнут, но способы их создания открыты для пересмотра. (MIT Technology Review назвал это будущее поколение моделей LLM+ в своем списке 10 важнейших явлений в сфере ИИ этого года.)

На сцену выходит волна стартапов, стремящихся раздвинуть границы этой бурно развивающейся технологии. Некоторые наверняка потерпят неудачу, но у них есть всё, за что стоит бороться, и гораздо меньше того, что можно потерять, чем у сегодняшних лидеров рынка. 

Сила в количестве

Но сначала — проблема. Ключевая сила трансформеров заключается в механизме, называемом плотным вниманием, который кодирует смысл блока текста в виде последовательности чисел. Этот процесс предполагает сравнение каждого слова (или части слова, известной как токен) в тексте с каждым другим словом посредством определенной формы умножения.

Плотное внимание способно с поразительной точностью улавливать смысл текста. Но по мере увеличения длины текста быстро растет и количество вычислений, необходимых для его обработки. Для документа объемом 10 000 слов трансформеру может потребоваться выполнить 50 миллионов умножений. Это главная причина, по которой LLM потребляют так много энергии.

Затраты огромны. По словам президента компании Грега Брокмана, OpenAI планирует потратить в этом году 50 миллиардов долларов на вычислительные мощности. А Международное энергетическое агентство прогнозирует, что общее потребление электроэнергии дата-центрами удвоится к 2030 году.

Более того, трансформеры с трудом справляются с тем, для чего предназначены многие новейшие модели. Из-за особенностей обработки текста слово за словом трансформеры не слишком хорошо отслеживают большое количество информации одновременно (иными словами, их контекстное окно не может быть слишком большим). И все же, если LLM должны выполнять более сложные задачи, им придется обрабатывать большие объемы данных: целую библиотеку документов, всю кодовую базу или, в случае агентов, результаты работы других LLM.

Что касается рассуждающих моделей, они работают, записывая заметки для себя (в своего рода черновике, известном как цепочка рассуждений), а затем перечитывая их, что снова увеличивает объем данных, за которыми нужно следить.

По мере того как LLM становятся больше и эффективнее, трансформеры превратились в узкое место. Ключевая сила этой технологии теперь стала ограничением.

Вот четыре новые идеи о том, как решить проблему трансформеров, — инновации, которые могут навсегда изменить LLM, сделав их быстрее, гораздо эффективнее и (возможно) даже умнее.

01: Переосмысление внимания

Очевидный способ сделать LLM быстрее и дешевле — взяться за проблему напрямую и изменить принцип работы внимания. Замена плотного внимания механизмом, называемым разреженным вниманием, который выполняет вычисления только для некоторых пар слов в блоке текста, а не для всех, может радикально сократить объем вычислений, необходимых LLM.  

За прошедшие годы исследователи разработали множество механизмов разреженного внимания. Проблема заключалась в том, что ни один из них не умел улавливать смысл так же хорошо, как плотное внимание.

Возможно, это изменилось. Стартап Subquadratic из Майами утверждает, что изобрел первый механизм разреженного внимания, сопоставимый с ведущими массовыми LLM по ряду задач, включая поиск и программирование. Заявление весьма серьезное (и некоторые представители отрасли по-прежнему относятся к нему скептически).

В Subquadratic говорят, что их модель SubQ работает, на лету определяя для каждого полученного фрагмента текста, какие слова важны, а какие нет. Компания также утверждает, что тысячи людей записались в список ожидания, и планирует вскоре сделать модель широко доступной.

Тем временем стартап Manifest AI из Сан-Франциско подходит к проблеме с другой стороны. Вместо того чтобы менять принцип работы внимания, компания заменяет его чем-то другим. 

Она разработала механизм, который называет удержанием мощности: он сохраняет только наиболее релевантную для конкретной задачи информацию и не позволяет объему данных, за которыми должна следить LLM, выйти из-под контроля.

Механизмы внимания заставляют LLM отслеживать всё в своем контекстном окне. Модель с разреженным вниманием (например, SubQ) отбрасывает множество отдельных слов, но по-прежнему сохраняет общее представление обо всем увиденном. Удержание мощности, напротив, работает, предоставляя модели постоянно обновляемое резюме ее контекстного окна. По мере добавления новой информации менее релевантные данные отбрасываются. 

Базовый принцип удержания существует уже десять лет. В Manifest AI утверждают, что обновили эти методы и впервые создали модели, способные конкурировать с LLM на базе трансформеров.

Компания заявляет, что трансформерную модель можно адаптировать в модель с удержанием мощности, проведя минимальное дообучение. Чтобы продемонстрировать это, она превратила существующую открытую LLM для программирования StarCoder в версию с удержанием мощности под названием PowerCoder. Также компания выпустила модель Brumby, которая, по ее утверждению, сопоставима с некоторыми версиями популярной открытой модели Alibaba Qwen. 

Manifest AI хочет, чтобы ее технология удержания мощности стала стандартным решением, когда LLM требуется выполнять задачи, связанные с обработкой огромных объемов данных. У нее есть множество полезных применений, утверждал сооснователь и технический директор Manifest AI Карлес Гелада в видео, представлявшем технологию компании в прошлом году: от анализа многочасовых видео до создания агентов, способных не отклоняться от задачи в течение нескольких недель. 

02: Уменьшение моделей и повышение их гибкости

Компания Liquid AI, выделившаяся в отдельный стартап из MIT и базирующаяся в Кембридже, штат Массачусетс, не стала полностью менять или отказываться от трансформеров, а объединяет их со своей технологией — жидкими нейронными сетями, — чтобы создавать то, что сооснователь и генеральный директор Рамин Хасани называет LFM (жидкими базовыми моделями).

Модели Liquid AI намного меньше и потребляют меньше энергии, чем большинство LLM. Компания создает модели для автопроизводителей, включая Mercedes, которые работают на небольших чипах внутри автомобилей. Ее новейшие модели могут работать на Raspberry Pi — маломощном компьютере для любителей, который стоит 50 долларов.

Ее модели бесплатно доступны любой организации с годовой выручкой менее 10 миллионов долларов. И они доказали свою популярность: по словам Хасани, модели компании скачали почти 34 миллиона раз.

Жидкие нейронные сети были вдохновлены мозгом червей. Они представляют собой расширение другого типа нейронных сетей, появившегося до трансформеров, — сверточных сетей. Ключевая инновация — механизм, позволяющий модели адаптировать свое поведение к новой информации, благодаря чему она может учиться в процессе работы. Для трансформеров это невозможно: после обучения поведение модели фиксировано.

Первые модели Liquid AI были довольно простыми, но могли управлять дронами или водить транспортные средства. С помощью LFM компания пытается масштабировать свою технологию, чтобы конкурировать с массовыми LLM. Ее новые модели соответствуют производительности конкурентов, которые в четыре раза больше, включая версии Qwen от Alibaba и открытой LLM Gemma от Google.

Типичная LLM создается из набора соединенных между собой трансформеров. Последние LFM от Liquid AI — гибридные модели, состоящие на 20% из трансформеров и на 80% из жидких нейронных сетей.

Это соотношение было найдено другой системой ИИ, созданной Liquid AI и используемой для разработки всех ее моделей. «Сейчас это ключевая технология нашей компании, — говорит Хасани. — Этот ИИ-конструктор перебирает множество различных сочетаний нейронных сетей — жидких, сверточных и других, а также трансформеров — и создает конструкции, объединяющие разные типы сетей для достижения оптимального баланса производительности и эффективности».

Хасани считает, что трансформеры были лишь началом: «Ваш мозг — это система AGI, понимаете, и она работает с мощностью 20 ватт. Как такое возможно? Мы можем проявить гораздо больше изобретательности».

03: Генерация текста целиком

Почти все LLM создают результат по одному слову за раз. Это имеет смысл, поскольку именно так люди говорят и пишут. Но для компьютеров это очень неэффективно.

LLM быстрее и дешевле генерировать текст целиком — выдавая сразу целые предложения или абзацы. Именно такой подход использует стартап Inception из Пало-Альто, штат Калифорния, который создает LLM с помощью метода, называемого диффузией. 

Диффузия больше известна как технология, лежащая в основе большинства моделей генерации изображений и видео. Диффузионные модели обучают брать случайную сетку пикселей — как помехи на экране старого телевизора — и превращать ее в изображение. Они делают это, обрабатывая все пиксели одновременно и определяя, какие из них нужно изменить, чтобы помехи стали больше похожи на фотографию высокого разрешения.

Оказывается, этот процесс работает и с текстом. Inception обучила свои LLM брать случайную последовательность слов и превращать ее в осмысленные предложения. Диффузионные LLM по-прежнему используют трансформеры для кодирования смысла, но, создавая целые блоки текста одновременно, заставляют трансформеры делать больше за меньшие ресурсы. «Вы по-прежнему используете большую модель-трансформер, но можете предсказывать множество токенов одновременно, — говорит сооснователь и генеральный директор Inception Стефано Эрмон. — Поэтому эти модели намного быстрее и экономичнее по сравнению с тем, что сегодня создают большинство других компаний».

Задача заключалась в том, чтобы взять технологию, разработанную для генерации изображений, и применить ее к тексту. В случае изображений, если нужно изменить синий пиксель на красный, можно пройти через промежуточные цвета, говорит Эрмон. С текстом это не работает: «Когда у вас есть “кошка” и “собака”, между ними на самом деле ничего нет».

Эрмон также является исследователем Стэнфордского университета. В 2024 году он и двое его коллег из Стэнфорда вывели математический аппарат, позволяющий диффузионным моделям работать с текстом. Они обучили диффузионную модель, которая соответствовала производительности GPT-2 — LLM, созданной OpenAI в 2019 году, — но работала в 10 раз быстрее. Этого оказалось достаточно, чтобы Эрмон основал компанию. 

Сегодня он нацелился на высшую лигу. Inception утверждает, что ее последняя модель Mercury 2 работает так же хорошо, как некоторые модели GPT-4 от OpenAI, выпущенные в 2023 году, но снова в 10 раз быстрее. «Мы с оптимизмом смотрим на этот подход, потому что именно он будет масштабироваться, — говорит Эрмон. 

Имеют значение только скорость и стоимость, добавляет он: «В конечном счете валютой станет интеллект на каждый доллар».

Inception — не единственная компания, делающая ставку на диффузию. Google также экспериментирует с этим подходом и создал прототип LLM под названием Diffusion Gemma. Но Эрмона не беспокоит конкуренция. «Я думаю, это подтверждает правильность подхода, — говорит он. — За этим будущее».

04: За пределами слов

Pathway, еще один стартап из Пало-Альто, пожалуй, самый радикальный представитель этой новой волны. Он хочет освободить LLM от ограничений языка.

Компания создала тип LLM под названием Dragon Hatchling (названную в честь драконов из романа Терри Пратчетта «Цвет волшебства», которые материализуются, если достаточно сильно о них думать). Самый заметный результат компании на данный момент — высокий балл в тесте, где LLM предлагается решить более 250 000 очень сложных судоку. Dragon Hatchling решила более 97% головоломок; несколько ведущих LLM из крупнейших лабораторий не смогли решить ни одной. 

Pathway хочет показать, что, несмотря на замечательные успехи в самых разных задачах, существуют важные классы проблем, с которыми LLM по-прежнему не справляются. Судоку — лишь один пример. Если мы хотим, чтобы LLM находили действительно новые решения реальных проблем, нам нужно выйти за пределы трансформеров, говорит соосновательница и генеральный директор Pathway Зузанна Стамировска. 

Причина в том, что трансформеры заставляют LLM делать всё с помощью текста. Но язык не лучший инструмент для некоторых видов рассуждений. «Очень трудно представить доску судоку слово за словом», — говорит Стамировска.

Решение Pathway заключается в изменении математики, лежащей в основе трансформера, и замене механизма внимания математической структурой, называемой пространством состояний. Вместо того чтобы кодировать информацию слово за словом, пространства состояний сжимают ее в более абстрактное представление. Используя этот метод, Dragon Hatchling по-прежнему может обрабатывать и создавать текст, но также способен имитировать формы рассуждений, не связанные с последовательностями слов. Это не только делает модель Pathway эффективнее, но и (теоретически) позволяет ей решать задачи, с которыми другие LLM справиться не могут. 

Возьмем шахматы или математику — такие головоломки не хранятся в голове в виде длинного предложения, говорит Стамировска: «Момент озарения, который возникает в вашем мозгу, не обязательно связан с языком. Мы бы сказали, что если вам приходится рассуждать на языке, вы каким-то образом ограничены».

Стамировска признает, что массовая LLM могла бы прочитать книгу о том, как решать судоку, а затем написать код для этого. Но мы хотим создавать модели, обладающие не только книжными знаниями, говорит она: «Надежда ИИ не в том, чтобы решать судоку, а в том, чтобы лечить рак. Книги об этом не существует».

«Трансформеры — это инженерное удобство, на которое мы наткнулись, — добавляет она. — Это положило начало целой религии, но глупо думать, что прорыв не произойдет снова».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости