PrismML надеется, что её крошечная LLM изменит то, как все мы используем ИИ
Если лаборатория искусственного интеллекта PrismML пока не попала в поле вашего зрения, ей стоит заинтересоваться — не потому, что она привлекла огромные деньги (пока нет: лишь $22,25 млн в рамках посевного раунда), а благодаря задействованным техническим специалистам и потенциально способным изменить индустрию технологиям, которые она разрабатывает.
PrismML делает ставку на то, что мощные, высокопроизводительные большие языковые модели с возможностями рассуждения вовсе не обязательно должны быть большими.
Компания создает модели с возможностями рассуждения настолько компактными, что они могут работать на ПК и смартфонах. (Также ходят слухи, что компания ведет переговоры с Apple, хотя генеральный директор Бабак Хассиби отказался комментировать это TechCrunch.)
В четверг PrismML выпустила Bonsai 2 27B — последнюю модель в своем семействе, которая сжимает Qwen3.8 27B, широко используемую открытую модель Alibaba, до 5,9 ГБ. Этого достаточно, чтобы она поместилась на ПК и, возможно, на смартфоне высокого класса. По сравнению с оригиналом объем памяти сокращен в 9–10 раз.
PrismML основала группа исследователей из Калифорнийского технологического института, а возглавляет ее Хассиби — профессор Калтеха и специалист по технологиям сжатия. Среди советников стартапа также Айон Стоика. Стоика — сооснователь Databricks (и других компаний) и директор знаменитой лаборатории Sky Computing при Беркли, где были созданы многочисленные технологии и стартапы — от Letta до SGLang.
Среди инвесторов PrismML также Khosla Ventures, Cerberus Capital и Калтех.
Этот стартап, конечно, не единственная компания, работающая над технологиями сжатия LLM. Еще одна — Multiverse Computing, основанная известным профессором из испанского Международного физического центра Донестиа. (И Multiverse Computing привлекла огромные суммы.)
Однако Хассиби утверждает, что технология сжатия PrismML уникальна, поскольку ее LLM практически не теряют в производительности по сравнению с оригиналами. Bonsai 2 набирает 98% от совокупных результатов Qwen в бенчмарках. Это выше, чем у первой Bonsai, выпущенной всего пару месяцев назад, в марте, которая достигала 95%. По данным компании, оригинальная модель уже была скачана более 11 млн раз, а еще более компактные модели PrismML — дополнительно 2,6 млн раз.
Таким образом, результаты сжатия PrismML улучшились от одного релиза к другому. Сможет ли компания когда-нибудь достичь 100%-ного соответствия показателям бенчмарков — вопрос открытый. По словам Хассиби, сжатие, вероятно, всегда будет оказывать некоторое влияние.
Впрочем, идеальное соответствие бенчмаркам в любом случае имеет скорее академическое значение. LLM в несжатом виде не настолько точны, а бенчмарки не настолько идеально отражают реальные задачи, чтобы снижение показателей на 2% существенно повлияло на работу модели в реальном использовании. (Кроме того, окружающее программное обеспечение — оболочка, внутри которой работает модель, — тоже сильно влияет на точность.)
В PrismML заявляют, что добиваются этого за счет уменьшения «весов», из которых состоит модель: по сути, веса — это информация, которую модель усваивает и хранит в процессе обучения. Обычно для каждого веса требуется 16 бит. Подход PrismML, называемый «тернарными» весами, упрощает это значение до трех вариантов: +1, −1 или 0. Благодаря гораздо меньшим значениям, которые нужно хранить для каждого веса, модель занимает значительно меньше места. (Более подробно о технологии сжатия можно узнать на странице проекта на GitHub.)
Следующая цель стартапа — применить эту технологию сжатия к еще более крупным моделям. «Следующие модели, которые мы надеемся выпустить в ближайшие пару месяцев, будут насчитывать несколько сотен миллиардов параметров, и я ожидаю, что там будет проще сохранить интеллект», — сказал Хассиби TechCrunch.
По мере увеличения размера модели, добавил он, «появляется больше возможностей сжать ее без потери интеллекта. Поэтому я бы сказал, что в целом для более крупных моделей проще достичь 100%».
Стоика говорит, что его воодушевляет эта технология, поскольку она позволяет запускать передовые модели на устройствах пользователей. «Интеллект будет у вас под рукой, и он будет бесплатным, потому что будет работать на устройстве, которое вы уже купили. Кроме того, он будет приватным, поскольку вам не придется отправлять его в облако».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.