PrismML се надява, че малкият ѝ LLM ще промени начина, по който всички използваме AI
Ако лабораторията за изкуствен интелект PrismML все още не е в полезрението ви, би трябвало да бъде — не защото е набрала огромни средства (все още не е — само начален рунд от 22,25 милиона долара), а заради техническите специалисти, които участват, и потенциално променящата индустрията технология, която разработва.
PrismML залага на идеята, че способните, високопроизводителни големи езикови модели с възможности за разсъждение всъщност не трябва да бъдат големи.
Компанията създава модели за разсъждение, които са толкова малки, че могат да работят на компютри и смартфони. (Дори се твърди, че води разговори с Apple, макар че главният изпълнителен директор Бабак Хасиби отказа да коментира това пред TechCrunch.)
В четвъртък PrismML пусна Bonsai 2 27B — най-новия модел от семейството си, който компресира Qwen3.8 27B, широко използван модел с отворен код от Alibaba, до 5,9 GB. Това е достатъчно малко, за да се побере на компютър и вероятно на смартфон от висок клас. Това представлява 9- до 10-кратно намаляване на използваната памет спрямо оригинала.
PrismML е основана от група изследователи от Caltech и се ръководи от Хасиби — професор в Caltech и експерт по технологии за компресиране. Сред съветниците на стартъпа е и Айън Сойка. Сойка е съосновател на Databricks (както и на други компании) и директор на прочутата лаборатория Sky Computing Lab в Бъркли, от която са произлезли множество технологии и стартъпи — от Letta до SGLang.
PrismML е подкрепена и от инвеститорите Khosla Ventures, Cerberus Capital и Caltech.
Този стартъп със сигурност не е единствената компания, която работи по технологии за компресиране на LLM. Multiverse Computing, основана от известен професор от испанския Donostia International Physics Center, е друга такава компания. (А Multiverse Computing е набрала огромни средства.)
Но Хасиби казва, че технологията за компресиране на PrismML е уникална, защото нейните LLM почти не са загубили производителност в сравнение с оригиналите. Bonsai 2 постига 98% от общите резултати на Qwen в бенчмарковете. Това е подобрение спрямо първия Bonsai, пуснат преди няколко месеца през март, който постигна 95%. Според компанията оригиналният модел вече е изтеглен над 11 милиона пъти, а още по-малките модели на PrismML са изтеглени допълнително 2,6 милиона пъти.
Това показва, че резултатите от компресирането на PrismML са се подобрили от едно издание към следващото. Дали някога ще успее да достигне 100% съответствие с производителността на бенчмарковете, предстои да видим. Според Хасиби компресирането вероятно винаги ще има някакво влияние.
Въпреки това пълното съответствие с бенчмарковете е донякъде академичен въпрос. LLM не са толкова точни в некомпресираната си форма, а бенчмарковете не отразяват действителните задачи толкова съвършено, че влошаване от 2% вероятно да окаже съществено влияние върху представянето на даден модел при реална употреба. (Освен това и заобикалящият софтуер — средата, в която работи моделът — има голямо значение за точността.)
PrismML казва, че постига това, като намалява размера на „теглата“, от които е изграден моделът — теглата по същество са информацията, която моделът научава и съхранява по време на обучението. Обикновено за всяко тегло са необходими 16 бита. Подходът на PrismML, наречен „тернарни“ тегла, опростява това до три стойности: +1, −1 или 0. Тъй като за всяко тегло се съхраняват много по-малки стойности, моделът заема драстично по-малко място. (За по-задълбочен преглед на техниката за компресиране вижте страницата на проекта в GitHub.)
Следващата цел на стартъпа е да приложи тази техника за компресиране към още по-големи модели. „Следващите модели, които ще пуснем, надявам се през следващите няколко месеца, ще бъдат в диапазона от няколкостотин милиарда параметъра и очаквам, че там ще бъде по-лесно да запазим интелигентността“, каза Хасиби пред TechCrunch.
С нарастването на размера на модела, добави той, „има повече възможности за компресирането му, без да се губи интелигентността. Така че бих казал, че като обща тенденция при по-големите модели е по-лесно да се достигне 100%.“
Сойка ни казва, че е развълнуван от тази технология, защото тя прави възможно използването на усъвършенствани модели на устройствата на потребителите. „Ще имате интелигентност на една ръка разстояние и тя ще бъде безплатна, защото ще работи на устройството, което вече сте си купили. Освен това ще бъде поверителна, защото няма да я изпращате в облака.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.