PrismML сподівається, що її крихітна LLM змінить те, як усі ми використовуємо ШІ
Якщо лабораторія ШІ PrismML ще не потрапила у ваше поле зору, варто звернути на неї увагу — не тому, що вона залучила купу грошей (поки що ні, лише $22,25 мільйона в межах посівного раунду), а через технічних фахівців, які беруть участь у її роботі, та технологію, здатну змінити індустрію, яку вона розробляє.
PrismML робить ставку на те, що потужні, високопродуктивні великі мовні моделі зі здатністю до міркування насправді не обов’язково мають бути великими.
Компанія створює моделі зі здатністю до міркування настільки малими, що вони можуть працювати на ПК і смартфонах. (Також ходять чутки, що вона веде переговори з Apple, хоча генеральний директор Бабак Хассіб відмовився коментувати це TechCrunch.)
У четвер PrismML випустила Bonsai 2 27B — останню модель у своєму сімействі, яка стискає Qwen3.8 27B, широко використовувану відкриту модель від Alibaba, до 5,9 ГБ. Цього достатньо, щоб розмістити її на ПК і, можливо, на смартфоні високого класу. Порівняно з оригіналом обсяг пам’яті зменшено у 9–10 разів.
PrismML заснувала група дослідників Каліфорнійського технологічного інституту (Caltech), а очолює компанію Хассіб — професор Caltech і фахівець із технологій стиснення. Серед радників стартапу також є Іон Стойка. Стойка — співзасновник Databricks (та інших компаній) і директор відомої лабораторії Sky Computing Lab при Каліфорнійському університеті в Берклі, де було створено чимало технологій і стартапів — від Letta до SGLang.
Серед інвесторів PrismML також Khosla Ventures, Cerberus Capital і Caltech.
Цей стартап, безумовно, не єдина компанія, що працює над технологіями стиснення великих мовних моделей. Ще одним прикладом є Multiverse Computing, заснована відомим професором із іспанського Міжнародного центру теоретичної фізики в Доностії. (А Multiverse Computing залучила чимало коштів.)
Однак Хассіб стверджує, що технологія стиснення PrismML унікальна, оскільки її LLM практично не втратили продуктивності порівняно з оригіналами. Bonsai 2 демонструє 98% сукупних результатів Qwen у бенчмарках. Це більше, ніж у першої Bonsai, випущеної кілька місяців тому, у березні, яка досягла 95%. За даними компанії, оригінальну модель уже завантажили понад 11 мільйонів разів, а ще менші моделі PrismML — додатково 2,6 мільйона разів.
Отже, результати стиснення PrismML покращилися від одного релізу до наступного. Чи зможе компанія коли-небудь досягти 100% відповідності продуктивності в бенчмарках — ще належить побачити. За словами Хассіба, стиснення, ймовірно, завжди матиме певний вплив.
Втім, ідеальна відповідність у бенчмарках — це здебільшого академічне питання. LLM у нестисненому вигляді не настільки точні, а бенчмарки не настільки ідеально відображають реальні завдання, щоб погіршення на 2% суттєво вплинуло на роботу моделі під час фактичного використання. (Крім того, супровідне програмне забезпечення — оболонка, у якій працює модель — також має велике значення для точності.)
У PrismML кажуть, що досягають цього, зменшуючи “ваги”, з яких складається модель, — ваги, по суті, є інформацією, яку модель вивчає та зберігає під час навчання. Зазвичай для кожної ваги потрібно 16 бітів. Підхід PrismML, який називається “тернарними” вагами, спрощує це до трьох значень: +1, −1 або 0. Оскільки для зберігання кожної ваги потрібні значно менші значення, модель займає набагато менше місця. (Якщо ви хочете глибше зануритися в технологію стиснення, ось сторінка проєкту на GitHub.)
Наступна мета стартапу — застосувати цю технологію стиснення до ще більших моделей. “Наступні моделі, які ми випустимо, сподіваюся, протягом найближчих кількох місяців, матимуть від кількох сотень мільярдів параметрів, і я очікую, що там буде легше зберегти інтелект”, — сказав Хассіб TechCrunch.
За його словами, зі збільшенням розміру моделі “з’являється більше можливостей стискати її без втрати інтелекту. Тож я б сказав, що загалом для більших моделей легше досягти 100%”.
Стойка каже, що його захоплює ця технологія, оскільки вона дає змогу запускати передові моделі на пристроях користувачів. “Інтелект буде у вас під рукою, і він буде безкоштовним, оскільки працюватиме на пристрої, який ви вже придбали. Він також буде приватним, тому що вам не доведеться надсилати його в хмару”.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.