Liquid AI випускає моделі з відкритими вагами d1-3B і d1-omni-600M: мультимодальні моделі ухвалення рішень із нульовою кількістю вихідних токенів
Liquid AI випустила Open d1 — дві мультимодальні моделі з відкритими вагами у своєму сімействі моделей прийняття рішень d1. d1-3B працює з текстом і зображеннями. d1-omni-600M працює з текстом і зображенням або з текстом і аудіо. Жодна з моделей не генерує текст. Кожна повертає калібровані типізовані відповіді за один прямий прохід із нульовою кількістю вихідних токенів. Мета — прийняття рішень у реальному часі на стеку NVIDIA: серверах DGX, робочих станціях RTX і периферійних платах Jetson.
Чи придатна вона для розгортання? Так. Обидва чекпойнти доступні на Hugging Face, завантажуються через Transformers і від першого дня підтримують llama.cpp. LFM Open License v1.0 дозволяє безкоштовне комерційне використання за річного доходу менш як 10 мільйонів доларів. d1-omni-600M — це ранній дослідницький реліз без опублікованих показників затримки.
Що таке модель прийняття рішень?
Генеративна LLM пише відповідь токен за токеном, а ваш код її аналізує. Модель прийняття рішень отримує стан і набір іменованих запитань. Вона зчитує їх один раз і повертає ймовірність для кожної дозволеної відповіді. Liquid AI визначає три типи запитань:
- noul: запитання з відповіддю «так» або «ні», що повертається як P(yes).
- choice: одна мітка з-поміж іменованих варіантів із повним розподілом імовірностей.
- score: позиція, зважена за ймовірністю, на впорядкованій шкалі оцінювання від 2 до 10 рівнів.
Кілька запитань можуть використовувати один стан в одному виклику. Кожна відповідь містить output_tokens: 0. Liquid AI рекомендує d1 для маршрутизації, модерації, класифікації намірів, повторного ранжування, оцінювання LLM як судді, захисних механізмів для агентів і візуальної інспекції. Жоден із чекпойнтів не є чат-моделлю.
Як створено d1-3B і d1-omni-600M?
d1-3B має 3,12 млрд параметрів і створена на основі LFM2.5-VL-3B — мультимодальної моделі «бачення-мова» лише з декодером. Liquid AI усереднила ваги LFM2.5-2.6B із текстовою основою цієї моделі. Потім компанія донавчила кілька чекпойнтів із різними початковими значеннями та сумішами даних і знову об’єднала їх. Модель використовує візуальний енкодер SigLIP2 NaFlex на 400 млн параметрів і контекст на 32 768 токенів. Довгі вхідні дані, перемішані варіанти відповідей і усунення залежності від поверхневих ознак даних виявилися важливішими за передові методи.
d1-omni-600M має 587 млн параметрів і створена на основі LFM2.5-Encoder-350M — двонапрямленого енкодера. До її складу входять спільний стрижень і голова прийняття рішень на 381 млн параметрів, візуальний енкодер на 94 млн параметрів і аудіоенкодер на 112 млн параметрів. Аудіоенкодер — це FastConformer із 17 шарами. Контекст становить 16 384 токени. Тривалість аудіокліпів обмежена 30 секундами. Запит містить або зображення, або аудіо, але ніколи не обидва типи даних одночасно. Аудіонавчання охоплювало лише англомовні запити від мовців до асистента.
Для чого найкраще підходить Open d1?
- Сортування звернень до служби підтримки й тикетів: Один виклик d1-3B може перевірити, чи можливе повернення коштів, визначити відповідальну команду й оцінити терміновість одного й того самого повідомлення — без вихідних токенів для аналізу.
- Візуальна інспекція та модерація в реальному часі на периферії: d1-3B зчитує зображення розміром 384 пікселі за 35 мс на Jetson AGX Thor, а Open d1 Arcade від Liquid AI обробляє його покадрово під час роботи з відео з камери для модерації контенту й керування жестами.
- Маршрутизація голосових команд на невеликих пристроях: d1-omni-600M приймає до 30 секунд мовлення разом із текстом і безпосередньо повертає намір або тему мовця. У картці моделі маршрутизація голосових команд і захисні механізми для агентів зазначені серед рекомендованих застосувань.
Як d1 показує себе на бенчмарках?
У Decision Index v0.2.1 модель d1-3B набирає 48,57 бала. Це більше, ніж у будь-якої моделі з менш ніж 10 млрд параметрів, і трохи більше, ніж у Decider 35B-A3B (47,11). Вищий результат має лише Winnow-12B — 50,02. Liquid AI самостійно запустила офіційний оцінювач, тому результати d1 не є поданнями до таблиці лідерів. d1-3B очолює категорії Tools (74,5) і Arts (36,3), але відстає в Knowledge (23,8).
У семи загальнодоступних текстових бенчмарках середній результат d1-3B становить 82,9 — більше, ніж у Decider 4B із показником 81,1. Середній результат d1-omni-600M становить 78,4; модель показує найкращі результати на Civil Comments (95,8) і PAWS-X (79,5). В 11 бенчмарках зображень середній результат d1-3B становить 74,1 проти 73,9 у базової моделі. Liquid AI називає аудіобенчмарки для прийняття рішень невирішеною проблемою.
Наскільки швидко d1-3B працює на обладнанні NVIDIA?
Liquid AI вимірювала наскрізну затримку, обробляючи по одному прогрітому запиту за раз. Одне запитання займає 8 мс на RTX 4090 і 9 мс на AMD MI325X. На Jetson AGX Thor обробляє його за 16 мс, AGX Orin — за 26 мс, а Orin Nano — за 50 мс. На Jetson AGX Thor три запитання для одного стану займають 20 мс проти 16 мс для одного запитання. Для показника RTX 4090 використано model.compile(mode="reduce-overhead"). Без цього одне запитання займає 16 мс. Jetson AI Lab від NVIDIA також містить інструкції для d1-3B.
Як Open d1 порівнюється з іншими відкритими моделями прийняття рішень?
| Характеристика | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| Розробник | Liquid AI | Liquid AI | Mapika (незалежна) | Mapika (незалежна) | EldanRing (незалежна) |
| Параметри | 3,12 млрд | 587 млн | 4,2 млрд | 34,7 млрд загалом, 3 млрд активних | 12 млрд |
| Базова модель | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| Вхідні дані | Текст, зображення | Текст + зображення або текст + аудіо | Текст | Текст | Текст, зображення |
| Контекст | 32 768 | 16 384 | Стан на 32 тис. токенів | Стан на 32 тис. токенів | 65 536 (тестування Q8) |
| Decision Index v0.2.1 | 48,57 | 15,95 | 40,70 | 47,11 | 50,02 |
| Ліцензія | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Опублікована затримка | 8 мс на запитання, RTX 4090 | Не опубліковано | 5,2 мс на запит із 3 запитаннями, B300 | 47 мс на запит із 3 запитаннями, B300 | 143 мс для кешованого запиту з 4 запитаннями поблизу контексту 64K, RTX 5070 Ti |
Джерела: картки моделей d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B. Бали індексу наведено так, як вони вказані в картках d1. Для вимірювання затримки використовувалися різне обладнання та різні робочі навантаження, тому показники не можна безпосередньо порівнювати.
Як запустити d1 локально?
d1-3B потребує transformers>=5.14 і trust_remote_code=True. d1-omni-600M потребує transformers>=5.15. Обидві моделі надають system_one(state, questions) для одного стану та system_one_batch для пакетних запитів. Liquid AI рекомендує float16 для d1-omni-600M на GPU, оскільки bfloat16 змінив деякі найімовірніші відповіді. Спробувати десять демонстрацій d1-3B із керуванням камерою можна у просторі Open d1 Arcade. Для NVIDIA Liquid AI також продемонструвала, як d1-3B керує Isaac Sim із Jetson.
Основні висновки
- Моделі d1 за один прохід виводять імовірності для фіксованих варіантів і ніколи не генерують токени.
- d1-3B набирає 48,57 у Decision Index v0.2.1 — це найкращий результат серед моделей із менш ніж 10 млрд параметрів.
- d1-3B відповідає на одне запитання за 8 мс на RTX 4090.
- d1-omni-600M працює з текстом і зображеннями або аудіо та має 587 млн параметрів.
- Ліцензія дозволяє безкоштовне комерційне використання за річного доходу менш як 10 млн доларів.
Ознайомтеся з моделями d1-3B, d1-omni-600M і технічними деталями. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.