Liquid AI пуска моделите с отворени тегла d1-3B и d1-omni-600M: мултимодални модели за вземане на решения с нула изходни токени
Liquid AI пусна Open d1 — два мултимодални модела с отворени тегла от семейството си от модели за вземане на решения d1. d1-3B разчита текст и изображения. d1-omni-600M разчита текст с изображение или текст с аудио. Нито един от двата модела не генерира текст. Всеки връща калибрирани отговори с определен тип при едно предаване напред и нула изходни токени. Целта е вземане на решения в реално време върху стека на NVIDIA: DGX сървъри, RTX работни станции и периферни платки Jetson.
Може ли да бъде внедрен? Да. И двете контролни точки са налични в Hugging Face, зареждат се чрез Transformers и от първия ден имат поддръжка за llama.cpp. Лицензът LFM Open v1.0 позволява безплатна комерсиална употреба при годишни приходи под 10 милиона долара. d1-omni-600M е ранна изследователска версия без публикувани показатели за латентност.
Какво представлява моделът за вземане на решения?
Генеративният LLM пише отговора си токен по токен, а вашият код го анализира. Моделът за вземане на решения приема състояние и набор от именувани въпроси. Той ги прочита веднъж и връща вероятност за всеки разрешен отговор. Liquid AI определя три типа въпроси:
- noul: въпрос с отговор да или не, върнат като P(да).
- choice: един етикет от именувани опции с пълно вероятностно разпределение.
- score: претеглена с вероятност позиция в подредена рубрика от 2 до 10 нива.
Няколко въпроса могат да споделят едно състояние в рамките на едно извикване. Всеки отговор отчита output_tokens: 0. Liquid AI препоръчва d1 за маршрутизиране, модериране, класификация на намерения, повторно класиране, оценяване от типа LLM-as-a-judge, защитни механизми за агенти и визуална инспекция. Нито една от двете контролни точки не е чат модел.
Как са създадени d1-3B и d1-omni-600M?
d1-3B има 3.12 милиарда параметъра и започва от LFM2.5-VL-3B, зрително-езиков модел само с декодер. Liquid AI усреднява теглата на LFM2.5-2.6B с текстовия гръбнак на този модел. След това дообучава няколко контролни точки с различни начални стойности и комбинации от данни и отново ги обединява. Моделът използва зрителен енкодер SigLIP2 NaFlex с 400M параметъра и контекст от 32 768 токена. Дългите входове, разбърканите опции за отговор и отстраняването на преките зависимости в данните са били по-важни от усъвършенстваните техники.
d1-omni-600M има 587 милиона параметъра и започва от LFM2.5-Encoder-350M, двупосочен енкодер. Той включва споделен гръбнак и глава за вземане на решения с 381M параметъра, зрителен енкодер с 94M параметъра и аудио енкодер със 112M параметъра. Аудио енкодерът е 17-слоен FastConformer. Контекстът е 16 384 токена. Аудиоклиповете са ограничени до 30 секунди. Една заявка съдържа изображения или аудио, но никога и двете едновременно. Обучението с аудио обхваща само заявки на английски от говорител към асистент.
За какво е най-подходящ Open d1?
- Сортиране на заявки за поддръжка и тикети: Едно извикване на d1-3B може да отговори на въпрос да или не за възстановяване на сума, да избере отговорния екип и да оцени спешността за едно и също съобщение — без изходни токени за анализ.
- Визуална инспекция и модериране в реално време на периферни устройства: d1-3B разчита изображение с размер 384 пиксела за 35 ms на Jetson AGX Thor, а Open d1 Arcade на Liquid AI го изпълнява кадър по кадър върху вход от камера на живо за модериране на съдържание и управление с жестове.
- Маршрутизиране на гласови команди на малки устройства: d1-omni-600M приема до 30 секунди реч заедно с текст и директно връща намерението или темата на говорещия. Картата на модела посочва маршрутизирането на гласови команди и защитните механизми за агенти сред препоръчителните му приложения.
Как се представя d1 в бенчмарковете?
В Decision Index v0.2.1 d1-3B получава 48.57. Това надминава всеки модел под 10B и го поставя малко пред Decider 35B-A3B (47.11). Само Winnow-12B има по-висок резултат — 50.02. Liquid AI е изпълнила официалния оценител сама, така че резултатите на d1 не са подадени в класацията. d1-3B води в категориите Tools (74.5) и Arts (36.3), но изостава в Knowledge (23.8).
В седем публични текстови бенчмарка d1-3B има среден резултат 82.9, пред Decider 4B с 81.1. d1-omni-600M има среден резултат 78.4 и постига най-високите резултати при Civil Comments (95.8) и PAWS-X (79.5). В 11 бенчмарка за изображения d1-3B има среден резултат 74.1 спрямо 73.9 за базовия си модел. Liquid AI определя бенчмарковете за вземане на решения с аудио като нерешен проблем.
Колко бърз е d1-3B върху хардуер на NVIDIA?
Liquid AI измерва латентността от край до край, като обработва по една затоплена заявка наведнъж. Един въпрос отнема 8 ms на RTX 4090 и 9 ms на AMD MI325X. При Jetson AGX Thor отнема 16 ms, AGX Orin — 26 ms, а Orin Nano — 50 ms. На Jetson AGX Thor три въпроса върху едно състояние отнемат 20 ms спрямо 16 ms за един въпрос. Стойността за RTX 4090 използва model.compile(mode="reduce-overhead"). Без него един въпрос отнема 16 ms. Jetson AI Lab на NVIDIA също предлага ръководства за d1-3B.
Как се сравнява Open d1 с други модели за вземане на решения с отворен код?
| Характеристика | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| Създател | Liquid AI | Liquid AI | Mapika (независим) | Mapika (независим) | EldanRing (независим) |
| Параметри | 3.12B | 587M | 4.2B | 34.7B общо, 3B активни | 12B |
| Базов модел | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| Входове | Текст, изображения | Текст + изображение или текст + аудио | Текст | Текст | Текст, изображения |
| Контекст | 32 768 | 16 384 | Състояние от 32K токена | Състояние от 32K токена | 65 536 (тествано с Q8) |
| Decision Index v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| Лиценз | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Публикувана латентност | 8 ms на въпрос, RTX 4090 | Не е публикувана | 5.2 ms за заявка с 3 въпроса, B300 | 47 ms за заявка с 3 въпроса, B300 | 143 ms за кеширана заявка с 4 въпроса близо до контекст от 64K, RTX 5070 Ti |
Източници: Картите на моделите d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B. Резултатите от индекса са посочени в картите на d1. Латентностите са измерени с различен хардуер и при различни работни натоварвания, така че не са пряко сравними.
Как се стартира d1 локално?
d1-3B изисква transformers>=5.14 и trust_remote_code=True. d1-omni-600M изисква transformers>=5.15. И двата модела предоставят system_one(state, questions) за едно състояние и system_one_batch за пакетирани заявки. Liquid AI препоръчва float16 за d1-omni-600M на GPU, тъй като bfloat16 променя някои от водещите отговори. Можете да изпробвате десет демонстрации на d1-3B, управлявани от камера, в пространството Open d1 Arcade. С NVIDIA Liquid AI също демонстрира как d1-3B управлява Isaac Sim от Jetson.
Основни изводи
- Моделите d1 извеждат вероятности за фиксирани опции с едно предаване, без генерирани токени.
- d1-3B получава 48.57 в Decision Index v0.2.1 — най-добрият резултат под 10B.
- d1-3B отговаря на един въпрос за 8 ms на RTX 4090.
- d1-omni-600M обработва текст с изображения или аудио при 587M параметъра.
- Лицензът позволява безплатна комерсиална употреба при годишни приходи под 10 милиона долара.
Разгледайте d1-3B, d1-omni-600M и техническите подробности. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.