Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Liquid AI пуска моделите с отворени тегла d1-3B и d1-omni-600M: мултимодални модели за вземане на решения с нула изходни токени

Liquid AI пусна Open d1 — два мултимодални модела с отворени тегла от семейството си от модели за вземане на решения d1. d1-3B разчита текст и изображения. d1-omni-600M разчита текст с изображение или текст с аудио. Нито един от двата модела не генерира текст. Всеки връща калибрирани отговори с определен тип при едно предаване напред и нула изходни токени. Целта е вземане на решения в реално време върху стека на NVIDIA: DGX сървъри, RTX работни станции и периферни платки Jetson.

Може ли да бъде внедрен? Да. И двете контролни точки са налични в Hugging Face, зареждат се чрез Transformers и от първия ден имат поддръжка за llama.cpp. Лицензът LFM Open v1.0 позволява безплатна комерсиална употреба при годишни приходи под 10 милиона долара. d1-omni-600M е ранна изследователска версия без публикувани показатели за латентност.

Какво представлява моделът за вземане на решения?

Генеративният LLM пише отговора си токен по токен, а вашият код го анализира. Моделът за вземане на решения приема състояние и набор от именувани въпроси. Той ги прочита веднъж и връща вероятност за всеки разрешен отговор. Liquid AI определя три типа въпроси:

  • noul: въпрос с отговор да или не, върнат като P(да).
  • choice: един етикет от именувани опции с пълно вероятностно разпределение.
  • score: претеглена с вероятност позиция в подредена рубрика от 2 до 10 нива.

Няколко въпроса могат да споделят едно състояние в рамките на едно извикване. Всеки отговор отчита output_tokens: 0. Liquid AI препоръчва d1 за маршрутизиране, модериране, класификация на намерения, повторно класиране, оценяване от типа LLM-as-a-judge, защитни механизми за агенти и визуална инспекция. Нито една от двете контролни точки не е чат модел.

Как са създадени d1-3B и d1-omni-600M?

d1-3B има 3.12 милиарда параметъра и започва от LFM2.5-VL-3B, зрително-езиков модел само с декодер. Liquid AI усреднява теглата на LFM2.5-2.6B с текстовия гръбнак на този модел. След това дообучава няколко контролни точки с различни начални стойности и комбинации от данни и отново ги обединява. Моделът използва зрителен енкодер SigLIP2 NaFlex с 400M параметъра и контекст от 32 768 токена. Дългите входове, разбърканите опции за отговор и отстраняването на преките зависимости в данните са били по-важни от усъвършенстваните техники.

d1-omni-600M има 587 милиона параметъра и започва от LFM2.5-Encoder-350M, двупосочен енкодер. Той включва споделен гръбнак и глава за вземане на решения с 381M параметъра, зрителен енкодер с 94M параметъра и аудио енкодер със 112M параметъра. Аудио енкодерът е 17-слоен FastConformer. Контекстът е 16 384 токена. Аудиоклиповете са ограничени до 30 секунди. Една заявка съдържа изображения или аудио, но никога и двете едновременно. Обучението с аудио обхваща само заявки на английски от говорител към асистент.

За какво е най-подходящ Open d1?

  • Сортиране на заявки за поддръжка и тикети: Едно извикване на d1-3B може да отговори на въпрос да или не за възстановяване на сума, да избере отговорния екип и да оцени спешността за едно и също съобщение — без изходни токени за анализ.
  • Визуална инспекция и модериране в реално време на периферни устройства: d1-3B разчита изображение с размер 384 пиксела за 35 ms на Jetson AGX Thor, а Open d1 Arcade на Liquid AI го изпълнява кадър по кадър върху вход от камера на живо за модериране на съдържание и управление с жестове.
  • Маршрутизиране на гласови команди на малки устройства: d1-omni-600M приема до 30 секунди реч заедно с текст и директно връща намерението или темата на говорещия. Картата на модела посочва маршрутизирането на гласови команди и защитните механизми за агенти сред препоръчителните му приложения.

Как се представя d1 в бенчмарковете?

В Decision Index v0.2.1 d1-3B получава 48.57. Това надминава всеки модел под 10B и го поставя малко пред Decider 35B-A3B (47.11). Само Winnow-12B има по-висок резултат — 50.02. Liquid AI е изпълнила официалния оценител сама, така че резултатите на d1 не са подадени в класацията. d1-3B води в категориите Tools (74.5) и Arts (36.3), но изостава в Knowledge (23.8).

В седем публични текстови бенчмарка d1-3B има среден резултат 82.9, пред Decider 4B с 81.1. d1-omni-600M има среден резултат 78.4 и постига най-високите резултати при Civil Comments (95.8) и PAWS-X (79.5). В 11 бенчмарка за изображения d1-3B има среден резултат 74.1 спрямо 73.9 за базовия си модел. Liquid AI определя бенчмарковете за вземане на решения с аудио като нерешен проблем.

Колко бърз е d1-3B върху хардуер на NVIDIA?

Liquid AI измерва латентността от край до край, като обработва по една затоплена заявка наведнъж. Един въпрос отнема 8 ms на RTX 4090 и 9 ms на AMD MI325X. При Jetson AGX Thor отнема 16 ms, AGX Orin — 26 ms, а Orin Nano — 50 ms. На Jetson AGX Thor три въпроса върху едно състояние отнемат 20 ms спрямо 16 ms за един въпрос. Стойността за RTX 4090 използва model.compile(mode="reduce-overhead"). Без него един въпрос отнема 16 ms. Jetson AI Lab на NVIDIA също предлага ръководства за d1-3B.

Как се сравнява Open d1 с други модели за вземане на решения с отворен код?

Характеристикаd1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
СъздателLiquid AILiquid AIMapika (независим)Mapika (независим)EldanRing (независим)
Параметри3.12B587M4.2B34.7B общо, 3B активни12B
Базов моделLFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
ВходовеТекст, изображенияТекст + изображение или текст + аудиоТекстТекстТекст, изображения
Контекст32 76816 384Състояние от 32K токенаСъстояние от 32K токена65 536 (тествано с Q8)
Decision Index v0.2.148.5715.9540.7047.1150.02
ЛицензLFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
Публикувана латентност8 ms на въпрос, RTX 4090Не е публикувана5.2 ms за заявка с 3 въпроса, B30047 ms за заявка с 3 въпроса, B300143 ms за кеширана заявка с 4 въпроса близо до контекст от 64K, RTX 5070 Ti

Източници: Картите на моделите d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B. Резултатите от индекса са посочени в картите на d1. Латентностите са измерени с различен хардуер и при различни работни натоварвания, така че не са пряко сравними.

Как се стартира d1 локално?

d1-3B изисква transformers>=5.14 и trust_remote_code=True. d1-omni-600M изисква transformers>=5.15. И двата модела предоставят system_one(state, questions) за едно състояние и system_one_batch за пакетирани заявки. Liquid AI препоръчва float16 за d1-omni-600M на GPU, тъй като bfloat16 променя някои от водещите отговори. Можете да изпробвате десет демонстрации на d1-3B, управлявани от камера, в пространството Open d1 Arcade. С NVIDIA Liquid AI също демонстрира как d1-3B управлява Isaac Sim от Jetson.

Основни изводи

  • Моделите d1 извеждат вероятности за фиксирани опции с едно предаване, без генерирани токени.
  • d1-3B получава 48.57 в Decision Index v0.2.1 — най-добрият резултат под 10B.
  • d1-3B отговаря на един въпрос за 8 ms на RTX 4090.
  • d1-omni-600M обработва текст с изображения или аудио при 587M параметъра.
  • Лицензът позволява безплатна комерсиална употреба при годишни приходи под 10 милиона долара.

Разгледайте d1-3B, d1-omni-600M и техническите подробности. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

[Спонсорирано] Уеб пространството е единственият API, който липсва на повечето агенти. Базите данни, календарите и хранилищата имат API. Отвореното уеб пространство в повечето случаи няма. MCP сървърът TinyFish предоставя на всеки MCP клиент четири инструмента: TinySearch, TinyFetch (пълни страници като markdown, включително JavaScript), TinyBrowser за вход и формуляри и TinyAgent за многостъпкови задачи. Search и Fetch са безплатни.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини