Liquid AI выпускает модели с открытыми весами d1-3B и d1-omni-600M: мультимодальные модели принятия решений с нулевым числом выходных токенов
Liquid AI выпустила Open d1 — две мультимодальные модели с открытыми весами из семейства моделей принятия решений d1. d1-3B обрабатывает текст и изображения. d1-omni-600M обрабатывает текст с изображением или текст с аудио. Ни одна из моделей не генерирует текст. Каждая возвращает калиброванные типизированные ответы за один прямой проход без выходных токенов. Цель — принятие решений в реальном времени на стеке NVIDIA: серверах DGX, рабочих станциях RTX и периферийных платах Jetson.
Можно ли её развернуть? Да. Обе контрольные точки доступны на Hugging Face, загружаются через Transformers и с первого дня поддерживаются llama.cpp. LFM Open License v1.0 разрешает бесплатное коммерческое использование при годовой выручке менее 10 миллионов долларов. d1-omni-600M — ранний исследовательский релиз без опубликованных показателей задержки.
Что такое модель принятия решений?
Генеративная LLM записывает ответ токен за токеном, а ваш код анализирует его. Модель принятия решений получает состояние и набор именованных вопросов. Она обрабатывает их один раз и возвращает вероятность каждого допустимого ответа. Liquid AI определяет три типа вопросов:
- noul: вопрос с ответом «да» или «нет», возвращается как P(yes).
- choice: одна метка из именованных вариантов с полным распределением вероятностей.
- score: взвешенная вероятностью позиция на упорядоченной шкале из 2–10 уровней.
Несколько вопросов могут использовать одно состояние в рамках одного вызова. Каждый ответ содержит output_tokens: 0. Liquid AI рекомендует d1 для маршрутизации, модерации, классификации намерений, переранжирования, оценки по принципу LLM-as-a-judge, ограничителей для агентов и визуального контроля. Ни одна из контрольных точек не является чат-моделью.
Как созданы d1-3B и d1-omni-600M?
d1-3B содержит 3,12 млрд параметров и создана на основе LFM2.5-VL-3B — визуально-языковой модели только с декодером. Liquid AI усреднила веса LFM2.5-2.6B с текстовой основой этой модели. Затем компания дообучила несколько контрольных точек с разными начальными значениями и смесями данных, а затем снова объединила их. Модель использует визуальный энкодер SigLIP2 NaFlex на 400 млн параметров и контекст из 32 768 токенов. Длинные входные данные, перемешивание вариантов ответов и устранение лазеек в данных оказались важнее продвинутых методов.
d1-omni-600M содержит 587 млн параметров и создана на основе LFM2.5-Encoder-350M — двунаправленного энкодера. В состав входят общий ствол и голова принятия решений на 381 млн параметров, визуальный энкодер на 94 млн параметров и аудиоэнкодер на 112 млн параметров. Аудиоэнкодер представляет собой FastConformer из 17 слоёв. Контекст составляет 16 384 токена. Аудиоклипы ограничены 30 секундами. Запрос содержит либо изображения, либо аудио, но не оба типа данных одновременно. Аудиоданные для обучения включали только запросы на английском языке от говорящего к ассистенту.
Для чего лучше всего подходит Open d1?
- Сортировка обращений в службу поддержки и тикетов: один вызов d1-3B может проверить возможность возврата средств с ответом «да» или «нет», выбрать ответственную команду и оценить срочность одного и того же сообщения — без выходных токенов для анализа.
- Визуальный контроль и модерация в реальном времени на периферийных устройствах: d1-3B обрабатывает изображение размером 384 пикселя за 35 мс на Jetson AGX Thor, а Open d1 Arcade от Liquid AI запускает её покадрово на видеопотоке с камеры для модерации контента и управления жестами.
- Маршрутизация голосовых команд на небольших устройствах: d1-omni-600M принимает до 30 секунд речи вместе с текстом и напрямую возвращает намерение или тему говорящего. В карточке модели маршрутизация голосовых команд и ограничители для агентов указаны среди рекомендуемых вариантов использования.
Как d1 показывает себя на бенчмарках?
В Decision Index v0.2.1 модель d1-3B набирает 48,57 балла. Это лучше результата любой модели с числом параметров менее 10 млрд и немного выше показателя Decider 35B-A3B (47,11). Более высокий результат показывает только Winnow-12B — 50,02. Liquid AI самостоятельно запустила официальный оценщик, поэтому показатели d1 не являются заявками в таблицу лидеров. d1-3B лидирует в категориях Tools (74,5) и Arts (36,3), но уступает в Knowledge (23,8).
В семи общедоступных текстовых бенчмарках средний результат d1-3B составляет 82,9 — выше, чем у Decider 4B (81,1). Средний результат d1-omni-600M составляет 78,4; модель показывает лучшие результаты на Civil Comments (95,8) и PAWS-X (79,5). В 11 бенчмарках изображений средний результат d1-3B составляет 74,1 против 73,9 у базовой модели. Liquid AI называет бенчмарки принятия решений по аудио нерешённой задачей.
Насколько быстро работает d1-3B на оборудовании NVIDIA?
Liquid AI измерила сквозную задержку, обрабатывая по одному прогретому запросу за раз. Один вопрос занимает 8 мс на RTX 4090 и 9 мс на AMD MI325X. На Jetson AGX Thor требует 16 мс, AGX Orin — 26 мс, а Orin Nano — 50 мс. На Jetson AGX Thor обработка трёх вопросов для одного состояния занимает 20 мс против 16 мс для одного вопроса. Для показателя RTX 4090 используется model.compile(mode="reduce-overhead"). Без него один вопрос занимает 16 мс. На сайте Jetson AI Lab от NVIDIA также размещены руководства по d1-3B.
Как Open d1 сравнивается с другими открытыми моделями принятия решений?
| Характеристика | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| Разработчик | Liquid AI | Liquid AI | Mapika (независимая разработка) | Mapika (независимая разработка) | EldanRing (независимая разработка) |
| Параметры | 3,12 млрд | 587 млн | 4,2 млрд | 34,7 млрд всего, 3 млрд активных | 12 млрд |
| Базовая модель | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| Входные данные | Текст, изображения | Текст + изображение или текст + аудио | Текст | Текст | Текст, изображения |
| Контекст | 32 768 | 16 384 | Состояние на 32 тыс. токенов | Состояние на 32 тыс. токенов | 65 536 (проверено в Q8) |
| Decision Index v0.2.1 | 48,57 | 15,95 | 40,70 | 47,11 | 50,02 |
| Лицензия | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Опубликованная задержка | 8 мс на вопрос, RTX 4090 | Не опубликована | 5,2 мс на запрос из 3 вопросов, B300 | 47 мс на запрос из 3 вопросов, B300 | 143 мс на кэшированный запрос из 4 вопросов при контексте около 64 тыс. токенов, RTX 5070 Ti |
Источники: карточки моделей d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B. Показатели индекса приведены так, как они указаны в карточках d1. Задержки измерялись на разном оборудовании и при разных нагрузках, поэтому напрямую сравнивать их нельзя.
Как запустить d1 локально?
Для d1-3B требуются transformers>=5.14 и trust_remote_code=True. Для d1-omni-600M требуется transformers>=5.15. Обе модели предоставляют system_one(state, questions) для одного состояния и system_one_batch для объединённых запросов. Liquid AI рекомендует использовать float16 для d1-omni-600M на GPU, поскольку bfloat16 изменил некоторые наиболее вероятные ответы. Вы можете попробовать десять демонстраций d1-3B с управлением от камеры в пространстве Open d1 Arcade. Для NVIDIA Liquid AI также показала, как d1-3B управляет Isaac Sim с Jetson.
Ключевые выводы
- Модели d1 за один проход выдают вероятности фиксированных вариантов, но никогда не генерируют токены.
- d1-3B набирает 48,57 балла в Decision Index v0.2.1 — лучший результат среди моделей с числом параметров менее 10 млрд.
- d1-3B отвечает на один вопрос за 8 мс на RTX 4090.
- d1-omni-600M обрабатывает текст с изображениями или аудио и содержит 587 млн параметров.
- Лицензия разрешает бесплатное коммерческое использование при годовой выручке менее 10 млн долларов.
Ознакомьтесь с материалами о d1-3B, d1-omni-600M и техническими подробностями. Вся благодарность — исследователю этого проекта. Также не стесняйтесь подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.