Мультимодальные открытые d1-модели принятия решений для периферии
- Лучшая модель принятия решений до 10B в Decision Index 0.2.1: d1-3B набирает 48,57 балла, опережая все модели 4B и 9B, а также Decider 35B-A3B (47,11).
- Мультимодальность: d1-3B поддерживает текст и изображения, тогда как d1-omni-600M поддерживает текст и изображения либо текст и аудио
- Высокая скорость: d1-3B отвечает на вопрос за 16 мс на NVIDIA Jetson AGX Thor, 26 мс на Jetson AGX Orin и 50 мс на Jetson Orin Nano
Как мы создали модели принятия решений для периферийных устройств
Эти открытые модели принятия решений d1 построены на основе наших Liquid Foundation Models (LFM). В отличие от генеративных моделей, модели принятия решений не генерируют токены, а отвечают за один прямой проход.
d1-3B и d1-omni-600M обучены на двух совершенно разных базовых моделях:
- d1-3B обучена на основе LFM2.5-VL-3B, нашей новейшей VLM с архитектурой только декодера. Она принимает на вход текст и изображения.
- d1-omni-600M обучена на основе LFM2.5-Encoder-350M, двунаправленного энкодера. Для работы со всеми тремя модальностями в неё добавлены энкодеры зрения и аудио. Она принимает либо текст и изображение, либо текст и аудио. В настоящее время эта модель находится на ранней исследовательской стадии выпуска и продолжает развиваться.
Результаты бенчмарков
Мы протестировали d1-3B и d1-omni-600M на семи общедоступных наборах данных, охватывающих понимание прочитанного, выявление токсичности, классификацию намерений, медицинские вопросы и ответы, а также кросс-лингвистическое понимание. Средний результат d1-3B составляет 82,9 — это самый высокий показатель в таблице, выше, чем у Decider 4B. d1-omni-600M набирает 78,4, превосходя Decider 2B (77,1) при всего четверти числа параметров.
| Бенчмарк | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74,0 | 83,3 | 67,7 | 76,0 |
| Civil Comments | 95,8 | 93,3 | 93,6 | 92,8 |
| MASSIVE intent | 86,1 | 86,9 | 81,1 | 88,3 |
| PubMedQA | 61,3 | 68,3 | 65,7 | 63,3 |
| BoolQ | 77,7 | 86,3 | 87,3 | 89,0 |
| XNLI | 74,7 | 85,6 | 85,0 | 88,6 |
| PAWS-X | 79,5 | 76,4 | 59,5 | 69,8 |
| Среднее | 78,4 | 82,9 | 77,1 | 81,1 |
Мы подтвердили, что d1-3B сохраняет возможности работы с изображениями своей базовой модели LFM2.5-VL-3B на стандартных бенчмарках компьютерного зрения, а d1-omni-600M работает со всеми тремя модальностями. Мы не приводим результаты тестов для зрения и аудио, поскольку Decision Index v0.3 включает только закрытую часть для зрения, а бенчмарки принятия решений для аудио пока остаются нерешённой задачей.
Скорость
В сотрудничестве с NVIDIA мы оценили d1-3B на стеке NVIDIA с использованием NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Поскольку d1-omni-600M находится на ранней исследовательской стадии выпуска, в этой публикации мы не приводим показатели её скорости.
Вывод на периферийных устройствах. d1-3B отвечает на один вопрос менее чем за 50 мс на каждом измеренном устройстве. Обработка трёх вопросов занимает лишь в 1,3 раза больше времени, чем одного: на AGX Thor время увеличивается с 16 до 20 мс.
| Один вопрос | 3 вопроса | Состояние на 3,4 тыс. токенов | Изображение 384 пикс. | 64 состояния, упакованные | |
|---|---|---|---|---|---|
| Apple M5 Pro | 30 мс | 41 мс | 640 мс | 62 мс | 78 / с |
| Jetson AGX Thor | 16 мс | 20 мс | 220 мс | 35 мс | 262 / с |
| Jetson AGX Orin 64 GB | 26 мс | 35 мс | 560 мс | 83 мс | 110 / с |
| Jetson Orin Nano | 50 мс | 73 мс | 1 640 мс | 202 мс | 38 / с |
Вывод на GPU. На GPU d1-3B отвечает на вопрос менее чем за 10 мс и обрабатывает изображение 384 пикселя менее чем за 18 мс на обеих платформах.
| Один вопрос | 3 вопроса | Состояние на 3,4 тыс. токенов | Изображение 384 пикс. | 64 состояния, упакованные | |
|---|---|---|---|---|---|
| NVIDIA RTX 4090 | 8 мс | 21 мс | 102 мс | 17 мс | 475 / с |
| AMD MI325X | 9 мс | 14 мс | 44 мс | 18 мс | 1 106 / с |
Как использовать открытые модели принятия решений d1
Используйте модели принятия решений d1, когда вам нужны быстрые структурированные решения, в том числе для мультимодальных входных данных. d1-3B обеспечивает высочайшее качество решений для своего размера, а d1-omni-600M подходит там, где важен компактный размер.
Установите зависимости (требуется transformers>=5.14):
pip install "transformers>=5.14" torch torchvision pillow
Эти модели содержат собственный код, поэтому загружайте их с параметром trust_remote_code=True:
import io
import urllib.request
import torch
from PIL import Image
from transformers import AutoModel
device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)
questions = {
"refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
"team": {"type": "choice", "instructions": "Which team should handle this?",
"criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
"fraud": "Suspected unauthorised use"}},
"urgency": {"type": "score", "instructions": "How urgent is this?",
"criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
"criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
images=[photo]))
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))
Для краткости мы приводим только пример для d1-3B. Инструкции по запуску d1-omni-600M см. в карточке модели d1-omni-600M.
Начало работы с открытыми моделями принятия решений d1
Обе модели принятия решений имеют открытые веса и уже доступны на Hugging Face:
- Скачать: d1-3B и d1-omni-600M на Hugging Face.
- Попробовать: запустите демонстрации в нашем пространстве Hugging Face System One Arcade.
Нам не терпится увидеть, что вы создадите.
Цитирование
Если вы используете эту работу, пожалуйста, процитируйте публикацию о выпуске:
@article{liquidAI2026opend1,
author = {Liquid AI},
title = {Open d1: Edge decision models for text, vision, and audio},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/open-d1},
}
Модели, упомянутые в этой статье 3
Пространства, упомянутые в этой статье 1
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 3
Пространства, упомянутые в этой статье 1
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

