Мултимодални отворени d1 модели за вземане на решения за периферията
- Най-добрият модел за вземане на решения под 10B в Decision Index 0.2.1: d1-3B получава 48.57 точки, изпреварвайки всеки модел с 4B и 9B параметъра, както и Decider 35B-A3B (47.11).
- Мултимодален: d1-3B поддържа текст и изображения, докато d1-omni-600M поддържа текст и изображения или текст и аудио
- Бърз: d1-3B отговаря на въпрос за 16 ms на NVIDIA Jetson AGX Thor, 26 ms на Jetson AGX Orin и 50 ms на Jetson Orin Nano
Как създадохме модели за вземане на решения за периферни устройства
Тези отворени модели за вземане на решения d1 са изградени върху нашите Liquid Foundation Models (LFM). За разлика от генеративните ни модели, моделите за вземане на решения не генерират токени, а отговарят с един-единствен проход напред.
d1-3B и d1-omni-600M са обучени от две много различни базови архитектури:
- d1-3B е обучен от LFM2.5-VL-3B, най-новия ни VLM, който е само декодер. Приема текст и изображения като вход.
- d1-omni-600M е обучен от LFM2.5-Encoder-350M, двупосочен енкодер. Добавя енкодери за изображения и аудио, за да обработва и трите модалности. Приема като вход или текст и изображение, или текст и аудио. Този модел в момента е в ранен изследователски етап и продължава да се разработва.
Резултати от бенчмарковете
Тествахме d1-3B и d1-omni-600M върху седем публични набора от данни, обхващащи разбиране на прочетен текст, откриване на токсичност, класификация на намерения, медицински въпроси и отговори и междуезиково разбиране. d1-3B постига среден резултат 82.9 — най-високия в таблицата и по-висок от този на Decider 4B. d1-omni-600M получава 78.4 точки, надминавайки Decider 2B (77.1) само с една четвърт от параметрите.
| Бенчмарк | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 |
| Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 |
| MASSIVE intent | 86.1 | 86.9 | 81.1 | 88.3 |
| PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 |
| BoolQ | 77.7 | 86.3 | 87.3 | 89.0 |
| XNLI | 74.7 | 85.6 | 85.0 | 88.6 |
| PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 |
| Средно | 78.4 | 82.9 | 77.1 | 81.1 |
Потвърдихме, че d1-3B запазва способностите за работа с изображения на своята базова архитектура LFM2.5-VL-3B при стандартни бенчмаркове за изображения и че d1-omni-600M обработва и трите модалности. Не представяме бенчмаркове за изображения или аудио, тъй като Decision Index v0.3 включва само частен набор за изображения, а бенчмарковете за вземане на решения от аудио в момента са нерешен проблем.
Скорост
В сътрудничество с NVIDIA оценихме d1-3B върху стека на NVIDIA с NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Тъй като d1-omni-600M е ранен изследователски модел, в тази версия не представяме данни за скоростта му.
Изводи на периферни устройства. d1-3B отговаря на един въпрос за под 50 ms на всяко измерено устройство. Три въпроса отнемат само 1,3 пъти повече време от един, като при AGX Thor времето се увеличава от 16 ms на 20 ms.
| Един въпрос | 3 въпроса | Състояние с 3,4K токена | Изображение 384 px | 64 състояния, пакетирани | |
|---|---|---|---|---|---|
| Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
| Jetson AGX Thor | 16 ms | 20 ms | 220 ms | 35 ms | 262 / s |
| Jetson AGX Orin 64 GB | 26 ms | 35 ms | 560 ms | 83 ms | 110 / s |
| Jetson Orin Nano | 50 ms | 73 ms | 1,640 ms | 202 ms | 38 / s |
GPU инференс. На GPU d1-3B отговаря на въпрос за под 10 ms и обработва изображение с размер 384 px за под 18 ms и на двете платформи.
| Един въпрос | 3 въпроса | Състояние с 3,4K токена | Изображение 384 px | 64 състояния, пакетирани | |
|---|---|---|---|---|---|
| NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
| AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
Как да използвате отворените модели за вземане на решения d1
Използвайте моделите за вземане на решения d1, когато се нуждаете от бързи, структурирани решения, включително при мултимодални входни данни. d1-3B осигурява най-високото качество на решенията за своя размер, докато d1-omni-600M е подходящ там, където размерът на модела е от значение.
Инсталирайте зависимостите (изисква transformers>=5.14):
pip install "transformers>=5.14" torch torchvision pillow
Тези модели включват собствен код, затова ги заредете с trust_remote_code=True:
import io
import urllib.request
import torch
from PIL import Image
from transformers import AutoModel
device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)
questions = {
"refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
"team": {"type": "choice", "instructions": "Which team should handle this?",
"criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
"fraud": "Suspected unauthorised use"}},
"urgency": {"type": "score", "instructions": "How urgent is this?",
"criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
"criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
images=[photo]))
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))
За краткост включваме само примера за d1-3B. Вижте картата на модела d1-omni-600M за инструкции как да го стартирате.
Започнете с отворените модели за вземане на решения d1
И двата модела за вземане на решения са с отворени тегла и са налични днес в Hugging Face:
- Изтегляне: d1-3B и d1-omni-600M в Hugging Face.
- Изпробване: стартирайте демонстрациите в нашето Hugging Face пространство System One Arcade.
Нямаме търпение да видим какво ще създадете.
Цитиране
Ако използвате тази работа, моля, цитирайте блога за изданието:
@article{liquidAI2026opend1,
author = {Liquid AI},
title = {Open d1: Edge decision models for text, vision, and audio},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/open-d1},
}
Модели, споменати в тази статия 3
Пространства, споменати в тази статия 1
Общност
· Регистрирайте се или влезте в профила си, за да коментирате
Модели, споменати в тази статия 3
Пространства, споменати в тази статия 1
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

