Мультимодальні відкриті d1-моделі ухвалення рішень для периферії
- Найкраща модель прийняття рішень із менш ніж 10B параметрів за індексом рішень 0.2.1: d1-3B набирає 48.57 бала, випереджаючи всі моделі 4B і 9B, а також Decider 35B-A3B (47.11).
- Мультимодальність: d1-3B підтримує текст і зображення, тоді як d1-omni-600M підтримує текст і зображення або текст і аудіо
- Швидкість: d1-3B відповідає на запитання за 16 мс на NVIDIA Jetson AGX Thor, за 26 мс на Jetson AGX Orin і за 50 мс на Jetson Orin Nano
Як ми створили моделі прийняття рішень для периферійних пристроїв
Ці відкриті моделі прийняття рішень d1 побудовані на основі наших Liquid Foundation Models (LFM). На відміну від генеративних моделей, моделі прийняття рішень не генерують токени, а відповідають за один прямий прохід.
d1-3B і d1-omni-600M навчені на двох дуже різних базових моделях:
- d1-3B навчена на основі LFM2.5-VL-3B, нашої найновішої VLM, яка має лише декодер. Вона приймає на вході текст і зображення.
- d1-omni-600M навчена на основі LFM2.5-Encoder-350M, двонапрямленого енкодера. До неї додано енкодери зображень і аудіо для роботи з усіма трьома модальностями. Вона приймає на вході або текст і зображення, або текст і аудіо. Наразі ця модель доступна в межах раннього дослідницького випуску та проходить подальшу розробку.
Результати тестування
Ми протестували d1-3B і d1-omni-600M на семи загальнодоступних наборах даних, що охоплюють розуміння прочитаного, виявлення токсичності, класифікацію намірів, медичні запитання й відповіді та міжмовне розуміння. Середній результат d1-3B становить 82.9 — це найвищий показник у таблиці, він перевищує результат Decider 4B. d1-omni-600M набирає 78.4, перевершуючи Decider 2B (77.1) лише з чвертю кількості параметрів.
| Тест | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 |
| Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 |
| Намір MASSIVE | 86.1 | 86.9 | 81.1 | 88.3 |
| PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 |
| BoolQ | 77.7 | 86.3 | 87.3 | 89.0 |
| XNLI | 74.7 | 85.6 | 85.0 | 88.6 |
| PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 |
| Середнє | 78.4 | 82.9 | 77.1 | 81.1 |
Ми підтвердили, що d1-3B зберігає можливості роботи із зображеннями своєї базової моделі LFM2.5-VL-3B на стандартних тестах для зору, а d1-omni-600M працює з усіма трьома модальностями. Ми не наводимо результати тестів для зображень чи аудіо, оскільки Decision Index v0.3 містить лише закриту частину для зору, а тести прийняття рішень для аудіо наразі залишаються відкритою проблемою.
Швидкість
У співпраці з NVIDIA ми оцінили d1-3B на стеку NVIDIA на NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB і Jetson Orin Nano. Оскільки d1-omni-600M є раннім дослідницьким випуском, у цьому випуску ми не наводимо даних про її швидкість.
Виведення на периферійних пристроях. d1-3B відповідає на одне запитання менш ніж за 50 мс на кожному виміряному пристрої. Три запитання займають лише в 1,3 раза більше часу, ніж одне: на AGX Thor час збільшується з 16 до 20 мс.
| Одне запитання | 3 запитання | Стан із 3,4 тис. токенів | Зображення 384 пікселі | 64 стани, упаковані | |
|---|---|---|---|---|---|
| Apple M5 Pro | 30 мс | 41 мс | 640 мс | 62 мс | 78 / с |
| Jetson AGX Thor | 16 мс | 20 мс | 220 мс | 35 мс | 262 / с |
| Jetson AGX Orin 64 GB | 26 мс | 35 мс | 560 мс | 83 мс | 110 / с |
| Jetson Orin Nano | 50 мс | 73 мс | 1 640 мс | 202 мс | 38 / с |
Виведення на GPU. На GPU d1-3B відповідає на запитання менш ніж за 10 мс і обробляє зображення розміром 384 пікселі менш ніж за 18 мс на обох платформах.
| Одне запитання | 3 запитання | Стан із 3,4 тис. токенів | Зображення 384 пікселі | 64 стани, упаковані | |
|---|---|---|---|---|---|
| NVIDIA RTX 4090 | 8 мс | 21 мс | 102 мс | 17 мс | 475 / с |
| AMD MI325X | 9 мс | 14 мс | 44 мс | 18 мс | 1 106 / с |
Як використовувати відкриті моделі прийняття рішень d1
Обирайте моделі прийняття рішень d1, коли вам потрібні швидкі структуровані рішення, зокрема з мультимодальними вхідними даними. d1-3B забезпечує найвищу якість прийняття рішень у своєму розмірі, тоді як d1-omni-600M підходить для випадків, де важливий компактний розмір.
Установіть залежності (потрібен transformers>=5.14):
pip install "transformers>=5.14" torch torchvision pillow
Ці моделі постачають власний код, тому завантажуйте їх із параметром trust_remote_code=True:
import io
import urllib.request
import torch
from PIL import Image
from transformers import AutoModel
device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)
questions = {
"refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
"team": {"type": "choice", "instructions": "Which team should handle this?",
"criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
"fraud": "Suspected unauthorised use"}},
"urgency": {"type": "score", "instructions": "How urgent is this?",
"criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
"criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
images=[photo]))
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))
Для стислості ми наводимо приклад лише для d1-3B. Інструкції із запуску дивіться в картці моделі d1-omni-600M.
Початок роботи з відкритими моделями прийняття рішень d1
Обидві моделі прийняття рішень мають відкриті ваги й уже доступні на Hugging Face:
- Завантажити: d1-3B і d1-omni-600M на Hugging Face.
- Спробувати: запустіть демонстрації в нашому просторі System One Arcade на Hugging Face.
Ми з нетерпінням чекаємо, що ви створите.
Цитування
Якщо ви використовуєте цю роботу, будь ласка, процитуйте публікацію про випуск:
@article{liquidAI2026opend1,
author = {Liquid AI},
title = {Open d1: Edge decision models for text, vision, and audio},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/open-d1},
}
Моделі, згадані в цій статті 3
Простори, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб коментувати
Моделі, згадані в цій статті 3
Простори, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

