Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Мультимодальні відкриті d1-моделі ухвалення рішень для периферії

Мультимодальні відкриті моделі прийняття рішень d1 для периферійних пристроїв
Команда Стаття
Опубліковано 7 жовтня 2026 року
Сьогодні ми випускаємо дві відкриті моделі прийняття рішень із нашого сімейства моделей прийняття рішень d1: d1-3B і d1-omni-600M (експериментальна).
  • Найкраща модель прийняття рішень із менш ніж 10B параметрів за індексом рішень 0.2.1: d1-3B набирає 48.57 бала, випереджаючи всі моделі 4B і 9B, а також Decider 35B-A3B (47.11).
  • Мультимодальність: d1-3B підтримує текст і зображення, тоді як d1-omni-600M підтримує текст і зображення або текст і аудіо
  • Швидкість: d1-3B відповідає на запитання за 16 мс на NVIDIA Jetson AGX Thor, за 26 мс на Jetson AGX Orin і за 50 мс на Jetson Orin Nano

Як ми створили моделі прийняття рішень для периферійних пристроїв

Ці відкриті моделі прийняття рішень d1 побудовані на основі наших Liquid Foundation Models (LFM). На відміну від генеративних моделей, моделі прийняття рішень не генерують токени, а відповідають за один прямий прохід.

d1-3B і d1-omni-600M навчені на двох дуже різних базових моделях:

  • d1-3B навчена на основі LFM2.5-VL-3B, нашої найновішої VLM, яка має лише декодер. Вона приймає на вході текст і зображення.
  • d1-omni-600M навчена на основі LFM2.5-Encoder-350M, двонапрямленого енкодера. До неї додано енкодери зображень і аудіо для роботи з усіма трьома модальностями. Вона приймає на вході або текст і зображення, або текст і аудіо. Наразі ця модель доступна в межах раннього дослідницького випуску та проходить подальшу розробку.

Результати тестування

Ми протестували d1-3B і d1-omni-600M на семи загальнодоступних наборах даних, що охоплюють розуміння прочитаного, виявлення токсичності, класифікацію намірів, медичні запитання й відповіді та міжмовне розуміння. Середній результат d1-3B становить 82.9 — це найвищий показник у таблиці, він перевищує результат Decider 4B. d1-omni-600M набирає 78.4, перевершуючи Decider 2B (77.1) лише з чвертю кількості параметрів.

Тест d1-omni-600M d1-3B Decider 2B Decider 4B
SQuAD 2.0 74.0 83.3 67.7 76.0
Civil Comments 95.8 93.3 93.6 92.8
Намір MASSIVE 86.1 86.9 81.1 88.3
PubMedQA 61.3 68.3 65.7 63.3
BoolQ 77.7 86.3 87.3 89.0
XNLI 74.7 85.6 85.0 88.6
PAWS-X 79.5 76.4 59.5 69.8
Середнє 78.4 82.9 77.1 81.1

Ми підтвердили, що d1-3B зберігає можливості роботи із зображеннями своєї базової моделі LFM2.5-VL-3B на стандартних тестах для зору, а d1-omni-600M працює з усіма трьома модальностями. Ми не наводимо результати тестів для зображень чи аудіо, оскільки Decision Index v0.3 містить лише закриту частину для зору, а тести прийняття рішень для аудіо наразі залишаються відкритою проблемою.

Швидкість

У співпраці з NVIDIA ми оцінили d1-3B на стеку NVIDIA на NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB і Jetson Orin Nano. Оскільки d1-omni-600M є раннім дослідницьким випуском, у цьому випуску ми не наводимо даних про її швидкість.

Виведення на периферійних пристроях. d1-3B відповідає на одне запитання менш ніж за 50 мс на кожному виміряному пристрої. Три запитання займають лише в 1,3 раза більше часу, ніж одне: на AGX Thor час збільшується з 16 до 20 мс.

Одне запитання 3 запитання Стан із 3,4 тис. токенів Зображення 384 пікселі 64 стани, упаковані
Apple M5 Pro 30 мс 41 мс 640 мс 62 мс 78 / с
Jetson AGX Thor 16 мс 20 мс 220 мс 35 мс 262 / с
Jetson AGX Orin 64 GB 26 мс 35 мс 560 мс 83 мс 110 / с
Jetson Orin Nano 50 мс 73 мс 1 640 мс 202 мс 38 / с

Виведення на GPU. На GPU d1-3B відповідає на запитання менш ніж за 10 мс і обробляє зображення розміром 384 пікселі менш ніж за 18 мс на обох платформах.

Одне запитання 3 запитання Стан із 3,4 тис. токенів Зображення 384 пікселі 64 стани, упаковані
NVIDIA RTX 4090 8 мс 21 мс 102 мс 17 мс 475 / с
AMD MI325X 9 мс 14 мс 44 мс 18 мс 1 106 / с

Як використовувати відкриті моделі прийняття рішень d1

Обирайте моделі прийняття рішень d1, коли вам потрібні швидкі структуровані рішення, зокрема з мультимодальними вхідними даними. d1-3B забезпечує найвищу якість прийняття рішень у своєму розмірі, тоді як d1-omni-600M підходить для випадків, де важливий компактний розмір.

Установіть залежності (потрібен transformers>=5.14):

pip install "transformers>=5.14" torch torchvision pillow

Ці моделі постачають власний код, тому завантажуйте їх із параметром trust_remote_code=True:

import io
import urllib.request

import torch
from PIL import Image
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
                                  dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)


questions = {
    "refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
    "team": {"type": "choice", "instructions": "Which team should handle this?",
             "criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
                          "fraud": "Suspected unauthorised use"}},
    "urgency": {"type": "score", "instructions": "How urgent is this?",
                "criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))


url = "http://images.cocodataset.org/val2017/000000039769.jpg"  
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
                                       "criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
                       images=[photo]))


tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))

Для стислості ми наводимо приклад лише для d1-3B. Інструкції із запуску дивіться в картці моделі d1-omni-600M.

Початок роботи з відкритими моделями прийняття рішень d1

Обидві моделі прийняття рішень мають відкриті ваги й уже доступні на Hugging Face:

Ми з нетерпінням чекаємо, що ви створите.

Цитування

Якщо ви використовуєте цю роботу, будь ласка, процитуйте публікацію про випуск:

@article{liquidAI2026opend1,
  author  = {Liquid AI},
  title   = {Open d1: Edge decision models for text, vision, and audio},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/open-d1},
}

Моделі, згадані в цій статті 3

Простори, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у текстове поле, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб коментувати

Моделі, згадані в цій статті 3

Простори, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини