Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Мултимодални отворени d1 модели за вземане на решения за периферията

Мултимодални отворени d1 модели за вземане на решения за периферни устройства
Екип Статия
Публикувано 7 октомври 2026 г.
Днес пускаме два отворени модела за вземане на решения от нашето семейство модели за решения d1: d1-3B и d1-omni-600M (експериментален).
  • Най-добрият модел за вземане на решения под 10B в Decision Index 0.2.1: d1-3B получава 48.57 точки, изпреварвайки всеки модел с 4B и 9B параметъра, както и Decider 35B-A3B (47.11).
  • Мултимодален: d1-3B поддържа текст и изображения, докато d1-omni-600M поддържа текст и изображения или текст и аудио
  • Бърз: d1-3B отговаря на въпрос за 16 ms на NVIDIA Jetson AGX Thor, 26 ms на Jetson AGX Orin и 50 ms на Jetson Orin Nano

Как създадохме модели за вземане на решения за периферни устройства

Тези отворени модели за вземане на решения d1 са изградени върху нашите Liquid Foundation Models (LFM). За разлика от генеративните ни модели, моделите за вземане на решения не генерират токени, а отговарят с един-единствен проход напред.

d1-3B и d1-omni-600M са обучени от две много различни базови архитектури:

  • d1-3B е обучен от LFM2.5-VL-3B, най-новия ни VLM, който е само декодер. Приема текст и изображения като вход.
  • d1-omni-600M е обучен от LFM2.5-Encoder-350M, двупосочен енкодер. Добавя енкодери за изображения и аудио, за да обработва и трите модалности. Приема като вход или текст и изображение, или текст и аудио. Този модел в момента е в ранен изследователски етап и продължава да се разработва.

Резултати от бенчмарковете

Тествахме d1-3B и d1-omni-600M върху седем публични набора от данни, обхващащи разбиране на прочетен текст, откриване на токсичност, класификация на намерения, медицински въпроси и отговори и междуезиково разбиране. d1-3B постига среден резултат 82.9 — най-високия в таблицата и по-висок от този на Decider 4B. d1-omni-600M получава 78.4 точки, надминавайки Decider 2B (77.1) само с една четвърт от параметрите.

Бенчмарк d1-omni-600M d1-3B Decider 2B Decider 4B
SQuAD 2.0 74.0 83.3 67.7 76.0
Civil Comments 95.8 93.3 93.6 92.8
MASSIVE intent 86.1 86.9 81.1 88.3
PubMedQA 61.3 68.3 65.7 63.3
BoolQ 77.7 86.3 87.3 89.0
XNLI 74.7 85.6 85.0 88.6
PAWS-X 79.5 76.4 59.5 69.8
Средно 78.4 82.9 77.1 81.1

Потвърдихме, че d1-3B запазва способностите за работа с изображения на своята базова архитектура LFM2.5-VL-3B при стандартни бенчмаркове за изображения и че d1-omni-600M обработва и трите модалности. Не представяме бенчмаркове за изображения или аудио, тъй като Decision Index v0.3 включва само частен набор за изображения, а бенчмарковете за вземане на решения от аудио в момента са нерешен проблем.

Скорост

В сътрудничество с NVIDIA оценихме d1-3B върху стека на NVIDIA с NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Тъй като d1-omni-600M е ранен изследователски модел, в тази версия не представяме данни за скоростта му.

Изводи на периферни устройства. d1-3B отговаря на един въпрос за под 50 ms на всяко измерено устройство. Три въпроса отнемат само 1,3 пъти повече време от един, като при AGX Thor времето се увеличава от 16 ms на 20 ms.

Един въпрос 3 въпроса Състояние с 3,4K токена Изображение 384 px 64 състояния, пакетирани
Apple M5 Pro 30 ms 41 ms 640 ms 62 ms 78 / s
Jetson AGX Thor 16 ms 20 ms 220 ms 35 ms 262 / s
Jetson AGX Orin 64 GB 26 ms 35 ms 560 ms 83 ms 110 / s
Jetson Orin Nano 50 ms 73 ms 1,640 ms 202 ms 38 / s

GPU инференс. На GPU d1-3B отговаря на въпрос за под 10 ms и обработва изображение с размер 384 px за под 18 ms и на двете платформи.

Един въпрос 3 въпроса Състояние с 3,4K токена Изображение 384 px 64 състояния, пакетирани
NVIDIA RTX 4090 8 ms 21 ms 102 ms 17 ms 475 / s
AMD MI325X 9 ms 14 ms 44 ms 18 ms 1,106 / s

Как да използвате отворените модели за вземане на решения d1

Използвайте моделите за вземане на решения d1, когато се нуждаете от бързи, структурирани решения, включително при мултимодални входни данни. d1-3B осигурява най-високото качество на решенията за своя размер, докато d1-omni-600M е подходящ там, където размерът на модела е от значение.

Инсталирайте зависимостите (изисква transformers>=5.14):

pip install "transformers>=5.14" torch torchvision pillow

Тези модели включват собствен код, затова ги заредете с trust_remote_code=True:

import io
import urllib.request

import torch
from PIL import Image
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
                                  dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)


questions = {
    "refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
    "team": {"type": "choice", "instructions": "Which team should handle this?",
             "criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
                          "fraud": "Suspected unauthorised use"}},
    "urgency": {"type": "score", "instructions": "How urgent is this?",
                "criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))


url = "http://images.cocodataset.org/val2017/000000039769.jpg"  
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
                                       "criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
                       images=[photo]))


tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))

За краткост включваме само примера за d1-3B. Вижте картата на модела d1-omni-600M за инструкции как да го стартирате.

Започнете с отворените модели за вземане на решения d1

И двата модела за вземане на решения са с отворени тегла и са налични днес в Hugging Face:

Нямаме търпение да видим какво ще създадете.

Цитиране

Ако използвате тази работа, моля, цитирайте блога за изданието:

@article{liquidAI2026opend1,
  author  = {Liquid AI},
  title   = {Open d1: Edge decision models for text, vision, and audio},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/open-d1},
}

Модели, споменати в тази статия 3

Пространства, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 3

Пространства, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини