Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Мультимодальные открытые d1-модели принятия решений для периферии

Мультимодальные открытые модели принятия решений d1 для периферийных устройств
Команда Статья
Опубликовано 7 октября 2026 года
Сегодня мы выпускаем две открытые модели принятия решений из нашего семейства моделей принятия решений d1: d1-3B и d1-omni-600M (экспериментальная).
  • Лучшая модель принятия решений до 10B в Decision Index 0.2.1: d1-3B набирает 48,57 балла, опережая все модели 4B и 9B, а также Decider 35B-A3B (47,11).
  • Мультимодальность: d1-3B поддерживает текст и изображения, тогда как d1-omni-600M поддерживает текст и изображения либо текст и аудио
  • Высокая скорость: d1-3B отвечает на вопрос за 16 мс на NVIDIA Jetson AGX Thor, 26 мс на Jetson AGX Orin и 50 мс на Jetson Orin Nano

Как мы создали модели принятия решений для периферийных устройств

Эти открытые модели принятия решений d1 построены на основе наших Liquid Foundation Models (LFM). В отличие от генеративных моделей, модели принятия решений не генерируют токены, а отвечают за один прямой проход.

d1-3B и d1-omni-600M обучены на двух совершенно разных базовых моделях:

  • d1-3B обучена на основе LFM2.5-VL-3B, нашей новейшей VLM с архитектурой только декодера. Она принимает на вход текст и изображения.
  • d1-omni-600M обучена на основе LFM2.5-Encoder-350M, двунаправленного энкодера. Для работы со всеми тремя модальностями в неё добавлены энкодеры зрения и аудио. Она принимает либо текст и изображение, либо текст и аудио. В настоящее время эта модель находится на ранней исследовательской стадии выпуска и продолжает развиваться.

Результаты бенчмарков

Мы протестировали d1-3B и d1-omni-600M на семи общедоступных наборах данных, охватывающих понимание прочитанного, выявление токсичности, классификацию намерений, медицинские вопросы и ответы, а также кросс-лингвистическое понимание. Средний результат d1-3B составляет 82,9 — это самый высокий показатель в таблице, выше, чем у Decider 4B. d1-omni-600M набирает 78,4, превосходя Decider 2B (77,1) при всего четверти числа параметров.

Бенчмарк d1-omni-600M d1-3B Decider 2B Decider 4B
SQuAD 2.0 74,0 83,3 67,7 76,0
Civil Comments 95,8 93,3 93,6 92,8
MASSIVE intent 86,1 86,9 81,1 88,3
PubMedQA 61,3 68,3 65,7 63,3
BoolQ 77,7 86,3 87,3 89,0
XNLI 74,7 85,6 85,0 88,6
PAWS-X 79,5 76,4 59,5 69,8
Среднее 78,4 82,9 77,1 81,1

Мы подтвердили, что d1-3B сохраняет возможности работы с изображениями своей базовой модели LFM2.5-VL-3B на стандартных бенчмарках компьютерного зрения, а d1-omni-600M работает со всеми тремя модальностями. Мы не приводим результаты тестов для зрения и аудио, поскольку Decision Index v0.3 включает только закрытую часть для зрения, а бенчмарки принятия решений для аудио пока остаются нерешённой задачей.

Скорость

В сотрудничестве с NVIDIA мы оценили d1-3B на стеке NVIDIA с использованием NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Поскольку d1-omni-600M находится на ранней исследовательской стадии выпуска, в этой публикации мы не приводим показатели её скорости.

Вывод на периферийных устройствах. d1-3B отвечает на один вопрос менее чем за 50 мс на каждом измеренном устройстве. Обработка трёх вопросов занимает лишь в 1,3 раза больше времени, чем одного: на AGX Thor время увеличивается с 16 до 20 мс.

Один вопрос 3 вопроса Состояние на 3,4 тыс. токенов Изображение 384 пикс. 64 состояния, упакованные
Apple M5 Pro 30 мс 41 мс 640 мс 62 мс 78 / с
Jetson AGX Thor 16 мс 20 мс 220 мс 35 мс 262 / с
Jetson AGX Orin 64 GB 26 мс 35 мс 560 мс 83 мс 110 / с
Jetson Orin Nano 50 мс 73 мс 1 640 мс 202 мс 38 / с

Вывод на GPU. На GPU d1-3B отвечает на вопрос менее чем за 10 мс и обрабатывает изображение 384 пикселя менее чем за 18 мс на обеих платформах.

Один вопрос 3 вопроса Состояние на 3,4 тыс. токенов Изображение 384 пикс. 64 состояния, упакованные
NVIDIA RTX 4090 8 мс 21 мс 102 мс 17 мс 475 / с
AMD MI325X 9 мс 14 мс 44 мс 18 мс 1 106 / с

Как использовать открытые модели принятия решений d1

Используйте модели принятия решений d1, когда вам нужны быстрые структурированные решения, в том числе для мультимодальных входных данных. d1-3B обеспечивает высочайшее качество решений для своего размера, а d1-omni-600M подходит там, где важен компактный размер.

Установите зависимости (требуется transformers>=5.14):

pip install "transformers>=5.14" torch torchvision pillow

Эти модели содержат собственный код, поэтому загружайте их с параметром trust_remote_code=True:

import io
import urllib.request

import torch
from PIL import Image
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
                                  dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)


questions = {
    "refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
    "team": {"type": "choice", "instructions": "Which team should handle this?",
             "criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
                          "fraud": "Suspected unauthorised use"}},
    "urgency": {"type": "score", "instructions": "How urgent is this?",
                "criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))


url = "http://images.cocodataset.org/val2017/000000039769.jpg"  
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
                                       "criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
                       images=[photo]))


tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))

Для краткости мы приводим только пример для d1-3B. Инструкции по запуску d1-omni-600M см. в карточке модели d1-omni-600M.

Начало работы с открытыми моделями принятия решений d1

Обе модели принятия решений имеют открытые веса и уже доступны на Hugging Face:

  • Скачать: d1-3B и d1-omni-600M на Hugging Face.
  • Попробовать: запустите демонстрации в нашем пространстве Hugging Face System One Arcade.

Нам не терпится увидеть, что вы создадите.

Цитирование

Если вы используете эту работу, пожалуйста, процитируйте публикацию о выпуске:

@article{liquidAI2026opend1,
  author  = {Liquid AI},
  title   = {Open d1: Edge decision models for text, vision, and audio},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/open-d1},
}

Модели, упомянутые в этой статье 3

Пространства, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 3

Пространства, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости