Sakhanda Wire
NVDA $229.28 -0.52% MSFT $535.07 +2.38% GOOGL $351.66 +0.97% META $718.67 -0.31% AMZN $262.43 +3.29%
← К новостям

Что такое Decision 3.0? Новые открытые модели принятия решений от vLLM Semantic Router

Команда vLLM Semantic Router выпустила Decision 3.0 — семейство мультимодальных моделей принятия решений. Мультимодальные модели принятия решений Decision 3.0 обрабатывают текст, JSON и изображения, а затем отвечают на типизированные вопросы о них. Доступно 5 размеров — от 0.8B до 27B, все под лицензией Apache-2.0. Для разработчиков это быстрый способ классифицировать, маршрутизировать и фильтровать запросы без разбора сгенерированного текста.

Кратко

  • Размер: 5 моделей: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B), d3 (26.09B). Длина контекста: не раскрыта.
  • Работает на: задержка измерена на 1 GPU AMD Instinct MI325X. Веса BF16; официальные квантованные варианты не указаны.
  • Производительность: 27B-модель d3 возглавляет обе таблицы — текстовую и визуальную — в своей карточке, однако оценки получены во время внутреннего тестирования.
  • Лучший результат: 97.7 на KIE (CORD+FUNSD) при извлечении данных из документов (d3).
  • Худший результат: 34.1 на R-Bench-M (d3).
  • Итог:
    • Лучшее: модель 9B теперь превосходит модель предыдущего поколения 27B.
    • Худшее: оценки предоставлены самой командой и сопоставлены с актуальными данными таблицы лидеров.

Что такое Decision 3.0?

Decision 3.0 — это набор открытых моделей принятия решений от vLLM Semantic Router, которые возвращают вероятности вместо текста. Вы передаёте состояние (текст или JSON), необязательные изображения и именованные вопросы. Каждый вопрос может быть вопросом с вариантами ответа, вопросом «Да/Нет» или оценкой по шкале. Модель отвечает на все вопросы за один вызов и возвращает вероятность каждого ответа.

Это паттерн «системы 1» для маршрутизаторов и защитных механизмов. Вместо того чтобы просить LLM и разбирать её вывод, вы получаете калиброванные оценки, для которых можно задать порог.

Как работает d3?

Каждая модель представляет собой дообученную версию базовой модели Qwen. Модель d3 27B построена на основе Qwen3.8-27B. Четыре меньшие модели построены на чекпойнтах Qwen3.5 размером 0.8B, 2B, 4B и 9B.

Каждая версия оснащена визуальным энкодером: 0.10B у d3-lite, 0.33B у d3-nano и d3-mini, а также 0.46B у d3-flash и d3. Запросы могут содержать несколько изображений в форматах PNG, JPEG или WebP, каждое из которых обрабатывается с разрешением до 1.6 мегапикселя. Каждый вопрос видит все изображения.

Для каждого вопроса выполняется отдельный прямой проход по входным данным. Для установки требуется transformers==5.17.0, а дополнительный пакет flash-linear-attention ускоряет слои с линейным вниманием. Для загрузки необходимо указать trust_remote_code=True.

Как Decision 3.0 показывает себя в бенчмарках?

В карточке модели исследовательская команда указывает Jev Decision Index 0.3.1 — таблицу лидеров, в которой ранжируются открытые воспроизведения системы принятия решений Jev от TypeSafe. Показатели d3 получены в ходе внутренней оценки команды.

В текстовой категории d3 набирает 64.1, опережая Perplexity Decider v1.1 (62.8) и Jev (60.1). Есть одна оговорка: Torchcast Decision 27B показывает более высокий результат в публичном наборе (65.1 против 64.9). В визуальной категории d3 набирает 71.6 против 70.6 у Perplexity Decider v1.1.

Наиболее впечатляющая часть — результаты моделей разных размеров. d3-flash (9B) набирает 59.0, опережая 27B Decision 2.0 с результатом 55.9. В публичном наборе прирост относительно Decision 2.0 составляет от +8.0 (27B) до +15.1 (0.8B).

Однако лидерство в категориях распределено неравномерно:

  • d3-mini (4B) и d3-flash (9B) возглавляют как свои текстовые, так и визуальные таблицы.
  • d3-lite (0.8B) лидирует в текстовой категории, но занимает 3-е место в визуальной (41.1, уступая JPT-0.8B с результатом 42.1).
  • d3-nano (2B) возглавляет свою визуальную таблицу, но уступает LiquidAI d1-3B в текстовой категории (35.8 против 40.1).

В публичных визуальных задачах d3 набирает 97.3 на InfographicVQA и 89.9 на Mind2Web — оба показателя относятся к приблизительно воссозданным тестам. Модель слабее справляется с визуальной частью MMMU-Pro (46.2) и модерацией Hateful Memes (44.6).

Насколько быстры эти модели?

Приведённые ниже медианные значения получены для 1 запроса за раз на 1 AMD Instinct MI325X, согласно данным каждой карточки:

  • d3-nano: 21.7 мс для текста, 92.0 мс с изображением
  • d3-lite: 23.5 мс для текста, 60.7 мс с изображением
  • d3-mini: 28.5 мс для текста, 115.0 мс с изображением
  • d3-flash: 29.7 мс для текста, 171.8 мс с изображением
  • d3: 84 мс для текста, 342 мс с изображением

Все модели обучались на GPU AMD Instinct MI325X.

Как d3 сравнивается с другими моделями принятия решений?

Характеристикаd3 (vLLM SR)Perplexity Decider v1.1Decision 2.0 Vega-27BLiquidAI d1-3B
Параметры26.09B26B (указано на HF)29.37B3.12B
Базовая модельQwen3.8-27BQwen3.8-27BQwen3.8-27BLFM2.5-VL-3B
Входные данныеТекст, JSON, изображенияТекст, изображенияТекст, JSONТекст, JSON, изображения
КонтекстНе раскрыт8 192 токена на решение32 768 токенов32 768 токенов
ЛицензияApache-2.0Apache-2.0Apache-2.0LFM 1.0
Decision Index (собственная карточка)64.1 (v0.3.1, внутренний)61.56 (версия не указана)56.5 (v0.2.1)48.57 (v0.2.1)
Таблица Index 0.3.1 (по карточкам d3)64.162.855.940.1
Визуальная таблица 0.3.171.670.6Не раскрыто (только текст)Не раскрыто
Медианная задержка (собственная карточка)84 мс для текста, 1 MI325XНе раскрыто71.4 мс, 1 GPU9 мс, 1 MI325X

Основные выводы

  • 5 моделей принятия решений под лицензией Apache-2.0, от 0.8B до 27B, все поддерживают ввод изображений.
  • d3 (27B) возглавляет свои текстовую (64.1) и визуальную (71.6) таблицы по результатам внутреннего тестирования.
  • d3-flash 9B (59.0) превосходит 27B Decision 2.0 (55.9).
  • Модели 0.8B и 2B не лидируют во всех таблицах.
  • Медианная задержка для текста составляет от 21.7 до 84 мс на 1 MI325X.

Ознакомьтесь с коллекцией на Hugging Face, карточкой модели d3 и репозиторием vLLM Semantic Router на GitHub. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости