Что такое Decision 3.0? Новые открытые модели принятия решений от vLLM Semantic Router
Команда vLLM Semantic Router выпустила Decision 3.0 — семейство мультимодальных моделей принятия решений. Мультимодальные модели принятия решений Decision 3.0 обрабатывают текст, JSON и изображения, а затем отвечают на типизированные вопросы о них. Доступно 5 размеров — от 0.8B до 27B, все под лицензией Apache-2.0. Для разработчиков это быстрый способ классифицировать, маршрутизировать и фильтровать запросы без разбора сгенерированного текста.
Кратко
- Размер: 5 моделей: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B), d3 (26.09B). Длина контекста: не раскрыта.
- Работает на: задержка измерена на 1 GPU AMD Instinct MI325X. Веса BF16; официальные квантованные варианты не указаны.
- Производительность: 27B-модель d3 возглавляет обе таблицы — текстовую и визуальную — в своей карточке, однако оценки получены во время внутреннего тестирования.
- Лучший результат: 97.7 на KIE (CORD+FUNSD) при извлечении данных из документов (d3).
- Худший результат: 34.1 на R-Bench-M (d3).
- Итог:
- Лучшее: модель 9B теперь превосходит модель предыдущего поколения 27B.
- Худшее: оценки предоставлены самой командой и сопоставлены с актуальными данными таблицы лидеров.
Что такое Decision 3.0?
Decision 3.0 — это набор открытых моделей принятия решений от vLLM Semantic Router, которые возвращают вероятности вместо текста. Вы передаёте состояние (текст или JSON), необязательные изображения и именованные вопросы. Каждый вопрос может быть вопросом с вариантами ответа, вопросом «Да/Нет» или оценкой по шкале. Модель отвечает на все вопросы за один вызов и возвращает вероятность каждого ответа.
Это паттерн «системы 1» для маршрутизаторов и защитных механизмов. Вместо того чтобы просить LLM и разбирать её вывод, вы получаете калиброванные оценки, для которых можно задать порог.
Как работает d3?
Каждая модель представляет собой дообученную версию базовой модели Qwen. Модель d3 27B построена на основе Qwen3.8-27B. Четыре меньшие модели построены на чекпойнтах Qwen3.5 размером 0.8B, 2B, 4B и 9B.
Каждая версия оснащена визуальным энкодером: 0.10B у d3-lite, 0.33B у d3-nano и d3-mini, а также 0.46B у d3-flash и d3. Запросы могут содержать несколько изображений в форматах PNG, JPEG или WebP, каждое из которых обрабатывается с разрешением до 1.6 мегапикселя. Каждый вопрос видит все изображения.
Для каждого вопроса выполняется отдельный прямой проход по входным данным. Для установки требуется transformers==5.17.0, а дополнительный пакет flash-linear-attention ускоряет слои с линейным вниманием. Для загрузки необходимо указать trust_remote_code=True.
Как Decision 3.0 показывает себя в бенчмарках?
В карточке модели исследовательская команда указывает Jev Decision Index 0.3.1 — таблицу лидеров, в которой ранжируются открытые воспроизведения системы принятия решений Jev от TypeSafe. Показатели d3 получены в ходе внутренней оценки команды.
В текстовой категории d3 набирает 64.1, опережая Perplexity Decider v1.1 (62.8) и Jev (60.1). Есть одна оговорка: Torchcast Decision 27B показывает более высокий результат в публичном наборе (65.1 против 64.9). В визуальной категории d3 набирает 71.6 против 70.6 у Perplexity Decider v1.1.
Наиболее впечатляющая часть — результаты моделей разных размеров. d3-flash (9B) набирает 59.0, опережая 27B Decision 2.0 с результатом 55.9. В публичном наборе прирост относительно Decision 2.0 составляет от +8.0 (27B) до +15.1 (0.8B).
Однако лидерство в категориях распределено неравномерно:
- d3-mini (4B) и d3-flash (9B) возглавляют как свои текстовые, так и визуальные таблицы.
- d3-lite (0.8B) лидирует в текстовой категории, но занимает 3-е место в визуальной (41.1, уступая JPT-0.8B с результатом 42.1).
- d3-nano (2B) возглавляет свою визуальную таблицу, но уступает LiquidAI d1-3B в текстовой категории (35.8 против 40.1).
В публичных визуальных задачах d3 набирает 97.3 на InfographicVQA и 89.9 на Mind2Web — оба показателя относятся к приблизительно воссозданным тестам. Модель слабее справляется с визуальной частью MMMU-Pro (46.2) и модерацией Hateful Memes (44.6).
Насколько быстры эти модели?
Приведённые ниже медианные значения получены для 1 запроса за раз на 1 AMD Instinct MI325X, согласно данным каждой карточки:
- d3-nano: 21.7 мс для текста, 92.0 мс с изображением
- d3-lite: 23.5 мс для текста, 60.7 мс с изображением
- d3-mini: 28.5 мс для текста, 115.0 мс с изображением
- d3-flash: 29.7 мс для текста, 171.8 мс с изображением
- d3: 84 мс для текста, 342 мс с изображением
Все модели обучались на GPU AMD Instinct MI325X.
Как d3 сравнивается с другими моделями принятия решений?
| Характеристика | d3 (vLLM SR) | Perplexity Decider v1.1 | Decision 2.0 Vega-27B | LiquidAI d1-3B |
|---|---|---|---|---|
| Параметры | 26.09B | 26B (указано на HF) | 29.37B | 3.12B |
| Базовая модель | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-27B | LFM2.5-VL-3B |
| Входные данные | Текст, JSON, изображения | Текст, изображения | Текст, JSON | Текст, JSON, изображения |
| Контекст | Не раскрыт | 8 192 токена на решение | 32 768 токенов | 32 768 токенов |
| Лицензия | Apache-2.0 | Apache-2.0 | Apache-2.0 | LFM 1.0 |
| Decision Index (собственная карточка) | 64.1 (v0.3.1, внутренний) | 61.56 (версия не указана) | 56.5 (v0.2.1) | 48.57 (v0.2.1) |
| Таблица Index 0.3.1 (по карточкам d3) | 64.1 | 62.8 | 55.9 | 40.1 |
| Визуальная таблица 0.3.1 | 71.6 | 70.6 | Не раскрыто (только текст) | Не раскрыто |
| Медианная задержка (собственная карточка) | 84 мс для текста, 1 MI325X | Не раскрыто | 71.4 мс, 1 GPU | 9 мс, 1 MI325X |
Основные выводы
- 5 моделей принятия решений под лицензией Apache-2.0, от 0.8B до 27B, все поддерживают ввод изображений.
- d3 (27B) возглавляет свои текстовую (64.1) и визуальную (71.6) таблицы по результатам внутреннего тестирования.
- d3-flash 9B (59.0) превосходит 27B Decision 2.0 (55.9).
- Модели 0.8B и 2B не лидируют во всех таблицах.
- Медианная задержка для текста составляет от 21.7 до 84 мс на 1 MI325X.
Ознакомьтесь с коллекцией на Hugging Face, карточкой модели d3 и репозиторием vLLM Semantic Router на GitHub. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.