Що таке Decision 3.0? Нові відкриті моделі ухвалення рішень від vLLM Semantic Router
Команда vLLM Semantic Router випустила Decision 3.0 — сімейство мультимодальних моделей прийняття рішень. Мультимодальні моделі прийняття рішень Decision 3.0 читають текст, JSON і зображення, а потім відповідають на типізовані запитання щодо них. Доступно 5 розмірів — від 0.8B до 27B, усі за ліцензією Apache-2.0. Для розробників це швидкий спосіб класифікувати, маршрутизувати та фільтрувати запити без аналізу згенерованого тексту.
Коротко
- Розмір: 5 моделей: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B), d3 (26.09B). Довжину контексту не розкрито.
- Працює на: затримку виміряно на 1 графічному процесорі AMD Instinct MI325X. Ваги BF16; офіційних квантизованих варіантів не зазначено.
- Продуктивність: модель d3 на 27B очолює таблиці як для тексту, так і для зображень у своїй картці, але за результатами внутрішнього оцінювання.
- Найкращий результат: 97.7 на KIE (CORD+FUNSD) для вилучення даних із документів (d3).
- Найгірший результат: 34.1 на R-Bench-M (d3).
- Підсумок:
- Найкраще: модель на 9B тепер перевершує модель попереднього покоління на 27B.
- Найгірше: результати самостійно заявлені порівняно з актуальними даними таблиць лідерів.
Що таке Decision 3.0?
Decision 3.0 — це набір відкритих моделей прийняття рішень від vLLM Semantic Router, які повертають імовірності замість тексту. Ви передаєте стан (текст або JSON), необов’язкові зображення та іменовані запитання. Кожне запитання є варіантом вибору, запитанням «Так/Ні» або оцінкою за шкалою. Модель відповідає на всі запитання за один виклик і повертає ймовірність для кожної відповіді.
Це патерн «системи один» для маршрутизаторів і захисних механізмів. Замість того щоб формувати запит до LLM і аналізувати її відповідь, ви отримуєте калібровані оцінки, для яких можна встановлювати пороги.
Як працює d3?
Кожна модель є донавченою версією базової моделі Qwen. Модель d3 на 27B побудована на основі Qwen3.8-27B. Менші 4 моделі побудовані на контрольних точках Qwen3.5 розміром 0.8B, 2B, 4B і 9B.
Кожен розмір має візуальний енкодер: 0.10B у d3-lite, 0.33B у d3-nano та d3-mini, і 0.46B у d3-flash та d3. Запити приймають кілька зображень у форматах PNG, JPEG або WebP, кожне з яких обробляється з роздільністю до 1.6 мегапікселя. Кожне запитання бачить усі зображення.
Для кожного запитання виконується окремий прямий прохід над вхідними даними. Для встановлення потрібен transformers==5.17.0, а додатковий пакет flash-linear-attention пришвидшує шари лінійної уваги. Для завантаження потрібно вказати trust_remote_code=True.
Як Decision 3.0 показує себе в бенчмарках?
У картці моделі дослідницька команда зазначає Jev Decision Index 0.3.1 — таблицю, що ранжує відкриті відтворення системи прийняття рішень Jev від TypeSafe. Показники d3 є результатами внутрішнього оцінювання команди.
У текстовій категорії d3 набирає 64.1, випереджаючи Perplexity Decider v1.1 (62.8) і Jev (60.1). Є один нюанс: Torchcast Decision 27B має вищий результат у відкритому наборі (65.1 проти 64.9). У таблиці для зображень d3 набирає 71.6 проти 70.6 у Perplexity Decider v1.1.
Найсильнішою частиною є залежність результатів від розміру. d3-flash (9B) набирає 59.0, перевершуючи 27B Decision 2.0 із результатом 55.9. У відкритому наборі перевага над Decision 2.0 становить від +8.0 (27B) до +15.1 (0.8B).
Однак лідерство в окремих класах не є однорідним:
- d3-mini (4B) і d3-flash (9B) очолюють як свої текстові таблиці, так і таблиці для зображень.
- d3-lite (0.8B) очолює текстову категорію, але посідає 3-тє місце в категорії зображень (41.1, позаду JPT-0.8B із результатом 42.1).
- d3-nano (2B) очолює свою таблицю для зображень, але поступається LiquidAI d1-3B у текстовій категорії (35.8 проти 40.1).
У відкритих завданнях із зображеннями d3 набирає 97.3 на InfographicVQA і 89.9 на Mind2Web — обидва є приблизними відтвореннями. Модель слабша на MMMU-Pro vision (46.2) і в модерації Hateful Memes (44.6).
Наскільки швидкі ці моделі?
Наведені нижче медіанні значення стосуються 1 запиту за раз на 1 AMD Instinct MI325X, згідно з кожною карткою:
- d3-nano: 21.7 мс для тексту, 92.0 мс із зображенням
- d3-lite: 23.5 мс для тексту, 60.7 мс із зображенням
- d3-mini: 28.5 мс для тексту, 115.0 мс із зображенням
- d3-flash: 29.7 мс для тексту, 171.8 мс із зображенням
- d3: 84 мс для тексту, 342 мс із зображенням
Усі моделі навчалися на графічних процесорах AMD Instinct MI325X.
Як d3 порівнюється з іншими моделями прийняття рішень?
| Характеристика | d3 (vLLM SR) | Perplexity Decider v1.1 | Decision 2.0 Vega-27B | LiquidAI d1-3B |
|---|---|---|---|---|
| Параметри | 26.09B | 26B (зазначено на HF) | 29.37B | 3.12B |
| Базова модель | Qwen3.8-27B | Qwen3.8-27B | Qwen3.8-27B | LFM2.5-VL-3B |
| Вхідні дані | Текст, JSON, зображення | Текст, зображення | Текст, JSON | Текст, JSON, зображення |
| Контекст | Не розкрито | 8,192 токенів на рішення | 32,768 токенів | 32,768 токенів |
| Ліцензія | Apache-2.0 | Apache-2.0 | Apache-2.0 | LFM 1.0 |
| Decision Index (власна картка) | 64.1 (v0.3.1, внутрішній) | 61.56 (версію не зазначено) | 56.5 (v0.2.1) | 48.57 (v0.2.1) |
| Таблиця Index 0.3.1 (за картками d3) | 64.1 | 62.8 | 55.9 | 40.1 |
| Таблиця vision 0.3.1 | 71.6 | 70.6 | Не розкрито (лише текст) | Не розкрито |
| Медіанна затримка (власна картка) | 84 мс для тексту, 1 MI325X | Не розкрито | 71.4 мс, 1 GPU | 9 мс, 1 MI325X |
Ключові висновки
- 5 моделей прийняття рішень за ліцензією Apache-2.0, від 0.8B до 27B, усі з підтримкою введення зображень.
- d3 (27B) очолює свої таблиці для тексту (64.1) і зображень (71.6) за результатами внутрішнього оцінювання.
- d3-flash на 9B (59.0) перевершує Decision 2.0 на 27B (55.9).
- Моделі на 0.8B і 2B не очолюють усі таблиці.
- Медіанна затримка для тексту становить від 21.7 до 84 мс на 1 MI325X.
Перегляньте колекцію на Hugging Face, картку моделі d3 та репозиторій vLLM Semantic Router на GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.