Sakhanda Wire
NVDA $229.28 -0.52% MSFT $535.07 +2.38% GOOGL $351.66 +0.97% META $718.67 -0.31% AMZN $262.43 +3.29%
← До новин

Що таке Decision 3.0? Нові відкриті моделі ухвалення рішень від vLLM Semantic Router

Команда vLLM Semantic Router випустила Decision 3.0 — сімейство мультимодальних моделей прийняття рішень. Мультимодальні моделі прийняття рішень Decision 3.0 читають текст, JSON і зображення, а потім відповідають на типізовані запитання щодо них. Доступно 5 розмірів — від 0.8B до 27B, усі за ліцензією Apache-2.0. Для розробників це швидкий спосіб класифікувати, маршрутизувати та фільтрувати запити без аналізу згенерованого тексту.

Коротко

  • Розмір: 5 моделей: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B), d3 (26.09B). Довжину контексту не розкрито.
  • Працює на: затримку виміряно на 1 графічному процесорі AMD Instinct MI325X. Ваги BF16; офіційних квантизованих варіантів не зазначено.
  • Продуктивність: модель d3 на 27B очолює таблиці як для тексту, так і для зображень у своїй картці, але за результатами внутрішнього оцінювання.
  • Найкращий результат: 97.7 на KIE (CORD+FUNSD) для вилучення даних із документів (d3).
  • Найгірший результат: 34.1 на R-Bench-M (d3).
  • Підсумок:
    • Найкраще: модель на 9B тепер перевершує модель попереднього покоління на 27B.
    • Найгірше: результати самостійно заявлені порівняно з актуальними даними таблиць лідерів.

Що таке Decision 3.0?

Decision 3.0 — це набір відкритих моделей прийняття рішень від vLLM Semantic Router, які повертають імовірності замість тексту. Ви передаєте стан (текст або JSON), необов’язкові зображення та іменовані запитання. Кожне запитання є варіантом вибору, запитанням «Так/Ні» або оцінкою за шкалою. Модель відповідає на всі запитання за один виклик і повертає ймовірність для кожної відповіді.

Це патерн «системи один» для маршрутизаторів і захисних механізмів. Замість того щоб формувати запит до LLM і аналізувати її відповідь, ви отримуєте калібровані оцінки, для яких можна встановлювати пороги.

Як працює d3?

Кожна модель є донавченою версією базової моделі Qwen. Модель d3 на 27B побудована на основі Qwen3.8-27B. Менші 4 моделі побудовані на контрольних точках Qwen3.5 розміром 0.8B, 2B, 4B і 9B.

Кожен розмір має візуальний енкодер: 0.10B у d3-lite, 0.33B у d3-nano та d3-mini, і 0.46B у d3-flash та d3. Запити приймають кілька зображень у форматах PNG, JPEG або WebP, кожне з яких обробляється з роздільністю до 1.6 мегапікселя. Кожне запитання бачить усі зображення.

Для кожного запитання виконується окремий прямий прохід над вхідними даними. Для встановлення потрібен transformers==5.17.0, а додатковий пакет flash-linear-attention пришвидшує шари лінійної уваги. Для завантаження потрібно вказати trust_remote_code=True.

Як Decision 3.0 показує себе в бенчмарках?

У картці моделі дослідницька команда зазначає Jev Decision Index 0.3.1 — таблицю, що ранжує відкриті відтворення системи прийняття рішень Jev від TypeSafe. Показники d3 є результатами внутрішнього оцінювання команди.

У текстовій категорії d3 набирає 64.1, випереджаючи Perplexity Decider v1.1 (62.8) і Jev (60.1). Є один нюанс: Torchcast Decision 27B має вищий результат у відкритому наборі (65.1 проти 64.9). У таблиці для зображень d3 набирає 71.6 проти 70.6 у Perplexity Decider v1.1.

Найсильнішою частиною є залежність результатів від розміру. d3-flash (9B) набирає 59.0, перевершуючи 27B Decision 2.0 із результатом 55.9. У відкритому наборі перевага над Decision 2.0 становить від +8.0 (27B) до +15.1 (0.8B).

Однак лідерство в окремих класах не є однорідним:

  • d3-mini (4B) і d3-flash (9B) очолюють як свої текстові таблиці, так і таблиці для зображень.
  • d3-lite (0.8B) очолює текстову категорію, але посідає 3-тє місце в категорії зображень (41.1, позаду JPT-0.8B із результатом 42.1).
  • d3-nano (2B) очолює свою таблицю для зображень, але поступається LiquidAI d1-3B у текстовій категорії (35.8 проти 40.1).

У відкритих завданнях із зображеннями d3 набирає 97.3 на InfographicVQA і 89.9 на Mind2Web — обидва є приблизними відтвореннями. Модель слабша на MMMU-Pro vision (46.2) і в модерації Hateful Memes (44.6).

Наскільки швидкі ці моделі?

Наведені нижче медіанні значення стосуються 1 запиту за раз на 1 AMD Instinct MI325X, згідно з кожною карткою:

  • d3-nano: 21.7 мс для тексту, 92.0 мс із зображенням
  • d3-lite: 23.5 мс для тексту, 60.7 мс із зображенням
  • d3-mini: 28.5 мс для тексту, 115.0 мс із зображенням
  • d3-flash: 29.7 мс для тексту, 171.8 мс із зображенням
  • d3: 84 мс для тексту, 342 мс із зображенням

Усі моделі навчалися на графічних процесорах AMD Instinct MI325X.

Як d3 порівнюється з іншими моделями прийняття рішень?

Характеристикаd3 (vLLM SR)Perplexity Decider v1.1Decision 2.0 Vega-27BLiquidAI d1-3B
Параметри26.09B26B (зазначено на HF)29.37B3.12B
Базова модельQwen3.8-27BQwen3.8-27BQwen3.8-27BLFM2.5-VL-3B
Вхідні даніТекст, JSON, зображенняТекст, зображенняТекст, JSONТекст, JSON, зображення
КонтекстНе розкрито8,192 токенів на рішення32,768 токенів32,768 токенів
ЛіцензіяApache-2.0Apache-2.0Apache-2.0LFM 1.0
Decision Index (власна картка)64.1 (v0.3.1, внутрішній)61.56 (версію не зазначено)56.5 (v0.2.1)48.57 (v0.2.1)
Таблиця Index 0.3.1 (за картками d3)64.162.855.940.1
Таблиця vision 0.3.171.670.6Не розкрито (лише текст)Не розкрито
Медіанна затримка (власна картка)84 мс для тексту, 1 MI325XНе розкрито71.4 мс, 1 GPU9 мс, 1 MI325X

Ключові висновки

  • 5 моделей прийняття рішень за ліцензією Apache-2.0, від 0.8B до 27B, усі з підтримкою введення зображень.
  • d3 (27B) очолює свої таблиці для тексту (64.1) і зображень (71.6) за результатами внутрішнього оцінювання.
  • d3-flash на 9B (59.0) перевершує Decision 2.0 на 27B (55.9).
  • Моделі на 0.8B і 2B не очолюють усі таблиці.
  • Медіанна затримка для тексту становить від 21.7 до 84 мс на 1 MI325X.

Перегляньте колекцію на Hugging Face, картку моделі d3 та репозиторій vLLM Semantic Router на GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини