Sakhanda Wire
NVDA $229.28 -0.52% MSFT $535.07 +2.38% GOOGL $351.66 +0.97% META $718.67 -0.31% AMZN $262.43 +3.29%
← Към новините

Какво е Decision 3.0? Новите отворени модели за вземане на решения на vLLM Semantic Router

Екипът на vLLM Semantic Router пусна Decision 3.0 – семейство мултимодални модели за вземане на решения. Мултимодалните модели за вземане на решения Decision 3.0 прочитат текст, JSON и изображения, след което отговарят на типизирани въпроси за тях. Има 5 размера – от 0.8B до 27B, всички с лиценз Apache-2.0. За разработчиците това е бърз начин за класифициране, маршрутизиране и филтриране на заявки, без да се налага анализиране на генерирания текст.

Накратко

  • Размер: 5 модела: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B), d3 (26.09B). Дължина на контекста: не е посочена.
  • Работи на: латентност, измерена на 1 графичен процесор AMD Instinct MI325X. Тегла BF16; не са посочени официални квантизирани варианти.
  • Производителност: 27B моделът d3 оглавява таблиците както за текст, така и за изображения в своята карта, но според вътрешна оценка.
  • Най-добър резултат: 97.7 при KIE (CORD+FUNSD) за извличане на данни от документи (d3).
  • Най-слаб резултат: 34.1 при R-Bench-M (d3).
  • Извод:
    • Най-добро: 9B моделът вече превъзхожда 27B модела от предишното поколение.
    • Най-лошо: резултатите са докладвани от самия екип спрямо актуални данни от класацията.

Какво представлява Decision 3.0?

Decision 3.0 е набор от отворени модели за вземане на решения от vLLM Semantic Router, които връщат вероятности вместо текст. Подавате състояние (текст или JSON), незадължителни изображения и именувани въпроси. Всеки въпрос може да бъде избор, въпрос с отговор „Да/Не“ или оценка по скала. Моделът отговаря на всички въпроси с едно извикване и връща вероятност за всеки отговор.

Това е моделът „система едно“ за маршрутизатори и защитни механизми. Вместо да подавате подкана към LLM и да анализирате изхода му, получавате калибрирани оценки, за които можете да задавате прагове.

Как работи d3?

Всеки модел е фино настроена версия на базов модел Qwen. 27B моделът d3 е изграден върху Qwen3.8-27B. По-малките 4 модела са изградени върху контролни точки Qwen3.5 с размери 0.8B, 2B, 4B и 9B.

Всеки размер включва енкодер за изображения: 0.10B при d3-lite, 0.33B при d3-nano и d3-mini и 0.46B при d3-flash и d3. Заявките приемат няколко изображения във формат PNG, JPEG или WebP, като всяко се прочита с размер до 1.6 мегапиксела. Всеки въпрос използва всички изображения.

Всеки въпрос получава собствено предно преминаване през входа. Инсталацията изисква transformers==5.17.0, а незадължителният пакет flash-linear-attention ускорява слоевете с линейно внимание. Зареждането изисква trust_remote_code=True.

Как се представя Decision 3.0 при бенчмарковете?

В картата на модела изследователският екип посочва Jev Decision Index 0.3.1 – класация, която подрежда отворени репродукции на системата за вземане на решения Jev на TypeSafe. Резултатите на d3 са от вътрешна оценка на екипа.

При текст d3 постига 64.1, пред Perplexity Decider v1.1 (62.8) и Jev (60.1). Една уговорка: Torchcast Decision 27B има по-висок резултат в публичния набор (65.1 срещу 64.9). В класацията за изображения d3 постига 71.6 срещу 70.6 за Perplexity Decider v1.1.

Историята с размерите е най-силната част. d3-flash (9B) постига 59.0 – над 27B модела на Decision 2.0, който има 55.9. В публичния набор подобренията спрямо Decision 2.0 варират от +8.0 (27B) до +15.1 (0.8B).

Лидерството по класове обаче не е равномерно:

  • d3-mini (4B) и d3-flash (9B) оглавяват както таблиците за текст, така и тези за изображения.
  • d3-lite (0.8B) е начело при текста, но заема 3-то място при изображенията (41.1, зад JPT-0.8B с 42.1).
  • d3-nano (2B) оглавява таблицата за изображения, но изостава от LiquidAI d1-3B при текста (35.8 срещу 40.1).

При публичните задачи с изображения d3 постига 97.3 при InfographicVQA и 89.9 при Mind2Web – и двете са приблизителни възстановки. Моделът е по-слаб при MMMU-Pro vision (46.2) и модерирането на Hateful Memes (44.6).

Колко бързи са моделите?

Медианите по-долу са за 1 заявка наведнъж на 1 AMD Instinct MI325X, според данните за всяка карта:

  • d3-nano: 21.7 ms за текст, 92.0 ms с изображение
  • d3-lite: 23.5 ms за текст, 60.7 ms с изображение
  • d3-mini: 28.5 ms за текст, 115.0 ms с изображение
  • d3-flash: 29.7 ms за текст, 171.8 ms с изображение
  • d3: 84 ms за текст, 342 ms с изображение

Всички модели са обучени върху графични процесори AMD Instinct MI325X.

Как се сравнява d3 с други модели за вземане на решения?

Характеристикаd3 (vLLM SR)Perplexity Decider v1.1Decision 2.0 Vega-27BLiquidAI d1-3B
Параметри26.09B26B (според HF)29.37B3.12B
Базов моделQwen3.8-27BQwen3.8-27BQwen3.8-27BLFM2.5-VL-3B
ВходовеТекст, JSON, изображенияТекст, изображенияТекст, JSONТекст, JSON, изображения
КонтекстНе е посочен8 192 токена на решение32 768 токена32 768 токена
ЛицензApache-2.0Apache-2.0Apache-2.0LFM 1.0
Decision Index (собствена карта)64.1 (v0.3.1, вътрешен)61.56 (версията не е посочена)56.5 (v0.2.1)48.57 (v0.2.1)
Класация Index 0.3.1 (според картите на d3)64.162.855.940.1
Класация за изображения 0.3.171.670.6Не е посочена (само текст)Не е посочена
Медианна латентност (собствена карта)84 ms за текст, 1 MI325XНе е посочена71.4 ms, 1 графичен процесор9 ms, 1 MI325X

Основни изводи

  • 5 модела за вземане на решения с лиценз Apache-2.0, от 0.8B до 27B, всички с вход за изображения.
  • d3 (27B) оглавява таблиците за текст (64.1) и изображения (71.6) според вътрешни оценки.
  • 9B моделът d3-flash (59.0) превъзхожда 27B модела на Decision 2.0 (55.9).
  • Моделите 0.8B и 2B не оглавяват всяка класация.
  • Медианната латентност при текст е от 21.7 до 84 ms на 1 MI325X.

Разгледайте колекцията в Hugging Face, картата на модела d3 и GitHub хранилището на vLLM Semantic Router. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини