Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Microsoft AI представи Microsoft-Decision-1: модел за оценяване на решения Microsoft-Decision-1 на Qwen3.5-9B

Microsoft пусна Microsoft-Decision-1 — модел за вземане на решения за маршрутизиране, класификация, проверка и контрол на агенти. Microsoft-Decision-1 е модел за оценяване на решения, който връща калибрирана вероятност за всяка предварително зададена опция за отговор, вместо генериран текст. Той е дообучен от Qwen3.5-9B на Alibaba и вече е достъпен в Microsoft Foundry и OpenRouter. .

Накратко

  • Размер: Изграден върху Qwen3.5-9B; точният брой параметри не е разкрит. Контекстов прозорец от 32 768 токена.
  • Работи на: Само хостван API (Microsoft Foundry, OpenRouter чрез Azure). Няма отворени тегла, няма квантизирани варианти, хардуерът не е разкрит.
  • Производителност: Най-висока средна точност в сравнението на Microsoft с 36 бенчмарка — при латентност p50 от 85 ms.
  • Най-добро: 83,5% средна точност в 36 бенчмарка, пред Quyet-1.0-Large с 81,9%.
  • Най-слабо: Калибрация от 92,2, втора след Quyet-1.0-Large с 93,1. Само текст, без обяснения.
  • Извод:
    • Най-доброто: бързи, евтини и калибрирани решения на цена от 0,042 долара за милион входни токена, с безплатен изход.
      • Най-лошото: затворени тегла и всеки бенчмарк е проведен от самия доставчик.

Какво представлява моделът за вземане на решения?

Моделът за вземане на решения прочита входни данни и оценява затворен набор от опции. Той не пише проза. Microsoft представя моделите за вземане на решения като нова категория ИИ, създадена за резултати, върху които софтуерът може да предприема действия незабавно.

Как работи Microsoft-Decision-1?

Microsoft е дообучил Qwen3.5-9B за еднопроходно оценяване на решения. При зададени ситуация, въпрос и фиксирани опции той връща вероятност за всяка опция с едно извикване. Компанията планира да базира бъдещите версии на модели MAI и OpenAI.

Картата на модела във Foundry изброява поддържаните формати:

  • въпроси с отговор „да/не“, въпроси с няколко възможни отговора, оценки, класификация и рубрики
  • оценяване на отговори на ИИ и предложени действия на агенти
  • проверки за обоснованост спрямо предоставени доказателства
  • изрични опции за въздържане от отговор, като „не може да се определи“

Обучението използва публични набори от данни съгласно процеса на Microsoft за отворени данни, както и синтетични данни. Изходът е JSON. OpenRouter отбелязва, че теглата се актуализират непрекъснато, докато структурата на API остава непроменена.

Колко бърз и точен е той?

Microsoft сравни 9 системи в 36 бенчмарка със 147 137 въпроса. Бенчмарковете са били скрити от обучението. Microsoft-Decision-1 зае първо място по средна точност с 83,5%.

Латентността му p50 беше 85 ms, а p95 — 125 ms. Това е 4,5 пъти по-бързо от Quyet-1.0-Large и 35 пъти по-бързо от GPT-6 Sol, на който са били нужни 3,01 секунди.

Microsoft също така тества устойчивостта. Всяка заявка се променя по 8 начина, включително чрез перифразиране и разбъркване на опциите. Средно моделът е променил решението си при 1,3% от променените заявки. Промените са били нулеви, когато опциите са били перифразирани, разменени или разбъркани.

По отношение на безопасността Microsoft е изпълнил 5250 заявки в 11 бенчмарка. Те са обхващали вредно съдържание, заобикаляне на защитите и инжектиране на промптове. Microsoft съобщава за коректни откази с висока запазена полезност, без да публикува оценка.

Вътрешни резултати, докладвани от Microsoft

  • Xbox Research: сортира над 10 000 елемента с обратна връзка, 14 пъти по-бързо и 200 пъти по-евтино от GPT-6 Sol.
  • Контрол на качеството на Copilot: конкурентоспособен спрямо GPT5.6 Luna и 100 пъти по-бърз.
  • Microsoft Discovery: 46 пъти по-последователен от оценяването от LLM, при 3 пъти по-висока скорост.

Как се сравнява с други модели за вземане на решения?

ХарактеристикаMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
РазработчикMicrosoftChinh NguyenH2O.aiOpenAI
Базов моделQwen3.5-9BGemma-4-31B-it (обединен LoRA)Qwen3.5-4BНе е разкрит
ПараметриНе са разкрити31,3B4BНе са разкрити
Контекст / вход32 768 токенаПромпт от 8000 токена (6000 състояние)40 960 (настройка за vLLM serve)Не е разкрит
ЛицензСобственически APIApache-2.0Apache-2.0Собственически API
МодалностТекстТекстТекст и изображенияТекст и изображения
ХардуерХостван (Azure)1x 80 GB GPU, bf16Тестван с 32 GB GPU; тегла от 9,1 GBХостван
Точност (Microsoft, 36 бенчмарка)83,5%81,9%77,2%79,4%
Калибрация (Microsoft)92,293,191,889,9
Медианна латентност в графиката на Microsoft85 ms380 ms210 ms300 ms
Цена0,042 долара за 1 млн. входни токена, изходът е безплатенСамостоятелно хостванеСамостоятелно хостване0,10 долара за 1 млн. входни токена, изходът е безплатен

Редовете за точност, калибрация и латентност са взети от графиката на Microsoft. Латентностите на конкурентите там използват коригираната медиана на JevBench v1.6.1.

Съпоставимо ли е сравнението на латентността?

Не напълно. Microsoft е измерил собствения си модел чрез Foundry. Данните за конкурентите използват коригираната медиана на JevBench, а не необработени измервания.

Картата на модела на H2O.ai оспорва това. В нея се посочва, че коригираната стойност на JevBench удвоява измереното време и добавя 0,15 секунди. H2O твърди, че измерената медиана на модела му е 29 ms, а не 210 ms. Microsoft-Decision-1 не се появява в класацията на JevBench. В официалната съставна класация на тази таблица H2O-Lightning-4B заема първо място с 72,5.

Как разработчиците го внедряват?

Разработчиците могат да го извикват от Microsoft Foundry като общодостъпен модел „директно от Azure“. В OpenRouter той работи чрез API за решения, а не чрез крайната точка за чат. SDK-тата за чат завършени заявки няма да работят.

Цената е 0,042 долара за милион входни токена, с безплатен изход. Крайната точка за решения Luna на OpenAI таксува 0,10 долара за милион входни токена.

Какви са ограниченията?

Картата на модела е изрична:

  • Не е предназначен за генериране на текст, отворени въпроси и отговори, чат, превод или обобщаване.
  • Само текст. Без изображения, аудио или видео.
  • В изхода няма обяснения или обосновки.
  • Не е предназначен за единствено автоматизирано вземане на решения относно кредити, заетост, жилищно настаняване, здравеопазване или правни права.
  • Приложенията трябва да определят опции, прагове, пътища за ескалация и човешки надзор.

Основни изводи

  • Microsoft-Decision-1 оценява фиксирани опции с калибрирани вероятности, а не с текст.
  • Дообучен е от Qwen3.5-9B и разполага с контекстов прозорец от 32 768 токена.
  • Води в сравнението на Microsoft с 36 бенчмарка с точност от 83,5% и p50 от 85 ms.
  • Цената е 0,042 долара за милион входни токена; изходните токени са безплатни.
  • Сравненията на латентността са оспорвани; очакват се независими резултати от JevBench.

Разгледайте официалното съобщение, картата на модела във Foundry и страницата в OpenRouter. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини