Sakhanda Wire
NVDA $229.28 -0.52% MSFT $535.07 +2.38% GOOGL $351.66 +0.97% META $718.67 -0.31% AMZN $262.43 +3.29%
← До новин

Microsoft AI випустила Microsoft-Decision-1: модель оцінювання рішень Microsoft-Decision-1 на базі Qwen3.5-9B

Microsoft випустила Microsoft-Decision-1 — модель прийняття рішень для маршрутизації, класифікації, перевірки та контролю агентів. Microsoft-Decision-1 — це модель оцінювання рішень, яка повертає калібровану ймовірність для кожного фіксованого варіанта відповіді замість згенерованого тексту. Її доопрацьовано на основі Qwen3.5-9B від Alibaba, і тепер вона доступна в Microsoft Foundry та OpenRouter. .

Коротко

  • Розмір: Створена на основі Qwen3.5-9B; точну кількість параметрів не розкрито. Контекстне вікно — 32 768 токенів.
  • Працює на: Лише через хостований API (Microsoft Foundry, OpenRouter через Azure). Відкритих ваг немає, квантизованих варіантів немає, апаратне забезпечення не розкрито.
  • Продуктивність: Найвища середня точність у порівнянні Microsoft за 36 бенчмарками — затримка p50 становить 85 мс.
  • Найкраще: Середня точність 83,5% за 36 бенчмарками, що випереджає Quyet-1.0-Large з результатом 81,9%.
  • Найгірше: Калібрування — 92,2, друге місце після Quyet-1.0-Large з результатом 93,1. Лише текст, без пояснень.
  • Підсумок:
    • Найкраще: швидкі, дешеві та калібровані рішення за ціною $0,042 за мільйон вхідних токенів, а вихідні токени безкоштовні.
      • Найгірше: закриті ваги, і кожен бенчмарк проведено постачальником.

Що таке модель прийняття рішень?

Модель прийняття рішень зчитує вхідні дані та оцінює закритий набір варіантів. Вона не пише прозу. Microsoft розглядає моделі прийняття рішень як нову категорію ШІ, створену для результатів, на які програмне забезпечення може негайно реагувати.

Як працює Microsoft-Decision-1?

Microsoft доопрацювала Qwen3.5-9B для одноетапного оцінювання рішень. Отримавши ситуацію, запитання та фіксовані варіанти, модель за один виклик повертає ймовірність для кожного варіанта. У майбутніх версіях планується перейти на базу моделей MAI та OpenAI.

У картці моделі Foundry перелічено підтримувані формати:

  • запитання «так/ні», з множинним вибором, рейтингові, класифікаційні та за рубрикою
  • оцінювання відповідей ШІ та запропонованих дій агентів
  • перевірки обґрунтованості на основі наданих доказів
  • явні варіанти утримання від відповіді, як-от «неможливо визначити»

Для навчання використано загальнодоступні набори даних у межах процесу Microsoft Open Data, а також синтетичні дані. Результат має формат JSON. OpenRouter зазначає, що ваги постійно оновлюються, тоді як форма API залишається незмінною.

Наскільки вона швидка й точна?

Microsoft порівняла 9 систем за 36 бенчмарками зі 147 137 запитаннями. Бенчмарки були приховані від навчання. Microsoft-Decision-1 посіла перше місце за середньою точністю — 83,5%.

Її затримка p50 становила 85 мс, а p95 — 125 мс. Це у 4,5 раза швидше за Quyet-1.0-Large і у 35 разів швидше за GPT-6 Sol, якій знадобилося 3,01 с.

Microsoft також перевірила стійкість. Вона змінює кожен запит 8 способами, зокрема перефразуванням і перемішуванням варіантів. У середньому модель змінювала своє рішення у 1,3% випадків. Рішень, що змінилися, не було, коли варіанти перефразовувалися, розгорталися у зворотному порядку або перемішувалися.

Щодо безпеки Microsoft виконала 5 250 запитів за 11 бенчмарками. Вони охоплювали шкідливий контент, джейлбрейки та ін’єкції підказок. Microsoft повідомляє про коректні відмови за умови високої збереженої корисності, не публікуючи оцінку.

Внутрішні результати, про які повідомляє Microsoft

  • Xbox Research: відсортувала понад 10 000 елементів відгуків, у 14 разів швидше та у 200 разів дешевше за GPT-6 Sol.
  • Контроль якості Copilot: порівнянна з GPT5.6 Luna і у 100 разів швидша.
  • Microsoft Discovery: у 46 разів послідовніша за оцінювання LLM, працюючи втричі швидше.

Як вона порівнюється з іншими моделями прийняття рішень?

ХарактеристикаMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
РозробникMicrosoftChinh NguyenH2O.aiOpenAI
Базова модельQwen3.5-9BGemma-4-31B-it (об’єднана LoRA)Qwen3.5-4BНе розкрито
ПараметриНе розкрито31,3 млрд4 млрдНе розкрито
Контекст / вхідні дані32 768 токенівПромпт на 8 000 токенів (стан на 6 000)40 960 (налаштування vLLM serve)Не розкрито
ЛіцензіяПропрієтарний APIApache-2.0Apache-2.0Пропрієтарний API
МодальністьТекстТекстТекст і зображенняТекст і зображення
Апаратне забезпеченняХостоване (Azure)1 графічний процесор на 80 ГБ, bf16Тестування на графічному процесорі на 32 ГБ; ваги — 9,1 ГБХостоване
Точність (Microsoft, 36 бенчмарків)83,5%81,9%77,2%79,4%
Калібрування (Microsoft)92,293,191,889,9
Медіанна затримка на графіку Microsoft85 мс380 мс210 мс300 мс
Ціна$0,042/млн вхідних токенів, вихідні безкоштовніСамостійне розгортанняСамостійне розгортання$0,10/млн вхідних токенів, вихідні безкоштовні

Рядки щодо точності, калібрування та затримки взято з графіка Microsoft. Затримки конкурентів у ньому використовують скориговану медіану JevBench v1.6.1.

Чи можна безпосередньо порівнювати затримку?

Не повністю. Microsoft вимірювала власну модель через Foundry. Дані конкурентів використовують скориговану медіану JevBench, а не необроблені результати вимірювань.

Картка моделі H2O.ai заперечує це. У ній зазначено, що скоригований показник JevBench подвоює виміряний час і додає 0,15 с. H2O стверджує, що виміряна медіана її моделі становить 29 мс, а не 210 мс. Microsoft-Decision-1 не представлена в таблиці JevBench. В офіційному зведеному рейтингу цієї таблиці H2O-Lightning-4B посідає перше місце з результатом 72,5.

Як розробники розгортають її?

Розробники можуть викликати її з Microsoft Foundry як загальнодоступну модель «безпосередньо з Azure». В OpenRouter вона працює через API рішень, а не через кінцеву точку чату. SDK для чат-комплетувань не працюватимуть.

Ціна становить $0,042 за мільйон вхідних токенів, вихідні токени безкоштовні. Кінцева точка рішень Luna від OpenAI стягує $0,10 за мільйон вхідних токенів.

Які обмеження?

У картці моделі прямо зазначено:

  • Не призначена для генерації тексту, відкритих запитань і відповідей, чату, перекладу або узагальнення.
  • Лише текст. Без зображень, аудіо чи відео.
  • У вихідних даних немає пояснень або обґрунтувань.
  • Не призначена для одноосібного автоматизованого ухвалення рішень щодо кредитування, працевлаштування, житла, охорони здоров’я або юридичних прав.
  • Застосунки мають визначати варіанти, пороги, шляхи ескалації та людський нагляд.

Ключові висновки

  • Microsoft-Decision-1 оцінює фіксовані варіанти за каліброваними ймовірностями, а не створює текст.
  • Доопрацьована на основі Qwen3.5-9B, із контекстним вікном на 32 768 токенів.
  • Очолює порівняння Microsoft за 36 бенчмарками з точністю 83,5% і показником p50 85 мс.
  • Коштує $0,042 за мільйон вхідних токенів; вихідні токени безкоштовні.
  • Порівняння затримки є спірними; незалежні результати JevBench ще очікуються.

Ознайомтеся з офіційним оголошенням, карткою моделі Foundry та переліком в OpenRouter. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини