Microsoft AI випустила Microsoft-Decision-1: модель оцінювання рішень Microsoft-Decision-1 на базі Qwen3.5-9B
Microsoft випустила Microsoft-Decision-1 — модель прийняття рішень для маршрутизації, класифікації, перевірки та контролю агентів. Microsoft-Decision-1 — це модель оцінювання рішень, яка повертає калібровану ймовірність для кожного фіксованого варіанта відповіді замість згенерованого тексту. Її доопрацьовано на основі Qwen3.5-9B від Alibaba, і тепер вона доступна в Microsoft Foundry та OpenRouter. .
Коротко
- Розмір: Створена на основі Qwen3.5-9B; точну кількість параметрів не розкрито. Контекстне вікно — 32 768 токенів.
- Працює на: Лише через хостований API (Microsoft Foundry, OpenRouter через Azure). Відкритих ваг немає, квантизованих варіантів немає, апаратне забезпечення не розкрито.
- Продуктивність: Найвища середня точність у порівнянні Microsoft за 36 бенчмарками — затримка p50 становить 85 мс.
- Найкраще: Середня точність 83,5% за 36 бенчмарками, що випереджає Quyet-1.0-Large з результатом 81,9%.
- Найгірше: Калібрування — 92,2, друге місце після Quyet-1.0-Large з результатом 93,1. Лише текст, без пояснень.
- Підсумок:
- Найкраще: швидкі, дешеві та калібровані рішення за ціною $0,042 за мільйон вхідних токенів, а вихідні токени безкоштовні.
- Найгірше: закриті ваги, і кожен бенчмарк проведено постачальником.
- Найкраще: швидкі, дешеві та калібровані рішення за ціною $0,042 за мільйон вхідних токенів, а вихідні токени безкоштовні.
Що таке модель прийняття рішень?
Модель прийняття рішень зчитує вхідні дані та оцінює закритий набір варіантів. Вона не пише прозу. Microsoft розглядає моделі прийняття рішень як нову категорію ШІ, створену для результатів, на які програмне забезпечення може негайно реагувати.
Як працює Microsoft-Decision-1?
Microsoft доопрацювала Qwen3.5-9B для одноетапного оцінювання рішень. Отримавши ситуацію, запитання та фіксовані варіанти, модель за один виклик повертає ймовірність для кожного варіанта. У майбутніх версіях планується перейти на базу моделей MAI та OpenAI.
У картці моделі Foundry перелічено підтримувані формати:
- запитання «так/ні», з множинним вибором, рейтингові, класифікаційні та за рубрикою
- оцінювання відповідей ШІ та запропонованих дій агентів
- перевірки обґрунтованості на основі наданих доказів
- явні варіанти утримання від відповіді, як-от «неможливо визначити»
Для навчання використано загальнодоступні набори даних у межах процесу Microsoft Open Data, а також синтетичні дані. Результат має формат JSON. OpenRouter зазначає, що ваги постійно оновлюються, тоді як форма API залишається незмінною.
Наскільки вона швидка й точна?
Microsoft порівняла 9 систем за 36 бенчмарками зі 147 137 запитаннями. Бенчмарки були приховані від навчання. Microsoft-Decision-1 посіла перше місце за середньою точністю — 83,5%.
Її затримка p50 становила 85 мс, а p95 — 125 мс. Це у 4,5 раза швидше за Quyet-1.0-Large і у 35 разів швидше за GPT-6 Sol, якій знадобилося 3,01 с.
Microsoft також перевірила стійкість. Вона змінює кожен запит 8 способами, зокрема перефразуванням і перемішуванням варіантів. У середньому модель змінювала своє рішення у 1,3% випадків. Рішень, що змінилися, не було, коли варіанти перефразовувалися, розгорталися у зворотному порядку або перемішувалися.
Щодо безпеки Microsoft виконала 5 250 запитів за 11 бенчмарками. Вони охоплювали шкідливий контент, джейлбрейки та ін’єкції підказок. Microsoft повідомляє про коректні відмови за умови високої збереженої корисності, не публікуючи оцінку.
Внутрішні результати, про які повідомляє Microsoft
- Xbox Research: відсортувала понад 10 000 елементів відгуків, у 14 разів швидше та у 200 разів дешевше за GPT-6 Sol.
- Контроль якості Copilot: порівнянна з GPT5.6 Luna і у 100 разів швидша.
- Microsoft Discovery: у 46 разів послідовніша за оцінювання LLM, працюючи втричі швидше.
Як вона порівнюється з іншими моделями прийняття рішень?
| Характеристика | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| Розробник | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| Базова модель | Qwen3.5-9B | Gemma-4-31B-it (об’єднана LoRA) | Qwen3.5-4B | Не розкрито |
| Параметри | Не розкрито | 31,3 млрд | 4 млрд | Не розкрито |
| Контекст / вхідні дані | 32 768 токенів | Промпт на 8 000 токенів (стан на 6 000) | 40 960 (налаштування vLLM serve) | Не розкрито |
| Ліцензія | Пропрієтарний API | Apache-2.0 | Apache-2.0 | Пропрієтарний API |
| Модальність | Текст | Текст | Текст і зображення | Текст і зображення |
| Апаратне забезпечення | Хостоване (Azure) | 1 графічний процесор на 80 ГБ, bf16 | Тестування на графічному процесорі на 32 ГБ; ваги — 9,1 ГБ | Хостоване |
| Точність (Microsoft, 36 бенчмарків) | 83,5% | 81,9% | 77,2% | 79,4% |
| Калібрування (Microsoft) | 92,2 | 93,1 | 91,8 | 89,9 |
| Медіанна затримка на графіку Microsoft | 85 мс | 380 мс | 210 мс | 300 мс |
| Ціна | $0,042/млн вхідних токенів, вихідні безкоштовні | Самостійне розгортання | Самостійне розгортання | $0,10/млн вхідних токенів, вихідні безкоштовні |
Рядки щодо точності, калібрування та затримки взято з графіка Microsoft. Затримки конкурентів у ньому використовують скориговану медіану JevBench v1.6.1.
Чи можна безпосередньо порівнювати затримку?
Не повністю. Microsoft вимірювала власну модель через Foundry. Дані конкурентів використовують скориговану медіану JevBench, а не необроблені результати вимірювань.
Картка моделі H2O.ai заперечує це. У ній зазначено, що скоригований показник JevBench подвоює виміряний час і додає 0,15 с. H2O стверджує, що виміряна медіана її моделі становить 29 мс, а не 210 мс. Microsoft-Decision-1 не представлена в таблиці JevBench. В офіційному зведеному рейтингу цієї таблиці H2O-Lightning-4B посідає перше місце з результатом 72,5.
Як розробники розгортають її?
Розробники можуть викликати її з Microsoft Foundry як загальнодоступну модель «безпосередньо з Azure». В OpenRouter вона працює через API рішень, а не через кінцеву точку чату. SDK для чат-комплетувань не працюватимуть.
Ціна становить $0,042 за мільйон вхідних токенів, вихідні токени безкоштовні. Кінцева точка рішень Luna від OpenAI стягує $0,10 за мільйон вхідних токенів.
Які обмеження?
У картці моделі прямо зазначено:
- Не призначена для генерації тексту, відкритих запитань і відповідей, чату, перекладу або узагальнення.
- Лише текст. Без зображень, аудіо чи відео.
- У вихідних даних немає пояснень або обґрунтувань.
- Не призначена для одноосібного автоматизованого ухвалення рішень щодо кредитування, працевлаштування, житла, охорони здоров’я або юридичних прав.
- Застосунки мають визначати варіанти, пороги, шляхи ескалації та людський нагляд.
Ключові висновки
- Microsoft-Decision-1 оцінює фіксовані варіанти за каліброваними ймовірностями, а не створює текст.
- Доопрацьована на основі Qwen3.5-9B, із контекстним вікном на 32 768 токенів.
- Очолює порівняння Microsoft за 36 бенчмарками з точністю 83,5% і показником p50 85 мс.
- Коштує $0,042 за мільйон вхідних токенів; вихідні токени безкоштовні.
- Порівняння затримки є спірними; незалежні результати JevBench ще очікуються.
Ознайомтеся з офіційним оголошенням, карткою моделі Foundry та переліком в OpenRouter. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.