Microsoft AI выпустила Microsoft-Decision-1: модель оценки решений Microsoft-Decision-1 на базе Qwen3.5-9B
Microsoft выпустила Microsoft-Decision-1 — модель принятия решений для маршрутизации, классификации, проверки и управления агентами. Microsoft-Decision-1 — это модель оценки решений, которая возвращает калиброванную вероятность для каждого фиксированного варианта ответа вместо сгенерированного текста. Она дообучена на основе Qwen3.5-9B от Alibaba и уже доступна в Microsoft Foundry и OpenRouter. .
Кратко
- Размер: Создана на основе Qwen3.5-9B; точное количество параметров не раскрывается. Контекстное окно на 32 768 токенов.
- Запуск: Только через размещённый API (Microsoft Foundry, OpenRouter через Azure). Открытых весов и квантованных вариантов нет, данные об аппаратном обеспечении не раскрываются.
- Производительность: Самая высокая средняя точность в сравнении Microsoft по 36 бенчмаркам при задержке p50 85 мс.
- Лучший результат: Средняя точность 83,5% по 36 бенчмаркам — выше, чем у Quyet-1.0-Large с результатом 81,9%.
- Худший результат: Калибровка 92,2 — второй результат после Quyet-1.0-Large с показателем 93,1. Только текст, без объяснений.
- Итог:
- Главное преимущество: быстрые, дешёвые и калиброванные решения по цене $0,042 за миллион входных токенов при бесплатных выходных токенах.
- Главный недостаток: закрытые веса, а все бенчмарки проводились поставщиком.
- Главное преимущество: быстрые, дешёвые и калиброванные решения по цене $0,042 за миллион входных токенов при бесплатных выходных токенах.
Что такое модель принятия решений?
Модель принятия решений считывает входные данные и оценивает закрытый набор вариантов. Она не пишет связный текст. Microsoft представляет модели принятия решений как новую категорию ИИ, созданную для выдачи результатов, на которые программное обеспечение может немедленно реагировать.
Как работает Microsoft-Decision-1?
Microsoft дообучила Qwen3.5-9B для одношаговой оценки решений. Получив ситуацию, вопрос и фиксированные варианты, модель за один вызов возвращает вероятность для каждого варианта. В будущем Microsoft планирует основывать новые версии на моделях MAI и OpenAI.
Карточка модели Foundry перечисляет поддерживаемые форматы:
- вопросы с ответами «да/нет», с множественным выбором, оценочные, классификационные и основанные на рубриках
- оценка ответов ИИ и предлагаемых действий агента
- проверка обоснованности на основе предоставленных доказательств
- явные варианты воздержания от ответа, например «невозможно определить»
При обучении использовались общедоступные наборы данных в рамках процесса Microsoft Open Data, а также синтетические данные. Результат выдаётся в формате JSON. OpenRouter отмечает, что веса постоянно обновляются, тогда как форма API остаётся неизменной.
Насколько модель быстрая и точная?
Microsoft сравнила 9 систем по 36 бенчмаркам со 147 137 вопросами. Бенчмарки были скрыты от процесса обучения. Microsoft-Decision-1 показала лучшую среднюю точность — 83,5%.
Задержка p50 составила 85 мс, а p95 — 125 мс. Это в 4,5 раза быстрее Quyet-1.0-Large и в 35 раз быстрее GPT-6 Sol, которой потребовалось 3,01 с.
Microsoft также проверила устойчивость. Каждый запрос изменялся 8 способами, включая перефразирование и перемешивание вариантов. В среднем модель меняла своё решение в 1,3% случаев. При перефразировании, изменении порядка или перемешивании вариантов таких изменений не было.
В рамках проверки безопасности Microsoft выполнила 5 250 запросов по 11 бенчмаркам. Они охватывали вредоносный контент, попытки обхода ограничений и внедрение промптов. Microsoft сообщает о корректных отказах при сохранении высокой полезности, не публикуя конкретную оценку.
Внутренние результаты, о которых сообщает Microsoft
- Xbox Research: отсортировала более 10 000 элементов обратной связи, в 14 раз быстрее и в 200 раз дешевле GPT-6 Sol.
- Контроль качества Copilot: сопоставима с GPT5.6 Luna и в 100 раз быстрее.
- Microsoft Discovery: в 46 раз более последовательна, чем оценка с помощью LLM, при трёхкратном превосходстве в скорости.
Как она сравнивается с другими моделями принятия решений?
| Характеристика | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| Разработчик | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| Базовая модель | Qwen3.5-9B | Gemma-4-31B-it (объединена LoRA) | Qwen3.5-4B | Не раскрывается |
| Параметры | Не раскрывается | 31,3B | 4B | Не раскрывается |
| Контекст / ввод | 32 768 токенов | Промпт на 8 000 токенов (состояние на 6 000) | 40 960 (настройка vLLM serve) | Не раскрывается |
| Лицензия | Проприетарный API | Apache-2.0 | Apache-2.0 | Проприетарный API |
| Модальность | Текст | Текст | Текст и изображения | Текст и изображения |
| Оборудование | Размещённая (Azure) | 1 графический процессор на 80 ГБ, bf16 | Протестирована на GPU 32 ГБ; веса занимают 9,1 ГБ | Размещённая |
| Точность (Microsoft, 36 бенчмарков) | 83,5% | 81,9% | 77,2% | 79,4% |
| Калибровка (Microsoft) | 92,2 | 93,1 | 91,8 | 89,9 |
| Медианная задержка на графике Microsoft | 85 мс | 380 мс | 210 мс | 300 мс |
| Цена | $0,042 за миллион входных токенов, выходные токены бесплатно | Самостоятельное размещение | Самостоятельное размещение | $0,10 за миллион входных токенов, выходные токены бесплатно |
Данные о точности, калибровке и задержке взяты из графика Microsoft. Задержки конкурентов на нём используют скорректированное медианное значение JevBench v1.6.1.
Можно ли напрямую сравнивать задержки?
Не полностью. Microsoft измеряла собственную модель через Foundry. Показатели конкурентов используют скорректированное медианное значение JevBench, а не исходные замеры.
В карточке модели H2O.ai это оспаривается. В ней говорится, что скорректированное значение JevBench удваивает измеренное время и добавляет 0,15 с. H2O утверждает, что медианная задержка её модели составляет 29 мс, а не 210 мс. Microsoft-Decision-1 не представлена в таблице JevBench. В официальном сводном рейтинге этой таблицы H2O-Lightning-4B занимает первое место с результатом 72,5.
Как разработчики разворачивают модель?
Разработчики могут вызывать её через Microsoft Foundry как общедоступную модель «напрямую из Azure». В OpenRouter она работает через API решений, а не через конечную точку чата. SDK для чатовых запросов работать не будут.
Цена составляет $0,042 за миллион входных токенов при бесплатных выходных токенах. Конечная точка решений Luna от OpenAI берёт $0,10 за миллион входных токенов.
Каковы ограничения?
В карточке модели прямо указано:
- Не предназначена для генерации текста, открытых вопросов и ответов, чата, перевода или суммирования.
- Только текст. Изображения, аудио и видео не поддерживаются.
- Выходные данные не содержат объяснений или обоснований.
- Не предназначена для единоличного принятия автоматизированных решений в вопросах кредита, трудоустройства, жилья, здравоохранения или юридических прав.
- Приложения должны определять варианты, пороги, пути эскалации и меры человеческого контроля.
Ключевые выводы
- Microsoft-Decision-1 оценивает фиксированные варианты с помощью калиброванных вероятностей, а не текста.
- Дообучена на основе Qwen3.5-9B, с контекстным окном на 32 768 токенов.
- Лидирует в сравнении Microsoft по 36 бенчмаркам с точностью 83,5% и задержкой p50 85 мс.
- Стоимость составляет $0,042 за миллион входных токенов; выходные токены бесплатны.
- Сравнение задержек оспаривается; независимые результаты JevBench пока не опубликованы.
Ознакомьтесь с официальным объявлением, карточкой модели Foundry и страницей OpenRouter. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.