Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Nace AI открывает исходный код Drex 1.5: модель принятия решений на 9 млрд параметров, оценивающая варианты, а не текст

Nace.AI открыла исходный код Drex 1.5 — модели принятия решений с 9 млрд параметров для агентов и серверных рабочих процессов. Модель принятия решений Drex 1.5 не пишет текст. Она считывает состояние и типизированные вопросы, а затем возвращает вероятность для каждого варианта. Nace сообщает результат 58.08 в общедоступном Decision Index 0.3.1 — это лучший результат среди моделей с менее чем 10 млрд параметров. Веса доступны на Hugging Face, а размещённая версия работает на OpenRouter.

Кратко

  • Размер: 8,95 млрд параметров (плотная модель), веса bf16 занимают около 18 ГБ. Контекст по умолчанию составляет 16 384 токена, максимум — 131 072.
  • Запускается на: 1 CUDA GPU в режиме bf16 (протестировано на A10G с 24 ГБ). Q8_0 GGUF (около 9,5 ГБ) работает на Apple Silicon и CPU.
  • Производительность: 58.08 в Decision Index 0.3.1 (общедоступный), в пределах диапазона ничьей таблицы лидеров с Jev 1.13.0 (57.96).
  • Лучший результат: точность 93,4% на документах объёмом от 32 до 128 тыс. токенов.
  • Худший результат: F1 7,4% на уровне отдельных отзывов в анализе аспектных тональностей ACOS против 29,5% у Jev.
  • Итог:
    • Преимущество: открытые веса, сопоставимые с закрытой моделью, при работе на 1 GPU.
    • Недостаток: слабые результаты в широких знаниях и тонком анализе тональности.

Что такое Drex 1.5?

Drex 1.5 — это модель принятия решений от Nace.AI, которая оценивает фиксированный набор вариантов за 1 прямой проход. Вы отправляете state (текст или JSON) и именованные вопросы. Поддерживаются 3 типа вопросов: choice, noul (да/нет) и порядковая оценка score. Токены не сэмплируются, поэтому параметры temperature и top_p не применяются. Модель может отвечать только вариантами, которые вы предоставили.

Она обслуживает API POST /v1/systemone. Это тот же формат запросов, который используется Jev от TypeSafe — закрытой моделью, положившей начало этой категории. Nace утверждает, что существующие клиенты Jev работают после изменения нескольких переменных окружения.

Как работает Drex 1.5?

В основе модели лежит MiMo-V2.6-Distill-Qwen-9B — дистиллированная модель Qwen 3.5 9B. Она содержит 32 слоя с гибридным механизмом внимания: 3 слоя с линейным вниманием на каждый слой с полным вниманием. Отдельная указательная голова (head.pt) оценивает каждый вариант на основе скрытых состояний базовой модели.

Каждый вопрос обрабатывается за 1 проход по состоянию и этому вопросу. В llama.cpp состояние кодируется один раз и используется совместно для всех вопросов. На странице Drex Nace сообщает, что модель обучалась на официальных обучающих выборках эталонных тестов индекса. Оценка проводилась только на отложенных выборках.

Как Drex 1.5 показывает себя в эталонных тестах?

В общедоступном Decision Index 0.3.1 (37 эталонных тестов с поправкой на случайное угадывание) в карточке модели указаны следующие результаты:

  • Drex 1.5: 58.08
  • Jev 1.13.0: 57.96
  • Bespoke Nimble 9B v3: 57.19
  • Cloudflare clef-flash: 56.15

Drex 1.5, Jev и Nimble находятся в пределах диапазона ничьей таблицы лидеров в 0,9 пункта. Drex опережает Jev в 20 из 37 эталонных тестов. Результат Drex получен в ходе собственного запуска официального набора Nace. Лучшие показатели по категориям у неё в разделе «Инструменты» (75.0), а худшие — в разделах «Знания» и «Рассуждения» (44.6). На графике запуска Nace используется более старая версия Decision Index 0.2.1, где Drex получила 58.28 против 57.91 у Jev.

В JevBench (231 общедоступный элемент) Drex набирает 86,2% против 87,0% у Jev. На сложных элементах обе модели достигают 73,9%. В очном сравнении в 8 играх OpenSpiel Drex одержала 122 победы, 47 раз сыграла вничью и потерпела 87 поражений от Jev (56,8%).

Длинные документы — явная сильная сторона:

  • От 8 до 32 тыс. токенов: точность 89,5%, медиана 0,65 с
  • От 32 до 128 тыс. токенов: точность 93,4%, медиана 2,0 с

Сокращение тех же запросов до 8 тыс. токенов снижает точность до 76,5% и 78%.

Как разработчики могут запускать Drex 1.5?

Доступны 4 варианта развёртывания, и все они используют один и тот же API:

  • Python (среда выполнения Kev): inference.py и serve.py на CUDA GPU.
  • llama.cpp: форк Nace с GGUF в форматах bf16 или Q8_0, работающий на CUDA, Metal или CPU.
  • Ollama: форк Nace, добавляющий возможность decision.
  • Облачный вариант: OpenRouter указывает цену $0.04 за 1 млн входных токенов и $0 за выходные данные; обслуживание выполняет DeepInfra. Nace также предоставляет собственный Console API.

Nace протестировала bf16 и Q8_0 на AWS g5.2xlarge (A10G с 24 ГБ) и получила идентичные ответы. GGUF Q8_0 также показал совпадающие результаты на Apple M5 Pro как при использовании Metal, так и CPU.

Навык агента Drex подключает модель к Claude Code, Codex, Cursor, OpenCode, Hermes Agent, Gemini CLI и GitHub Copilot. В публикации о запуске Nace также предлагает облачным пользователям бонус $25 за регистрацию.

Как Drex 1.5 сравнивается с другими моделями принятия решений?

ХарактеристикаDrex 1.5Jev 1.13.0Bespoke Nimble 9B v3
РазработчикNace.AITypeSafe AIBespoke Labs
Параметры8.95BНе раскрытоLoRA на Qwen3.5-9B
ВесаОткрытыеЗакрытые (только API)Открытые (адаптер)
ЛицензияNace.AI Open RAIL-MПроприетарнаяCC BY-NC 4.0
Контекст16 384 по умолчанию, до 131 07264K на запрос, состояние 32K плюс самый длинный вопросНе раскрыто
Decision Index 0.3.1 (общедоступный)58.0857.9657.19
Decision Index 0.2.158.2857.9156.88
JevBench (231 элемент)86,2%87,0%Не раскрыто
Локальное оборудование1 CUDA GPU (bf16), Apple Silicon или CPU (Q8_0)Не применимоБазовая Qwen3.5-9B плюс адаптер
Цена API (ввод / вывод за 1 млн)$0.04 / $0 (OpenRouter)$0.042 / $0Не раскрыто

Строки Decision Index 0.3.1 взяты из карточки модели Drex 1.5, в которой для Jev и Nimble приводятся данные общедоступной таблицы лидеров. Результат Nimble в версии 0.2.1 взят из собственной карточки модели.

Каковы ограничения?

Drex 1.5 — это слой принятия решений, а не универсальная модель. Она не может генерировать текст, код или объяснения. Её слабое место — тесты, требующие обширных знаний: 45,4% на GPQA Diamond против 78,6% у Jev и 58,7% на MMLU-Pro против 82,7%.

Обучение на обучающих выборках эталонных тестов индекса помогает модели справляться со знакомыми типами решений. Результаты в новых областях могут отличаться. Для локального развёртывания через Ollama и llama.cpp требуются форки Nace, а не основные сборки. На веса распространяется лицензия RAIL-M с ограничениями на использование, поэтому перед коммерческим применением ознакомьтесь с условиями.

Ключевые выводы

  • Drex 1.5 — это открытая модель принятия решений с 9 млрд параметров, оценивающая варианты за 1 проход.
  • Она набирает 58.08 в Decision Index 0.3.1, разделяя первое место с закрытой Jev 1.13.0.
  • Точность на длинных документах достигает 93,4% при объёме от 32 до 128 тыс. токенов.
  • Модель работает на 1 GPU или в виде Q8_0 GGUF размером 9,5 ГБ на Mac.
  • Слабые места: GPQA Diamond (45,4%) и анализ тональности ACOS (7,4%).

Ознакомьтесь с весами модели на Hugging Face, репозиторием на GitHub и страницей продукта Drex. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией 150k+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости