Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

AWS Strands Labs выпустила Strands Decider 2B: модель принятия решений с открытым исходным кодом, выбирающая варианты примерно за 115 мс

AWS Strands Labs выпускает Strands Decider 2B — модель принятия решений с открытым исходным кодом. Она не генерирует текст. Она читает состояние и типизированные вопросы, а затем возвращает вариант, вероятность «да/нет» или оценку с откалиброванной уверенностью. Модель содержит 1,9 миллиарда параметров и работает локально на CPU, пользовательском GPU или Mac с Apple Silicon.

Можно ли её развернуть? Да, для локального использования и самостоятельного хостинга. Веса доступны на Hugging Face по лицензии Apache-2.0, а команда pip install strands-decider устанавливает CLI и HTTP-сервер. Встроенный сервер привязывается к 127.0.0.1 и не использует аутентификацию, поэтому для промышленной эксплуатации потребуется собственный слой аутентификации. Пока ни один провайдер размещённого инференса её не предоставляет.

Что делает модель принятия решений

Модели принятия решений, также называемые моделями System One, стали отдельной категорией после того, как в прошлом месяце TypeSafe AI запустила Jev. LLM может генерировать произвольный вывод. Модель принятия решений лишь выбирает один из вариантов или выставляет оценку по шкале.

Strands Decider поддерживает 3 типа вопросов:

  • choice: выбрать 1 из N вариантов.
  • noul: вероятность «да/нет» от 0 до 1.
  • score: уровень по упорядоченной шкале.

Каждый ответ выбирается из разрешённых вариантов и сопровождается показателем уверенности. Команда заявляет, что на сложных задачах модель уступает моделям, способным рассуждать. Она не подходит для программирования, чата или суммаризации.

Архитектура: LLM без речевого аппарата

Команда начинает с Qwen3.5-2B-Base и удаляет языковую моделирующую «голову». Её заменяет небольшая указательная голова примерно с 1 миллионом параметров. Эта голова сравнивает скрытое состояние в позиции <answer> со скрытым состоянием последнего токена каждого варианта. Один прямой проход даёт результат, без цикла декодирования.

В основе используется LoRA ранга 16, а голова работает в fp32. Наборы меток поступают из запроса, поэтому количество вариантов ничем не ограничено. Выпущенная контрольная точка — v19.

Задать несколько вопросов по одному тексту недорого. Состояние считывается один раз, а каждый дополнительный вопрос добавляет только собственные токены.

Бенчмарки и задержка

Команда измеряет точность и калибровку на общедоступном наборе JevBench — стороннем бенчмарке для моделей класса Jev. Опубликованные показатели v19:

  • Общедоступная точность JevBench v1: 0,723 (167 из 231 задачи).
  • Оценка Бриера — 0,342, ожидаемая ошибка калибровки — 0,052.
  • Точность по уровням: простые — 1,000, стандартные — 0,875, сложные — 0,505.
  • Задержка на RTX 3090: медиана 115 мс, 95-й процентиль — 299 мс.
  • Задержка на M3 Pro: медиана 153 мс в прогретом состоянии при размере менее 300 токенов.

На таблице v1.4.2 от 25 сентября v19 заняла 3-е место из 33 в классе 2B. Если исключить 3 модели, лишь немного превышающие 2B, она заняла 1-е место из 30. В репозитории также отмечается оговорка. Более новая версия decider-2b v11 от Mapika набрала 175 из 231 на тестовом стенде Strands — на 8 задач больше. На момент написания статьи Strands Decider не была представлена в более новой сводной таблице v1.5.4.

Практическое преимущество — калибровка. На ранее не встречавшихся коротких задачах классификации ответы с уверенностью 0,9 и выше оказывались правильными примерно в 95% случаев. Команда рекомендует подтверждать результат или передавать задачу на эскалацию, если показатель ниже этого порога.

Сравнение

ХарактеристикаStrands Decider 2B (v19)Jev 1.13.0decider-2bDecision 2B
РазработчикStrands Agents (AWS)TypeSafe AIMapikaFlyMy.AI
ДоступОткрытые веса, Apache-2.0Закрытый размещённый APIОткрытый код или весаОткрытый код или веса
Базовая модельQwen3.5-2B-Base + LoRA + указательная головаНе раскрываетсяQwen3.5-2B-Base + обученный считывающий модульMiniCPM5-2B + LoRA + указательная голова
Размер1,9BНе раскрывается1,9B2,5B, плотная
Самостоятельный хостингДаНетДаДа
Опубликованы полный рецепт обучения и список данныхДаНетНе провереноНе проверено
Общедоступная точность JevBench (таблица v1.4.2)0,723В исходной таблице отсутствует0,7100,753
Заявленная задержкаМедиана 115 мс (RTX 3090)От 70 до 500 мс (по данным поставщика)Не сравниваласьНе сравнивалась

Источники: сравнение Strands на JevBench, JevBench от Benchmark Heaven, страница продукта Jev. Задержки получены на разном оборудовании и в разных тестовых стендах, поэтому их нельзя напрямую сравнивать.

Варианты использования и пример защитного механизма

Команда сообщает о первых успешных результатах в маршрутизации моделей, выборе инструментов, проверке аргументов, первичной сортировке, защитных механизмах, оценивании и гибридных агентах. В гибридном агенте LLM принимает сложные решения, а decider обрабатывает рутинные.

Пример в репозитории ограничивает вызов погодного инструмента внутри агента Strands. Вмешательство before_tool_call задаёт 2 вопроса с ответами «да/нет». Основаны ли аргументы на том, что сказал пользователь? Не слишком ли рано выполнять вызов? Если агент угадал город, он вместо этого спрашивает пользователя.

В CLI маршрутизация запроса «Помогите! Мои выплаты не проходят уже 3 дня!» между категориями биллинга, продаж и возвратов в рознице возвращает billing с уверенностью 0,768.

Основные выводы

  • Strands Decider 2B возвращает варианты, ответы «да/нет» и оценки, но никогда не генерирует текст.
  • Она заменяет языковую голову Qwen3.5-2B на указательную голову примерно с 1 млн параметров.
  • v19 набирает 0,723 на общедоступном JevBench при ECE 0,052.
  • Медианная задержка на RTX 3090 составляет 115 мс.
  • Веса, код, список данных и рецепт выпускаются по лицензии Apache-2.0.

Ознакомьтесь с техническими подробностями, репозиторием на GitHub и весами модели. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости