Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

AWS Strands Labs пусна Strands Decider 2B: модел с отворен код за вземане на решения, който избира опции за около 115 мс

AWS Strands Labs пуска Strands Decider 2B, модел с отворен код за вземане на решения. Той не генерира текст. Прочита състояние и типизирани въпроси, след което връща избор, вероятност „да/не“ или оценка с калибрирана увереност. Моделът има 1,9 милиарда параметъра и работи локално на процесор, потребителски графичен процесор или Mac с Apple silicon.

Може ли да бъде внедрен? Да, за локална употреба и самостоятелно хостване. Теглата са в Hugging Face под лиценза Apache-2.0, а pip install strands-decider предоставя CLI и HTTP сървър. Вграденият сървър се свързва към 127.0.0.1 без удостоверяване, така че за продукционна среда е необходим ваш собствен слой за удостоверяване. Все още няма доставчик на хоствани услуги за инференция, който да го предлага.

Какво прави един модел за вземане на решения

Моделите за вземане на решения, наричани още модели System One, се превърнаха в отделна категория, след като TypeSafe AI пусна Jev миналия месец. Един LLM може да генерира произволен изход. Моделът за вземане на решения избира само между опции или оценява по скала.

Strands Decider поддържа 3 типа въпроси:

  • choice: избира 1 от N опции.
  • noul: вероятност „да/не“ между 0 и 1.
  • score: ниво по подредена скала за оценяване.

Всеки отговор е сред разрешените опции и включва увереност. Екипът посочва, че моделът е по-слаб от моделите за разсъждение при сложни задачи. Той не е подходящ за програмиране, чат или обобщаване.

Архитектура: LLM без устата му

Екипът започва с Qwen3.5-2B-Base и премахва езиковата глава за моделиране. На нейно място е поставена малка указателна глава с около 1 милион параметъра. Тази глава сравнява скритото състояние на позицията <answer> със скритото състояние на последния токен на всяка опция. Един проход напред дава резултата, без цикъл за декодиране.

Тялото използва LoRA с ранг 16, а главата работи във fp32. Наборите от етикети идват от заявката, така че броят на опциите не е ограничен. Публикуваната контролна точка е v19.

Задаването на няколко въпроса за един текст е евтино. Състоянието се прочита веднъж, а всеки допълнителен въпрос добавя само собствените си токени.

Бенчмаркове и латентност

Екипът измерва точността и калибрирането върху публичния набор на JevBench, независим бенчмарк за модели от класа на Jev. Публикувани резултати за v19:

  • Публична точност на JevBench v1: 0,723 (167 от 231 задачи).
  • Резултат на Brier 0,342, очаквана грешка при калибриране 0,052.
  • Точност по нива: лесни 1,000, стандартни 0,875, трудни 0,505.
  • Латентност на RTX 3090: медиана 115 ms, p95 299 ms.
  • Латентност на M3 Pro: загрята медиана 153 ms при под 300 токена.

В класацията v1.4.2 от 25 септември v19 зае 3-то място от 33 модела в класа 2B. Без 3-те модела, които са малко над 2B, той зае 1-во място от 30. Хранилището също посочва една уговорка. По-новият decider-2b v11 на Mapika постига 175 от 231 в тестовата система на Strands, с 8 задачи повече. Към момента на написване Strands Decider не беше включен в по-новата комбинирана класация v1.5.4.

Калибрирането е практическото предимство. При невиждани кратки задачи за класификация отговорите с увереност 0,9 или по-висока са били правилни около 95% от времето. Екипът препоръчва потвърждение или ескалация под този праг.

Как се сравнява

ХарактеристикаStrands Decider 2B (v19)Jev 1.13.0decider-2bDecision 2B
РазработчикStrands Agents (AWS)TypeSafe AIMapikaFlyMy.AI
ДостъпОтворени тегла, Apache-2.0Затворен хостван APIОтворен код или теглаОтворен код или тегла
Базов моделQwen3.5-2B-Base + LoRA + указателна главаНе е обявенQwen3.5-2B-Base + обучен readoutMiniCPM5-2B + LoRA + указателна глава
Размер1,9BНе е обявен1,9B2,5B плътен
Самостоятелно хостванеДаНеДаДа
Пълна рецепта за обучение и публикуван списък с данниДаНеНе е потвърденоНе е потвърдено
Публична точност на JevBench (класация v1.4.2)0,723Не присъства в изходната таблица0,7100,753
Отчетена латентностМедиана 115 ms (RTX 3090)70 до 500 ms (доставчик)Не е сравненаНе е сравнена

Източници: Сравнение на Strands с JevBench, Benchmark Heaven JevBench, Продуктова страница на Jev. Латентностите са измерени на различен хардуер и с различни тестови системи, така че не са пряко сравними.

Случаи на употреба и пример с предпазна мярка

Екипът отчита ранни успехи при маршрутизиране между модели, избор на инструменти, проверка на аргументи, триаж, предпазни мерки, оценки и хибридни агенти. При хибриден агент LLM взема трудните решения, а моделът за решения обработва рутинните.

Примерът в хранилището контролира извикването на инструмент за времето в агент на Strands. Интервенция before_tool_call задава 2 въпроса с отговор „да/не“. Съответстват ли аргументите на казаното от потребителя? Преждевременно ли е извикването в момента? Ако агентът е отгатнал град, той пита потребителя вместо това.

От CLI маршрутизирането на „Помощ! Моите плащания не минават от 3 дни!“ между категориите за фактуриране, продажби и връщане на стоки го определя като billing с увереност 0,768.

Основни изводи

  • Strands Decider 2B връща избори, отговори „да/не“ и оценки, но никога текст.
  • Той заменя LM главата на Qwen3.5-2B с указателна глава с около 1 милион параметъра.
  • v19 постига 0,723 в публичния JevBench, с ECE 0,052.
  • Медианната латентност е 115 ms на RTX 3090.
  • Теглата, кодът, списъкът с данни и рецептата се предоставят под Apache-2.0.

Разгледайте техническите подробности, хранилището в GitHub и теглата на модела. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини