AWS Strands Labs випустила Strands Decider 2B: модель ухвалення рішень із відкритим кодом, що обирає варіанти приблизно за 115 мс
AWS Strands Labs випускає Strands Decider 2B — модель прийняття рішень із відкритим кодом. Вона не генерує текст. Модель зчитує стан і типізовані запитання, а потім повертає вибір, імовірність «так/ні» або оцінку з каліброваною впевненістю. Модель має 1,9 мільярда параметрів і працює локально на CPU, споживчому GPU або Mac з Apple silicon.
Чи придатна вона для розгортання? Так, для локального використання та власного хостингу. Ваги доступні на Hugging Face за ліцензією Apache-2.0, а команда pip install strands-decider надає CLI та HTTP-сервер. Вбудований сервер прив’язується до 127.0.0.1 і не має автентифікації, тож для продакшену потрібен власний рівень автентифікації. Поки що жоден провайдер хостингу інференсу її не обслуговує.
Що робить модель прийняття рішень
Моделі прийняття рішень, також відомі як моделі System One, стали окремою категорією після того, як минулого місяця TypeSafe AI представила Jev. LLM може генерувати довільний результат. Модель прийняття рішень лише обирає між варіантами або оцінює за шкалою.
Strands Decider підтримує 3 типи запитань:
- choice: вибір 1 із N варіантів.
- noul: імовірність «так/ні» від 0 до 1.
- score: рівень за впорядкованою шкалою.
Кожна відповідь походить із дозволених варіантів і має показник упевненості. Команда зазначає, що модель поступається моделям міркування у складних завданнях. Вона не підходить для програмування, чатів або підсумовування.
Архітектура: LLM без здатності говорити
Команда починає з Qwen3.5-2B-Base і відкидає мовну моделювальну голову. Замість неї використовується невелика вказівна голова приблизно на 1 мільйон параметрів. Ця голова порівнює прихований стан у позиції <answer> із прихованим станом останнього токена кожного варіанта. Один прямий прохід дає результат без циклу декодування.
У торсі використовується LoRA рангу 16, а голова працює у форматі fp32. Набори міток надходять із запиту, тож кількість варіантів нічим не обмежена. Випущена контрольна точка — v19.
Поставити кілька запитань щодо одного тексту недорого. Стан зчитується один раз, а кожне додаткове запитання додає лише власні токени.
Бенчмарки та затримка
Команда вимірює точність і калібрування на загальнодоступному наборі JevBench — сторонньому бенчмарку для моделей класу Jev. Опубліковані показники v19:
- Загальнодоступна точність JevBench v1: 0,723 (167 із 231 завдання).
- Оцінка Бр'єра — 0,342, очікувана похибка калібрування — 0,052.
- Точність за рівнями: легкі — 1,000, стандартні — 0,875, складні — 0,505.
- Затримка на RTX 3090: медіана 115 мс, 95-й перцентиль — 299 мс.
- Затримка на M3 Pro: медіана 153 мс у прогрітому стані для запитів до 300 токенів.
На таблиці v1.4.2 від 25 вересня v19 посіла 3-тє місце з 33 у класі 2B. Якщо не враховувати 3 моделі, що лише трохи перевищують 2B, вона посіла 1-ше місце з 30. Репозиторій також містить застереження. Новіша модель Mapika decider-2b v11 набрала 175 із 231 за тестовим стендом Strands — на 8 завдань більше. На момент написання матеріалу Strands Decider не була представлена на новішій зведеній таблиці v1.5.4.
Калібрування є практичною перевагою. У невідомих коротких завданнях класифікації відповіді з упевненістю 0,9 або вище були правильними приблизно у 95% випадків. Команда радить підтверджувати відповідь або передавати завдання на ескалацію, якщо показник нижчий за цей поріг.
Порівняння
| Характеристика | Strands Decider 2B (v19) | Jev 1.13.0 | decider-2b | Decision 2B |
|---|---|---|---|---|
| Розробник | Strands Agents (AWS) | TypeSafe AI | Mapika | FlyMy.AI |
| Доступ | Відкриті ваги, Apache-2.0 | Закритий API із хостингом | Відкритий код або ваги | Відкритий код або ваги |
| Базова модель | Qwen3.5-2B-Base + LoRA + вказівна голова | Не розкрито | Qwen3.5-2B-Base + навчений зчитувач | MiniCPM5-2B + LoRA + вказівна голова |
| Розмір | 1,9B | Не розкрито | 1,9B | 2,5B, щільна |
| Власний хостинг | Так | Ні | Так | Так |
| Повний рецепт навчання та список даних опубліковано | Так | Ні | Не перевірено | Не перевірено |
| Загальнодоступна точність JevBench (таблиця v1.4.2) | 0,723 | Відсутня у вихідній таблиці | 0,710 | 0,753 |
| Заявлена затримка | Медіана 115 мс (RTX 3090) | 70–500 мс (за даними постачальника) | Не порівнювалася | Не порівнювалася |
Джерела: порівняння Strands JevBench, Benchmark Heaven JevBench, сторінка продукту Jev. Показники затримки отримано на різному обладнанні та за допомогою різних тестових стендів, тому їх не можна безпосередньо порівнювати.
Варіанти використання та приклад захисного механізму
Команда повідомляє про перші успішні результати у маршрутизації моделей, виборі інструментів, перевірці аргументів, тріажі, захисних механізмах, оцінюванні та гібридних агентах. У гібридному агенті LLM приймає складні рішення, а decider обробляє рутинні.
Приклад у репозиторії обмежує виклик погодного інструмента всередині агента Strands. Перехоплення before_tool_call ставить 2 запитання «так/ні». Чи ґрунтуються аргументи на тому, що сказав користувач? Чи не зарано виконувати виклик? Якщо агент вгадав місто, він натомість запитує користувача.
У CLI маршрутизація запиту «Допоможіть! Мої виплати не проходять уже 3 дні!» між категоріями billing, sales і retail повертає billing з упевненістю 0,768.
Основні висновки
- Strands Decider 2B повертає варіанти, відповіді «так/ні» та оцінки, але ніколи не генерує текст.
- Вона замінює LM-голову Qwen3.5-2B на вказівну голову приблизно з 1 млн параметрів.
- v19 набирає 0,723 на загальнодоступному JevBench, а ECE становить 0,052.
- Медіанна затримка на RTX 3090 становить 115 мс.
- Ваги, код, список даних і рецепт поширюються за ліцензією Apache-2.0.
Ознайомтеся з технічними деталями, репозиторієм GitHub і вагами моделі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібне партнерство з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.