Команда AWS Strands Agents выпустила Strands Harness: открытый фреймворк для агентов с затратами на токены на 28% ниже при сопоставимой точности
Многие разработчики обнаруживают, что идея агента работает внутри Claude Code или Codex, но начинает испытывать трудности после того, как они пересобирают её с собственным циклом. Команда Strands Agents в AWS нацелилась на устранение этого пробела с помощью Strands harness — полностью собранной универсальной оболочки для агентов. Она работает локально или разворачивается у облачного провайдера, выпускается для Python и TypeScript по лицензии Apache 2.0 и запускается одной строкой кода. Команда сообщает о снижении стоимости на 28% по сравнению с другими оболочками, использующими те же модели Claude или GPT, по итогам 6 бенчмарков при почти такой же точности.
Можно ли её развернуть? Да. Она работает локально, а входящий в комплект файл навыков помогает вашему агенту для работы с кодом генерировать конфигурацию развёртывания для AWS, GCP, Azure, Cloudflare и Modal.
Что такое Strands Harness
Оболочка — это система вокруг модели: цикл, инструменты, обработка контекста, память и восстановление. Strands уже предоставляла эти строительные блоки через Strands Harness SDK. Strands harness объединяет их в рабочие настройки по умолчанию. Она создана как универсальный агент, а не как агент для работы с кодом.
Сразу после создания create_harness() возвращает агента, который:
- Работает на актуальной reasoning-модели через Amazon Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.
- Поставляется с инструментами оболочки, файловыми инструментами (чтение, запись, редактирование) и веб-инструментами вместо специализированного инструмента для каждой задачи.
- Выгружает объёмные результаты работы инструментов в файлы и кэширует повторно используемые части каждого запроса.
- Сохраняет долгосрочную память между запусками и возобновляет разговор по идентификатору сессии.
- Передаёт открытые подзадачи встроенному вспомогательному агенту и отслеживает многоэтапную работу с помощью контрольного списка.
- Загружает навыки агентов, когда обнаруживает их.
Настройка бенчмарка и показатель 28%
Команда Strands Agents провела распределённое тестирование производительности на Amazon EC2 с помощью Harbor — фреймворка оценки от создателей Terminal-Bench. Оценка представляет собой среднее значение по 6 бенчмаркам: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench и Terminal-Bench 2.1. Стоимость — это среднее количество долларов на задачу. Конкуренты на графике — Claude Code, Codex, oh-my-pi, OpenCode и DeepSeek Harness.
Важно отметить одну вещь. DeepSeek Harness оказался самой эффективной по количеству токенов оболочкой в целом: его запуск обходился примерно на 14% дешевле, чем Strands harness. Однако он также показал более низкие результаты по каждому бенчмарку. В примечании к графику указано, что его включение снизило общий показатель экономии до 28%. Самая высокая точка на графике — Claude Opus 5 в Strands harness, около 85%.
Terminal-Bench 2.1: одна модель, 5 оболочек
Наиболее наглядное прямое сравнение использует Claude Fable 5 в Terminal-Bench 2.1 — по 89 испытаний для каждой оболочки.
| Оболочка | Стоимость запуска | Точность |
|---|---|---|
| Strands harness | $56.29 | 69.7 |
| Oh-my-pi | $86.83 | 69.7 |
| OpenCode | $73.42 | 66.3 |
| Claude Code | $248.05 | 61.8 |
| DeepSeek Harness | $40.30 | 59.5 |
По сравнению с Claude Code стоимость Strands harness была на 77% ниже, а результат — на 7,9 процентного пункта выше. Oh-my-pi достигла такой же точности — 69,7 — при стоимости на 54% выше. DeepSeek Harness оказался ещё дешевле, но отстал на 10,2 процентного пункта. Команда также отметила, что ещё 2 оболочки с открытым исходным кодом показали хорошие результаты по стоимости и точности в сравнении с Claude Code.
Что обеспечивает эффективность
В Strands harness по умолчанию предусмотрены кэширование промптов и управление контекстом. По словам команды, именно управление контекстом в значительной степени обеспечило эффективность использования токенов и точность. Работу выполняют 3 правила:
- Результаты работы инструментов объёмом более примерно 1 500 токенов усекаются.
- Суммаризация (компактификация) запускается, когда использование контекста превышает 85%.
- Восстановление контекста выполняется внутри цикла, если происходит переполнение окна.
Это соответствует результатам недавнего независимого исследования. В исследовании HarnessTax сравнивались Claude Code, Codex CLI и Pi на 7 моделях. Оно показало, что выбор оболочки почти не влияет на показатели успешности, тогда как одна и та же модель достигала схожего уровня успешности при разнице в стоимости до 5 раз. Исследователи Strands сообщили, что готовят последующую статью о своих бенчмарках.
Начало работы
Установите пакет с помощью pip install strands-harness или npm install @strands-agents/harness. Выберите модель по имени или укажите оболочке локальную модель Ollama:
from strands_harness import create_harness
agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")Strands CLI (npm install @strands-agents/strands-cli) позволяет создавать прототип агента на обычном английском языке. В демонстрации команды агенту поручили добавить сервер Playwright MCP и измерить задержку загрузки видео в записи блога. После запуска /export был создан код оболочки с включённым Playwright MCP в виде zip-архива для Python или TypeScript.
Сам CLI построен на Strands harness. Инженер Strands Гаутам Сирдешмух также использовал его для создания настольного приложения, которое удалённо запускает процессы Strands harness.
Возможности настройки весьма широки. Можно переопределить любые настройки по умолчанию, заменить модели, добавить инструменты или заменить компоненты вплоть до Strands Harness SDK. Поскольку оболочка является зависимостью библиотеки, агент, созданный в виде прототипа на ноутбуке, остаётся тем же самым агентом, встроенным в рабочую среду.
Ключевые выводы
- Strands harness объединяет примитивы Strands от AWS в универсального агента по лицензии Apache 2.0.
- По данным команды, стоимость работы на 28% ниже, чем у конкурирующих оболочек, по итогам 6 бенчмарков при сопоставимой точности.
- При использовании Fable 5 в Terminal-Bench 2.1 стоимость была на 77% ниже, чем у Claude Code, а результат — выше.
- Выигрыш обеспечивается настройками контекста по умолчанию: усечение на 1 500 токенах, компактификация при 85% и восстановление внутри цикла.
- Один вызов
create_harness()позволяет работать с Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.
Подробнее читайте в разделе «Технические детали», репозитории GitHub, пакете PyPI и документации Strands Agents.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.