Екипът AWS Strands Agents представи Strands Harness: отворена платформа за агенти с 28% по-нисък разход на токени при сравнима точност
Много разработчици установяват, че идеята за агент работи в Claude Code или Codex, но започва да среща затруднения, когато я изградят наново със собствен цикъл. Екипът на Strands Agents в AWS се стреми да запълни тази празнина с Strands harness — напълно сглобена, универсална инфраструктура за агенти. Тя работи локално или се внедрява при облачен доставчик, предлага се за Python и TypeScript под лиценз Apache 2.0 и стартира с един ред код. Екипът отчита 28% по-ниска цена от други инфраструктури, работещи със същите модели Claude или GPT, при 6 бенчмарка и почти равна точност.
Може ли да бъде внедрена? Да. Работи локално, а включен файл с умения помага на вашия кодиращ агент да генерира конфигурация за внедряване за AWS, GCP, Azure, Cloudflare и Modal.
Какво представлява Strands Harness
Инфраструктурата е системата около модела: цикълът, инструментите, обработката на контекста, паметта и възстановяването. Strands вече предоставяше тези градивни блокове чрез Strands Harness SDK. Strands harness ги обединява в работещи настройки по подразбиране. Тя е създадена като универсален агент, а не като агент за програмиране.
По подразбиране create_harness() връща агент, който:
- Работи с актуален модел за разсъждение чрез Amazon Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.
- Предлага инструменти за shell, файлове (четене, запис, редактиране) и уеб, вместо специално създаден инструмент за всяка задача.
- Изнася обемистите резултати от инструментите във файлове и кешира повторно използваните части от всяка заявка.
- Съхранява дългосрочна памет между изпълненията и възобновява разговор от идентификатор на сесия.
- Делегира отворени подзадачи на вграден помощен агент и проследява многостъпковата работа с контролен списък.
- Зарежда Agent Skills, когато ги открие.
Настройка на бенчмарка и цифрата 28%
Екипът на Strands Agents проведе разпределено бенчмарк тестване в Amazon EC2 с Harbor — рамката за оценяване от създателите на Terminal-Bench. Резултатът е средната стойност от 6 бенчмарка: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench и Terminal-Bench 2.1. Цената е средната стойност в долари за задача. Конкурентите на графиката са Claude Code, Codex, oh-my-pi, OpenCode и DeepSeek Harness.
Важно е да се отбележи едно нещо. DeepSeek Harness беше най-ефективната по отношение на токените инфраструктура като цяло и работеше с около 14% по-ниска цена от Strands harness. Тя обаче постигна по-нисък резултат на всеки бенчмарк. Бележката към графиката посочва, че включването ѝ е намалило общата стойност на спестяванията до 28%. Най-високата точка на графиката е Claude Opus 5 със Strands harness — близо до 85%.
Terminal-Bench 2.1: Един и същ модел, 5 инфраструктури
Най-ясното директно сравнение използва Claude Fable 5 в Terminal-Bench 2.1, с 89 изпитания за всяка инфраструктура.
| Инфраструктура | Цена на изпълнението | Точност |
|---|---|---|
| Strands harness | $56.29 | 69.7 |
| Oh-my-pi | $86.83 | 69.7 |
| OpenCode | $73.42 | 66.3 |
| Claude Code | $248.05 | 61.8 |
| DeepSeek Harness | $40.30 | 59.5 |
Спрямо Claude Code Strands harness струваше с 77% по-малко и постигна резултат с 7,9 пункта по-висок. Oh-my-pi изравни нейната точност от 69,7 при 54% по-висока цена. DeepSeek Harness беше още по-евтина, но изостана с 10,2 пункта. Екипът отбеляза също, че 2 други инфраструктури с отворен код са се представили добре по отношение на цена и точност спрямо Claude Code.
Какво осигурява ефективността
Strands harness предлага настройки по подразбиране за кеширане на подсказките и управление на контекста. Екипът посочва, че управлението на контекста до голяма степен е довело както до ефективността по отношение на токените, така и до точността. 3 правила вършат работата:
- Резултатите от инструментите с обем над около 1500 токена се съкращават.
- Обобщаването (компактирането) се задейства, когато използването на контекста надхвърли 85%.
- Възстановяването на контекста се изпълнява в цикъла, ако прозорецът се препълни.
Това съответства на скорошни независими изследвания. Проучването HarnessTax сравнява Claude Code, Codex CLI и Pi със 7 модела. То установява, че изборът на инфраструктура почти не променя процента на успех, докато един и същ модел достига сходен успех при цена до 5 пъти по-висока. Изследователите от Strands посочват, че предстои публикация с последващо изследване на техните бенчмаркове.
Първи стъпки
Инсталирайте с pip install strands-harness или npm install @strands-agents/harness. Изберете модел по име или насочете инфраструктурата към локален модел на Ollama:
from strands_harness import create_harness
agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")CLI инструментът на Strands (npm install @strands-agents/strands-cli) ви позволява да прототипирате агент на обикновен английски език. В демонстрацията на екипа агентът беше помолен да добави сървъра Playwright MCP и да измери латентността при зареждане на видео в публикация в блог. След изпълнение на /export беше генериран кодът на инфраструктурата с включен Playwright MCP като zip архив за Python или TypeScript.
Самият CLI инструмент е изграден върху Strands harness. Инженерът на Strands Гаутам Сирдешмух също го използва, за да изгради настолно приложение, което стартира дистанционно изпълнения на Strands harness.
Персонализацията е задълбочена. Можете да замените всяка настройка по подразбиране, да смените моделите, да добавите инструменти или да замените компоненти чак до Strands Harness SDK. Тъй като инфраструктурата е библиотечна зависимост, агентът, прототипиран на лаптоп, е същият, който е вграден в продукционната среда.
Основни изводи
- Strands harness обединява примитивите на AWS Strands в универсален агент с лиценз Apache 2.0.
- Тя отчита 28% по-ниска цена от конкурентните инфраструктури при 6 бенчмарка и сравнима точност.
- С Fable 5 в Terminal-Bench 2.1 тя струваше с 77% по-малко от Claude Code и постигна по-висок резултат.
- Настройките на контекста по подразбиране осигуряват подобренията: съкращаване при 1500 токена, компактиране при 85% и възстановяване в цикъла.
- Едно извикване на
create_harness()работи с Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.
Разгледайте техническите подробности, хранилището в GitHub, пакета в PyPI и документацията на Strands Agents.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.