Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Екипът AWS Strands Agents представи Strands Harness: отворена платформа за агенти с 28% по-нисък разход на токени при сравнима точност

Много разработчици установяват, че идеята за агент работи в Claude Code или Codex, но започва да среща затруднения, когато я изградят наново със собствен цикъл. Екипът на Strands Agents в AWS се стреми да запълни тази празнина с Strands harness — напълно сглобена, универсална инфраструктура за агенти. Тя работи локално или се внедрява при облачен доставчик, предлага се за Python и TypeScript под лиценз Apache 2.0 и стартира с един ред код. Екипът отчита 28% по-ниска цена от други инфраструктури, работещи със същите модели Claude или GPT, при 6 бенчмарка и почти равна точност.

Може ли да бъде внедрена? Да. Работи локално, а включен файл с умения помага на вашия кодиращ агент да генерира конфигурация за внедряване за AWS, GCP, Azure, Cloudflare и Modal.

Какво представлява Strands Harness

Инфраструктурата е системата около модела: цикълът, инструментите, обработката на контекста, паметта и възстановяването. Strands вече предоставяше тези градивни блокове чрез Strands Harness SDK. Strands harness ги обединява в работещи настройки по подразбиране. Тя е създадена като универсален агент, а не като агент за програмиране.

По подразбиране create_harness() връща агент, който:

  • Работи с актуален модел за разсъждение чрез Amazon Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.
  • Предлага инструменти за shell, файлове (четене, запис, редактиране) и уеб, вместо специално създаден инструмент за всяка задача.
  • Изнася обемистите резултати от инструментите във файлове и кешира повторно използваните части от всяка заявка.
  • Съхранява дългосрочна памет между изпълненията и възобновява разговор от идентификатор на сесия.
  • Делегира отворени подзадачи на вграден помощен агент и проследява многостъпковата работа с контролен списък.
  • Зарежда Agent Skills, когато ги открие.

Настройка на бенчмарка и цифрата 28%

Екипът на Strands Agents проведе разпределено бенчмарк тестване в Amazon EC2 с Harbor — рамката за оценяване от създателите на Terminal-Bench. Резултатът е средната стойност от 6 бенчмарка: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench и Terminal-Bench 2.1. Цената е средната стойност в долари за задача. Конкурентите на графиката са Claude Code, Codex, oh-my-pi, OpenCode и DeepSeek Harness.

Важно е да се отбележи едно нещо. DeepSeek Harness беше най-ефективната по отношение на токените инфраструктура като цяло и работеше с около 14% по-ниска цена от Strands harness. Тя обаче постигна по-нисък резултат на всеки бенчмарк. Бележката към графиката посочва, че включването ѝ е намалило общата стойност на спестяванията до 28%. Най-високата точка на графиката е Claude Opus 5 със Strands harness — близо до 85%.

Terminal-Bench 2.1: Един и същ модел, 5 инфраструктури

Най-ясното директно сравнение използва Claude Fable 5 в Terminal-Bench 2.1, с 89 изпитания за всяка инфраструктура.

ИнфраструктураЦена на изпълнениетоТочност
Strands harness$56.2969.7
Oh-my-pi$86.8369.7
OpenCode$73.4266.3
Claude Code$248.0561.8
DeepSeek Harness$40.3059.5

Спрямо Claude Code Strands harness струваше с 77% по-малко и постигна резултат с 7,9 пункта по-висок. Oh-my-pi изравни нейната точност от 69,7 при 54% по-висока цена. DeepSeek Harness беше още по-евтина, но изостана с 10,2 пункта. Екипът отбеляза също, че 2 други инфраструктури с отворен код са се представили добре по отношение на цена и точност спрямо Claude Code.

Какво осигурява ефективността

Strands harness предлага настройки по подразбиране за кеширане на подсказките и управление на контекста. Екипът посочва, че управлението на контекста до голяма степен е довело както до ефективността по отношение на токените, така и до точността. 3 правила вършат работата:

  • Резултатите от инструментите с обем над около 1500 токена се съкращават.
  • Обобщаването (компактирането) се задейства, когато използването на контекста надхвърли 85%.
  • Възстановяването на контекста се изпълнява в цикъла, ако прозорецът се препълни.

Това съответства на скорошни независими изследвания. Проучването HarnessTax сравнява Claude Code, Codex CLI и Pi със 7 модела. То установява, че изборът на инфраструктура почти не променя процента на успех, докато един и същ модел достига сходен успех при цена до 5 пъти по-висока. Изследователите от Strands посочват, че предстои публикация с последващо изследване на техните бенчмаркове.

Първи стъпки

Инсталирайте с pip install strands-harness или npm install @strands-agents/harness. Изберете модел по име или насочете инфраструктурата към локален модел на Ollama:

Копиране на кодаКопираноИзползване на друг браузър
from strands_harness import create_harness

agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")

CLI инструментът на Strands (npm install @strands-agents/strands-cli) ви позволява да прототипирате агент на обикновен английски език. В демонстрацията на екипа агентът беше помолен да добави сървъра Playwright MCP и да измери латентността при зареждане на видео в публикация в блог. След изпълнение на /export беше генериран кодът на инфраструктурата с включен Playwright MCP като zip архив за Python или TypeScript.

Самият CLI инструмент е изграден върху Strands harness. Инженерът на Strands Гаутам Сирдешмух също го използва, за да изгради настолно приложение, което стартира дистанционно изпълнения на Strands harness.

Персонализацията е задълбочена. Можете да замените всяка настройка по подразбиране, да смените моделите, да добавите инструменти или да замените компоненти чак до Strands Harness SDK. Тъй като инфраструктурата е библиотечна зависимост, агентът, прототипиран на лаптоп, е същият, който е вграден в продукционната среда.

Основни изводи

  • Strands harness обединява примитивите на AWS Strands в универсален агент с лиценз Apache 2.0.
  • Тя отчита 28% по-ниска цена от конкурентните инфраструктури при 6 бенчмарка и сравнима точност.
  • С Fable 5 в Terminal-Bench 2.1 тя струваше с 77% по-малко от Claude Code и постигна по-висок резултат.
  • Настройките на контекста по подразбиране осигуряват подобренията: съкращаване при 1500 токена, компактиране при 85% и възстановяване в цикъла.
  • Едно извикване на create_harness() работи с Bedrock, Anthropic, OpenAI, Google, Ollama или LiteLLM.

Разгледайте техническите подробности, хранилището в GitHub, пакета в PyPI и документацията на Strands Agents.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини