Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Команда AWS Strands Agents випустила Strands Harness: відкритий фреймворк для агентів із на 28% нижчими витратами токенів за порівнянної точності

Багато розробників виявляють, що ідея агента працює всередині Claude Code або Codex, але починає давати збої, щойно вони перебудовують її за допомогою власного циклу. Команда Strands Agents в AWS намагається усунути цю проблему за допомогою Strands harness — повністю зібраного універсального каркаса для агентів. Він працює локально або розгортається в хмарного провайдера, доступний для Python і TypeScript за ліцензією Apache 2.0 та запускається одним рядком коду. Команда повідомляє про на 28% нижчу вартість порівняно з іншими каркасами, що запускають ті самі моделі Claude або GPT у 6 бенчмарках, за майже однакової точності.

Чи придатний він для розгортання? Так. Він працює локально, а вбудований файл навичок допомагає вашому агенту для програмування генерувати конфігурацію розгортання для AWS, GCP, Azure, Cloudflare і Modal.

Що таке Strands Harness

Каркас — це система навколо моделі: цикл, інструменти, робота з контекстом, пам’ять і відновлення. Strands уже надавав ці будівельні блоки через Strands Harness SDK. Strands harness об’єднує їх у готові робочі налаштування. Він створений як універсальний агент, а не агент для програмування.

Одразу після створення create_harness() повертає агента, який:

  • Працює на сучасній моделі міркування через Amazon Bedrock, Anthropic, OpenAI, Google, Ollama або LiteLLM.
  • Має вбудовані інструменти оболонки, роботи з файлами (читання, запис, редагування) і вебу замість окремого спеціального інструмента для кожного завдання.
  • Виносить об’ємні результати роботи інструментів у файли та кешує частини кожного запиту, які використовуються повторно.
  • Зберігає довготривалу пам’ять між запусками та відновлює розмову за ідентифікатором сесії.
  • Делегує відкриті підзавдання вбудованому допоміжному агенту й відстежує багатокрокову роботу за допомогою контрольного списку.
  • Завантажує Agent Skills, коли знаходить їх.

Налаштування бенчмарків і показник 28%

Команда Strands Agents провела розподілене тестування продуктивності на Amazon EC2 за допомогою Harbor — фреймворку оцінювання від творців Terminal-Bench. Оцінка є середнім значенням за 6 бенчмарками: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench і Terminal-Bench 2.1. Вартість — це середні витрати в доларах на одне завдання. Конкуренти на графіку — Claude Code, Codex, oh-my-pi, OpenCode і DeepSeek Harness.

Важливо зазначити одну річ. DeepSeek Harness загалом був каркасом із найефективнішим використанням токенів: його запуск був приблизно на 14% дешевшим, ніж у Strands harness. Він також показав нижчі результати в кожному бенчмарку. У примітці до графіка зазначено, що його включення знизило загальний показник економії до 28%. Найвища точка на графіку — Claude Opus 5 на Strands harness, приблизно 85%.

Terminal-Bench 2.1: одна модель, 5 каркасів

Найнаочніше пряме порівняння використовує Claude Fable 5 на Terminal-Bench 2.1, із 89 випробуваннями для кожного каркаса.

КаркасВартість запускуТочність
Strands harness$56.2969.7
Oh-my-pi$86.8369.7
OpenCode$73.4266.3
Claude Code$248.0561.8
DeepSeek Harness$40.3059.5

Порівняно з Claude Code, Strands harness коштував на 77% дешевше й набрав на 7,9 пункта більше. Oh-my-pi досяг такої самої точності — 69,7 — за вартості, що була на 54% вищою. DeepSeek Harness був іще дешевшим, але відставав на 10,2 пункта. Команда також зазначила, що 2 інші каркаси з відкритим кодом добре показали себе за вартістю й точністю порівняно з Claude Code.

Що забезпечує ефективність

Strands harness постачається з готовими налаштуваннями для кешування промптів і керування контекстом. Команда стверджує, що керування контекстом значною мірою забезпечило як ефективність використання токенів, так і точність. Роботу виконують 3 правила:

  • Результати роботи інструментів обсягом приблизно понад 1 500 токенів скорочуються.
  • Узагальнення (компактизація) запускається, коли використання контексту перевищує 85%.
  • Відновлення контексту виконується всередині циклу, якщо вікно переповнюється.

Це відповідає результатам нещодавнього незалежного дослідження. У дослідженні HarnessTax порівнювали Claude Code, Codex CLI та Pi на 7 моделях. Воно показало, що вибір каркаса майже не впливав на показники успішності, тоді як та сама модель досягала схожого результату за вартості, що була до 5 разів вищою. Дослідники Strands повідомляють, що готують подальшу статтю про свої бенчмарки.

Початок роботи

Встановіть пакет за допомогою pip install strands-harness або npm install @strands-agents/harness. Виберіть модель за назвою або вкажіть каркасу на локальну модель Ollama:

Копіювати кодСкопійованоВикористати інший браузер
from strands_harness import create_harness

agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")

Strands CLI (npm install @strands-agents/strands-cli) дає змогу створювати прототип агента звичайною англійською мовою. У демонстрації команди агенту доручили додати сервер Playwright MCP і виміряти затримку завантаження відео в публікації блогу. Після виконання /export було створено код каркаса з доданим Playwright MCP у вигляді zip-архіву для Python або TypeScript.

Сам CLI побудований на Strands harness. Інженер Strands Гаутам Сірдешмух також використав його для створення настільного застосунку, який віддалено запускає сеанси Strands harness.

Можливості налаштування широкі. Ви можете перевизначити будь-яке типове налаштування, замінити моделі, додати інструменти або замінити компоненти аж до рівня Strands Harness SDK. Оскільки каркас є залежністю бібліотеки, агент, прототип якого створено на ноутбуці, буде тим самим агентом, вбудованим у виробничу систему.

Ключові висновки

  • Strands harness об’єднує примітиви AWS Strands у універсальний агент за ліцензією Apache 2.0.
  • Він забезпечує на 28% нижчу вартість порівняно з конкуруючими каркасами в 6 бенчмарках за зіставної точності.
  • Під час роботи з Fable 5 на Terminal-Bench 2.1 він коштував на 77% дешевше за Claude Code і показав вищий результат.
  • Переваги забезпечують типові налаштування контексту: скорочення після 1 500 токенів, компактизація на рівні 85% і відновлення всередині циклу.
  • Один виклик create_harness() підтримує Bedrock, Anthropic, OpenAI, Google, Ollama або LiteLLM.

Ознайомтеся з технічними деталями, репозиторієм на GitHub, пакетом PyPI і документацією Strands Agents.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини