Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Могут ли LLM проектировать собственный агентский х harness? HarnessDev от ByteDance Seed показывает: обобщаются лишь 34 из 64 изменений

Агентский каркас — это код вокруг модели: цикл выполнения, инструменты, контекст, состояние, восстановление и проверка. Согласно рейтингу Terminal-Bench 2.1, GPT-5 решает 35,2% задач внутри Terminus 2, но 49,6% — внутри Codex CLI при идентичных весах. В большинстве бенчмарков этот каркас фиксирован. HarnessDev, предложенный командой исследователей из ByteDance Seed, Сингапурского университета технологий и дизайна, Технологического института Джорджии, M-A-P и TokenWave.AI, меняет цель: оцениваемым артефактом становится исполняемый каркас, который пишет модель, а не выдаваемый ею ответ.

2 этапа: создание и эволюция

На этапе создания каждый создатель получает один и тот же слабый задел: пассивные примитивы для работы с файлами, поиска и процессов, а также средства записи результатов и траекторий — без цикла, планировщика, верификатора, повторных попыток или правила остановки. В неизменённом виде он набирает 0 баллов повсюду. Создатель получает спецификацию семейства задач, краткое руководство по проектированию и от 1 до 3 примеров для разработки, создаёт полный каркас, после чего каркас замораживается перед выполнением скрытых задач.

На этапе эволюции создатель начинает со своего собственного замороженного каркаса кода, созданного на этапе создания, и дорабатывает его, используя обратную связь о выполнении на фиксированном наборе из 100 задач SWE-bench Pro и всех 89 задач Terminal-Bench 2.1. Каждый официальный кандидат должен пройти обе оценки в виде пары, с бюджетом в 10 пар и не более чем 2 пробами по пять задач между парами. Каждая официальная версия впоследствии оценивается на 630 отложенных экземплярах SWE-Pro, которые создатель никогда не видит.

Каркасы оцениваются по способности (успешность выполнения задач) и эффективности (число токенов исполнителя; токены создателя не учитываются).

Настройка

Были протестированы 6 создателей-LLM: Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max и Seed 2.0 Pro, работавших внутри Claude Code 2.1.177 (GPT-5.5 использовал Codex 0.144.3). Создание охватывает 4 области и 5 бенчмарков, всего 2 207 экземпляров: публичная выборка SWE-bench Pro (731), Terminal-Bench 2.1 (89), MLE-bench (75), EQ-Bench3 (46) и BrowseComp (1 266). Каждый создатель строит по 3 каркаса для каждого бенчмарка; результаты представлены как avg@3. Self-Eval запускает каждый каркас с его создателем, а Unified-Eval запускает все каркасы с Gemini 3.1 Pro.

Результаты создания

В Self-Eval Opus 4.8 показывает самый высокий средний результат — 67,8 против 86,2 у эталона, созданного человеком. Разрыв зависит от области:

  • Код: Opus 4.8 достигает 69,3 на SWE-Pro против 80,0 у эталона. Gemini 3.1 Pro лидирует в Terminal-Bench с результатом 68,8 против 88,8.
  • Поиск: самый большой разрыв. Лучший результат в BrowseComp составляет 52,6 (GPT-5.5) против 92,2 у эталона.
  • Письменные задания: Opus 4.8 набирает 84,6 в EQ-Bench3, превысив результат эталона 83,7.
  • Эксперименты в машинном обучении: Opus 4.8 (32,9) и Gemini (32,4) превосходят результат эталона MLE-bench, равный 24,0.

Эталонные результаты для SWE-Pro, Terminal-Bench и BrowseComp взяты из внешних данных отчёта OpenAI о GPT-5.6, а не получены в результате повторных запусков.

Объём кода не предсказывал качество: 18 каркасов кода добавили 17 111 чистых строк, однако Gemini добавила меньше всех (1 006) и возглавила рейтинг Terminal-Bench. Число самопроверок почти не коррелировало с результатом (Спирмен 0,13–0,26); корреляция для вызовов пересмотра достигла 0,57.

Большая часть сгенерированной инфраструктуры бездействует. Из 108 экземпляров компонентов кода 72 запускаются в реальных прогонах, а 18 никогда не срабатывают — все они связаны с состоянием и памятью. В 11 из 18 каркасов определён класс State, однако ни в одной из 26 679 траекторий не встречается событие контрольной точки. 124 из 587 функций для написания текстов являются мёртвым кодом.

Стоимость и переносимость между исполнителями

Использование токенов в MLE-bench различалось примерно в 19 раз. GPT-5.5 достиг доли медалей 19,1% при 29,3 млн токенов, тогда как DeepSeek V4 достиг 19,6% при 208,4 млн. Замена исполнителя на Gemini изменила расстановку в рейтинге: результат Qwen в BrowseComp вырос на 17,6 пункта, а в MLE-bench — на 12,9, тогда как результат Opus 4.8 в SWE-Pro упал с 69,3 до 33,0, отчасти потому, что один каркас жёстко задал ограничение в 120 шагов для своего исходного исполнителя. После замены доля дублирующихся запросов в поисковом каркасе Opus выросла с 10,1% до 88,2%.

Результаты эволюции

9 линий развития (5 с собственным рантаймом и 4 с фиксированным Gemini) создали 73 официальные версии и 64 последовательных изменения. Все 5 создателей с собственным рантаймом улучшили результаты на отложенных задачах — от +1,43 до +4,44 пункта (в среднем +3,11). При использовании фиксированного Gemini улучшение показал только Opus; результат GPT-5.5 снизился на 10,32 пункта.

Прогресс не был монотонным. Из 64 изменений 8 ухудшили результаты на обоих бенчмарках, 16 — на одном, 27 дали прирост только в пределах уровня шума, а 2 продемонстрировали явные положительные свидетельства. Один коммит может отличаться примерно на ±4,75 пункта парного результата. Обратная связь и результаты на отложенных задачах двигались в одном направлении лишь в 34 из 64 случаев (53,1%), и только 2 из 9 заявленных финальных версий оказались оптимальными на отложенных задачах. Из 169 новых функций или классов 25 не имеют вызывающего кода.

Самый очевидный успех: Opus 4.8 заметил, что 99 из 100 запусков сообщали об успехе, хотя успешно завершались только 48, установил причиной преждевременное завершение и добавил контроль завершения. Диагностика сбоев в остальном оказалась самым слабым этапом: специализированный интерфейс траекторий был вызван лишь дважды.

Интерактивное объяснение

Ключевые выводы

  • HarnessDev оценивает каркас, созданный моделью, а не возвращаемый ею ответ.
  • Каркасы, созданные самостоятельно, соответствуют эталонам или превосходят их в письменных заданиях и экспериментах в области машинного обучения, но значительно уступают в коде и поиске.
  • Качество каркаса зависит от исполнителя: результат Opus 4.8 в SWE-Pro при использовании Gemini падает с 69,3 до 33,0.
  • Улучшения в ходе эволюции невелики и нестабильны; только 34 из 64 изменений направлены в ту же сторону на отложенных задачах.
  • Большая часть сгенерированного кода для работы с состоянием и памятью никогда не выполняется.

Ознакомьтесь с исследовательской статьёй и страницей проекта. Также подписывайтесь на нас в Твиттере и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости