Чи можуть LLM проєктувати власний агентський х harness? HarnessDev від ByteDance Seed показує: узагальнюються лише 34 із 64 змін
Агентський каркас — це код навколо моделі: цикл виконання, інструменти, контекст, стан, відновлення та перевірка. Згідно з таблицею лідерів Terminal-Bench 2.1, GPT-5 розв’язує 35,2% завдань у Terminus 2, але 49,6% у Codex CLI за ідентичних ваг. У більшості бенчмарків цей каркас залишається фіксованим. HarnessDev, запропонований командою дослідників із ByteDance Seed, Сінгапурського університету технологій і дизайну, Технологічного інституту Джорджії, M-A-P та TokenWave.AI, змінює об’єкт оцінювання: оцінюється виконуваний каркас, який пише модель, а не відповідь, яку вона генерує.
2 етапи: створення та еволюція
На етапі створення кожен творець отримує однакову слабку початкову версію: пасивні примітиви роботи з файлами, пошуку та процесами, а також засоби запису результатів і траєкторій — без циклу, планувальника, верифікатора, повторних спроб чи правила зупинки. У незміненому вигляді вона набирає 0 балів всюди. Творець отримує специфікацію сімейства завдань, короткий посібник із проєктування та від 1 до 3 прикладів для розробки, створює повний каркас, після чого каркас заморожується перед виконанням прихованих завдань.
На етапі еволюції творець починає зі свого замороженого каркаса коду зі створення та переглядає його, використовуючи зворотний зв’язок від виконання на фіксованому наборі зі 100 завдань SWE-bench Pro і всіх 89 завдань Terminal-Bench 2.1. Кожен офіційний кандидат має пройти обидва оцінювання як пару, із бюджетом у 10 пар і не більш як 2 пробними запусками по п’ять завдань між парами. Кожна офіційна версія згодом оцінюється на 630 відкладених екземплярах SWE-Pro, яких творець ніколи не бачить.
Каркаси оцінюються за спроможністю (успішністю виконання завдань) та ефективністю (кількістю токенів виконавця, без урахування токенів творця).
Налаштування
Було протестовано 6 LLM-творців: Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max і Seed 2.0 Pro, які працювали в Claude Code 2.1.177 (GPT-5.5 використовував Codex 0.144.3). Створення охоплює 4 домени та 5 бенчмарків, разом 2 207 екземплярів: публічний спліт SWE-bench Pro (731), Terminal-Bench 2.1 (89), MLE-bench (75), EQ-Bench3 (46) і BrowseComp (1 266). Кожен творець створює по 3 каркаси на бенчмарк, результати подаються як avg@3. Self-Eval запускає кожен каркас із його творцем; Unified-Eval запускає всі каркаси з Gemini 3.1 Pro.
Результати створення
У Self-Eval Opus 4.8 показує найвищий середній результат — 67,8 проти 86,2 у референсної версії, створеної людиною. Розрив залежить від домену:
- Код: Opus 4.8 досягає 69,3 у SWE-Pro проти 80,0 у референсної версії. Gemini 3.1 Pro лідирує в Terminal-Bench із результатом 68,8 проти 88,8.
- Пошук: найбільший розрив. Найкращий результат BrowseComp становить 52,6 (GPT-5.5) проти 92,2 у референсної версії.
- Письмо: Opus 4.8 набирає 84,6 в EQ-Bench3, що вище за референсний результат 83,7.
- Експерименти з ML: Opus 4.8 (32,9) і Gemini (32,4) перевершують референсний результат MLE-bench, що становить 24,0.
Референсні результати SWE-Pro, Terminal-Bench і BrowseComp — це зовнішні результати зі звіту OpenAI про GPT-5.6, а не повторні запуски.
Обсяг коду не передбачав якість: 18 кодових каркасів додали 17 111 чистих рядків, однак Gemini додав найменше (1 006) і очолив Terminal-Bench. Кількість самотестів майже не корелювала з результатом (Spearman від 0,13 до 0,26); виклики для перегляду досягли 0,57.
Значна частина згенерованої інфраструктури неактивна. Із 108 екземплярів кодових компонентів 72 запускаються під час реальних виконань, а 18 ніколи не спрацьовують — усі вони стосуються стану та пам’яті. 11 із 18 каркасів визначають клас State, однак у 26 679 траєкторіях не зафіксовано жодної події контрольної точки. 124 із 587 функцій письма є мертвим кодом.
Вартість і перенесення між виконавцями
Використання токенів у MLE-bench відрізнялося приблизно в 19 разів. GPT-5.5 досяг рівня медалей 19,1% із 29,3 млн токенів, тоді як DeepSeek V4 досяг 19,6% із 208,4 млн. Заміна виконавця на Gemini змінила рейтинг: Qwen отримав 17,6 бала на BrowseComp і 12,9 на MLE-bench, тоді як результат Opus 4.8 у SWE-Pro впав із 69,3 до 33,0, частково тому, що один каркас жорстко задавав обмеження у 120 кроків навколо початкового виконавця. Після заміни частка дублікатів запитів у пошуковому каркасі Opus зросла з 10,1% до 88,2%.
Результати еволюції
9 ліній (5 із власним середовищем виконання, 4 із фіксованим Gemini) створили 73 офіційні версії та 64 послідовні зміни. Усі 5 творців із власним середовищем виконання покращили результати на відкладених завданнях — від +1,43 до +4,44 бала (у середньому +3,11). За фіксованого Gemini покращився лише Opus; GPT-5.5 втратив 10,32 бала.
Прогрес не був монотонним. Із 64 змін 8 погіршили результати на обох бенчмарках, 16 — на одному, 27 дали приріст лише в межах смуги шуму, а 2 продемонстрували чіткі позитивні докази. Один коміт може змінювати результат пари приблизно на ±4,75 бала. Відгук і результати на відкладених завданнях рухалися в одному напрямку лише у 34 із 64 випадків (53,1%), і лише 2 із 9 оголошених фінальних версій були оптимальними на відкладених даних. Із 169 нових функцій або класів 25 не мають жодного виклику.
Найочевидніший успіх: Opus 4.8 помітив, що 99 зі 100 запусків повідомляли про успіх, хоча успішними були лише 48, визначив причиною передчасне завершення та додав перевірку завершення. В іншому діагностика помилок була найслабшим етапом: спеціальний інтерфейс траєкторій викликали лише двічі.
Інтерактивне пояснення
Ключові висновки
- HarnessDev оцінює каркас, який створює модель, а не відповідь, яку вона повертає.
- Каркаси, створені самостійно, відповідають або перевершують референсні результати в письмі та експериментах із ML, але значно поступаються їм у коді та пошуку.
- Якість каркаса залежить від виконавця; результат Opus 4.8 у SWE-Pro падає з 69,3 до 33,0 під час роботи з Gemini.
- Переваги еволюції незначні та нестабільні, і лише 34 із 64 змін спрямовані в той самий бік на відкладених завданнях.
- Значна частина згенерованого коду стану та пам’яті ніколи не виконується.
Ознайомтеся з дослідженням і сторінкою проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.