Google AI представляє EnvHarness: програмований шар, що перетворює статичні середовища для агентів на адаптивні світи навчання
Команда дослідників із Google Cloud AI Research, Вашингтонського університету в Сент-Луїсі та UNC Chapel Hill випустила EnvHarness — програмований шар, який перетворює статичний бенчмарк для агентів на такий, що адаптується до навчання політики, яка в ньому тренується. Тепер агенти на основі LLM навчаються менше на підібраному тексті й більше в інтерактивних середовищах, але ці середовища створюються вручну й залишаються незмінними: вони поводяться однаково незалежно від того, який агент діє та наскільки він удосконалився. Звичайне рішення — генерувати нові середовища, що прив’язує вас до предметно-специфічних конвеєрів і верифікаторів, написаних LLM, які потрібно генерувати з надлишком і фільтрувати. EnvHarness робить протилежний крок. Він обгортає наявне середовище компонентами-плагінами, які працюють виключно через стандартний інтерфейс reset() / step(), змінюючи місце початку епізоду, доступні агенту дії та те, що він бачить, тоді як базовий симулятор, завдання й створений людиною верифікатор залишаються недоторканими. Дизайнер LLM під назвою EnvRigger автоматично створює ці обгортки для усунення недоліків, які він діагностує у власних траєкторіях політики. У п’яти бенчмарках у чотирьох сферах навички, отримані таким способом, демонструють приріст до 9,0 бала на відкладених завданнях і потребують на 9,8% менше кроків виконання.
Чи можна це розгорнути?
Так, якщо у вас уже працює цикл оцінювання агента. EnvHarness постачається як Python-проєкт під ліцензією Apache-2.0 із драйверами відтворення для шести середовищ. Новий бенчмарк підключається шляхом реалізації одного інтерфейсу (reset / step / observe / evaluate / get_env_state / save_state / from_state); у подальшій частині системи нічого змінювати не потрібно. Ключова передумова — середовище, яке можна скидати, що виключає облікові записи реальних користувачів і фізичних роботів.
Середовища, які перестають навчати
Тепер агенти на основі LLM навчаються менше на підібраному тексті й більше в інтерактивних середовищах. Ці середовища створюються вручну й залишаються статичними: вони поводяться однаково незалежно від того, який агент діє та наскільки він удосконалився, тому не можуть бути спрямовані на слабкі місця політики й більше нічого не можуть навчити після розв’язання завдання.
Звичайна відповідь — генерувати більше середовищ. У статті про EnvHarness названо дві проблеми: конвеєри генерації є предметно-специфічними й не переносяться між сферами, а верифікатори, написані LLM, потрібно генерувати з надлишком і ретельно фільтрувати, при цьому вони ніколи не стають цілком надійними.
Обгортання, а не створення
Дослідницька команда пропонує протилежний підхід. Середовище для агента надає замороженій LLM можливості через інструменти, пам’ять і навички-плагіни. EnvHarness застосовує цю ідею до іншого боку циклу, обгортаючи заморожене середовище компонентами-плагінами, які працюють виключно через стандартний інтерфейс reset() / step().
Формально компонент є перетворенням E' = w(E), яке переписує терміни стану, дії, спостереження та переходу. Термін винагороди навмисно виключено. Оскільки жодне втручання не досягає серверної частини симулятора, кожне переформатоване завдання зберігає свій оригінальний верифікатор, створений людиною, а оскільки код, специфічний для бенчмарку, не змінюється, одна реалізація охоплює всі сфери.
До комплекту входять три компоненти, які можна вільно комбінувати:
- Stage після
reset()повторно відтворює фіксований список дій, тому епізод починається в іншому місці. Якщо сховати цільову чашку в закритій шухляді, агент буде змушений шукати, а не просто дістатися до неї. - Contract встановлює покрокові обробники для осей дії, переходу та спостереження: блокує дію, переписує відповідь або скорочує спостереження.
- Chain додає друге середовище до того самого епізоду в межах спільного бюджету кроків, причому складений вердикт є логічним «і» обох верифікаторів.
EnvRigger: цикл проєктування
Компоненти не залежать від політики, але їхній вибір — залежить. EnvRigger розглядає політику як чорну скриньку й виконує чотири етапи: спостерігає за п’ятьма базовими траєкторіями, діагностує системний недолік, пише компоненти як справжній код Python і перевіряє їх на п’яти нових траєкторіях. Кандидати, які неможливо або тривіально розв’язати, відхиляються; для кожного завдання передбачено до п’яти раундів доопрацювання. Згенеровані обробники компілюються в ізольованому підпроцесі, тому невдала мутація перетворюється на записаний трасувальний журнал, а не на аварійне завершення запуску.
Продуктивність
У ALFWorld, WebArena, SWE-bench Verified, OfficeQA та SpreadsheetBench навички, отримані за допомогою індукції в стилі ReasoningBank, перевершили обидва контрольні підходи на незадіяних відкладених завданнях.
Середній показник ALFWorld зріс із 62,4 до 68,3 порівняно з навичками для оригінального середовища, а на розподілі поза навчанням приріст становить +9,0 бала. Частка розв’язаних завдань у SWE-bench Verified зросла з 49,88 до 52,58, тоді як середня кількість кроків зменшилася з 55,01 до 49,61 — це заявлена в статті ефективність на 9,8%. У SpreadsheetBench і WebArena навички з незмінених середовищ показують результат нижчий за базовий рівень без навичок; саме переформатування робить отримання навичок доцільним. Порівняно з предметно-специфічними генераторами EnvHarness перевершує SWE-smith на 2,46 бала, використовуючи на 5,11 кроку менше.
Під час навчання GRPO на Qwen3-8B-base навчання з підкріпленням у переформатованих середовищах перевершує навчання з підкріпленням в оригінальних середовищах за трьома з чотирьох показників (ALFWorld у розподілі даних із навчання: 81,4 → 87,9), із невеликим погіршенням на розподілі поза навчанням (89,6 → 88,8). Масштабування середовища дає результат 54,79 на 300 середовищах проти 52,13 для оригінальних і 50,37 для згенерованих, оскільки дизайнер спільно еволюціонує кожну партію відповідно до поточної політики. А коли потрібно спрямувати показник успішності для кожного завдання в діапазон [0,4, 0,6], охоплення цього діапазону зростає з 6% до 80%.
Основні висновки
- EnvHarness обгортає заморожені середовища, використовуючи лише
reset()/step(), тому верифікатори залишаються створеними людьми. - Три компоненти — Stage, Contract і Chain — охоплюють початковий стан, правила взаємодії та композицію епізодів.
- EnvRigger діагностує недоліки політики за траєкторіями та створює цільові обгортки, перевіряючи їх на нових траєкторіях.
- Переваги зберігаються в п’яти бенчмарках: +9,0 бала поза навчанням у ALFWorld, на 9,8% менше кроків у SWE-bench Verified.
- Код під ліцензією Apache-2.0 уже доступний; ціна — токени дизайнера та жорстка вимога до середовищ, які можна скидати.
Ознайомтеся зі статтею, репозиторієм GitHub і сторінкою проєкту. Також можете стежити за нами у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.