Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Google AI представя EnvHarness: програмируем слой, който превръща статичните среди за агенти в адаптивни тренировъчни светове

Екип от изследователи от Google Cloud AI Research, Вашингтонския университет в Сейнт Луис и UNC Chapel Hill представи EnvHarness — програмируем слой, който превръща статичен бенчмарк за агенти в такъв, който се адаптира към обучението на политиката, изпълнявано върху него. Днес LLM агентите се учат по-малко от куриран текст и повече от интерактивни среди, но тези среди са създадени ръчно и са фиксирани: те се държат по един и същи начин независимо от това кой агент действа или колко се е подобрил. Обичайното решение е да се генерират нови среди, което ви обвързва със специфични за домейна конвейери и верификатори, написани от LLM, които трябва да бъдат генерирани в излишък и филтрирани. EnvHarness обръща този подход. Той обвива съществуваща среда в плъгин компоненти, които работят строго чрез стандартния интерфейс reset() / step(), променяйки откъде започва епизодът, какво може да прави агентът и какво вижда, докато базовият симулатор, задачите и създаденият от хора верификатор остават непокътнати. LLM дизайнерът, наречен EnvRigger, автоматично създава тези обвивки според недостатъците, които диагностицира в собствените изпълнения на политиката. В пет бенчмарка в четири домейна уменията, извлечени по този начин, постигат до 9,0 точки повече върху неизползвани за обучението задачи, като изпълняват 9,8% по-малко стъпки.

Готово ли е за внедряване?

Да, ако вече използвате цикъл за оценяване на агенти. EnvHarness се разпространява като Python код с лиценз Apache-2.0 и драйвери за възпроизвеждане за шест среди. Нов бенчмарк се добавя чрез реализиране на един интерфейс (reset / step / observe / evaluate / get_env_state / save_state / from_state); нищо надолу по веригата не се променя. Основното задължително условие е средата да може да се нулира, което изключва реални потребителски акаунти и физически роботи.

Средите, които спират да обучават

Днес LLM агентите се учат по-малко от куриран текст и повече от интерактивни среди. Тези среди са създадени ръчно и са статични: те се държат по един и същи начин независимо от това кой агент действа или колко се е подобрил, така че не могат да се насочат към слабостите на дадена политика и нямат какво повече да преподават, след като бъдат решени.

Обичайният отговор е генерирането на повече среди. Документът за EnvHarness посочва две разходи: конвейерите за генериране са специфични за домейна и не се прехвърлят между домейни, а верификаторите, написани от LLM, трябва да се генерират в излишък и да се филтрират усилено, без никога да бъдат напълно надеждни.

Обвиване, а не създаване

Изследователският екип предлага обратния подход. Един хъб за агенти прави замръзнал LLM способен чрез плъгин инструменти, памет и умения. EnvHarness прилага тази идея към другата страна на цикъла, като обвива замръзнала среда в плъгин компоненти, които работят строго чрез стандартния интерфейс reset() / step().

Формално компонентът е трансформация E' = w(E), която пренаписва състоянието, действието, наблюдението и термините на прехода. Терминът за наградата умишлено е пропуснат. Тъй като никаква намеса не достига до бекенда на симулатора, всяка променена задача запазва своя оригинален, създаден от хора верификатор, а тъй като нищо не докосва специфичния за бенчмарка код, една реализация обхваща всеки домейн.

Предлагат се три компонента, които могат свободно да се комбинират:

  • Stage възпроизвежда фиксиран списък от действия след reset(), така че епизодът да започва от друго място. Скриването на целевата чаша в затворено чекмедже принуждава агента да търси, вместо просто да се протегне до нея.
  • Contract инсталира хукове за всяка стъпка по осите на действието, прехода и наблюдението: блокира действие, пренаписва отговор или съкращава наблюдение.
  • Chain комбинира втора среда в същия епизод при общ лимит на стъпките, като съставната оценка е конюнкцията на двата верификатора.

EnvRigger: цикълът на дизайнера

Компонентите не зависят от политиката, но изборът им зависи. EnvRigger третира политиката като черна кутия и изпълнява четири етапа: наблюдава пет базови изпълнения, диагностицира системен недостатък, пише компоненти като реален Python код и валидира резултата върху пет нови изпълнения. Кандидатите, които са нерешими или тривиално решими, се отхвърлят, като за всяка задача се допускат до пет кръга на редакция. Генерираните хукове се компилират в изолиран подпроцес, така че лошата мутация се превръща в записана следа, а не в прекъснато изпълнение.

Производителност

В ALFWorld, WebArena, SWE-bench Verified, OfficeQA и SpreadsheetBench уменията, извлечени с индукция в стил ReasoningBank, превъзхождат и двата контролни варианта върху неизползвани за обучението задачи.

Средният резултат в ALFWorld се повишава от 62,4 до 68,3 спрямо уменията от оригиналните среди, с +9,0 точки в разделянето извън разпределението. Процентът на решените задачи в SWE-bench Verified се променя от 49,88 → 52,58, докато средният брой стъпки спада от 55,01 → 49,61 — твърдението на документа за 9,8% ефективност. В SpreadsheetBench и WebArena уменията от непроменени среди остават под базовата линия без умения; именно променянето на средата прави извличането полезно. Спрямо специфичните за домейна генератори EnvHarness превъзхожда SWE-smith с 2,46 точки и с 5,11 по-малко стъпки.

При GRPO върху Qwen3-8B-base обучението с подсилване в променени среди превъзхожда обучението в оригиналните среди по три от четири показателя (ALFWorld в разпределението 81,4 → 87,9), с малка регресия при разделянето извън разпределението (89,6 → 88,8). Мащабирането на средата достига 54,79 при 300 среди спрямо 52,13 за оригиналните и 50,37 за генерираните, тъй като дизайнерът съвместно еволюира всяка партида спрямо текущата политика. А когато е поискано да насочи процента на успех за всяка задача в диапазона [0,4, 0,6], покритието в диапазона се повишава от 6% на 80%.

Основни изводи

  • EnvHarness обвива замразени среди, използвайки единствено reset()/step(), така че верификаторите остават създадени от хора.
  • Трите компонента — Stage, Contract и Chain — обхващат началното състояние, правилата за взаимодействие и композицията на епизода.
  • EnvRigger диагностицира недостатъци на политиката от изпълненията и създава целеви обвивки, като валидира резултата върху нови изпълнения.
  • Подобренията се запазват в пет бенчмарка: +9,0 точки извън разпределението в ALFWorld и 9,8% по-малко стъпки в SWE-bench Verified.
  • Кодът с лиценз Apache-2.0 е достъпен; цената е в токени за дизайнера и задължителното изискване за среди, които могат да се нулират.

Разгледайте документа, GitHub хранилището и страницата на проекта. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини