Google Research пуска на отворен код RRSI: AI агенти, които подобряват собствената си обвивка без преобучаване
MarkTechPost·4 мин четене
Google Cloud AI Research, съвместно с UNC-Chapel Hill, Stanford и Washington University в Сейнт Луис, представи RRSI (Regularized Recursive Self-Improvement). Той позволява на LLM агент да пренаписва собствения си управляващ слой: подсказки, инструменти, памет, контролен поток и подагенти. Теглата на модела никога не се променят. RRSI ограничава самия цикъл на подобрение, така че постигнатите резултати се запазват и при бенчмаркове, спрямо които агентът не е бил оптимизиран.
Готов ли е за внедряване? Да, като изследователска рамка. Кодът е с лиценз Apache 2.0, изисква Python 3.10+ и приема всеки низ за модел от LiteLLM. Настройките по подразбиране предполагат Claude Opus 4.8 във Vertex AI.
Защо самоусъвършенстващите се управляващи слоеве се преоптимизират
Циклите за еволюция на управляващия слой предлагат промени, оценяват ги върху фиксиран набор за еволюция и запазват победителя. Едни и същи задачи се използват повторно във всеки рунд, така че цикълът може да ги запамети. Изследването на RRSI посочва 3 режима на отказ: специфично за бенчмарка напасване, преследване на шума и натрупване на сложност. Всеки от тях увеличава разликата между резултатите върху набора за еволюция и реалното прехвърляне.
Как работи RRSI
RRSI поддържа всеки компонент на управляващия слой редактируем. Вместо това той регулира начина, по който се движи търсенето.
Страна на предложенията
Аниилиран бюджет за промени: косинусова схема позволява на ранните рундове да обединяват няколко промени. В късните рундове се допуска една промяна, която може да бъде еднозначно приписана.
Кредитиране, съобразено с доказателствата: всеки кандидат се записва с неговия компонент, хипотеза, разлика, промяна в резултата и промяна в разходите. Предлагащият прочита този регистър, така че опроверганите идеи да не се изпробват повторно.
Структурирано изследване: когато прогресът спре в рамките на шумовата зона, бюджетът се пренасочва към компоненти, които не са били докосвани от изпълнението.
Страна на селекцията
Критик за изтичане на информация: отхвърля имена на задачи, обекти, отговори или специфична за бенчмарка логика преди каквото и да е оценяване.
Коригиран спрямо шума праг: подобренията трябва да надхвърлят дисперсията, измерена върху непроменения базов управляващ слой.
Правило за разходите: допълнителните токени за извеждане трябва да бъдат компенсирани от измерено подобрение.
Окастряне: компонентите, които престават да генерират подобрения, стават цели за изтриване.
Изследователският екип представя тези механизми като аналогии на класически регуляризатори. Бюджетът за промени съответства на L0, окастрянето — на Lasso (L1), а правилото за разходите — на Ridge (L2).
Harvey LAB: +1.1 върху дела за еволюция, +2.3 върху задържания дял.
И шестте задържани дяла се подобряват. С Gemini 3.5 Flash като политика Terminal-Bench 2.1 се повишава от 64.6 до 78.7. SWE-bench Verified се повишава от 76.8 до 79.0.
Управляващият слой е и по-лек. В инстанцията за агентно работно пространство RRSI използва 2.42M токена на политиката за изпитание. Нерегулираната еволюция използва 3.80M. Резюмето представя това като 30% по-малко; страницата на проекта посочва 36%.
RRSI спрямо най-близките конкуренти
Резултатите са от Таблица 1 на изследователската статия за RRSI. Всички методи споделят един и същ начален управляващ слой, политика, дял за еволюция и бюджет за кандидати.
Агентен предлагащ върху кода, резултатите и следите на всички предишни кандидати
Цикъл, управляван от наблюдаемостта; промените са съчетани с проверени предсказания
Развива управляващия слой по време на тестването, без еталонни етикети
Модулни типизирани примитиви, адаптация, управлявана от следи
Тегла на модела
Замразени
Замразени
Замразени
Замразени
Замразени
Правило за разходите и окастряне
Да
Не*
Не*
Не*
Не*
Резултат на Harvey LAB при еволюция
90.5
93.0
90.7
91.1
91.8
Средно за OOD (H0 = 39.7)
43.6
40.6
39.2
38.0
39.7
*Според изследователския екип на RRSI. Средната стойност за OOD е средната от JobBench, GDPval и APEX-Agents, изчислена от Таблица 1.
Meta-Harness води при дела за еволюция на Harvey LAB. RRSI има най-малкото подобрение при еволюция, но е единственият със средна стойност за OOD, която е с повече от 1 точка над H0.
Интерактивно обяснение
Как RRSI регулира самоусъвършенстването на агента
Моделът остава замразен. Управляващият слой (подсказки, инструменти, памет, контролен поток) се развива, но всяка промяна трябва да премине през регуляризаторите.
Изберете промяна-кандидат и натиснете Run. Вижте къде RRSI я спира.
ПредлагащПрочита пълния регистър на промените, свиващия се бюджет за промени
Критик за изтичане на информацияПроверява разликата преди оценяването
ОценяванеИзпълнение върху набора за еволюция
ПрагШумов праг + правило за разходите
Управляващ слой Ht+1Приет, след което се проверява за окастряне
Кандидатите са илюстративни. Правилата, които задействат, са описаните в статията за RRSI.
bmax (промени на кандидат, рано) 5
bmin (промени на кандидат, късно) 1
T (рундове) 16
Ранните рундове могат да обединяват координирани промени за откриване на механизъм. Късните рундове получават единични промени, които могат да бъдат еднозначно приписани.
рунд 0рунд T−1
Косинусова схема от статията (уравнение 4). Стойностите на плъзгачите са за изследване; статията посочва собствените си настройки в Приложение D.
ΔS, подобрение на резултата спрямо текущия най-добър (т.) 2.0
ΔC, промяна в разхода на токени (%) 20
δ, шумова зона от повтарящи се базови изпълнения (т.) 1.5
β0 + β1ΔS допустим разход: β1 (% на т.) 8
?Коригиран спрямо шума праг: резултатът не трябва да спада с повече от δ под най-добрия досега
?Ясно подобрение: ΔS > δ, в противен случай се прилага правилото на статията за стойности в рамките на зоната
?Правило за разходите: ΔC ≤ β0 + β1ΔS
…
Илюстративни прагове (β0 е фиксирано на 5% тук). При RRSI δ се оценява върху непроменения базов управляващ слой, а стойностите на β се настройват върху набора за еволюция и след това се замразяват.
'});
var B=$('#rr-bars');B.innerHTML=h;setTimeout(function(){B.querySelectorAll('div').forEach(function(d){d.style.height=d.getAttribute('data-h')+'%'})},30)}
['#s-bmax','#s-bmin','#s-T'].forEach(function(s){$(s).oninput=budget});budget();
/* PANE 3 */
function setChk(id,st){var e=$(id),ic=e.querySelector('.ic');var col=st===1?'#34A853':st===0?'#EA4335':'#5f6368';ic.style.background=col;ic.textContent=st===1?'\u2713':st===0?'\u2715':'-';e.style.borderColor=col}
function gate(){var ds=+$('#s-ds').value,dc=+$('#s-dc').value,d=+$('#s-d').value,b1=+$('#s-b1').value,b0=5;
$('#v-ds').textContent=ds.toFixed(1);$('#v-dc').textContent=dc;$('#v-d').textContent=d.toFixed(1);$('#v-b1').textContent=b1;
var allow=b0+b1*ds;$('#c3t').innerHTML='Правило за разходите: ΔC ≤ β0 + β1ΔS = '+allow.toFixed(1)+'%';
var f=ds>=-d,clear=ds>d,cost=dc<=allow,V=$('#rr-verdict'),txt,col;
setChk('#c1',f?1:0);
if(!f){setChk('#c2',-1);setChk('#c3',-1);txt='ОТХВЪРЛЕНО: спад под коригирания спрямо шума праг';col='#EA4335'}
else if(!clear){setChk('#c2',0);setChk('#c3',-1);txt='В РАМКИТЕ НА ШУМА: не се отчита като ясно подобрение';col='#FBBC05'}
else{setChk('#c2',1);setChk('#c3',cost?1:0);txt=cost?'ПРИЕТО: реално подобрение, което компенсира токените':'ОТХВЪРЛЕНО: подобрението не компенсира допълнителните токени';col=cost?'#34A853':'#EA4335'}
V.textContent=txt;V.style.background=col+'22';V.style.color=col;V.style.border='1px solid '+col}
['#s-ds','#s-dc','#s-d','#s-b1'].forEach(function(s){$(s).oninput=gate});gate();
/* PANE 4 */
var D=[
{t:'H0 спрямо RRSI, замразен Claude Opus 4.8 (дялът за еволюция е отбелязан)',max:100,u:'',rows:[
['Terminal-Bench 2.1','еволюция',74.2,80.2],['SWE-bench Verified','OOD',82.0,83.8],['Harvey LAB','еволюция',89.4,90.5],['Harvey LAB задържан','ID задържан',86.9,89.2],['JobBench','OOD',36.0,40.7],['GDPval','OOD',48.8,52.3],['APEX-Agents','OOD',34.2,37.9],['EngDesign','еволюция',50.0,54.9],['Frontier-Eng','OOD',17.7,22.0]],
n:'Сива лента = нееволюирал управляващ слой H0, синя лента = RRSI. Frontier-Eng е в медални точки; GDPval е процент победи спрямо човешки експерти; Harvey LAB е броят преминати критерии от рубриката.'},
{t:'Средна стойност извън разпределението (JobBench, GDPval, APEX-Agents)',max:50,u:'',single:1,rows:[['H0 (без еволюция)','',39.7],['Meta-Harness','',40.6],['AHE','',39.2],['TTHE','',38.0],['HarnessX','',39.7],['RRSI','',43.6]],
n:'Средните стойности са изчислени от Таблица 1 на статията за RRSI. Всички методи започват от един и същ H0, политика, дял за еволюция и бюджет за кандидати.'},
{t:'Токени на политиката за изпитание (милиони), агентно работно пространство',max:4,u:'M',single:1,rows:[['H0 (без еволюция)','OOD 39.7',1.56],['Нерегулирана еволюция','OOD 40.3',3.80],['без регуляризатори за приемане','OOD 41.0',3.59],['без регуляризатори за предложения','OOD 41.9',2.69],['RRSI','OOD 43.6',2.42]],
n:'От таблицата с аблации: RRSI използва 2.42M токена на изпитание спрямо 3.80M при нерегулирана еволюция — около 36% по-малко, при това с най-висока средна стойност за OOD.'}],view=0;
function chart(v){var d=D[v],h='