Google Research відкрила код RRSI: ШІ-агенти вдосконалюють власну оболонку без перенавчання
MarkTechPost·4 хв читання
Google Cloud AI Research спільно з UNC-Chapel Hill, Stanford і Washington University in St. Louis випустила RRSI (Regularized Recursive Self-Improvement). Вона дає змогу LLM-агенту переписувати власний каркас: підказки, інструменти, пам’ять, потік керування та субагентів. Ваги моделі ніколи не змінюються. RRSI обмежує сам цикл удосконалення, тому покращення зберігаються на бенчмарках, під які агент ніколи не оптимізувався.
Чи можна розгортати? Так, як дослідницький фреймворк. Код поширюється за ліцензією Apache 2.0, потребує Python 3.10+ і приймає будь-який рядок моделі LiteLLM. Типові налаштування передбачають Claude Opus 4.8 у Vertex AI.
Чому каркаси, що самовдосконалюються, перенавчаються
Цикли еволюції каркаса пропонують зміни, оцінюють їх на фіксованому наборі еволюції та залишають переможця. Ті самі завдання використовуються в кожному раунді, тому цикл може їх запам’ятати. У дослідженні RRSI названо 3 режими відмови: підлаштування під конкретний бенчмарк, переслідування шуму та накопичення складності. Кожен із них збільшує розрив між оцінками на наборі еволюції та реальним перенесенням.
Як працює RRSI
RRSI залишає кожен компонент каркаса редагованим. Натомість вона регуляризує спосіб переміщення пошуку.
Сторона пропозицій
Анізотропний бюджет змін: косинусний розклад дає змогу на ранніх раундах об’єднувати кілька змін. На пізніх раундах дозволяється одна зміна, яку можна однозначно атрибутувати.
Облік доказів: кожен кандидат реєструється разом із його компонентом, гіпотезою, дифом, зміною оцінки та зміною вартості. Пропонувач читає цей журнал, тому спростовані ідеї не випробовуються повторно.
Структуроване дослідження: коли прогрес зупиняється в межах смуги шуму, бюджет спрямовується на компоненти, яких запуск ще не торкався.
Сторона відбору
Критик витоків: відхиляє назви завдань, сутності, відповіді або логіку, специфічну для бенчмарка, ще до будь-якого оцінювання.
Поріг із поправкою на шум: приріст має перевищувати дисперсію, виміряну на незміненому базовому каркасі.
Правило вартості: додаткові токени інференсу мають компенсуватися вимірюваним приростом.
Обрізання: компоненти, які перестають давати приріст, стають цілями для видалення.
Дослідницька команда описує їх як аналогії до класичних регуляризаторів. Бюджет змін відповідає L0, обрізання — Lasso (L1), а правило вартості — Ridge (L2).
Harvey LAB: +1,1 на наборі еволюції, +2,3 на відкладеному наборі.
Усі 6 відкладених наборів показали покращення. З Gemini 3.5 Flash як політикою Terminal-Bench 2.1 зріс із 64,6 до 78,7. SWE-bench Verified зріс із 76,8 до 79,0.
Каркас також став легшим. На екземплярі агентного робочого простору RRSI використовує 2,42 млн токенів політики на випробування. Нерегуляризована еволюція використовує 3,80 млн. В анотації це подано як на 30% менше; на сторінці проєкту зазначено 36%.
RRSI проти найближчих конкурентів
Оцінки взято з таблиці 1 дослідницької статті про RRSI. Усі методи використовують той самий початковий каркас, політику, набір еволюції та бюджет кандидатів.
Агентний пропонувач, що працює з кодом, оцінками та трасами всіх попередніх кандидатів
Цикл на основі спостережуваності; зміни поєднані з перевіреними прогнозами
Еволюціонує каркас під час тестування, без еталонних міток
Модульні типізовані примітиви, адаптація на основі трас
Ваги моделі
Заморожені
Заморожені
Заморожені
Заморожені
Заморожені
Правило вартості та обрізання
Так
Ні*
Ні*
Ні*
Ні*
Оцінка еволюції Harvey LAB
90,5
93,0
90,7
91,1
91,8
Середнє OOD (H0 = 39,7)
43,6
40,6
39,2
38,0
39,7
*За даними дослідницької команди RRSI. Середнє OOD — це середнє значення JobBench, GDPval та APEX-Agents, обчислене за таблицею 1.
Meta-Harness лідирує на наборі еволюції Harvey LAB. RRSI має найменший приріст на еволюції, але єдиний показник середнього OOD, що більш ніж на 1 пункт перевищує H0.
Інтерактивне пояснення
Як RRSI регуляризує самовдосконалення агента
Модель залишається замороженою. Каркас (підказки, інструменти, пам’ять, потік керування) еволюціонує, але кожна зміна має пройти регуляризатори.
Виберіть зміни кандидата, потім натисніть «Запустити». Подивіться, де RRSI його зупиняє.
ПропонувачЧитає повний журнал змін, зменшуючи бюджет змін
Критик витоківПеревіряє диф до оцінювання
ОцінюванняЗапуск на наборі еволюції
ФільтрПоріг шуму + правило вартості
Каркас Ht+1Прийнято, потім перевірка обрізання
Кандидати є ілюстративними. Правила, яких вони стосуються, описані в статті про RRSI.
bmax (змін на кандидата, на початку) 5
bmin (змін на кандидата, наприкінці) 1
T (раунди) 16
На ранніх раундах можна об’єднувати скоординовані зміни, щоб знайти механізм. На пізніх раундах виконуються одиничні зміни, які можна однозначно атрибутувати.
раунд 0раунд T−1
Косинусний розклад зі статті (рівняння 4). Значення повзунка призначені для дослідження; у додатку D стаття наводить власні налаштування.
ΔS, приріст оцінки проти поточного лідера (пункти) 2.0
ΔC, зміна вартості токенів (%) 20
δ, смуга шуму на основі повторних базових запусків (пункти) 1.5
β0 + β1ΔS, допустима вартість: β1 (% на пункт) 8
?Поріг із поправкою на шум: оцінка не має бути більш ніж на δ нижчою за найкращий результат
?Очевидний приріст: ΔS > δ, інакше застосовується правило статті для меж смуги
?Правило вартості: ΔC ≤ β0 + β1ΔS
…
Ілюстративні пороги (β0 тут зафіксовано на рівні 5%). У RRSI δ оцінюється на незміненому базовому каркасі, а значення β налаштовуються на наборі еволюції, після чого заморожуються.
'});
var B=$('#rr-bars');B.innerHTML=h;setTimeout(function(){B.querySelectorAll('div').forEach(function(d){d.style.height=d.getAttribute('data-h')+'%'})},30)}
['#s-bmax','#s-bmin','#s-T'].forEach(function(s){$(s).oninput=budget});budget();
/* ПАНЕЛЬ 3 */
function setChk(id,st){var e=$(id),ic=e.querySelector('.ic');var col=st===1?'#34A853':st===0?'#EA4335':'#5f6368';ic.style.background=col;ic.textContent=st===1?'\u2713':st===0?'\u2715':'-';e.style.borderColor=col}
function gate(){var ds=+$('#s-ds').value,dc=+$('#s-dc').value,d=+$('#s-d').value,b1=+$('#s-b1').value,b0=5;
$('#v-ds').textContent=ds.toFixed(1);$('#v-dc').textContent=dc;$('#v-d').textContent=d.toFixed(1);$('#v-b1').textContent=b1;
var allow=b0+b1*ds;$('#c3t').innerHTML='Правило вартості: ΔC ≤ β0 + β1ΔS = '+allow.toFixed(1)+'%';
var f=ds>=-d,clear=ds>d,cost=dc<=allow,V=$('#rr-verdict'),txt,col;
setChk('#c1',f?1:0);
if(!f){setChk('#c2',-1);setChk('#c3',-1);txt='ВІДХИЛЕНО: результат опустився нижче порогу з поправкою на шум';col='#EA4335'}
else if(!clear){setChk('#c2',0);setChk('#c3',-1);txt='У МЕЖАХ ШУМУ: не зараховано як очевидний приріст';col='#FBBC05'}
else{setChk('#c2',1);setChk('#c3',cost?1:0);txt=cost?'ПРИЙНЯТО: реальний приріст компенсує витрати токенів':'ВІДХИЛЕНО: приріст не компенсує додаткові токени';col=cost?'#34A853':'#EA4335'}
V.textContent=txt;V.style.background=col+'22';V.style.color=col;V.style.border='1px solid '+col}
['#s-ds','#s-dc','#s-d','#s-b1'].forEach(function(s){$(s).oninput=gate});gate();
/* ПАНЕЛЬ 4 */
var D=[
{t:'H0 проти RRSI, заморожена Claude Opus 4.8 (набір еволюції позначено)',max:100,u:'',rows:[
['Terminal-Bench 2.1','еволюція',74.2,80.2],['SWE-bench Verified','OOD',82.0,83.8],['Harvey LAB','еволюція',89.4,90.5],['Harvey LAB відкладений','ID відкладений',86.9,89.2],['JobBench','OOD',36.0,40.7],['GDPval','OOD',48.8,52.3],['APEX-Agents','OOD',34.2,37.9],['EngDesign','еволюція',50.0,54.9],['Frontier-Eng','OOD',17.7,22.0]],
n:'Сіра смуга = нееволюціонований каркас H0, синя смуга = RRSI. Frontier-Eng — медальні пункти; GDPval — частка перемог проти експертів-людей; Harvey LAB — пройдені критерії оцінювання.'},
{t:'Середнє значення поза розподілом (JobBench, GDPval, APEX-Agents)',max:50,u:'',single:1,rows:[['H0 (без еволюції)','',39.7],['Meta-Harness','',40.6],['AHE','',39.2],['TTHE','',38.0],['HarnessX','',39.7],['RRSI','',43.6]],
n:'Середні значення обчислено за таблицею 1 статті про RRSI. Усі методи починають з того самого H0, політики, набору еволюції та бюджету кандидатів.'},
{t:'Токени політики на випробування (мільйони), агентний робочий простір',max:4,u:'M',single:1,rows:[['H0 (без еволюції)','OOD 39.7',1.56],['Нерегуляризована еволюція','OOD 40.3',3.80],['без регуляризаторів прийняття','OOD 41.0',3.59],['без регуляризаторів пропозицій','OOD 41.9',2.69],['RRSI','OOD 43.6',2.42]],
n:'З таблиці абляції: RRSI використовує 2,42 млн токенів на випробування проти 3,80 млн для нерегуляризованої еволюції — приблизно на 36% менше, маючи найкраще середнє OOD.'}],view=0;
function chart(v){var d=D[v],h='