Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google Research открыла исходный код RRSI: ИИ-агенты улучшают собственую оболочку без переобучения

Google Cloud AI Research совместно с UNC-Chapel Hill, Стэнфордским университетом и Университетом Вашингтона в Сент-Луисе выпустила RRSI (Regularized Recursive Self-Improvement). Она позволяет агенту на базе LLM переписывать собственную оболочку: промпты, инструменты, память, логику управления и субагентов. Веса модели никогда не меняются. RRSI ограничивает сам цикл улучшений, поэтому полученные преимущества сохраняются на бенчмарках, под которые агент никогда не оптимизировался.

Готово к развертыванию? Да, в качестве исследовательского фреймворка. Код распространяется по лицензии Apache 2.0, требует Python 3.10+ и принимает любую строку модели LiteLLM. По умолчанию предполагается Claude Opus 4.8 на Vertex AI.

Почему самоулучшающиеся оболочки переобучаются

Циклы эволюции оболочки предлагают изменения, оценивают их на фиксированном наборе эволюции и сохраняют победителя. Одни и те же задачи используются в каждом раунде, поэтому цикл может их запомнить. В исследовании RRSI названы 3 режима отказа: подгонка под конкретный бенчмарк, погоня за шумом и накопление сложности. Каждый из них увеличивает разрыв между результатами на наборе эволюции и реальным переносом.

Как работает RRSI

RRSI оставляет редактируемыми все компоненты оболочки. Вместо этого регуляризируется способ перемещения поиска.

Сторона предложений

  • Адаптивный бюджет изменений: косинусный график позволяет объединять несколько изменений на ранних раундах. На поздних раундах допускается одно изменение, результат которого можно однозначно атрибутировать.
  • Учет доказательств при распределении заслуг: каждый кандидат регистрируется вместе с его компонентом, гипотезой, разницей, изменением оценки и изменением стоимости. Предлагающий агент читает этот журнал, поэтому опровергнутые идеи не предлагаются повторно.
  • Структурированное исследование: когда прогресс останавливается в пределах полосы шума, бюджет направляется на компоненты, которых запуск еще не затрагивал.

Сторона отбора

  • Критик утечек: отклоняет названия задач, сущности, ответы или логику, специфичную для бенчмарка, до начала любой оценки.
  • Порог с поправкой на шум: улучшения должны превышать дисперсию, измеренную на неизмененной базовой оболочке.
  • Правило стоимости: дополнительные токены инференса должны компенсироваться измеримым улучшением.
  • Удаление: компоненты, переставшие приносить улучшения, становятся кандидатами на удаление.

Исследовательская команда рассматривает это как аналогии с классическими регуляризаторами. Бюджет изменений соответствует L0, удаление — Lasso (L1), а правило стоимости — Ridge (L2).

Результаты на 8 бенчмарках

  • Terminal-Bench 2.1 (набор эволюции): с 74,2% до 80,2%.
  • SWE-bench Verified (никогда не использовался для отбора): с 82,0% до 83,8%.
  • Вне распределения: JobBench +4,7, GDPval +3,5 и APEX-Agents +3,7 пункта.
  • EngDesign (эволюция) +4,9; Frontier-Eng +4,3 медальных балла.
  • Harvey LAB: +1,1 на наборе эволюции, +2,3 на отложенном наборе.

Все 6 отложенных наборов показали улучшение. С Gemini 3.5 Flash в качестве политики результат Terminal-Bench 2.1 вырос с 64,6 до 78,7. Результат SWE-bench Verified вырос с 76,8 до 79,0.

Оболочка также стала легче. В экземпляре агентного рабочего пространства RRSI использует 2,42 млн токенов политики на испытание. Нерегуляризованная эволюция использует 3,80 млн. В аннотации это указано как сокращение на 30%; на странице проекта — на 36%.

RRSI и ближайшие конкуренты

Результаты взяты из таблицы 1 исследовательской статьи о RRSI. Все методы используют одну и ту же исходную оболочку, политику, набор эволюции и бюджет кандидатов.

ХарактеристикаRRSIMeta-HarnessAHETTHEHarnessX
Основная идеяРегуляризованные предложение и отборАгент, предлагающий изменения в коде, оценках и трассировках всех предыдущих кандидатовЦикл на основе наблюдаемости; изменения сопровождаются проверенными прогнозамиЭволюция оболочки во время тестирования, без эталонных метокМодульные типизированные примитивы, адаптация на основе трассировок
Веса моделиЗамороженыЗамороженыЗамороженыЗамороженыЗаморожены
Правило стоимости и удалениеДаНет*Нет*Нет*Нет*
Результат Harvey LAB на эволюции90.593.090.791.191.8
Среднее OOD (H0 = 39.7)43.640.639.238.039.7

*По данным исследовательской команды RRSI. Среднее OOD — это среднее значение JobBench, GDPval и APEX-Agents, рассчитанное по таблице 1.

Meta-Harness лидирует на наборе Harvey LAB для эволюции. У RRSI наименьший прирост на эволюционном наборе, но только у нее среднее OOD более чем на 1 пункт выше H0.

Интерактивное объяснение

Как RRSI регуляризирует самоулучшение агента

Модель остается замороженной. Оболочка (промпты, инструменты, память, логика управления) эволюционирует, но каждое изменение должно пройти регуляризаторы.
Выберите изменение кандидата, затем нажмите «Запустить». Посмотрите, где RRSI его остановит.
Предлагающий агентЧитает полный журнал изменений, сокращая бюджет изменений
Критик утечекПроверяет разницу до оценки
ОценкаЗапуск на наборе эволюции
ФильтрПорог шума + правило стоимости
Оболочка Ht+1Принята, затем проверка удаления
Кандидаты приведены для иллюстрации. Затрагиваемые ими правила описаны в статье о RRSI.
// журнал изменений: компонент | гипотеза | Δоценки | Δстоимости | вердикт
bt = ⌈ bmin + (bmax − bmin) · ½(1 + cos(πt / T)) ⌉
bmax (изменений на кандидата, в начале) 5 bmin (изменений на кандидата, в конце) 1 T (раундов) 16 На ранних раундах можно объединять согласованные изменения для поиска механизма. На поздних раундах используются одиночные изменения, результат которых можно однозначно атрибутировать.
раунд 0раунд T−1
Косинусный график из статьи (уравнение 4). Значения ползунков предназначены для исследования; собственные настройки статьи приведены в приложении D.
ΔS, прирост оценки по сравнению с текущим лучшим результатом (пункты) 2.0 ΔC, изменение стоимости токенов (%) 20 δ, полоса шума по повторным запускам базы (пункты) 1.5 β0 + β1ΔS, допустимая стоимость: β1 (% на пункт) 8
?Порог с поправкой на шум: оценка не должна опускаться более чем на δ ниже текущего лучшего результата
?Явное улучшение: ΔS > δ, в противном случае применяется правило статьи для результатов внутри полосы
?Правило стоимости: ΔC ≤ β0 + β1ΔS
…
Иллюстративные пороги (здесь β0 фиксировано на уровне 5%). В RRSI δ оценивается на неизмененной базовой оболочке, а значения β настраиваются на наборе эволюции, после чего замораживаются.
Данные: статья о RRSI · GitHub · страница проектаСоздано Marktechpost
'}); var B=$('#rr-bars');B.innerHTML=h;setTimeout(function(){B.querySelectorAll('div').forEach(function(d){d.style.height=d.getAttribute('data-h')+'%'})},30)} ['#s-bmax','#s-bmin','#s-T'].forEach(function(s){$(s).oninput=budget});budget(); /* PANE 3 */ function setChk(id,st){var e=$(id),ic=e.querySelector('.ic');var col=st===1?'#34A853':st===0?'#EA4335':'#5f6368';ic.style.background=col;ic.textContent=st===1?'\u2713':st===0?'\u2715':'-';e.style.borderColor=col} function gate(){var ds=+$('#s-ds').value,dc=+$('#s-dc').value,d=+$('#s-d').value,b1=+$('#s-b1').value,b0=5; $('#v-ds').textContent=ds.toFixed(1);$('#v-dc').textContent=dc;$('#v-d').textContent=d.toFixed(1);$('#v-b1').textContent=b1; var allow=b0+b1*ds;$('#c3t').innerHTML='Правило стоимости: ΔC ≤ β0 + β1ΔS = '+allow.toFixed(1)+'%'; var f=ds>=-d,clear=ds>d,cost=dc<=allow,V=$('#rr-verdict'),txt,col; setChk('#c1',f?1:0); if(!f){setChk('#c2',-1);setChk('#c3',-1);txt='ОТКЛОНЕНО: результат опустился ниже порога с поправкой на шум';col='#EA4335'} else if(!clear){setChk('#c2',0);setChk('#c3',-1);txt='В ПРЕДЕЛАХ ШУМА: не засчитано как явное улучшение';col='#FBBC05'} else{setChk('#c2',1);setChk('#c3',cost?1:0);txt=cost?'ПРИНЯТО: реальное улучшение, компенсирующее затраты на токены':'ОТКЛОНЕНО: улучшение не компенсирует дополнительные токены';col=cost?'#34A853':'#EA4335'} V.textContent=txt;V.style.background=col+'22';V.style.color=col;V.style.border='1px solid '+col} ['#s-ds','#s-dc','#s-d','#s-b1'].forEach(function(s){$(s).oninput=gate});gate(); /* PANE 4 */ var D=[ {t:'H0 против RRSI, замороженная Claude Opus 4.8 (набор эволюции отмечен)',max:100,u:'',rows:[ ['Terminal-Bench 2.1','эволюция',74.2,80.2],['SWE-bench Verified','OOD',82.0,83.8],['Harvey LAB','эволюция',89.4,90.5],['Harvey LAB отложенный','ID отложенный',86.9,89.2],['JobBench','OOD',36.0,40.7],['GDPval','OOD',48.8,52.3],['APEX-Agents','OOD',34.2,37.9],['EngDesign','эволюция',50.0,54.9],['Frontier-Eng','OOD',17.7,22.0]], n:'Серая полоса = неэволюционировавшая оболочка H0, синяя полоса = RRSI. Frontier-Eng — медальные баллы; GDPval — доля побед по сравнению с экспертами-людьми; Harvey LAB — пройденные критерии рубрики.'}, {t:'Среднее вне распределения (JobBench, GDPval, APEX-Agents)',max:50,u:'',single:1,rows:[['H0 (без эволюции)','',39.7],['Meta-Harness','',40.6],['AHE','',39.2],['TTHE','',38.0],['HarnessX','',39.7],['RRSI','',43.6]], n:'Средние значения рассчитаны по таблице 1 статьи о RRSI. Все методы начинают с одной и той же H0, политики, набора эволюции и бюджета кандидатов.'}, {t:'Токены политики на испытание (миллионы), агентное рабочее пространство',max:4,u:'M',single:1,rows:[['H0 (без эволюции)','OOD 39.7',1.56],['Нерегуляризованная эволюция','OOD 40.3',3.80],['без регуляризаторов принятия','OOD 41.0',3.59],['без регуляризаторов предложения','OOD 41.9',2.69],['RRSI','OOD 43.6',2.42]], n:'Из таблицы абляции: RRSI использует 2,42 млн токенов на испытание против 3,80 млн у нерегуляризованной эволюции — примерно на 36% меньше, при этом демонстрируя лучшее среднее OOD.'}],view=0; function chart(v){var d=D[v],h='
'+d.t+'
'; d.rows.forEach(function(r){var isR=r[0]==='RRSI'; if(d.single){h+='
'+r[0]+(r[1]?''+r[1]+'':'')+''+r[2].toFixed(d.u?2:1)+d.u+'
'} else{h+='
'+r[0]+''+r[1]+''+r[2].toFixed(1)+' → '+r[3].toFixed(1)+' (+'+(r[3]-r[2]).toFixed(1)+')
'}}); $('#rr-chart').innerHTML=h;$('#rr-cnote').textContent=d.n; setTimeout(function(){$$('#rr-chart i').forEach(function(i){i.style.width=i.getAttribute('data-w')+'%'});resize()},40)} $$('#rr-views .btn').forEach(function(b){b.onclick=function(){$$('#rr-views .btn').forEach(function(x){x.classList.remove('on')});b.classList.add('on');view=+b.getAttribute('data-v');chart(view)}}); chart(0); window.addEventListener('load',resize);window.addEventListener('resize',resize);setTimeout(resize,300); })();

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

The Decoder Manus 2.0 позволяет пользователям редактировать видео, размещать многопользовательские игры и удалённо запускать агентов со своего телефона The Decoder GPT-6.1 Astra слишком вводит в заблуждение для выпуска, что стало самым масштабным вмешательством OpenAI в вопросы безопасности на данный момент MarkTechPost H Company выпустила Holo4: модели с открытыми весами для управления компьютером, которые кликают, пишут код и вызывают инструменты в настольных системах, вебе, Android и API TechCrunch Проспект Anthropic раскрывает убытки, стремительный рост и — да — предупреждение, что её ИИ может уничтожить человечество MarkTechPost Alibaba Qwen выпустила Qwen-Audio-3.1-Realtime: полнодуплексную голосовую модель, обученную думать, действовать и решать, когда говорить MarkTechPost Anthropic выпустила Claude Sonnet 5.5: 70,6% в Terminal-Bench 4.0 по той же цене $2/$10

Все последние новости