Рекурсивное самосовершенствование ИИ может всё-таки произойти не так скоро
Самое смелое обещание индустрии ИИ на данный момент заключается в том, что вскоре ИИ начнет совершенствовать себя практически без участия человека. Большие языковые модели уже умеют писать код, генерировать синтетические данные для обучения и оптимизировать компьютерные чипы, на которых работают. Прогнозы стремительного развития ИИ предполагают, что так называемое рекурсивное самосовершенствование уже не за горами.
Но новое исследование предполагает, что до этого еще может быть далеко. Исследователи выяснили, что агенты ИИ пока не способны проводить открытые исследования в области ИИ — свободные исследования без однозначных ответов, требующие суждения и вкуса, которые могут иметь решающее значение для создания самосовершенствующегося ИИ.
Группа исследователей из нескольких организаций под руководством Питера Киргиса и Саяша Капура из Принстонского университета установила, что агенты ИИ способны решать инженерные задачи, необходимые для проведения исследований в области ИИ, но им не хватает суждения и креативности, чтобы создавать оригинальные исследования уровня статей, принимаемых на ведущую конференцию по машинному обучению. Этот разрыв позволяет предположить, что некоторые широко обсуждаемые прогнозы сроков автоматизации исследований в области ИИ опережают имеющиеся доказательства.
В большинстве существующих исследований того, как агенты могут автоматизировать исследования в области ИИ, оценивается их способность выполнять узкие задачи с проверяемыми ответами, например решать инженерные задачи или дообучать небольшие языковые модели по определенному бенчмарку. Но прогресс в исследованиях ИИ также требует открытого мышления — выбора набора гипотез, определения того, какие доказательства позволят разрешить вопрос, или понимания того, когда следует начать сначала.
Чтобы проверить агентов на такие навыки, исследователи предложили новый метод оценки, названный «теневой оценкой». Он требует от ИИ ответить на исследовательский вопрос из качественной неопубликованной статьи.
Исследователи поручили Claude Opus 4.8 компании Anthropic, работающей на программном обеспечении с открытым исходным кодом OpenClaw, решить такие вопросы — в данном случае из двух статей, поданных на престижную конференцию по машинному обучению NeurIPS 2026.
В первом вопросе спрашивалось, можно ли управлять «персонами» большой языковой модели, определяющими ее поведение, редактируя ее веса (миллиарды чисел, в которых хранится все, чему она научилась во время обучения). Во втором спрашивалось, как разработать детектор, указывающий на то, что модель, делающая прогнозы на основе данных электронных таблиц, стала ненадежной. Поскольку статьи не были опубликованы, агенты не могли запомнить ответы из обучающих данных или найти их в интернете.
Агентам дали шесть дней, кредиты Anthropic API на сумму 3000 долларов, бюджет GPU для проведения экспериментов, собственные виртуальные компьютеры и доступ к открытой сети, чтобы подготовить исследовательскую статью, достойную публикации на ведущей конференции по ИИ. Авторы статей оценивали работы агентов так же, как оценивали бы статью, поданную на конференцию.
Авторы отклонили обе статьи.
По мнению ученых, агенты были способны выполнять все необходимые для исследования инженерные задачи. Они изучили научную литературу, провели сотни экспериментов и систематизировали результаты.
«С другой стороны, агенты однозначно плохо справлялись с самим проведением исследований, — говорит Капур. — Они ставили странные эксперименты (в некоторых случаях проверяя свои гипотезы на крошечных синтетических наборах данных), с трудом внятно описывали свою работу и не внесли ничего нового в свои области». По его словам, «по качеству эти статьи даже близко не соответствовали уровню ведущей конференции по ИИ».
Причина в том, что агентам было трудно проявить креативность и суждение, необходимые для проведения исследований. Они недостаточно изучали различные идеи и слишком быстро останавливались на бесперспективных подходах. Хотя агенты выдвигали новые и амбициозные гипотезы, похожие на те, с которых начинали сами авторы оригинальных статей, они отвергали их на основании очень ограниченных данных. Кроме того, они не могли отказаться от неудачных подходов и вернуться назад. Они могли вносить небольшие изменения, но не умели принципиально переосмыслить свой подход или попробовать новые варианты с нуля.
Агенты также не смогли учесть обратную связь от субагентов или внешних инструментов ИИ для проверки. Вместо пересмотра методологии они сужали свои утверждения и добавляли оговорки. Они также не умели эффективно использовать такие ресурсы, как токены, вычислительные мощности и время. Кроме того, они не могли следовать инструкциям о том, сколько времени уделять разным этапам исследования или какой длины должна быть статья.
Несмотря на все эти провалы, агенты не прибегали к поведению, которое исследователи называют «взломом вознаграждения», то есть не скрывали и не искажали эксперименты или данные. Хотя субагенты — вспомогательные ИИ, которых основной агент запускает для выполнения отдельных частей работы, — время от времени галлюцинировали или искажали результаты, агент-оркестратор, главный ИИ, руководивший проектом, выявлял эти ошибки.
Причина, по которой модели ИИ хорошо справляются с инженерной стороной исследований, но не с открытыми исследованиями, может быть связана с тем, как они обучаются, говорит Капур. Модели хорошо осваивают все, чему их можно систематически обучать в рамках процесса, называемого обучением с подкреплением, которое проще применять к задачам с автоматически проверяемым результатом. «Но сложнее создавать среды для обучения таких моделей, когда сама задача имеет открытый характер», — говорит он.
Капур говорит, что теперь команда проводит эксперимент с Mythos — самой продвинутой моделью Anthropic, запущенной в апреле. Впоследствии администрация Трампа обязала ее соблюдать различные ограничения безопасности, и теперь она доступна только одобренным организациям. Anthropic не ответила на запрос о комментарии.
У исследования есть некоторые ограничения. В нем рассматривались всего две исследовательские статьи, а их авторы знали, что оценивают работы, созданные агентами ИИ, что могло повлиять на их оценки. Кроме того, исследователи обладали значительной свободой в разработке и проведении исследования, поэтому их уже существовавшие убеждения и предубеждения могли повлиять на результаты. Оценка открытых исследований предполагает некоторую потерю объективности ради гораздо более содержательной проверки, чем та, которую способен предложить любой бенчмарк.
Тем не менее результаты могут умерить заявления о том, что рекурсивное самосовершенствование уже не за горами. В июне Anthropic опубликовала сообщение в блоге под заголовком «Когда ИИ создает себя», в котором описала прогресс на пути к моделям, ускоряющим собственное развитие. В июле OpenAI сообщила, что ее новая модель GPT-5.6 Sol помогла дообучить меньшую модель, сэкономив исследователям несколько недель работы.
Тем не менее этот вывод может также отражать то, что компании, занимающиеся ИИ, обнаруживают внутри своих организаций. Сооснователь Anthropic Джек Кларк написал в своем информационном бюллетене Import AI, что это перекликается с результатами компании, полученными при попытке автоматизировать некоторые аспекты исследований безопасности ИИ.
«В современных системах ИИ наблюдается определенное отсутствие ценной интуитивной креативности, и, хотя они чрезвычайно хорошо справляются с инженерными задачами, им, похоже, присуще шаблонное, механическое мышление, которое может мешать им быть хорошими исследователями», — написал он. Отсутствие креативности у систем ИИ он назвал «негативным сигналом для краткосрочных прогнозов рекурсивного самосовершенствования».
У компаний, занимающихся ИИ, есть все стимулы для создания систем, способных быстро ускорять собственный прогресс, — так же как у них были стимулы сделать модели лучше в программировании. OpenAI поставила создание автоматизированного исследователя ИИ в качестве явной цели, а Anthropic считает самосовершенствующийся ИИ следующей вехой развития индустрии.
«Если в этом направлении будут инвестиции и целенаправленные усилия, я думаю, что прогресс будет интересным, даже если сейчас попытки терпят неудачу», — говорит Наджун Ким, профессор лингвистики и информатики Бостонского университета, исследующая, как агенты ИИ могут автоматизировать исследования в области ИИ, но не участвовавшая в этом исследовании. С другой стороны, возможно, развитие ИИ будет разделено на два направления. Системы ИИ могут стремительно продвигаться в узких задачах — тех, которые можно оценить количественно, — и медленно развиваться в открытых исследованиях.
Таким образом, главный открытый вопрос заключается в том, насколько открытые исследования важны для рекурсивного самосовершенствования — смогут ли системы ИИ достичь его без них, просто совершенствуясь в более узких задачах. «Если обратиться к крупнейшим достижениям в этой области, к изобретению трансформеров или созданию новых крупных архитектур, которые позволили добиться значительного прогресса в ИИ, — все они требовали творческих прорывов», — говорит Капур.
«При этом другие придерживаются гипотезы, что все необходимое для трансформирующего ИИ, особенно для рекурсивного самосовершенствования, уже существует», например возможность ускорить обучение модели и повысить ее показатели на бенчмарках.
«Честно говоря, сейчас это вопрос на триллион долларов», — говорит он.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.