Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Meta FAIR представляет модели предпочтений для ИИ-исследований (RPMs): ранжирование ML-экспериментов до расходования GPU-часов

ИИ-агенты для исследовательской работы уже могут предлагать, реализовывать и оценивать собственные эксперименты в области машинного обучения. Генерация идей обходится дёшево, а проверка — нет. Обучение одной модели-кандидата может занимать от нескольких часов до нескольких дней GPU-времени, поэтому агент предлагает гораздо больше кандидатов, чем может позволить себе запустить. Выбор тех, которые будут запущены, — настоящий рычаг прогресса в исследованиях.

Исследовательская команда из FAIR при Meta, Оксфордского университета и Университетского колледжа Лондона формализует этот рычаг как исследовательское предпочтение и представляет модели предпочтений для ИИ-исследований (AI Research Preference Models, RPM). RPM ранжирует неисполненные кандидаты и выбирает один из них для запуска. Как выяснила команда, модель никогда не прогнозирует абсолютную оценку: языковые модели ненадёжны при предсказании метрик или результатов выполнения.

Готово ли это к внедрению? Частично. RPM используют замороженные предварительно обученные LLM без дообучения, фреймворк AIRA-dojo и бенчмарк AIRS-Bench имеют открытый исходный код, а базовая модель Qwen3.6-27B распространяется с открытыми весами.

Где RPM находится в цикле работы агента

AIRA-dojo представляет собой эволюционный поиск по дереву: жадный выбор родителя, операторы Draft / Improve / Debug и возврат узла с наивысшей оценкой на валидации в конце. RPM вмешивается только на этапе создания потомка. Вместо генерации и выполнения одного потомка агент 15 раз параллельно применяет оператор, получая 15 неисполненных кандидатов, а затем сравнивает их попарно в турнире на выбывание. Выполняется только победитель. Каждое сравнение основывается на контекстных узлах, собранных в ходе обхода исследованного дерева в ширину; для каждого узла указывается полученная им оценка на валидации.

Два варианта, два вычислительных бюджета

RPM только для инференса: LLM в роли судьи, оценивающей планы кандидатов, код и историю поиска. Её промпт был оптимизирован с помощью MIPROv2 из DSPy, в результате чего была сформирована рубрика главного исследователя, допускающая исправимые ошибки, поощряющая расширяемость и штрафующая избыточные направления; точность в офлайн-тестах составила от 57,7% до 59,0%.

Агентная RPM: тот же судья и песочница, клонирующая окружение агента, включая один H200. Доступные инструменты — python, bash и submit_solution. Она запускает пилотные эксперименты в уменьшенном масштабе, после чего модель обратной связи либо предлагает следующий наиболее информативный эксперимент, либо завершает цикл. Важную роль играют два проектных решения: оставшийся бюджет намеренно завышается (указывается 2 700 секунд вместо реальных 300), чтобы агент не останавливался слишком рано, а число пилотов ограничено 30 при пороге в 60 секунд. Время пилотов конкурирует с собственным временем агента, поэтому агентный селектор запускается только на этапах Draft и Improve; на этапе Debug снова используется случайный выбор.

Результаты на AIRS-Bench

Конфигурация: 20 общедоступных текстовых и табличных задач, 24 часа на одном H200 для каждой задачи, 10 начальных значений, Qwen3.6-27B в качестве базовой модели и для операторов, и для RPM — таким образом, прирост обусловлен уровнем выбора, а не более сильным судьёй.

Выбор потомкаСредняя нормализованная оценка
Без RPM (случайный выбор)0.684
RPM только для инференса0.711
Агентная RPM0.729
Оракул валидации (верхняя граница)0.748
Оракул тестирования (верхняя граница)0.759

Вероятность улучшения по сравнению с вариантом без RPM составляет 0.5923 и 0.5913, а нижние границы 95%-ных доверительных интервалов — 0.5066 и 0.5018.

Эффективность — более практичный результат. RPM только для инференса достигает итоговой оценки базового варианта 0.684 за 14,88 часа (1,61×), а агентная RPM — за 15,50 часа (1,55×). Самостоятельно размещаемый инференс добавляет 0,660 часа на один запуск; даже с учётом этого показатель составляет 0.708 за 23,34 часа.

Сообщается о двух новых результатах SOTA: 94,1% на WinoGrande с агентной RPM против прежнего агентного SOTA 90,4% от AIRA₂, а также 95,7% на SVAMP с RPM только для инференса против прежнего человеческого SOTA 94,2%.

Основные выводы

  • RPM ранжируют неисполненные кандидаты, чтобы ИИ-агент для исследовательской работы запускал только наиболее перспективный из них.
  • Два варианта на основе замороженных LLM: судья, работающий только на инференсе, и агентный судья, запускающий короткие пилотные эксперименты.
  • На AIRS-Bench средняя нормализованная оценка повышается с 0.684 до 0.711 и 0.729.
  • Оба варианта достигают оценки базового метода за 24 часа примерно за 15 часов, обеспечивая ускорение в 1,5–1,6 раза.
  • Новые заявленные результаты SOTA на WinoGrande (94,1%) и SVAMP (95,7%).

Ознакомьтесь с научной статьёй и объявлением в LinkedIn. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите стать нашим партнёром для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости