Meta FAIR представляет модели предпочтений для ИИ-исследований (RPMs): ранжирование ML-экспериментов до расходования GPU-часов
ИИ-агенты для исследовательской работы уже могут предлагать, реализовывать и оценивать собственные эксперименты в области машинного обучения. Генерация идей обходится дёшево, а проверка — нет. Обучение одной модели-кандидата может занимать от нескольких часов до нескольких дней GPU-времени, поэтому агент предлагает гораздо больше кандидатов, чем может позволить себе запустить. Выбор тех, которые будут запущены, — настоящий рычаг прогресса в исследованиях.
Исследовательская команда из FAIR при Meta, Оксфордского университета и Университетского колледжа Лондона формализует этот рычаг как исследовательское предпочтение и представляет модели предпочтений для ИИ-исследований (AI Research Preference Models, RPM). RPM ранжирует неисполненные кандидаты и выбирает один из них для запуска. Как выяснила команда, модель никогда не прогнозирует абсолютную оценку: языковые модели ненадёжны при предсказании метрик или результатов выполнения.
Готово ли это к внедрению? Частично. RPM используют замороженные предварительно обученные LLM без дообучения, фреймворк AIRA-dojo и бенчмарк AIRS-Bench имеют открытый исходный код, а базовая модель Qwen3.6-27B распространяется с открытыми весами.
Где RPM находится в цикле работы агента
AIRA-dojo представляет собой эволюционный поиск по дереву: жадный выбор родителя, операторы Draft / Improve / Debug и возврат узла с наивысшей оценкой на валидации в конце. RPM вмешивается только на этапе создания потомка. Вместо генерации и выполнения одного потомка агент 15 раз параллельно применяет оператор, получая 15 неисполненных кандидатов, а затем сравнивает их попарно в турнире на выбывание. Выполняется только победитель. Каждое сравнение основывается на контекстных узлах, собранных в ходе обхода исследованного дерева в ширину; для каждого узла указывается полученная им оценка на валидации.
Два варианта, два вычислительных бюджета
RPM только для инференса: LLM в роли судьи, оценивающей планы кандидатов, код и историю поиска. Её промпт был оптимизирован с помощью MIPROv2 из DSPy, в результате чего была сформирована рубрика главного исследователя, допускающая исправимые ошибки, поощряющая расширяемость и штрафующая избыточные направления; точность в офлайн-тестах составила от 57,7% до 59,0%.
Агентная RPM: тот же судья и песочница, клонирующая окружение агента, включая один H200. Доступные инструменты — python, bash и submit_solution. Она запускает пилотные эксперименты в уменьшенном масштабе, после чего модель обратной связи либо предлагает следующий наиболее информативный эксперимент, либо завершает цикл. Важную роль играют два проектных решения: оставшийся бюджет намеренно завышается (указывается 2 700 секунд вместо реальных 300), чтобы агент не останавливался слишком рано, а число пилотов ограничено 30 при пороге в 60 секунд. Время пилотов конкурирует с собственным временем агента, поэтому агентный селектор запускается только на этапах Draft и Improve; на этапе Debug снова используется случайный выбор.
Результаты на AIRS-Bench
Конфигурация: 20 общедоступных текстовых и табличных задач, 24 часа на одном H200 для каждой задачи, 10 начальных значений, Qwen3.6-27B в качестве базовой модели и для операторов, и для RPM — таким образом, прирост обусловлен уровнем выбора, а не более сильным судьёй.
| Выбор потомка | Средняя нормализованная оценка |
|---|---|
| Без RPM (случайный выбор) | 0.684 |
| RPM только для инференса | 0.711 |
| Агентная RPM | 0.729 |
| Оракул валидации (верхняя граница) | 0.748 |
| Оракул тестирования (верхняя граница) | 0.759 |
Вероятность улучшения по сравнению с вариантом без RPM составляет 0.5923 и 0.5913, а нижние границы 95%-ных доверительных интервалов — 0.5066 и 0.5018.
Эффективность — более практичный результат. RPM только для инференса достигает итоговой оценки базового варианта 0.684 за 14,88 часа (1,61×), а агентная RPM — за 15,50 часа (1,55×). Самостоятельно размещаемый инференс добавляет 0,660 часа на один запуск; даже с учётом этого показатель составляет 0.708 за 23,34 часа.
Сообщается о двух новых результатах SOTA: 94,1% на WinoGrande с агентной RPM против прежнего агентного SOTA 90,4% от AIRA₂, а также 95,7% на SVAMP с RPM только для инференса против прежнего человеческого SOTA 94,2%.
Основные выводы
- RPM ранжируют неисполненные кандидаты, чтобы ИИ-агент для исследовательской работы запускал только наиболее перспективный из них.
- Два варианта на основе замороженных LLM: судья, работающий только на инференсе, и агентный судья, запускающий короткие пилотные эксперименты.
- На AIRS-Bench средняя нормализованная оценка повышается с 0.684 до 0.711 и 0.729.
- Оба варианта достигают оценки базового метода за 24 часа примерно за 15 часов, обеспечивая ускорение в 1,5–1,6 раза.
- Новые заявленные результаты SOTA на WinoGrande (94,1%) и SVAMP (95,7%).
Ознакомьтесь с научной статьёй и объявлением в LinkedIn. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.