Meta FAIR представя модели за предпочитания в ИИ изследванията (RPMs): класиране на ML експерименти преди изразходването на GPU часове
Агентите за изследвания в областта на ИИ вече могат да предлагат, изпълняват и оценяват собствените си експерименти в машинното обучение. Генерирането на идеи е евтино; проверката – не. Обучението на един кандидат може да отнеме от часове до дни GPU време, така че един агент предлага много повече кандидати, отколкото може да си позволи да изпълни. Кои от тях ще бъдат изпълнени е истинският лост за напредъка в изследванията.
Изследователски екип от FAIR към Meta, Оксфордския университет и University College London формализира този лост като изследователско предпочитание и представя AI Research Preference Models (RPMs). RPM класира неизпълнените кандидати и избира един за изпълнение. Екипът установява, че той никога не прогнозира абсолютен резултат, тъй като езиковите модели са ненадеждни при предвиждането на метрики или резултати от изпълнението.
Може ли да бъде внедрен? Частично. RPM използват замразени предварително обучени LLM без допълнително дообучаване, scaffold-ът AIRA-dojo и бенчмаркът AIRS-Bench са с отворен код, а базовият модел Qwen3.6-27B е с отворени тегла.
Мястото на RPM в цикъла на агента
AIRA-dojo представлява еволюционно търсене в дърво: жаден избор на родител, оператори Draft / Improve / Debug и връщане на възела с най-висок резултат от валидирането в края. RPM се намесва единствено при създаването на дете. Вместо да генерира едно дете и да го изпълни, агентът прилага оператора 15 пъти паралелно, за да създаде 15 неизпълнени кандидати, след което ги сравнява по двойки в турнир с елиминации. Изпълнява се единствено победителят. Всяко сравнение се основава на контекстови възли, събрани чрез BFS обхождане на изследваното дърво, като за всеки е посочен полученият резултат от валидирането.
Два варианта, два изчислителни бюджета
RPM само за инференция: LLM като съдия за планове на кандидати, код и история на търсенето. Подканата му е оптимизирана с MIPROv2 от DSPy, като се стига до рубрика на главен изследовател, която толерира поправими грешки, насърчава разширяемостта и санкционира излишните направления; точността офлайн е от 57,7% до 59,0%.
Агентен RPM: Същият съдия и пясъчник, който клонира средата на агента, включително един H200. Инструментите са python, bash и submit_solution. Той изпълнява пилотни експерименти в малък мащаб, след което модел за обратна връзка или предлага следващия най-информативен експеримент, или прекратява цикъла. Две проектни решения са от съществено значение: оставащият бюджет умишлено е завишен (отчетени са 2 700 секунди при реални 300 секунди), за да не спира агентът твърде рано, а пилотите са ограничени до 30 с праг от 60 секунди. Времето за пилотите се конкурира със собствения часовник на агента, затова агентният селектор се изпълнява само при стъпките Draft и Improve; Debug се връща към случаен избор.
Резултати върху AIRS-Bench
Настройка: 20 публични текстови и таблични задачи, 24 часа на един H200 за всяка задача, 10 начални стойности, Qwen3.6-27B като базов модел както за операторите, така и за RPM, така че подобрението идва от слоя за селекция, а не от по-силен съдия.
| Избор на дете | Среден нормализиран резултат |
|---|---|
| Без RPM (случаен избор) | 0.684 |
| RPM само за инференция | 0.711 |
| Агентен RPM | 0.729 |
| Оракул за валидирането (горна граница) | 0.748 |
| Оракул за теста (горна граница) | 0.759 |
Вероятността за подобрение спрямо варианта без RPM е 0.5923 и 0.5913, като долните граници на 95% CI са съответно 0.5066 и 0.5018.
Ефективността е по-практичният резултат. Вариантът само за инференция достига крайния резултат на базовия модел от 0.684 за 14,88 часа (1,61×), а агентният вариант – за 15,50 часа (1,55×). Самостоятелно хостваният инференс добавя 0,660 часа на изпълнение; дори след корекция за него резултатът е 0,708 за 23,34 часа.
Два нови отчетени резултата SOTA: WinoGrande 94,1% с Agentic RPM спрямо предишен агентен SOTA от 90,4% от AIRA₂ и SVAMP 95,7% с варианта само за инференция спрямо предишен човешки SOTA от 94,2%.
Основни изводи
- RPM класират неизпълнените кандидати, така че агентът за изследвания в областта на ИИ да изпълнява само най-перспективния.
- Два варианта със замразен LLM: съдия само за инференция и агентен съдия, който изпълнява кратки пилотни експерименти.
- Върху AIRS-Bench средният нормализиран резултат нараства от 0.684 до 0.711 и 0.729.
- И двата варианта достигат резултата на базовия модел за 24 часа за приблизително 15 часа, което представлява ускорение от 1,5–1,6×.
- Нови отчетени резултати SOTA на WinoGrande (94,1%) и SVAMP (95,7%).
Вижте статията и съобщението в LinkedIn. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, продуктова премиера, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.