Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Meta FAIR представляє моделі уподобань для досліджень ШІ (RPMs): ранжування ML-експериментів до витрачання GPU-годин

Агенти для досліджень у сфері ШІ вже можуть пропонувати, реалізовувати й оцінювати власні експерименти машинного навчання. Генерувати ідеї дешево, а перевіряти їх — ні. Навчання однієї кандидатної моделі може потребувати від кількох годин до кількох днів роботи GPU, тож агент пропонує набагато більше кандидатів, ніж може дозволити собі запустити. Саме вибір того, які кандидати запускати, є головним важелем прогресу в дослідженнях.

Дослідницька команда з FAIR у Meta, Оксфордського університету та Університетського коледжу Лондона формалізує цей важіль як дослідницьку перевагу та представляє моделі дослідницьких переваг ШІ (AI Research Preference Models, RPMs). RPM ранжує невиконані кандидати й обирає одного для запуску. Як з’ясувала команда, він ніколи не прогнозує абсолютний бал, оскільки мовні моделі ненадійно передбачають метрики або результати виконання.

Чи можна це впровадити? Частково. RPM використовують заморожені попередньо навчені LLM без донавчання, каркас AIRA-dojo і бенчмарк AIRS-Bench мають відкритий вихідний код, а базова модель Qwen3.6-27B доступна з відкритими вагами.

Де RPM розташована в циклі роботи агента

AIRA-dojo — це еволюційний пошук по дереву: жадібний вибір батьківського вузла, оператори Draft / Improve / Debug і повернення вузла з найвищим показником на валідації наприкінці. RPM втручається лише на етапі створення дочірніх вузлів. Замість того щоб згенерувати один дочірній вузол і виконати його, агент застосовує оператор паралельно 15 разів, отримуючи 15 невиконаних кандидатів, а потім попарно порівнює їх у турнірі на вибування. Виконується лише переможець. Кожне порівняння ґрунтується на контекстних вузлах, зібраних під час обходу дослідженого дерева в ширину, причому для кожного вказано отриманий ним показник на валідації.

Два варіанти, два обсяги обчислень

RPM лише для інференсу: LLM у ролі судді, яка оцінює плани кандидатів, код та історію пошуку. Її промпт було оптимізовано за допомогою MIPROv2 від DSPy; у результаті сформувався критерій головного дослідника, який допускає помилки, що можна виправити, заохочує розширюваність і штрафує надлишкові напрями; точність в автономному режимі становить від 57,7% до 59,0%.

Агентна RPM: той самий суддя та пісочниця, яка клонує середовище агента, включно з одним H200. Доступні інструменти: python, bash і submit_solution. Вона запускає пілотні експерименти малого масштабу, після чого модель зворотного зв’язку або пропонує наступний найінформативніший експеримент, або завершує цикл. Важливими є два рішення: залишковий бюджет навмисно завищується (звітується 2 700 с проти фактичних 300 с), щоб агент не зупинявся зарано, а кількість пілотів обмежується 30 із порогом у 60 секунд. Час пілотів конкурує з власним часом агента, тому агентний селектор запускається лише на етапах Draft та Improve; на етапі Debug знову використовується випадковий вибір.

Результати на AIRS-Bench

Налаштування: 20 загальнодоступних текстових і табличних завдань, 24 години на одному H200 для кожного завдання, 10 початкових значень, Qwen3.6-27B як базова модель і для операторів, і для RPM, тож приріст забезпечує рівень вибору, а не сильніший суддя.

Вибір дочірнього вузлаСередній нормалізований бал
Без RPM (випадковий вибір)0.684
RPM лише для інференсу0.711
Агентна RPM0.729
Оракул валідації (верхня межа)0.748
Тестовий оракул (верхня межа)0.759

Імовірність покращення порівняно з варіантом без RPM становить 0.5923 і 0.5913, а нижні межі 95% ДІ — 0.5066 і 0.5018.

Ефективність — практично важливіший результат. RPM лише для інференсу досягає фінального показника базового варіанта 0.684 за 14,88 години (у 1,61 раза швидше), а агентна — за 15,50 години (у 1,55 раза швидше). Локальний інференс додає 0,660 години на запуск; навіть з урахуванням цього показник становить 0.708 за 23,34 години.

Повідомлено про два нові результати SOTA: 94,1% на WinoGrande з агентною RPM проти попереднього агентного SOTA 90,4% від AIRA₂, а також 95,7% на SVAMP з RPM лише для інференсу проти попереднього людського SOTA 94,2%.

Основні висновки

  • RPM ранжують невиконані кандидати, щоб дослідницький агент ШІ запускав лише найперспективніший із них.
  • Два варіанти із замороженими LLM: суддя лише для інференсу та агентний суддя, який запускає короткі пілотні експерименти.
  • На AIRS-Bench середній нормалізований бал зростає з 0.684 до 0.711 і 0.729.
  • Обидва варіанти досягають показника базового підходу за 24 години приблизно за 15 годин, забезпечуючи прискорення в 1,5–1,6 раза.
  • Нові заявлені результати SOTA на WinoGrande (94,1%) і SVAMP (95,7%).

Ознайомтеся зі статтею та оголошенням у LinkedIn. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого GitHub-репозиторію, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини