Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Perplexity навчає свого комп’ютерного агента на реальних помилках за допомогою самодистиляції під керуванням підказок

Perplexity Research опублікувала нове дослідження посттренування. У ньому модель усередині Perplexity Computer навчається на реальних сесіях користувачів, зокрема невдалих. Метод поєднує донавчання методом відбору відхилень із самодистиляцією під керуванням підказок. У реальному A/B-тесті кількість помилок викликів інструментів знизилася з 2,24% до 1,77% між двома навченими контрольними точками. Команда Perplexity повідомляє про статистично значуще відносне зниження на 21,2%.

Чи можна це розгорнути? Не безпосередньо. Perplexity не опублікувала ваги посттренованої моделі або код навчання. Модель працює лише як опція моделі всередині Perplexity Computer. Базова модель, GLM 5.2, відкрито доступна на Hugging Face.

Чому фільтрація лише за результатом не дає достатнього ефекту

Стандартне донавчання методом відбору відхилень (RFT) оцінює кожну сесію та імітує лише успішні. Успішний результат не означає, що правильним був кожен крок. Агент може виправити наслідки невдалого виклику інструмента й усе одно надати правильну відповідь. Імітація всієї такої траєкторії може закріпити помилку. Відкидання невдалих сесій також позбавляє нас чітких свідчень помилок, яких можна було уникнути.

Імітувати, виправляти або залишати як контекст

Команда Perplexity розділяє 2 рішення: які сесії містять поведінку, гідну імітації, і які ходи містять помилки, що потребують виправлення.

Кожен хід асистента отримує 1 із 3 обробок:

  • Імітувати: ходи без помилок в успішних сесіях отримують втрати перехресної ентропії (CE).
  • Виправляти: ходи з помилками, для яких є підтверджена підказка, отримують втрати дивергенції Кульбака—Лейблера (KL) у будь-якій сесії.
  • Залишати як контекст: решта ходів залишаються у вхідних даних, але не отримують втрат.

Успішні сесії можуть надавати як цілі для імітації, так і цілі для виправлення. Невдалі сесії надають лише цілі для виправлення.

Як підказка стає навчальним сигналом

Підказка — це коротка коригувальна інструкція, заснована на інформації, яку модель уже мала. В одному прикладі пошуковий виклик задав recency_filter значення «year». Схема дозволяла лише «day», «week» або «month». Підказка називає невдалий виклик, містить помилку перевірки й пропонує дозволене значення або вилучення необов’язкового поля.

Коригувальна частина використовує самодистиляцію на основі власної політики (OPSD). Тренер двічі запускає ту саму контрольну точку GLM 5.2 на записаному ході. Під час проходу вчителя використовується підказка, а під час проходу учня — ні. Обидва проходи використовують примусове навчання, тому замінна відповідь не генерується. Імовірності наступного токена вчителя від’єднуються від обчислення градієнта й діють як м’яка ціль через пряму KL-дивергенцію.

Комбінована втрата має вигляд (CE + λ × KL), поділена на кількість токенів, що імітуються. За λ = 0 відновлюється стандартне SFT. Компонент CE має значення. Навчання лише на виправленнях може дозволити вчителю та учневі погодитися, ігноруючи контекст.

Відстеження скарг до справжньої помилки

Конвеєр використовує придатні для навчання сесії Computer, оброблені GLM 5.2. Сесії з персональною інформацією та користувачі, які відмовилися від участі, виключаються. Суддя-LLM залишає завдання, оцінені в 4 або 5 балів за 5-бальною шкалою складності. Двоє суддів-LLM повинні схвалити фінальний результат, щоб сесія вважалася успішною.

Щодо відгуків користувачів, три судді-LLM визначають відповідальний хід, і щонайменше 2 з них мають погодитися. Це важливо, оскільки останній хід асистента перед скаргою є першопричиною лише приблизно в половині випадків. Кожна підказка також перевіряється на відповідність інформації, доступній до помилки. Така перевірка зменшує упередження заднім числом.

Один із прикладів: користувач попросив свій «w3» у Paychex. Модель припустила, що це помилка в написанні W-2, і шукала неправильну форму. Підказка спрямована на попередню інтерпретацію, а не лише на фінальну відповідь.

Інтерактивне пояснення

Що показують оцінювання

  • Підказки працюють до навчання: На 985 відкладених ходах із помилками інструментів незмінена базова модель уникала початкової помилки у 93,7% випадків із підказками — порівняно з 75,1% без них. Частка випадків із виконанням виправленої дії зросла з 60,6% до 82,3%. На ходах із відгуками користувачів частка виправлених або таких, що залишилися на правильному шляху, випадків зросла з 40,0% до 75,0% для явних свідчень. Для виведеного наміру вона зросла з 32,5% до 80,0%.
  • Кількість офлайнових помилок інструментів зменшилася: Зафіксована частка помилок інструментів становила 2,79% для стандартної GLM 5.2 і 1,35% лише для RFT. Контрольна точка RFT плюс OPSD досягла показника 0,87%. Perplexity зазначає, що ці контрольні точки використовували різні навчальні дані, тому це не є зіставленим абляційним дослідженням. Результати на рівні завдань у таких наборах тестів, як BrowseComp і SpreadsheetBench, були неоднозначними.
  • Результати в реальному середовищі вужчі: У кожному A/B-тесті було приблизно по 100 000 користувачів у кожній групі. Рання контрольна точка порівняно зі стандартною GLM 5.2 показала 2,82% проти 2,94% помилок, що не було статистично значущим. Порівняння пізнішої контрольної точки продемонструвало значуще зниження на 21,2% без підказок під час висновування. Сильне невдоволення змінилося з 2,58% до 2,54%, що також не було статистично значущим. Perplexity не порівнювала пізнішу контрольну точку безпосередньо зі стандартною GLM 5.2 онлайн.

Ключові висновки

  • Perplexity навчається на невдалих сесіях, а не лише на успішних.
  • Підтверджені підказки перетворюють помилки, яких можна було уникнути, на цілі для KL-виправлення.
  • 1 модель виконує роль учителя (з підказкою) та учня (без підказки).
  • Кількість помилок викликів інструментів у реальному середовищі знизилася з 2,24% до 1,77%.
  • Невдоволення користувачів не продемонструвало статистично значущих змін.

Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання, де понад 150 тис. учасників, а також підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини