Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Perplexity обучава своя компютърен агент на реални грешки със самодистилация, насочвана от подсказки

Perplexity Research публикува ново проучване за дообучаване. В него модел се обучава в рамките на Perplexity Computer върху реални потребителски сесии, включително неуспешни. Методът съчетава дообучаване чрез извадково отхвърляне с насочена с подсказки самодистилация. В реален A/B тест неуспешните извиквания на инструменти намаляват от 2.24% на 1.77% между 2 дообучени контролни точки. Екипът на Perplexity отчита това като статистически значително относително намаление от 21.2%.

Може ли да бъде внедрен? Не директно. Perplexity не е публикувала дообучените тегла или кода за обучение. Моделът работи единствено като опция за модел в Perplexity Computer. Базовият модел, GLM 5.2, е публично достъпен в Hugging Face.

Защо филтрирането само по резултат не е достатъчно

Стандартното дообучаване чрез извадково отхвърляне (RFT) оценява всяка сесия и имитира само успешните. Успешният резултат не означава, че всяка стъпка е била правилна. Един агент може да се възстанови след неправилно извикване на инструмент и въпреки това да предостави правилния отговор. Имитирайки цялата траектория, той може да затвърди грешката. Отхвърлянето на неуспешните сесии също така премахва ясни доказателства за грешки, които е можело да бъдат избегнати.

Имитиране, коригиране или запазване като контекст

Екипът на Perplexity разделя 2 решения: кои сесии съдържат поведение, което си струва да бъде имитирано, и кои ходове съдържат грешки, които си струва да бъдат коригирани.

Всеки ход на асистента получава 1 от 3 обработки:

  • Имитиране: ходовете без грешки в успешните сесии получават загуба на кръстосана ентропия (CE).
  • Коригиране: ходовете с грешки и потвърдена подсказка получават загуба от дивергенцията на Кулбак–Лайблер (KL), независимо от сесията.
  • Запазване като контекст: останалите ходове остават във входа, но за тях не се изчислява загуба.

Успешните сесии могат да предоставят както цели за имитиране, така и цели за коригиране. Неуспешните сесии предоставят само цели за коригиране.

Как подсказката се превръща в обучаващ сигнал

Подсказката е кратка корективна инструкция, основана на информация, с която моделът вече е разполагал. В един пример заявка за търсене задава recency_filter на „year“. Схемата позволява само „day“, „week“ или „month“. Подсказката посочва неуспешната заявка, включва грешката при валидирането и предлага разрешена стойност или пропускане на незадължителното поле.

Корективната част използва самодистилация на текущата политика (OPSD). Обучаващият изпълнява същата контролна точка на GLM 5.2 два пъти върху записания ход. При преминаването на учителя се използва подсказката, а при преминаването на ученика — не. И двете използват принудително подаване на правилните токени, така че не се генерира заместващ отговор. Вероятностите на учителя за следващия токен се отделят от градиентите и служат като мека цел чрез пряка KL дивергенция.

Комбинираната загуба е (CE + λ × KL), разделена на броя имитирани токени. Задаването на λ на 0 възстановява стандартното SFT. Членът CE е важен. Обучаването само с корекции може да позволи на учителя и ученика да постигнат съгласие, като игнорират контекста.

Проследяване на оплакванията до действителната грешка

Конвейерът използва допустими за обучение сесии в Computer, обслужвани от GLM 5.2. Сесиите с лична информация и потребителите, които са се отказали от участие, се изключват. Съдия LLM запазва задачите, оценени с 4 или 5 по 5-степенна скала за трудност. Двама съдии LLM трябва и двамата да одобрят крайния резултат, за да бъде сесията отчетена като успешна.

При потребителска обратна връзка трима съдии LLM определят отговорния ход и поне 2 от тях трябва да постигнат съгласие. Това е важно, защото последният ход на асистента преди оплакването е първопричината само в около половината от случаите. Всяка подсказка също се проверява спрямо информацията, налична преди грешката. Тази проверка намалява предубедеността от погледа назад.

Един пример: потребител поиска своя „w3“ в Paychex. Моделът предположи, че става дума за печатна грешка при W-2, и потърси грешния формуляр. Подсказката е насочена към по-ранното тълкуване, а не само към крайния отговор.

Интерактивно обяснение

Какво показват оценките

  • Подсказките работят преди обучението: При 985 задържани хода с грешки на инструменти непромененият базов модел избягва първоначалния неуспех в 93.7% от случаите с подсказки спрямо 75.1% без тях. Делът на случаите, в които се предприема коригираното действие, нараства от 60.6% на 82.3%. При ходовете с потребителска обратна връзка делът на фиксираните или насочените в правилна посока случаи нараства от 40.0% на 75.0% при явно посочени доказателства. При изведено намерение той нараства от 32.5% на 80.0%.
  • Офлайн грешките при инструментите намаляват: Записаните нива на грешки при инструментите са 2.79% за стандартния GLM 5.2 и 1.35% само за RFT. Контролната точка с RFT плюс OPSD достига 0.87%. Perplexity отбелязва, че тези контролни точки използват различни обучаващи данни, така че това не е съпоставимо аблационно сравнение. Резултатите на ниво задача в набори като BrowseComp и SpreadsheetBench са смесени.
  • Резултатите на живо са по-ограничени: Всеки A/B тест използва около 100 000 потребители във всяко условие. Ранна контролна точка спрямо стандартния GLM 5.2 показва 2.82% спрямо 2.94% грешки, което не е статистически значимо. Сравнението с по-късната контролна точка показва значим спад от 21.2% без подсказки при извеждането. Силното неудовлетворение намалява от 2.58% на 2.54%, което също не е статистически значимо. Perplexity не сравнява директно по-късната контролна точка със стандартния GLM 5.2 онлайн.

Основни изводи

  • Perplexity се учи от неуспешни сесии, а не само от успешни.
  • Потвърдените подсказки превръщат грешките, които могат да бъдат избегнати, в цели за KL корекция.
  • 1 модел действа като учител (с подсказка) и ученик (без подсказка).
  • Неуспешните извиквания на инструменти на живо намаляват от 2.24% на 1.77%.
  • Неудовлетвореността на потребителите не показва значима промяна.

Разгледайте техническите подробности. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини