Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Perplexity обучает своего компьютерного агента на реальных ошибках с самодистилляцией под управлением подсказок

Perplexity Research опубликовала новое исследование постобучения. В нём модель обучают внутри Perplexity Computer на реальных пользовательских сессиях, включая неудачные. Метод объединяет дообучение с выборкой отклонений и самодистилляцию с подсказками. В реальном A/B-тесте доля сбоев вызовов инструментов снизилась с 2,24% до 1,77% между двумя обученными чекпойнтами. Команда Perplexity сообщает об этом как о статистически значимом относительном снижении на 21,2%.

Можно ли это внедрить? Не напрямую. Perplexity не выпустила веса модели после обучения или код обучения. Модель работает только как вариант модели внутри Perplexity Computer. Базовая модель, GLM 5.2, открыто доступна на Hugging Face.

Почему фильтрация только по результату недостаточна

Стандартное дообучение с выборкой отклонений (RFT) оценивает каждую сессию и имитирует только успешные. Успешный результат не означает, что каждый шаг был правильным. Агент может исправить ошибочный вызов инструмента и всё равно выдать правильный ответ. Имитация всей такой траектории может закрепить ошибку. Отбрасывание неудачных сессий также лишает модель явных свидетельств ошибок, которых можно было избежать.

Имитировать, исправлять или сохранять как контекст

Команда Perplexity разделяет 2 решения: какие сессии содержат поведение, достойное имитации, и какие ходы содержат ошибки, требующие исправления.

Каждый ход ассистента получает 1 из 3 вариантов обработки:

  • Имитировать: ходы без ошибок в успешных сессиях получают функцию потерь на основе перекрёстной энтропии (CE).
  • Исправлять: ходы с ошибками и подтверждённой подсказкой получают функцию потерь на основе дивергенции Кульбака — Лейблера (KL) в любой сессии.
  • Сохранять как контекст: остальные ходы остаются во входных данных, но не влияют на функцию потерь.

Успешные сессии могут предоставлять как цели для имитации, так и цели для исправления. Неуспешные сессии предоставляют только цели для исправления.

Как подсказка превращается в обучающий сигнал

Подсказка — это краткая инструкция по исправлению, основанная на информации, которая уже была у модели. В одном примере поисковый вызов установил значение recency_filter равным ‘year’. Схема допускала только ‘day’, ‘week’ или ‘month’. В подсказке указывается неудачный вызов, приводится ошибка валидации и предлагается допустимое значение либо удаление необязательного поля.

Для исправления используется самодистилляция на собственной политике (OPSD). Обучающий процесс дважды запускает тот же чекпойнт GLM 5.2 на записанном ходе. Учитель видит подсказку, а ученик — нет. Оба используют принудительную генерацию по эталону, поэтому новый ответ взамен исходного не создаётся. Вероятности следующих токенов учителя отсоединяются от графа вычислений и выступают в качестве мягкой цели через прямую KL-дивергенцию.

Комбинированная функция потерь имеет вид (CE + λ × KL), делённая на количество имитируемых токенов. При λ, равном 0, получается стандартное SFT. Слагаемое CE важно. Обучение только на исправлениях может позволить учителю и ученику прийти к согласию, игнорируя контекст.

Отслеживание жалоб до настоящей ошибки

Конвейер использует допущенные к обучению сессии Computer, обслуживаемые GLM 5.2. Сессии с персональными идентифицируемыми данными и пользователи, отказавшиеся от участия, исключаются. Судья на основе LLM оставляет задачи, получившие оценку 4 или 5 по 5-балльной шкале сложности. Для того чтобы сессия считалась успешной, два судьи на основе LLM должны одобрить итоговую выдачу.

При анализе отзывов пользователей три судьи на основе LLM определяют ответственный ход, и как минимум 2 из них должны согласиться. Это важно, поскольку последний ход ассистента перед жалобой является первопричиной лишь примерно в половине случаев. Каждая подсказка также проверяется на соответствие информации, доступной до совершения ошибки. Такая проверка снижает предвзятость задним числом.

Один из примеров: пользователь запросил свой ‘w3’ в Paychex. Модель предположила, что речь идёт об опечатке в W-2, и стала искать не ту форму. Подсказка направлена на исправление более ранней интерпретации, а не только итогового ответа.

Интерактивное объяснение

Что показывают оценки

  • Подсказки работают до обучения: На 985 отложенных ходах с ошибками инструментов неизменённая базовая модель избегала исходной ошибки в 93,7% случаев с подсказками против 75,1% без них. Доля случаев, в которых выполнялось исправленное действие, выросла с 60,6% до 82,3%. На ходах с отзывами пользователей доля исправленных или соответствующих направлению случаев выросла с 40,0% до 75,0% для явных свидетельств. Для предполагаемого намерения она выросла с 32,5% до 80,0%.
  • Количество ошибок инструментов в офлайн-тестах снизилось: Зафиксированная доля ошибок инструментов составила 2,79% для стандартной GLM 5.2 и 1,35% только для RFT. Чекпойнт RFT плюс OPSD достиг 0,87%. Perplexity отмечает, что для этих чекпойнтов использовались разные обучающие данные, поэтому это не сопоставимое абляционное исследование. Результаты на уровне задач в таких наборах, как BrowseComp и SpreadsheetBench, были неоднозначными.
  • Результаты в реальных условиях более узкие: В каждом A/B-тесте на каждое условие приходилось около 100 000 пользователей. Сравнение раннего чекпойнта со стандартной GLM 5.2 показало 2,82% против 2,94% сбоев, что не было статистически значимым. Сравнение более позднего чекпойнта дало значимое снижение на 21,2% без подсказок на этапе вывода. Сильная неудовлетворённость снизилась с 2,58% до 2,54%, что также не было статистически значимым. Perplexity не сравнивала более поздний чекпойнт напрямую со стандартной GLM 5.2 онлайн.

Основные выводы

  • Perplexity учится на неудачных сессиях, а не только на успешных.
  • Подтверждённые подсказки превращают ошибки, которых можно было избежать, в цели для исправления с помощью KL-дивергенции.
  • 1 модель выступает в роли учителя (с подсказкой) и ученика (без неё).
  • Доля сбоев вызовов инструментов в реальных условиях снизилась с 2,24% до 1,77%.
  • Заметного изменения неудовлетворённости пользователей не наблюдалось.

Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тыс. и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости