Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Perplexity выпускает pplx-embed-v2-context-9b-preview: контекстную embedding-модель, которая извлекает ответы и подтверждающие их свидетельства

Perplexity Research и turbopuffer выпустили pplx-embed-v2-context-9b-preview — модель контекстных эмбеддингов для RAG-пайплайнов. Каждый фрагмент встраивается с учётом всего документа. Главное изменение — обучающий сигнал. Модель учится извлекать ответ вместе с контекстом, необходимым для его проверки, а не один «эталонный фрагмент». П

Можно ли её развернуть? Да, в виде предварительной версии для самостоятельного размещения. Веса доступны на Hugging Face по лицензии MIT. Для загрузки требуется transformers>=5.4.0 с trust_remote_code=True. В API Perplexity модель пока недоступна. В карточке модели отмечается, что веса и интерфейс могут измениться без обратной совместимости.

Почему эталонный фрагмент не справляется

RAG-системы разбивают длинные документы на фрагменты. Фрагмент часто зависит от сущности, заголовка или определения, указанных в другом месте. Контекстные модели решают эту проблему с помощью позднего разбиения на фрагменты. Документ кодируется за один проход, после чего для каждого фрагмента выполняется pooling.

Однако при обучении обычно отмечается один эталонный фрагмент для каждого запроса. Все остальные фрагменты становятся отрицательными, включая предложения, которые позволяют проверить ответ. Perplexity указывает ещё на 3 проблемы. Бинарные метки дают грубый сигнал. Стоимость разметки с помощью LLM растёт линейно с размером набора данных. Кроме того, метки зависят от одной стратегии разбиения на фрагменты.

Как работает обучение

В качестве учителя используется модель сжатия контекста с учётом запроса Perplexity. Она одновременно обрабатывает запрос и документ и оценивает каждый токен.

  • Релевантность фрагмента: среднее значение оценок для n лучших токенов внутри каждого фрагмента.
  • Мягкая цель: softmax с масштабированием по температуре для фрагментов в положительном документе. Фрагменты в других документах получают нулевое значение.
  • Функция потерь дистилляции: прямая дивергенция KL между распределениями учителя и ученика.
  • Потери документа: InfoNCE, где оценка документа равна оценке его лучшего фрагмента; подход вдохновлён MaxSim в ColBERT.

В каждом батче случайным образом выбирается стратегия разбиения на фрагменты. Фрагменты разделяются обучаемым токеном <|chunk_sep|>, после чего для них вычисляется mean pooling. Учитель используется только во время обучения, поэтому на этапе вывода задержка или дополнительные требования к хранилищу не увеличиваются.

Модель начинается с собственной модели поиска ColBERT на 9B параметров. Линейная проекция выдаёт 2048 измерений. Обучение Matryoshka также поддерживает 1024 измерения. Обучение с учётом квантования обеспечивает нативные эмбеддинги int8. Выпуск представляет собой смесь нескольких контрольных точек. Для обучения использовалось примерно 430 наборов данных, охватывающих более 50 языков, без данных ConTEB.

Интерактивное объяснение

Объяснение контекстных эмбеддингов pplx-embed-v2
контекст
Как pplx-embed-v2-context извлекает ответы и подтверждающие их данные

Интерактивное знакомство с предварительной версией контекстных эмбеддингов Perplexity: почему изолированные фрагменты не справляются, как дистилляция учителя заменяет единственный эталонный фрагмент и что означают приведённые числа.

В трёх файлах аренды встречается предложение «Ежемесячная арендная плата составляет …». Только один из них относится к 5 Park Avenue. Переключайте режимы и запускайте поиск.

ЗАПРОСКогда заканчивается аренда 5 Park Avenue и какова текущая арендная плата?
Выберите режим и нажмите «Запустить поиск».

Иллюстративный пример, основанный на сценарии с арендой из публикации Perplexity. Оценки приведены только для объяснения и не являются результатами работы модели.

Модель сжатия контекста выступает в роли учителя. Она оценивает каждый токен с точки зрения запроса. Эти оценки агрегируются для каждого фрагмента (среднее значение для n лучших токенов) и преобразуются в мягкую цель вместо унитарной эталонной метки.

Границы фрагментов: Температура0.25
1 Учитель оценивает токены2 Среднее top-n для каждого фрагмента3 Цель softmax4 Ученик сопоставляет распределения с помощью KL

Метка эталонного фрагмента (унитарная)

Цель учителя (мягкая, на основе оценок токенов)

Измените границы: те же оценки токенов агрегируются заново без повторной разметки. Именно это свойство Perplexity называет «гибкими границами фрагментов». Приведённые здесь оценки токенов являются иллюстративными.

context-bench (2 099 запросов, 38 894 документа, 2 458 072 фрагмента предложений, исчерпывающее ранжирование). Приведённые ниже значения указаны Perplexity для K = 10.

pplx-embed-v2-context-9b-previewvoyage-context-4 (выведено из указанной разницы)

Значения для Voyage рассчитаны как показатель Perplexity минус указанная разница (14,4 и 5,0 пункта). Другие метрики Voyage представлены только на графике Perplexity и здесь не приводятся.

Контекстные эмбеддинги хранят один вектор на фрагмент — так же, как обычный индекс фрагментов. Стоимость зависит от размера вектора. Perplexity сообщает, что int8 с размерностью 1024 (1 КБ) немного превосходит voyage-context-4 с размерностью 2048 и float32 (8 КБ) в своём наборе тестов для поиска фрагментов.

Фрагменты
0
хранение векторов (только векторы, без полного индекса)
Байт на вектор
–
по сравнению с 2048-мерным float32
–
Чувствительность к размеру фрагмента (от 64 до 512 токенов)
81,0%–79,9%

Байты = размерность × число байт на значение. Чувствительность — это среднее значение nDCG@10 по 74 задачам MTEB, согласно данным Perplexity.

Источники: Perplexity Research · Карточка модели Создано Marktechpost

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости