Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Perplexity пуска pplx-embed-v2-context-9b-preview: контекстуален embedding модел, който извлича отговори и доказателствата в тяхна подкрепа

Perplexity Research и turbopuffer пуснаха pplx-embed-v2-context-9b-preview — модел за контекстуални ембединг в RAG конвейери. Всеки сегмент се вгражда с оглед на целия документ. Същинската промяна е в обучаващия сигнал. Моделът се учи да извлича отговора заедно с контекста, необходим за проверката му, а не един „златен пасаж“. P

Може ли да бъде внедрен? Да, като самостоятелно хостван preview. Теглата са в Hugging Face под лиценза MIT. Зареждането изисква transformers>=5.4.0 с trust_remote_code=True. Все още не е наличен в API на Perplexity. Картата на модела отбелязва, че теглата и интерфейсът може да се променят без обратна съвместимост.

Защо златният пасаж не е достатъчен

RAG системите разделят дългите документи на сегменти. Един сегмент често зависи от обект, заглавие или дефиниция, посочени другаде. Контекстуалните модели се справят с това чрез късно сегментиране. Документът се кодира на един проход, след което се извършва pooling за всеки сегмент.

При обучението обаче обикновено се маркира един златен сегмент за всяка заявка. Всеки друг сегмент се превръща в отрицателен пример, включително изреченията, които правят отговора проверим. Perplexity посочва още 3 проблема. Двоичните етикети дават груб сигнал. Разходите за анотация от LLM нарастват линейно с размера на набора от данни. Етикетите също така са обвързани с една стратегия за сегментиране.

Как работи обучението

Учителят е моделът на Perplexity за компресиране на контекста с отчитане на заявката. Той прочита заявката и документа заедно и оценява всеки токен.

  • Релевантност на сегмента: средната стойност на най-високите n оценки на токени във всеки сегмент.
  • Мека цел: softmax, мащабиран с температура, върху сегментите в положителния документ. Сегментите в други документи получават нулева стойност.
  • Загуба от дистилация: разминаване KL в права посока между разпределенията на учителя и ученика.
  • Загуба на документа: InfoNCE, при което документът получава оценка като най-добрия си сегмент, вдъхновено от MaxSim на ColBERT.

Всеки пакет използва произволно избрана стратегия за сегментиране. Сегментите се разделят чрез обучаем токен <|chunk_sep|> и се усредняват. Учителят работи само по време на обучението, така че при извеждане не се добавят нито латентност, нито допълнително хранилище.

Моделът започва от вътрешен 9B модел на ColBERT за извличане. Линейна проекция извежда 2048 измерения. Обучението Matryoshka поддържа и 1024 измерения. Обучението с отчитане на квантизацията позволява естествени int8 ембединги. Пуснатата версия представлява model soup от няколко checkpoint-а. При обучението са използвани приблизително 430 набора от данни, обхващащи над 50 езика, без данни от ConTEB.

Интерактивно обяснение

Обяснение на контекстуалните ембединги pplx-embed-v2
ctx
Как pplx-embed-v2-context извлича отговори и доказателства за тях

Интерактивно представяне на контекстуалния preview на Perplexity: защо изолираните сегменти не работят, как дистилацията от учител заменя единичния златен пасаж и какво означават отчетените стойности.

Три договора за наем съдържат изречението „Месечният наем е …“. Само един принадлежи на 5 Park Avenue. Превключвайте режимите и стартирайте извличането.

ЗАЯВКАКога изтича договорът за наем на 5 Park Avenue и какъв е текущият наем?
Изберете режим и натиснете „Стартирай извличането“.

Илюстративен пример, моделиран по сценария с договорите за наем в публикацията на Perplexity. Оценките са само с обяснителна цел, а не са изходни данни от модела.

Модел за компресиране на контекста действа като учител. Той оценява всеки токен спрямо заявката. Тези оценки се обединяват за всеки сегмент (средна стойност на най-високите n токена) и се превръщат в мека цел вместо в еднократен златен етикет.

Граници на сегментите: Температура0.25
1 Учителят оценява токените2 Средна стойност на най-високите n за сегмент3 Целеви softmax4 Ученикът съпоставя чрез KL

Етикет на златния сегмент (еднократен)

Цел на учителя (мека, от оценките на токените)

Променете границите: същите оценки на токените се прегрупират без повторна анотация. Това е свойството „гъвкави граници на сегментите“, описано от Perplexity. Оценките на токените тук са илюстративни.

context-bench (2 099 заявки, 38 894 документа, 2 458 072 изречения-сегменти, изчерпателно класиране). Стойностите по-долу са отчетените от Perplexity при K = 10.

pplx-embed-v2-context-9b-previewvoyage-context-4 (изведено от отчетената разлика)

Стойностите за Voyage са изчислени като стойността на Perplexity минус посочената разлика (14,4 и 5,0 пункта). Другите метрики за Voyage се появяват само в графиката на Perplexity и не са показани тук.

Контекстуалните ембединги съхраняват един вектор на сегмент, както при обикновен индекс на сегменти. Разходите зависят от размера на вектора. Perplexity съобщава, че 1024-мерните int8 (1 KB) ембединги малко надминават voyage-context-4 с 2048-мерни float32 (8 KB) ембединги в набора му за извличане на сегменти.

Сегменти
0
векторно хранилище (само вектори, без целия индекс)
Байтове на вектор
–
спрямо 2048-мерен float32
–
Чувствителност към размера на сегмента (64 до 512 токена)
81,0% до 79,9%

Байтове = измерения × байтове на стойност. Чувствителността е средната стойност на nDCG@10 за 74 задачи от MTEB, както е отчетено от Perplexity.

Източници: Perplexity Research · Карта на модела Създадено от Marktechpost

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини