Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Perplexity AI пуска pplx-embed-v2-late: edge модел с 0,6B параметъра и 9B модел с резултат 92,4% на MADQA

Perplexity пусна pplx-embed-v2-late – двойка мултимодални модели за вграждания в стил ColBERT. Те се предлагат в 2 размера: 0.6B за бързи и евтини заявки и 9B за максимално качество. И двата модела извличат текст, изображения и визуализирани страници от PDF файлове и споделят едно и също пространство за вграждания.

Може ли да се внедри? Да, ако го хоствате сами. И двата модела са налични в Hugging Face под лиценза MIT. Планира се хостван endpoint на Perplexity API, но все още не е активен.

Накратко

Най-доброто

  • Моделът 0.6B използва около 340M активни параметъра за изображения и се доближава до конкурентни модели с 8B параметъра.
  • Индекс 9B може да се търси със заявки от 0.6B, като възстановява около половината от разликата в качеството спрямо 9B при цена на заявка като при 0.6B.
  • Неговите токенни вектори със 128 измерения са от 16 до 32 пъти по-тесни от тези на конкурентите с 2 048 до 4 096 измерения.
  • Лиценз MIT, позволяващ търговска употреба.

Най-лошото

  • Съхранява 1 вектор на токен, така че размерът на индекса нараства с дължината на документа.
  • Не е №1 при извличането на изображения във ViDoRe v3; EVIE на Tencent постига по-висок резултат.
  • Един вход не може да смесва текст и изображения.
  • Всички резултати са заявени от самата компания, а техническият доклад все още не е публикуван.

Размер на модела и върху какво работи

Показателиpplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
Общ брой параметри594M9B (Hugging Face посочва 8B)
Активни параметри~240M за текст, 340M за изображения7.4B
Базов моделQwen3.5-0.8B, съкратен до 12 текстови слояQwen3.5
Изход128 измерения на токен128 измерения на токен
Тегла в паметта (bf16, наша оценка)~1.2 GB~16 до 18 GB
Предназначена машинаЛаптоп, edge устройство или малък графичен процесорЦентър за данни или графичен процесор с много памет
Препоръчана от Perplexity роляЕнкодер на заявки в реално време, изцяло локалноСъздаване на индекса на документите

Perplexity проектира модела 0.6B като лек енкодер на заявки, който може да работи и на edge устройства. И двата моделни информационни листа показват използване на CUDA графичен процесор. Те изискват sentence-transformers >= 6.0.0 и transformers >= 5.4.0. Стойностите за паметта са наша оценка при 2 байта на параметър и се отнасят само до теглата. Публикуваните checkpoint-и се съхраняват във формат F32, което удвоява размера за изтегляне.

Колко добре се представя: най-добри и най-лоши резултати

Всички числа по-долу са от съобщението на Perplexity:

Бенчмарк0.6B9BПозиция
MADQA (агентен PDF QA, точност)90.1%92.4% (най-добър)Изпреварва ретривъра на Mixedbread (88.9%); изостава от Mixedbread Agentic Search (93.4%)
Специализиран за домейна текст (72 задачи, nDCG@10)78.0%81.3%9B води всички тествани модели с 1.6 процентни пункта; 0.6B изостава с 0.3 процентни пункта от gemini-embedding-2
Q2D-Web (Recall@1000)73.6%74.8%И двата изпреварват предишния най-добър резултат от 69.3%
ViDoRe v3 изображения (nDCG@10)62.3%65.2%0.6B е в рамките на 1.2 процентни пункта от nemotron-colembed-v2-8b; EVIE води
ViDoRe v3 Markdown (nDCG@10)61.2% (най-слаб)64.7%И двата изпреварват всеки тестван външен модел
BrowseComp+ (точност)Не е посочено64.0% (най-нисък)Все пак е с 4.9 процентни пункта над следващия ColBERT модел

Най-силният резултат: 92.4% на MADQA, постигнат от модела 9B. Най-голямата разлика е при BrowseComp+ – 8.7 процентни пункта пред най-добрия плътен модел.

Най-слабият резултат: 61.2% на ViDoRe v3 Markdown, постигнат от модела 0.6B. Той все пак е вторият най-добър резултат в този бенчмарк. Търсенето на изображения е реалната слабост: Gemini Embedding 2 изпреварва модела 9B в MIRACL-Vision и с 2 процентни пункта в PPLX-Q2I.

Комбиниране на размери: индекс 9B, търсен с модела 0.6B, постига 63.5% при извличане на изображения във ViDoRe v3. Това е по-добре от 62.3% при 0.6B и от двете страни, при същата цена на заявката.

Как работи

Плътните модели компресират документа в 1 вектор. Вместо това pplx-embed-v2 запазва 128-мерен вектор за всеки токен. Оценяването се извършва с MaxSim: всеки токен от заявката намира най-добрия си токен в документа, след което тези максимални стойности се сумират. Страниците се кодират като изображения, така че не е необходима стъпка за OCR. Perplexity дистилира и двата модела от учител с 18B параметъра чрез обучение на ниво токени в стил LEAF. Именно това обучение създава споделеното пространство.

Най-добри случаи на употреба

  • Най-подходящ е за визуално търсене в документи – PDF файлове, презентации и сканирани отчети.
  • Търсене с ниска латентност: индексиране в облака с 9B, последвано от търсене на устройството с 0.6B.
  • Агентен RAG върху големи колекции от PDF файлове или уеб страници.

Интерактивно обяснение

Как се сравнява

Характеристикаpplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
Размер0.6B, 9B~8.8B0.8B, 2B с отворен кодНе е разкрит
Ширина на вектора128 на токен4 096 на токен2 048 на токен (малък)128 до 3 072, 1 вектор
ВходовеТекст, изображения, визуализации на странициТекстови заявки, изображения на странициТекст, изображения на странициТекст, изображения, видео, аудио, PDF
Работи върхуВашия графичен процесор; 0.6B на edge устройствоNVIDIA A100/H100, LinuxCUDA графичен процесор (Ampere+)Google API
Споделено пространство между размеритеДаНе е посоченоНе е посоченоНеприложимо
ЛицензMITCC-BY-NC-4.0Apache 2.0 (малък)Собственически

Основни изводи

  • Моделът 0.6B е подходящ за edge устройства; моделът 9B е създаден за качество при индексиране.
  • Най-добър резултат: 92.4% на MADQA. Най-слаб: 61.2% на ViDoRe v3 Markdown.
  • Заявките от 0.6B върху индекс 9B превъзхождат конфигурацията с 0.6B и от двете страни.
  • Нарастването на обема за съхранение и резултатите, заявени от самата компания, са основните уговорки.

Разгледайте теглата на моделите в HF и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.

[Спонсорирано] Уеб пространството е единственият API, който липсва на повечето агенти. Базите данни, календарите и хранилищата разполагат с API. Отвореният уеб обаче до голяма степен няма такъв. TinyFish MCP server предоставя на всеки MCP клиент четири инструмента: TinySearch, TinyFetch (пълни страници като markdown, включително JavaScript), TinyBrowser за вход и формуляри и TinyAgent за многостъпкови задачи. Search и Fetch са безплатни.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини