Perplexity AI пуска pplx-embed-v2-late: edge модел с 0,6B параметъра и 9B модел с резултат 92,4% на MADQA
Perplexity пусна pplx-embed-v2-late – двойка мултимодални модели за вграждания в стил ColBERT. Те се предлагат в 2 размера: 0.6B за бързи и евтини заявки и 9B за максимално качество. И двата модела извличат текст, изображения и визуализирани страници от PDF файлове и споделят едно и също пространство за вграждания.
Може ли да се внедри? Да, ако го хоствате сами. И двата модела са налични в Hugging Face под лиценза MIT. Планира се хостван endpoint на Perplexity API, но все още не е активен.
Накратко
Най-доброто
- Моделът 0.6B използва около 340M активни параметъра за изображения и се доближава до конкурентни модели с 8B параметъра.
- Индекс 9B може да се търси със заявки от 0.6B, като възстановява около половината от разликата в качеството спрямо 9B при цена на заявка като при 0.6B.
- Неговите токенни вектори със 128 измерения са от 16 до 32 пъти по-тесни от тези на конкурентите с 2 048 до 4 096 измерения.
- Лиценз MIT, позволяващ търговска употреба.
Най-лошото
- Съхранява 1 вектор на токен, така че размерът на индекса нараства с дължината на документа.
- Не е №1 при извличането на изображения във ViDoRe v3; EVIE на Tencent постига по-висок резултат.
- Един вход не може да смесва текст и изображения.
- Всички резултати са заявени от самата компания, а техническият доклад все още не е публикуван.
Размер на модела и върху какво работи
| Показатели | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Общ брой параметри | 594M | 9B (Hugging Face посочва 8B) |
| Активни параметри | ~240M за текст, 340M за изображения | 7.4B |
| Базов модел | Qwen3.5-0.8B, съкратен до 12 текстови слоя | Qwen3.5 |
| Изход | 128 измерения на токен | 128 измерения на токен |
| Тегла в паметта (bf16, наша оценка) | ~1.2 GB | ~16 до 18 GB |
| Предназначена машина | Лаптоп, edge устройство или малък графичен процесор | Център за данни или графичен процесор с много памет |
| Препоръчана от Perplexity роля | Енкодер на заявки в реално време, изцяло локално | Създаване на индекса на документите |
Perplexity проектира модела 0.6B като лек енкодер на заявки, който може да работи и на edge устройства. И двата моделни информационни листа показват използване на CUDA графичен процесор. Те изискват sentence-transformers >= 6.0.0 и transformers >= 5.4.0. Стойностите за паметта са наша оценка при 2 байта на параметър и се отнасят само до теглата. Публикуваните checkpoint-и се съхраняват във формат F32, което удвоява размера за изтегляне.
Колко добре се представя: най-добри и най-лоши резултати
Всички числа по-долу са от съобщението на Perplexity:
| Бенчмарк | 0.6B | 9B | Позиция |
|---|---|---|---|
| MADQA (агентен PDF QA, точност) | 90.1% | 92.4% (най-добър) | Изпреварва ретривъра на Mixedbread (88.9%); изостава от Mixedbread Agentic Search (93.4%) |
| Специализиран за домейна текст (72 задачи, nDCG@10) | 78.0% | 81.3% | 9B води всички тествани модели с 1.6 процентни пункта; 0.6B изостава с 0.3 процентни пункта от gemini-embedding-2 |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | И двата изпреварват предишния най-добър резултат от 69.3% |
| ViDoRe v3 изображения (nDCG@10) | 62.3% | 65.2% | 0.6B е в рамките на 1.2 процентни пункта от nemotron-colembed-v2-8b; EVIE води |
| ViDoRe v3 Markdown (nDCG@10) | 61.2% (най-слаб) | 64.7% | И двата изпреварват всеки тестван външен модел |
| BrowseComp+ (точност) | Не е посочено | 64.0% (най-нисък) | Все пак е с 4.9 процентни пункта над следващия ColBERT модел |
Най-силният резултат: 92.4% на MADQA, постигнат от модела 9B. Най-голямата разлика е при BrowseComp+ – 8.7 процентни пункта пред най-добрия плътен модел.
Най-слабият резултат: 61.2% на ViDoRe v3 Markdown, постигнат от модела 0.6B. Той все пак е вторият най-добър резултат в този бенчмарк. Търсенето на изображения е реалната слабост: Gemini Embedding 2 изпреварва модела 9B в MIRACL-Vision и с 2 процентни пункта в PPLX-Q2I.
Комбиниране на размери: индекс 9B, търсен с модела 0.6B, постига 63.5% при извличане на изображения във ViDoRe v3. Това е по-добре от 62.3% при 0.6B и от двете страни, при същата цена на заявката.
Как работи
Плътните модели компресират документа в 1 вектор. Вместо това pplx-embed-v2 запазва 128-мерен вектор за всеки токен. Оценяването се извършва с MaxSim: всеки токен от заявката намира най-добрия си токен в документа, след което тези максимални стойности се сумират. Страниците се кодират като изображения, така че не е необходима стъпка за OCR. Perplexity дистилира и двата модела от учител с 18B параметъра чрез обучение на ниво токени в стил LEAF. Именно това обучение създава споделеното пространство.
Най-добри случаи на употреба
- Най-подходящ е за визуално търсене в документи – PDF файлове, презентации и сканирани отчети.
- Търсене с ниска латентност: индексиране в облака с 9B, последвано от търсене на устройството с 0.6B.
- Агентен RAG върху големи колекции от PDF файлове или уеб страници.
Интерактивно обяснение
Как се сравнява
| Характеристика | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Размер | 0.6B, 9B | ~8.8B | 0.8B, 2B с отворен код | Не е разкрит |
| Ширина на вектора | 128 на токен | 4 096 на токен | 2 048 на токен (малък) | 128 до 3 072, 1 вектор |
| Входове | Текст, изображения, визуализации на страници | Текстови заявки, изображения на страници | Текст, изображения на страници | Текст, изображения, видео, аудио, PDF |
| Работи върху | Вашия графичен процесор; 0.6B на edge устройство | NVIDIA A100/H100, Linux | CUDA графичен процесор (Ampere+) | Google API |
| Споделено пространство между размерите | Да | Не е посочено | Не е посочено | Неприложимо |
| Лиценз | MIT | CC-BY-NC-4.0 | Apache 2.0 (малък) | Собственически |
Основни изводи
- Моделът 0.6B е подходящ за edge устройства; моделът 9B е създаден за качество при индексиране.
- Най-добър резултат: 92.4% на MADQA. Най-слаб: 61.2% на ViDoRe v3 Markdown.
- Заявките от 0.6B върху индекс 9B превъзхождат конфигурацията с 0.6B и от двете страни.
- Нарастването на обема за съхранение и резултатите, заявени от самата компания, са основните уговорки.
Разгледайте теглата на моделите в HF и техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.