Perplexity AI выпускает pplx-embed-v2-late: edge-модель с 0,6B параметра и модель на 9B параметров с результатом 92,4% на MADQA
Perplexity выпустила pplx-embed-v2-late — пару мультимодальных embedding-моделей в стиле ColBERT. Они доступны в двух размерах: 0.6B для быстрых и дешёвых запросов и 9B для максимального качества. Обе модели извлекают текст, изображения и отрендеренные страницы PDF и используют единое пространство эмбеддингов.
Можно ли её развернуть? Да, если разместить её самостоятельно. Обе модели доступны на Hugging Face по лицензии MIT. Размещённая конечная точка Perplexity API запланирована, но пока недоступна.
Кратко
Лучшее
- Модель 0.6B использует около 340M активных параметров для изображений и близка по качеству к конкурентам с 8B параметров.
- Индекс 9B можно искать с помощью запросов 0.6B, восполняя примерно половину отставания 9B по качеству на тексте при стоимости запросов 0.6B.
- Её 128-мерные векторы токенов в 16–32 раза уже, чем у конкурентов с размерностью от 2 048 до 4 096.
- Лицензия MIT разрешает коммерческое использование.
Худшее
- Она хранит по 1 вектору на токен, поэтому размер индекса растёт вместе с длиной документа.
- Она не занимает первое место в извлечении изображений на ViDoRe v3; EVIE от Tencent набирает больше баллов.
- Один вход не может одновременно содержать текст и изображения.
- Все оценки представлены разработчиками самостоятельно, а технический отчёт ещё не опубликован.
Размер модели и оборудование для её запуска
| Показатели | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Всего параметров | 594M | 9B (на Hugging Face указано 8B) |
| Активные параметры | ~240M для текста, 340M для изображений | 7.4B |
| Базовая модель | Qwen3.5-0.8B, сокращённая до 12 текстовых слоёв | Qwen3.5 |
| Выходные данные | 128 измерений на токен | 128 измерений на токен |
| Веса в памяти (bf16, наша оценка) | ~1.2 ГБ | ~16–18 ГБ |
| Предполагаемое устройство | Ноутбук, периферийное устройство или небольшой GPU | Дата-центр или GPU с большим объёмом памяти |
| Рекомендуемая Perplexity роль | Кодировщик запросов в реальном времени, полностью локально | Создание индекса документов |
Perplexity разработала модель 0.6B как лёгкий кодировщик запросов, способный работать и на периферийных устройствах. Обе карточки моделей показывают использование CUDA GPU. Для их работы требуются sentence-transformers >= 6.0.0 и transformers >= 5.4.0. Значения объёма памяти — наша оценка из расчёта 2 байта на параметр только для весов. Опубликованные чекпойнты хранятся в формате F32, что вдвое увеличивает размер загрузки.
Насколько хорошо она работает: лучшие и худшие оценки
Все приведённые ниже значения взяты из анонса Perplexity:
| Бенчмарк | 0.6B | 9B | Позиция |
|---|---|---|---|
| MADQA (агентная работа с PDF, точность) | 90.1% | 92.4% (лучший результат) | Превосходит ретривер Mixedbread (88.9%), но уступает Mixedbread Agentic Search (93.4%) |
| Специализированный текстовый домен (72 задачи, nDCG@10) | 78.0% | 81.3% | 9B опережает все протестированные модели на 1.6 п.п.; 0.6B отстаёт от gemini-embedding-2 на 0.3 п.п. |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | Обе модели превосходят предыдущий лучший результат в 69.3% |
| Изображения ViDoRe v3 (nDCG@10) | 62.3% | 65.2% | 0.6B отстаёт от nemotron-colembed-v2-8b на 1.2 п.п.; лидирует EVIE |
| Markdown ViDoRe v3 (nDCG@10) | 61.2% (худший результат) | 64.7% | Обе модели превосходят все протестированные внешние модели |
| BrowseComp+ (точность) | Не указано | 64.0% (самый низкий результат) | Тем не менее на 4.9 п.п. выше, чем у следующей модели ColBERT |
Самый сильный результат: 92.4% на MADQA, показанные моделью 9B. Наибольший отрыв наблюдается на BrowseComp+: 8.7 п.п. по сравнению с лучшей плотной моделью.
Самый слабый результат: 61.2% на ViDoRe v3 Markdown, показанные моделью 0.6B. Тем не менее это второй лучший результат на данном бенчмарке. Настоящий пробел наблюдается в поиске изображений: Gemini Embedding 2 превосходит модель 9B на MIRACL-Vision и на 2 п.п. на PPLX-Q2I.
Сочетание размеров: индекс 9B, по которому выполнялись запросы моделью 0.6B, получил 63.5% при извлечении изображений ViDoRe v3. Это выше, чем 62.3% при использовании 0.6B с обеих сторон, при той же стоимости запроса.
Как это работает
Плотные модели сжимают документ в 1 вектор. pplx-embed-v2 вместо этого сохраняет 128-мерный вектор для каждого токена. Оценка выполняется с помощью MaxSim: каждый токен запроса находит наиболее подходящий токен документа, после чего эти максимальные значения суммируются. Страницы кодируются как изображения, поэтому этап OCR не требуется. Perplexity дистиллировала обе модели из модели-учителя 18B с использованием обучения на уровне токенов в стиле LEAF. Именно это обучение создаёт общее пространство.
Лучшие варианты использования
- Лучше всего модель подходит для поиска по визуальным документам — PDF-файлам, презентациям и отсканированным отчётам.
- Поиск с низкой задержкой: индексировать в облаке с помощью 9B, а затем выполнять запросы на устройстве с помощью 0.6B.
- Агентный RAG по большим коллекциям PDF-файлов или веб-страниц.
Интерактивное объяснение
Сравнение
| Характеристика | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Размер | 0.6B, 9B | ~8.8B | 0.8B, 2B в открытом доступе | Не раскрыт |
| Размерность вектора | 128 на токен | 4 096 на токен | 2 048 на токен (маленькая модель) | от 128 до 3 072, 1 вектор |
| Входные данные | Текст, изображения, отрендеренные страницы | Текстовые запросы, изображения страниц | Текст, изображения страниц | Текст, изображения, видео, аудио, PDF |
| Работает на | Вашем GPU; 0.6B — на периферийных устройствах | NVIDIA A100/H100, Linux | CUDA GPU (Ampere и новее) | Google API |
| Общее пространство между размерами | Да | Не указано | Не указано | Неприменимо |
| Лицензия | MIT | CC-BY-NC-4.0 | Apache 2.0 (маленькая модель) | Проприетарная |
Главные выводы
- Модель 0.6B подходит для периферийных устройств; модель 9B создана для качества на этапе построения индекса.
- Лучший результат: 92.4% на MADQA. Худший: 61.2% на ViDoRe v3 Markdown.
- Запросы 0.6B к индексу 9B превосходят вариант, в котором 0.6B используется с обеих сторон.
- Основные оговорки — рост объёма хранилища и оценки, представленные разработчиками самостоятельно.
Ознакомьтесь с весами модели на HF и техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией 150k+ и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.