Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Perplexity AI выпускает pplx-embed-v2-late: edge-модель с 0,6B параметра и модель на 9B параметров с результатом 92,4% на MADQA

Perplexity выпустила pplx-embed-v2-late — пару мультимодальных embedding-моделей в стиле ColBERT. Они доступны в двух размерах: 0.6B для быстрых и дешёвых запросов и 9B для максимального качества. Обе модели извлекают текст, изображения и отрендеренные страницы PDF и используют единое пространство эмбеддингов.

Можно ли её развернуть? Да, если разместить её самостоятельно. Обе модели доступны на Hugging Face по лицензии MIT. Размещённая конечная точка Perplexity API запланирована, но пока недоступна.

Кратко

Лучшее

  • Модель 0.6B использует около 340M активных параметров для изображений и близка по качеству к конкурентам с 8B параметров.
  • Индекс 9B можно искать с помощью запросов 0.6B, восполняя примерно половину отставания 9B по качеству на тексте при стоимости запросов 0.6B.
  • Её 128-мерные векторы токенов в 16–32 раза уже, чем у конкурентов с размерностью от 2 048 до 4 096.
  • Лицензия MIT разрешает коммерческое использование.

Худшее

  • Она хранит по 1 вектору на токен, поэтому размер индекса растёт вместе с длиной документа.
  • Она не занимает первое место в извлечении изображений на ViDoRe v3; EVIE от Tencent набирает больше баллов.
  • Один вход не может одновременно содержать текст и изображения.
  • Все оценки представлены разработчиками самостоятельно, а технический отчёт ещё не опубликован.

Размер модели и оборудование для её запуска

Показателиpplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
Всего параметров594M9B (на Hugging Face указано 8B)
Активные параметры~240M для текста, 340M для изображений7.4B
Базовая модельQwen3.5-0.8B, сокращённая до 12 текстовых слоёвQwen3.5
Выходные данные128 измерений на токен128 измерений на токен
Веса в памяти (bf16, наша оценка)~1.2 ГБ~16–18 ГБ
Предполагаемое устройствоНоутбук, периферийное устройство или небольшой GPUДата-центр или GPU с большим объёмом памяти
Рекомендуемая Perplexity рольКодировщик запросов в реальном времени, полностью локальноСоздание индекса документов

Perplexity разработала модель 0.6B как лёгкий кодировщик запросов, способный работать и на периферийных устройствах. Обе карточки моделей показывают использование CUDA GPU. Для их работы требуются sentence-transformers >= 6.0.0 и transformers >= 5.4.0. Значения объёма памяти — наша оценка из расчёта 2 байта на параметр только для весов. Опубликованные чекпойнты хранятся в формате F32, что вдвое увеличивает размер загрузки.

Насколько хорошо она работает: лучшие и худшие оценки

Все приведённые ниже значения взяты из анонса Perplexity:

Бенчмарк0.6B9BПозиция
MADQA (агентная работа с PDF, точность)90.1%92.4% (лучший результат)Превосходит ретривер Mixedbread (88.9%), но уступает Mixedbread Agentic Search (93.4%)
Специализированный текстовый домен (72 задачи, nDCG@10)78.0%81.3%9B опережает все протестированные модели на 1.6 п.п.; 0.6B отстаёт от gemini-embedding-2 на 0.3 п.п.
Q2D-Web (Recall@1000)73.6%74.8%Обе модели превосходят предыдущий лучший результат в 69.3%
Изображения ViDoRe v3 (nDCG@10)62.3%65.2%0.6B отстаёт от nemotron-colembed-v2-8b на 1.2 п.п.; лидирует EVIE
Markdown ViDoRe v3 (nDCG@10)61.2% (худший результат)64.7%Обе модели превосходят все протестированные внешние модели
BrowseComp+ (точность)Не указано64.0% (самый низкий результат)Тем не менее на 4.9 п.п. выше, чем у следующей модели ColBERT

Самый сильный результат: 92.4% на MADQA, показанные моделью 9B. Наибольший отрыв наблюдается на BrowseComp+: 8.7 п.п. по сравнению с лучшей плотной моделью.

Самый слабый результат: 61.2% на ViDoRe v3 Markdown, показанные моделью 0.6B. Тем не менее это второй лучший результат на данном бенчмарке. Настоящий пробел наблюдается в поиске изображений: Gemini Embedding 2 превосходит модель 9B на MIRACL-Vision и на 2 п.п. на PPLX-Q2I.

Сочетание размеров: индекс 9B, по которому выполнялись запросы моделью 0.6B, получил 63.5% при извлечении изображений ViDoRe v3. Это выше, чем 62.3% при использовании 0.6B с обеих сторон, при той же стоимости запроса.

Как это работает

Плотные модели сжимают документ в 1 вектор. pplx-embed-v2 вместо этого сохраняет 128-мерный вектор для каждого токена. Оценка выполняется с помощью MaxSim: каждый токен запроса находит наиболее подходящий токен документа, после чего эти максимальные значения суммируются. Страницы кодируются как изображения, поэтому этап OCR не требуется. Perplexity дистиллировала обе модели из модели-учителя 18B с использованием обучения на уровне токенов в стиле LEAF. Именно это обучение создаёт общее пространство.

Лучшие варианты использования

  • Лучше всего модель подходит для поиска по визуальным документам — PDF-файлам, презентациям и отсканированным отчётам.
  • Поиск с низкой задержкой: индексировать в облаке с помощью 9B, а затем выполнять запросы на устройстве с помощью 0.6B.
  • Агентный RAG по большим коллекциям PDF-файлов или веб-страниц.

Интерактивное объяснение

Сравнение

Характеристикаpplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
Размер0.6B, 9B~8.8B0.8B, 2B в открытом доступеНе раскрыт
Размерность вектора128 на токен4 096 на токен2 048 на токен (маленькая модель)от 128 до 3 072, 1 вектор
Входные данныеТекст, изображения, отрендеренные страницыТекстовые запросы, изображения страницТекст, изображения страницТекст, изображения, видео, аудио, PDF
Работает наВашем GPU; 0.6B — на периферийных устройствахNVIDIA A100/H100, LinuxCUDA GPU (Ampere и новее)Google API
Общее пространство между размерамиДаНе указаноНе указаноНеприменимо
ЛицензияMITCC-BY-NC-4.0Apache 2.0 (маленькая модель)Проприетарная

Главные выводы

  • Модель 0.6B подходит для периферийных устройств; модель 9B создана для качества на этапе построения индекса.
  • Лучший результат: 92.4% на MADQA. Худший: 61.2% на ViDoRe v3 Markdown.
  • Запросы 0.6B к индексу 9B превосходят вариант, в котором 0.6B используется с обеих сторон.
  • Основные оговорки — рост объёма хранилища и оценки, представленные разработчиками самостоятельно.

Ознакомьтесь с весами модели на HF и техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией 150k+ и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

[Реклама] Веб — это единственный API, которого не хватает большинству агентов. У баз данных, календарей и репозиториев есть API. У открытого веба его в основном нет. MCP-сервер TinyFish предоставляет любому MCP-клиенту четыре инструмента: TinySearch, TinyFetch (полные страницы в формате Markdown, включая JavaScript), TinyBrowser для входа в аккаунты и заполнения форм и TinyAgent для многоэтапных задач. Search и Fetch бесплатны.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости