Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Perplexity AI випускає pplx-embed-v2-late: edge-модель на 0,6B параметра та модель на 9B параметрів із результатом 92,4% на MADQA

Perplexity випустила pplx-embed-v2-late — пару мультимодальних моделей векторних представлень у стилі ColBERT. Вони доступні у 2 розмірах: 0.6B для швидких і дешевих запитів та 9B для максимальної якості. Обидві моделі здійснюють пошук за текстом, зображеннями та відрендереними сторінками PDF і використовують спільний простір векторних представлень.

Чи можна її розгорнути? Так, якщо розмістити її самостійно. Обидві моделі доступні на Hugging Face за ліцензією MIT. Розміщений API-ендпойнт Perplexity запланований, але ще недоступний.

Коротко

Найкраще

  • Модель 0.6B використовує близько 340M активних параметрів для зображень і за якістю майже не поступається конкурентам на 8B.
  • Індекс 9B можна шукати за допомогою запитів 0.6B, компенсуючи приблизно половину розриву в якості 9B на тексті за вартості запитів 0.6B.
  • Її 128-вимірні вектори токенів у 16–32 рази вужчі, ніж у конкурентів із 2 048–4 096 вимірами.
  • Ліцензія MIT дозволяє комерційне використання.

Найгірше

  • Вона зберігає 1 вектор на токен, тому розмір індексу зростає разом із довжиною документа.
  • Вона не посідає 1-е місце в пошуку зображень ViDoRe v3; EVIE від Tencent набирає більше.
  • Один вхідний запит не може одночасно містити текст і зображення.
  • Усі оцінки наведені самою компанією, а технічний звіт ще не опубліковано.

Розмір моделі та обладнання для її запуску

Метрикиpplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
Загальна кількість параметрів594M9B (Hugging Face вказує 8B)
Активні параметри~240M для тексту, 340M для зображень7.4B
Базова модельQwen3.5-0.8B, скорочена до 12 текстових шарівQwen3.5
Вихідні дані128 вимірів на токен128 вимірів на токен
Ваги в пам’яті (bf16, наша оцінка)~1.2 GB~16–18 GB
Призначене обладнанняНоутбук, периферійний пристрій або невеликий GPUЦентр обробки даних або GPU з великим обсягом пам’яті
Рекомендована Perplexity рольКодер запитів у реальному часі, 100% локальноСтворення індексу документів

Perplexity розробила модель 0.6B як легкий кодер запитів, який також може працювати на периферійних пристроях. Обидві картки моделей демонструють використання GPU CUDA. Для них потрібні sentence-transformers >= 6.0.0 і transformers >= 5.4.0. Показники пам’яті — наша оцінка з розрахунку 2 байти на параметр лише для ваг. Опубліковані контрольні точки зберігаються у форматі F32, що вдвічі збільшує розмір завантаження.

Наскільки добре вона працює: найкращі та найгірші оцінки

Усі наведені нижче показники взято з анонсу Perplexity:

Бенчмарк0.6B9BПозиція
MADQA (агентне запитання-відповідь за PDF, точність)90.1%92.4% (найкращий результат)Перевершує пошукову модель Mixedbread (88.9%); поступається Mixedbread Agentic Search (93.4%)
Спеціалізований за доменами текст (72 завдання, nDCG@10)78.0%81.3%9B випереджає всі протестовані моделі на 1.6 в. п.; 0.6B поступається gemini-embedding-2 на 0.3 в. п.
Q2D-Web (Recall@1000)73.6%74.8%Обидві перевершують попередній найкращий результат у 69.3%
Зображення ViDoRe v3 (nDCG@10)62.3%65.2%0.6B відстає від nemotron-colembed-v2-8b лише на 1.2 в. п.; лідирує EVIE
Markdown ViDoRe v3 (nDCG@10)61.2% (найгірший результат)64.7%Обидві перевершують усі протестовані зовнішні моделі
BrowseComp+ (точність)Не вказано64.0% (найнижчий результат)Водночас це на 4.9 в. п. вище за наступну модель ColBERT

Найсильніший результат: 92.4% на MADQA, досягнутий моделлю 9B. Найбільша перевага — на BrowseComp+, де результат на 8.7 в. п. вищий за найкращу щільну модель.

Найслабший результат: 61.2% на ViDoRe v3 Markdown, показаний моделлю 0.6B. Водночас це 2-й найкращий результат на цьому бенчмарку. Справжній розрив спостерігається в пошуку зображень: Gemini Embedding 2 перевершує модель 9B на MIRACL-Vision і на 2 в. п. на PPLX-Q2I.

Поєднання розмірів: індекс 9B, для якого запити надходили від моделі 0.6B, набрав 63.5% у пошуку зображень ViDoRe v3. Це краще за результат 62.3%, отриманий за використання 0.6B з обох боків, за тієї самої вартості запитів.

Як це працює

Щільні моделі стискають документ в 1 вектор. Натомість pplx-embed-v2 зберігає 128-вимірний вектор для кожного токена. Оцінювання виконується за допомогою MaxSim: кожен токен запиту знаходить найкращий токен документа, після чого ці максимальні значення підсумовуються. Сторінки кодуються як зображення, тому крок OCR не потрібен. Perplexity дистилювала обидві моделі з учительської моделі на 18B за допомогою навчання на рівні токенів у стилі LEAF. Саме це навчання створює спільний простір.

Найкращі варіанти використання

  • Найкраще рішення — візуальний пошук документів у PDF, презентаціях і відсканованих звітах.
  • Пошук із малою затримкою: індексуйте в хмарі за допомогою 9B, а потім виконуйте запити на пристрої за допомогою 0.6B.
  • Агентний RAG для великих колекцій PDF або вебдокументів.

Інтерактивне пояснення

Порівняння

Характеристикаpplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
Розмір0.6B, 9B~8.8B0.8B, 2B у відкритому доступіНе розкрито
Ширина вектора128 на токен4 096 на токен2 048 на токен (мала)128–3 072, 1 вектор
Вхідні даніТекст, зображення, рендери сторінокТекстові запити, зображення сторінокТекст, зображення сторінокТекст, зображення, відео, аудіо, PDF
Працює наВашому GPU; 0.6B — на периферійних пристрояхNVIDIA A100/H100, LinuxGPU CUDA (Ampere+)Google API
Спільний простір між розмірамиТакНе вказаноНе вказаноНе застосовується
ЛіцензіяMITCC-BY-NC-4.0Apache 2.0 (мала модель)Пропрієтарна

Основні висновки

  • Модель 0.6B підходить для периферійних пристроїв; модель 9B створена для якості під час індексації.
  • Найкращий результат: 92.4% на MADQA. Найслабший: 61.2% на ViDoRe v3 Markdown.
  • Запити 0.6B до індексу 9B перевершують варіант, у якому 0.6B використовується з обох боків.
  • Основні застереження — зростання обсягу сховища та оцінки, наведені самою компанією.

Перегляньте ваги моделей на HF і технічні деталі. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

[Спонсорський матеріал] Веб — це єдиний API, якого бракує більшості агентів. Бази даних, календарі та репозиторії мають API. Відкритий веб — здебільшого ні. TinyFish MCP server надає будь-якому MCP-клієнту чотири інструменти: TinySearch, TinyFetch (повні сторінки у форматі markdown, включно з JavaScript), TinyBrowser для входу в облікові записи та заповнення форм і TinyAgent для багатокрокових завдань. Search і Fetch безкоштовні.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини