Perplexity AI випускає pplx-embed-v2-late: edge-модель на 0,6B параметра та модель на 9B параметрів із результатом 92,4% на MADQA
Perplexity випустила pplx-embed-v2-late — пару мультимодальних моделей векторних представлень у стилі ColBERT. Вони доступні у 2 розмірах: 0.6B для швидких і дешевих запитів та 9B для максимальної якості. Обидві моделі здійснюють пошук за текстом, зображеннями та відрендереними сторінками PDF і використовують спільний простір векторних представлень.
Чи можна її розгорнути? Так, якщо розмістити її самостійно. Обидві моделі доступні на Hugging Face за ліцензією MIT. Розміщений API-ендпойнт Perplexity запланований, але ще недоступний.
Коротко
Найкраще
- Модель 0.6B використовує близько 340M активних параметрів для зображень і за якістю майже не поступається конкурентам на 8B.
- Індекс 9B можна шукати за допомогою запитів 0.6B, компенсуючи приблизно половину розриву в якості 9B на тексті за вартості запитів 0.6B.
- Її 128-вимірні вектори токенів у 16–32 рази вужчі, ніж у конкурентів із 2 048–4 096 вимірами.
- Ліцензія MIT дозволяє комерційне використання.
Найгірше
- Вона зберігає 1 вектор на токен, тому розмір індексу зростає разом із довжиною документа.
- Вона не посідає 1-е місце в пошуку зображень ViDoRe v3; EVIE від Tencent набирає більше.
- Один вхідний запит не може одночасно містити текст і зображення.
- Усі оцінки наведені самою компанією, а технічний звіт ще не опубліковано.
Розмір моделі та обладнання для її запуску
| Метрики | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Загальна кількість параметрів | 594M | 9B (Hugging Face вказує 8B) |
| Активні параметри | ~240M для тексту, 340M для зображень | 7.4B |
| Базова модель | Qwen3.5-0.8B, скорочена до 12 текстових шарів | Qwen3.5 |
| Вихідні дані | 128 вимірів на токен | 128 вимірів на токен |
| Ваги в пам’яті (bf16, наша оцінка) | ~1.2 GB | ~16–18 GB |
| Призначене обладнання | Ноутбук, периферійний пристрій або невеликий GPU | Центр обробки даних або GPU з великим обсягом пам’яті |
| Рекомендована Perplexity роль | Кодер запитів у реальному часі, 100% локально | Створення індексу документів |
Perplexity розробила модель 0.6B як легкий кодер запитів, який також може працювати на периферійних пристроях. Обидві картки моделей демонструють використання GPU CUDA. Для них потрібні sentence-transformers >= 6.0.0 і transformers >= 5.4.0. Показники пам’яті — наша оцінка з розрахунку 2 байти на параметр лише для ваг. Опубліковані контрольні точки зберігаються у форматі F32, що вдвічі збільшує розмір завантаження.
Наскільки добре вона працює: найкращі та найгірші оцінки
Усі наведені нижче показники взято з анонсу Perplexity:
| Бенчмарк | 0.6B | 9B | Позиція |
|---|---|---|---|
| MADQA (агентне запитання-відповідь за PDF, точність) | 90.1% | 92.4% (найкращий результат) | Перевершує пошукову модель Mixedbread (88.9%); поступається Mixedbread Agentic Search (93.4%) |
| Спеціалізований за доменами текст (72 завдання, nDCG@10) | 78.0% | 81.3% | 9B випереджає всі протестовані моделі на 1.6 в. п.; 0.6B поступається gemini-embedding-2 на 0.3 в. п. |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | Обидві перевершують попередній найкращий результат у 69.3% |
| Зображення ViDoRe v3 (nDCG@10) | 62.3% | 65.2% | 0.6B відстає від nemotron-colembed-v2-8b лише на 1.2 в. п.; лідирує EVIE |
| Markdown ViDoRe v3 (nDCG@10) | 61.2% (найгірший результат) | 64.7% | Обидві перевершують усі протестовані зовнішні моделі |
| BrowseComp+ (точність) | Не вказано | 64.0% (найнижчий результат) | Водночас це на 4.9 в. п. вище за наступну модель ColBERT |
Найсильніший результат: 92.4% на MADQA, досягнутий моделлю 9B. Найбільша перевага — на BrowseComp+, де результат на 8.7 в. п. вищий за найкращу щільну модель.
Найслабший результат: 61.2% на ViDoRe v3 Markdown, показаний моделлю 0.6B. Водночас це 2-й найкращий результат на цьому бенчмарку. Справжній розрив спостерігається в пошуку зображень: Gemini Embedding 2 перевершує модель 9B на MIRACL-Vision і на 2 в. п. на PPLX-Q2I.
Поєднання розмірів: індекс 9B, для якого запити надходили від моделі 0.6B, набрав 63.5% у пошуку зображень ViDoRe v3. Це краще за результат 62.3%, отриманий за використання 0.6B з обох боків, за тієї самої вартості запитів.
Як це працює
Щільні моделі стискають документ в 1 вектор. Натомість pplx-embed-v2 зберігає 128-вимірний вектор для кожного токена. Оцінювання виконується за допомогою MaxSim: кожен токен запиту знаходить найкращий токен документа, після чого ці максимальні значення підсумовуються. Сторінки кодуються як зображення, тому крок OCR не потрібен. Perplexity дистилювала обидві моделі з учительської моделі на 18B за допомогою навчання на рівні токенів у стилі LEAF. Саме це навчання створює спільний простір.
Найкращі варіанти використання
- Найкраще рішення — візуальний пошук документів у PDF, презентаціях і відсканованих звітах.
- Пошук із малою затримкою: індексуйте в хмарі за допомогою 9B, а потім виконуйте запити на пристрої за допомогою 0.6B.
- Агентний RAG для великих колекцій PDF або вебдокументів.
Інтерактивне пояснення
Порівняння
| Характеристика | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Розмір | 0.6B, 9B | ~8.8B | 0.8B, 2B у відкритому доступі | Не розкрито |
| Ширина вектора | 128 на токен | 4 096 на токен | 2 048 на токен (мала) | 128–3 072, 1 вектор |
| Вхідні дані | Текст, зображення, рендери сторінок | Текстові запити, зображення сторінок | Текст, зображення сторінок | Текст, зображення, відео, аудіо, PDF |
| Працює на | Вашому GPU; 0.6B — на периферійних пристроях | NVIDIA A100/H100, Linux | GPU CUDA (Ampere+) | Google API |
| Спільний простір між розмірами | Так | Не вказано | Не вказано | Не застосовується |
| Ліцензія | MIT | CC-BY-NC-4.0 | Apache 2.0 (мала модель) | Пропрієтарна |
Основні висновки
- Модель 0.6B підходить для периферійних пристроїв; модель 9B створена для якості під час індексації.
- Найкращий результат: 92.4% на MADQA. Найслабший: 61.2% на ViDoRe v3 Markdown.
- Запити 0.6B до індексу 9B перевершують варіант, у якому 0.6B використовується з обох боків.
- Основні застереження — зростання обсягу сховища та оцінки, наведені самою компанією.
Перегляньте ваги моделей на HF і технічні деталі. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.