Cohere випускає Embed 5: як він порівнюється з Voyage 4 Large, Gemini Embedding 2 та OpenAI
Cohere випустила Embed 5, нове сімейство моделей для створення векторних представлень. Воно призначене для корпоративного пошуку, RAG і агентного пошуку. Сімейство моделей постачається у 2 рівнях. Embed 5 Pro орієнтована на максимальну якість пошуку. Embed 5 Fast орієнтована на затримку та вартість під час обробки запитів у реальному часі. Обидві моделі приймають текст, зображення та об’єднані текстово-зображувальні вхідні дані. Обидві охоплюють понад 100 мов і обробляють до 128K токенів. Ключове конструктивне рішення: Pro і Fast використовують 1 спільний простір векторних представлень. Ви можете індексувати однією моделлю, а виконувати запити — іншою.
Чи можна розгортати її вже сьогодні? Так, обидва рівні загальнодоступні через API Cohere і Model Vault, Microsoft Foundry та Amazon SageMaker. Обслуговування у приватній VPC або локальне розгортання здійснюється через vLLM.
Що випустила Cohere
Ідентифікатори моделей API — embed-v5.0-pro і embed-v5.0-fast, згідно з документацією моделей Cohere. Обидві моделі створюють вектори розмірністю 2048, 1536, 1024, 768, 512 або 256, причому розмірність за замовчуванням становить 2048. Векторні представлення повертаються у форматі float, int8 або binary. Pro коштує $0.12 за 1 млн текстових токенів. Fast коштує $0.08. Вхідні зображення коштують $0.40 за 1 млн токенів в обох моделях.
Embed 5 може безпосередньо створювати векторне представлення зображення сторінки. Вона також може об’єднувати зображення з його метаданими в один вектор. Це важливо для відсканованих сторінок, презентацій, схем і діаграм, де під час вилучення тексту втрачається інформація.
Pro і Fast: один індекс, два шляхи виконання запитів
Cohere протестувала кожне поєднання корпусу та запитів на 40 наборах даних для розробки. Якщо нормалізувати результат Pro плюс Pro до 100, індекс Pro, для якого запити виконувалися Fast, отримав 98.4. Конфігурація лише з Fast отримала 96.6. Cohere рекомендує індексувати за допомогою Pro, а запити виконувати за допомогою Fast. Єдине обмеження: обидві сторони мають використовувати однакову вихідну розмірність.
Такий поділ призначений для агентних навантажень. Агент може виконувати десятки пошуків за одне завдання, і затримка запитів накопичується. За даними команди Cohere, Fast обробляла 377.3 документа на секунду проти 159.7 у Pro.
Бенчмарки
На ViDoRe V3 Embed 5 Pro у середньому набирає 85.8 — на 8.8 бала більше, ніж Embed 4. Fast у середньому набирає 84.5. Voyage 4 Large отримує 83.7, Gemini Embedding 2 — 83.2, а OpenAI text-embedding-3-large — 75.5. У наборі Cohere для оброблених PDF-файлів Pro лідирує з результатом 84.8 проти 83.6 у Voyage 4 Large.
Найкращі результати показано у фінансах. Pro посідає перше місце у FinanceBench (80.1), FinQA (90.0) і ViDoRe V3 Finance (85.0). Fast посідає друге місце в усіх 3 тестах.
Багатомовні результати неоднозначні. Pro очолює середній показник для європейських мов — 77. Однак Gemini Embedding 2 випереджає Pro у 9 із 10 додаткових мов у власній таблиці результатів Cohere. Серед них японська, арабська, гінді та телугу.
Важливо зазначити. У більшості випадків використовується RCP-nDCG@10, нова метрика Cohere. Вона змінює порядок фіксованого набору кандидатів, тому більше вимірює якість повторного ранжування, ніж пошуку на першому етапі. Cohere опублікувала код оцінювання, але незалежне відтворення результатів ще очікується.
Витрати на зберігання у великих масштабах
Embed 5 використовує навчання матрьошкових представлень і вихідні дані зі зниженою точністю. Вектор float32 розмірністю 2048 потребує 8 КБ. Вектор int8 розмірністю 1024 потребує 1 КБ. Бінарний вектор розмірністю 256 потребує 32 байти. Для 100 млн фрагментів обсяг необробленого сховища зменшується приблизно з 819 ГБ до 3.2 ГБ. Cohere рекомендує int8 розмірністю 1024 як стандартний варіант, посилаючись на якість, майже ідентичну якості повної точності.
Інтерактивне пояснення: як працює Embed 5
Пояснення Cohere Embed 5 | Marktechpost1. Що насправді робить модель векторних представлень
На вході текст, на виході — вектор чисел. Потім пошук ранжує документи за близькістю їхніх векторів до вектора запиту. Натисніть кнопку, щоб побачити, як це працює.
Запит
Документи, ранжовані за косинусною схожістю
Документи взято із прикладу коду запуску Cohere. Смуги векторів і показники схожості тут є ілюстративними, а не результатами роботи реальної моделі.
2. Два рівні, один простір векторних представлень
Pro і Fast записують вектори в один простір. Виберіть, яка модель індексує корпус, а яка створює векторне представлення запиту. Якість нормалізовано так, що Pro плюс Pro дорівнює 100.
Індексувати корпус за допомогою
Створювати векторні представлення запитів за допомогою
Рекомендований Cohere підхід: індексувати за допомогою Pro, виконувати запити за допомогою Fast.
Кільце збільшено до діапазону від 90 до 100, щоб стали помітними невеликі відмінності.
Пропускна здатність документів (документів за секунду, виміряно Cohere)
Ціна за 1 млн текстових токенів: Pro — $0.12, Fast — $0.08. Зображення коштують $0.40 за 1 млн токенів в обох рівнях.
3. Зменшуйте вектор, а не якість
Навчання за принципом матрьошки дає змогу усікати розмірність. Вихідні дані зі зниженою точністю ще більше зменшують обсяг у байтах. Змініть налаштування й подивіться, як змінюється обсяг сховища.
Вихідна розмірність
Точність
Фрагментів у вашому індексі: 100,000,000
Математика: виміри × байти на значення (4, 1 або 1/8). Cohere рекомендує int8 розмірністю 1024 як оптимальний варіант за замовчуванням. Binary жертвує частиною точності й підходить для першого етапу перед повторним ранжуванням.
4. Як модель показує себе порівняно з конкурентами
Середні показники за даними Cohere з використанням її нової метрики RCP-nDCG@10. Вважайте їх даними постачальника, доки не з’являться результати незалежних запусків.
Джерело: публікація Cohere про запуск Embed 5, 30 вересня 2026 року. RCP-nDCG@10 змінює порядок фіксованого набору кандидатів, тому відображає якість повторного ранжування більше, ніж повноту пошуку на першому етапі.
5. Скільки вміщується в один вхідний запит
Довший контекст означає меншу кількість фрагментів для великих документів і посібників. Натисніть «Відтворити», щоб порівняти максимальну довжину вхідних даних за один виклик.
Обмеження взято з документації моделей кожного постачальника. Для масштабу стовпчика 128K показано як 131,072 токени.
6. Чи можна розгортати? Так. Оберіть спосіб.
Обидва рівні загальнодоступні. Натисніть спосіб, щоб дізнатися, що він дає.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.