Cohere выпускает Embed 5: сравнение с Voyage 4 Large, Gemini Embedding 2 и OpenAI
Cohere выпустила Embed 5 — новое семейство моделей эмбеддингов. Оно предназначено для корпоративного поиска, RAG и агентского поиска. Семейство моделей выпускается в 2 уровнях. Embed 5 Pro ориентирована на максимальное качество поиска. Embed 5 Fast оптимизирована для задержки и стоимости в процессе обработки запросов. Обе модели принимают текст, изображения, а также объединённые текстовые и графические входные данные. Обе поддерживают более 100 языков и обрабатывают до 128K токенов. Ключевое проектное решение: Pro и Fast используют 1 общее пространство эмбеддингов. Можно индексировать данные одной моделью, а выполнять запросы — другой.
Можно ли развернуть их уже сегодня? Да, оба уровня доступны всем пользователям через Cohere API и Model Vault, Microsoft Foundry и Amazon SageMaker. Обслуживание в частном VPC или локально выполняется через vLLM.
Что выпустила Cohere
Идентификаторы моделей API — embed-v5.0-pro и embed-v5.0-fast, согласно документации Cohere по моделям. Обе модели возвращают эмбеддинги размерностью 2048, 1536, 1024, 768, 512 или 256, причём размерность по умолчанию составляет 2048. Эмбеддинги возвращаются в формате float, int8 или binary. Стоимость Pro составляет $0.12 за 1 млн текстовых токенов. Стоимость Fast — $0.08. Обработка изображений стоит $0.40 за 1 млн токенов для обеих моделей.
Embed 5 может напрямую создавать эмбеддинг изображения страницы. Она также может объединять изображение с его метаданными в один вектор. Это важно для отсканированных страниц, презентаций, схем и диаграмм, где извлечение текста приводит к потере информации.
Pro и Fast: один индекс, два пути обработки запросов
Cohere протестировала каждую пару корпуса и запроса на 40 наборах данных для разработки. Если принять результат Pro плюс Pro за 100, то индекс Pro при запросах Fast получил 98.4. Конфигурация, полностью использующая Fast, получила 96.6. Cohere рекомендует индексировать данные с помощью Pro, а выполнять запросы с помощью Fast. Ограничение: обе стороны должны использовать одинаковую выходную размерность.
Такое разделение ориентировано на агентские рабочие нагрузки. Агент может выполнять десятки поисковых запросов за одну задачу, и задержка запросов накапливается. По данным команды Cohere, Fast обрабатывала 377.3 документа в секунду против 159.7 у Pro.
Результаты тестирования
В тесте ViDoRe V3 Embed 5 Pro в среднем набрала 85.8 — на 8.8 пункта больше, чем Embed 4. Средний результат Fast — 84.5. Voyage 4 Large набрала 83.7, Gemini Embedding 2 — 83.2, а OpenAI text-embedding-3-large — 75.5. В наборе Cohere для тестирования обработанных PDF-файлов Pro лидирует с результатом 84.8 против 83.6 у Voyage 4 Large.
Наиболее сильные результаты показал финансовый сектор. Pro занимает первое место в FinanceBench (80.1), FinQA (90.0) и ViDoRe V3 Finance (85.0). Fast занимает второе место во всех 3 тестах.
Мультиязычные результаты неоднозначны. Pro лидирует по среднему показателю для европейских языков с результатом 77. Однако Gemini Embedding 2 превосходит Pro в 9 из 10 дополнительных языков в собственной таблице результатов Cohere. В их число входят японский, арабский, хинди и телугу.
Важно отметить следующее. В большинстве случаев используется RCP-nDCG@10 — новая метрика Cohere. Она изменяет порядок фиксированного набора кандидатов, поэтому в большей степени измеряет качество переранжирования, чем поиска на первом этапе. Cohere опубликовала код оценки, но независимое воспроизведение результатов ещё не проведено.
Стоимость хранения при масштабировании
Embed 5 использует обучение представлений Matryoshka и выходные данные с пониженной точностью. Вектор float32 размерностью 2048 занимает 8 КБ. Вектор int8 размерностью 1024 занимает 1 КБ. Бинарный вектор размерностью 256 занимает 32 байта. Для 100 млн фрагментов объём необработанного хранилища сокращается примерно с 819 ГБ до 3.2 ГБ. Cohere рекомендует использовать по умолчанию int8 размерностью 1024, указывая на почти полное сохранение качества по сравнению с полной точностью.
Интерактивное объяснение: как работает Embed 5
Объяснение работы Cohere Embed 5 | Marktechpost1. Что на самом деле делает модель эмбеддингов
На вход поступает текст, а на выходе получается вектор чисел. Затем поиск ранжирует документы по близости их векторов к вектору запроса. Нажмите кнопку, чтобы увидеть процесс.
Запрос
Документы, ранжированные по косинусному сходству
Документы взяты из примера кода запуска Cohere. Полосы векторов и показатели сходства здесь приведены только для иллюстрации и не являются результатами работы реальной модели.
2. Два уровня, одно пространство эмбеддингов
Pro и Fast записывают векторы в одно и то же пространство. Выберите, какая модель будет индексировать корпус, а какая — создавать эмбеддинги запросов. Качество нормализовано так, что Pro плюс Pro равно 100.
Индексировать корпус с помощью
Создавать эмбеддинги запросов с помощью
Рекомендованный Cohere вариант: индексировать с помощью Pro, выполнять запросы с помощью Fast.
Кольцо увеличено до диапазона от 90 до 100, чтобы небольшие различия были видны.
Пропускная способность обработки документов (документов в секунду, измерено Cohere)
Цена за 1 млн текстовых токенов: Pro — $0.12, Fast — $0.08. Для обоих уровней изображения стоят $0.40 за 1 млн токенов.
3. Уменьшайте размер вектора, а не качество
Обучение Matryoshka позволяет усекать размерность. Выходные данные с пониженной точностью ещё больше сокращают объём в байтах. Измените настройки и наблюдайте за изменением объёма хранилища.
Выходная размерность
Точность
Фрагментов в вашем индексе: 100,000,000
Расчёт: размерность x количество байт на значение (4, 1 или 1/8). Cohere рекомендует использовать int8 размерностью 1024 как оптимальный вариант по умолчанию. Бинарный формат жертвует частью точности и подходит для первого этапа перед переранжированием.
4. Как модель показывает себя на фоне конкурентов
Средние показатели по данным Cohere с использованием новой метрики RCP-nDCG@10. Считайте их данными поставщика, пока не появятся результаты независимых запусков.
Источник: публикация Cohere о запуске Embed 5, 30 сентября 2026 года. RCP-nDCG@10 изменяет порядок фиксированного набора кандидатов, поэтому отражает качество переранжирования в большей степени, чем полноту поиска на первом этапе.
5. Сколько данных помещается в один входной запрос
Более длинный контекст означает меньшее количество фрагментов для объёмных документов и руководств. Нажмите кнопку воспроизведения, чтобы сравнить максимальную длину входных данных за один вызов.
Ограничения взяты из документации к моделям каждого поставщика. Для масштаба столбца 128K показано как 131,072 токена.
6. Можно ли это развернуть? Да. Выберите способ.
Оба уровня доступны всем пользователям. Выберите способ, чтобы узнать, что он даёт.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.