Cohere представя Embed 5: как се сравнява с Voyage 4 Large, Gemini Embedding 2 и OpenAI
Cohere пусна Embed 5, ново семейство модели за вграждане. То е предназначено за корпоративно търсене, RAG и агентно извличане. Семейството модели се предлага в 2 нива. Embed 5 Pro е насочен към максимално качество на извличане. Embed 5 Fast е насочен към латентност и разходи при обработката на заявки в реално време. И двата модела приемат текст, изображения и комбинирани входове от текст и изображения. И двата поддържат над 100 езика и обработват до 128K токена. Ключовото конструктивно решение: Pro и Fast споделят 1 пространство за вграждане. Можете да индексирате с единия и да правите заявки с другия.
Може ли да се внедри още днес? Да, и двете нива са общодостъпни чрез API на Cohere и Model Vault, Microsoft Foundry и Amazon SageMaker. Обслужването в частен VPC или локално се осъществява чрез vLLM.
Какво пусна Cohere
Идентификаторите на API моделите са embed-v5.0-pro и embed-v5.0-fast, според документацията за моделите на Cohere. И двата модела извеждат 2048, 1536, 1024, 768, 512 или 256 измерения, като стойността по подразбиране е 2048. Вгражданията се връщат като float, int8 или binary. Pro струва $0.12 за 1 млн. текстови токена. Fast струва $0.08. Входовете с изображения струват $0.40 за 1 млн. токена и при двата модела.
Embed 5 може да вгради директно изображение на страница. Може също да комбинира изображение с неговите метаданни в един вектор. Това е важно за сканирани страници, презентации, схеми и диаграми, при които извличането на текст води до загуба на информация.
Pro и Fast: Един индекс, два пътя за заявки
Cohere тества всяка комбинация от корпус и заявка в 40 набора от данни за разработка. Нормализирано спрямо Pro плюс Pro при 100, индекс Pro, заявен с Fast, получава резултат 98.4. Конфигурация изцяло с Fast получава 96.6. Препоръчваният от Cohere модел е индексиране с Pro и заявки с Fast. Едно ограничение: и двете страни трябва да използват едно и също изходно измерение.
Разделянето е насочено към агентни работни натоварвания. Един агент може да извършва десетки търсения на задача, а латентността на заявките се натрупва. Екипът на Cohere съобщава, че Fast обработва 377.3 документа в секунда спрямо 159.7 за Pro.
Бенчмаркове
В ViDoRe V3 Embed 5 Pro постига среден резултат 85.8 — ръст от 8.8 точки спрямо Embed 4. Fast постига средно 84.5. Voyage 4 Large получава 83.7, Gemini Embedding 2 получава 83.2, а OpenAI text-embedding-3-large получава 75.5. В набора на Cohere за анализирани PDF файлове Pro води с 84.8 спрямо 83.6 за Voyage 4 Large.
Финансите са най-силната област. Pro се класира на първо място във FinanceBench (80.1), FinQA (90.0) и ViDoRe V3 Finance (85.0). Fast се класира на второ място и в трите.
Многоезичните резултати са смесени. Pro води при средната стойност за европейските езици със 77. Gemini Embedding 2 обаче превъзхожда Pro при 9 от 10 допълнителни езика в собствената таблица с резултати на Cohere. Сред тях са японски, арабски, хинди и телугу.
Едно важно нещо, което трябва да се отбележи. Повечето числа използват RCP-nDCG@10, нов показател на Cohere. Той пренарежда фиксиран набор от кандидати, така че измерва по-скоро качеството на повторното класиране, отколкото извличането на първия етап. Cohere публикува кода за оценяване, но независимото възпроизвеждане все още предстои.
Разходи за съхранение в мащаб
Embed 5 използва обучение за представяне Matryoshka, както и изходи с по-ниска точност. Вектор с 2048 измерения и float32 изисква 8 KB. Вектор с 1024 измерения и int8 изисква 1 KB. Двоичен вектор с 256 измерения изисква 32 байта. При 100 млн. фрагмента необработеното хранилище намалява от около 819 GB до 3.2 GB. Cohere препоръчва 1024 измерения и int8 като стойности по подразбиране, позовавайки се на качество, близко до това при пълна точност.
Интерактивно обяснение: Как работи Embed 5
Обяснение на Cohere Embed 5 | Marktechpost1. Какво всъщност прави моделът за вграждане
Въвежда се текст, а на изхода се получава вектор от числа. След това търсенето класира документите според близостта на техните вектори до вектора на заявката. Натиснете бутона, за да видите как работи.
Заявка
Документи, класирани по косинусова близост
Документите са взети от примерния код за стартиране на Cohere. Лентите за векторите и оценките за близостта са илюстративни, а не реален изход от модела.
2. Две нива, едно пространство за вграждане
Pro и Fast записват вектори в едно и също пространство. Изберете кой модел да индексира корпуса и кой да вгражда заявката. Качеството е нормализирано така, че Pro плюс Pro дава 100.
Индексиране на корпуса с
Вграждане на заявки с
Препоръчваният от Cohere модел: индексиране с Pro, заявки с Fast.
Пръстенът е увеличен до диапазона от 90 до 100, за да се виждат малките разлики.
Производителност на документите (документи в секунда, измерено от Cohere)
Цена за 1 млн. текстови токена: Pro $0.12, Fast $0.08. Изображенията струват $0.40 за 1 млн. токена и при двете нива.
3. Намалете размера на вектора, не качеството
Обучението Matryoshka позволява съкращаване на измеренията. Изходите с по-ниска точност намаляват допълнително броя байтове. Променете настройките и вижте как се променя хранилището.
Изходни измерения
Точност
Фрагменти във вашия индекс: 100,000,000
Изчисление: измерения x байтове на стойност (4, 1 или 1/8). Cohere препоръчва 1024 измерения и int8 като оптималната стойност по подразбиране. Binary жертва част от точността и е подходящ за първи етап преди повторното класиране.
4. Как се представя спрямо конкурентите
Средни стойности, отчетени от Cohere, използващи новия показател RCP-nDCG@10. Приемайте ги като данни от производителя, докато не бъдат публикувани независими резултати.
Източник: публикация на Cohere за стартирането на Embed 5, 30 септември 2026 г. RCP-nDCG@10 пренарежда фиксиран набор от кандидати, така че отразява по-скоро качеството на повторното класиране, отколкото извличането на първия етап.
5. Колко съдържание се побира в един вход
По-дългият контекст означава по-малко фрагменти за дълги документи и ръководства. Натиснете „Пускане“, за да сравните максималната дължина на входа при едно извикване.
Ограниченията са взети от документацията за моделите на всеки производител. 128K е показано като 131,072 токена за мащаба на лентата.
6. Може ли да се внедри? Да. Изберете начин.
И двете нива са общодостъпни. Докоснете даден начин, за да видите какво предлага.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.