Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Cohere представя Embed 5: как се сравнява с Voyage 4 Large, Gemini Embedding 2 и OpenAI

Cohere пусна Embed 5, ново семейство модели за вграждане. То е предназначено за корпоративно търсене, RAG и агентно извличане. Семейството модели се предлага в 2 нива. Embed 5 Pro е насочен към максимално качество на извличане. Embed 5 Fast е насочен към латентност и разходи при обработката на заявки в реално време. И двата модела приемат текст, изображения и комбинирани входове от текст и изображения. И двата поддържат над 100 езика и обработват до 128K токена. Ключовото конструктивно решение: Pro и Fast споделят 1 пространство за вграждане. Можете да индексирате с единия и да правите заявки с другия.

Може ли да се внедри още днес? Да, и двете нива са общодостъпни чрез API на Cohere и Model Vault, Microsoft Foundry и Amazon SageMaker. Обслужването в частен VPC или локално се осъществява чрез vLLM.

Какво пусна Cohere

Идентификаторите на API моделите са embed-v5.0-pro и embed-v5.0-fast, според документацията за моделите на Cohere. И двата модела извеждат 2048, 1536, 1024, 768, 512 или 256 измерения, като стойността по подразбиране е 2048. Вгражданията се връщат като float, int8 или binary. Pro струва $0.12 за 1 млн. текстови токена. Fast струва $0.08. Входовете с изображения струват $0.40 за 1 млн. токена и при двата модела.

Embed 5 може да вгради директно изображение на страница. Може също да комбинира изображение с неговите метаданни в един вектор. Това е важно за сканирани страници, презентации, схеми и диаграми, при които извличането на текст води до загуба на информация.

Pro и Fast: Един индекс, два пътя за заявки

Cohere тества всяка комбинация от корпус и заявка в 40 набора от данни за разработка. Нормализирано спрямо Pro плюс Pro при 100, индекс Pro, заявен с Fast, получава резултат 98.4. Конфигурация изцяло с Fast получава 96.6. Препоръчваният от Cohere модел е индексиране с Pro и заявки с Fast. Едно ограничение: и двете страни трябва да използват едно и също изходно измерение.

Разделянето е насочено към агентни работни натоварвания. Един агент може да извършва десетки търсения на задача, а латентността на заявките се натрупва. Екипът на Cohere съобщава, че Fast обработва 377.3 документа в секунда спрямо 159.7 за Pro.

Бенчмаркове

В ViDoRe V3 Embed 5 Pro постига среден резултат 85.8 — ръст от 8.8 точки спрямо Embed 4. Fast постига средно 84.5. Voyage 4 Large получава 83.7, Gemini Embedding 2 получава 83.2, а OpenAI text-embedding-3-large получава 75.5. В набора на Cohere за анализирани PDF файлове Pro води с 84.8 спрямо 83.6 за Voyage 4 Large.

Финансите са най-силната област. Pro се класира на първо място във FinanceBench (80.1), FinQA (90.0) и ViDoRe V3 Finance (85.0). Fast се класира на второ място и в трите.

Многоезичните резултати са смесени. Pro води при средната стойност за европейските езици със 77. Gemini Embedding 2 обаче превъзхожда Pro при 9 от 10 допълнителни езика в собствената таблица с резултати на Cohere. Сред тях са японски, арабски, хинди и телугу.

Едно важно нещо, което трябва да се отбележи. Повечето числа използват RCP-nDCG@10, нов показател на Cohere. Той пренарежда фиксиран набор от кандидати, така че измерва по-скоро качеството на повторното класиране, отколкото извличането на първия етап. Cohere публикува кода за оценяване, но независимото възпроизвеждане все още предстои.

Разходи за съхранение в мащаб

Embed 5 използва обучение за представяне Matryoshka, както и изходи с по-ниска точност. Вектор с 2048 измерения и float32 изисква 8 KB. Вектор с 1024 измерения и int8 изисква 1 KB. Двоичен вектор с 256 измерения изисква 32 байта. При 100 млн. фрагмента необработеното хранилище намалява от около 819 GB до 3.2 GB. Cohere препоръчва 1024 измерения и int8 като стойности по подразбиране, позовавайки се на качество, близко до това при пълна точност.

Интерактивно обяснение: Как работи Embed 5

Обяснение на Cohere Embed 5 | Marktechpost
Cohere Embed 5 · Интерактивно обяснение1 / 6

1. Какво всъщност прави моделът за вграждане

Въвежда се текст, а на изхода се получава вектор от числа. След това търсенето класира документите според близостта на техните вектори до вектора на заявката. Натиснете бутона, за да видите как работи.

Заявка

Какво се случи с нетния лихвен марж през последното тримесечие?
Модел: embed-v5.0-pro · 1024 измерения

Документи, класирани по косинусова близост

Нетният лихвен марж се сви с 12 базисни пункта до 2.61%, тъй като разходите по депозитите нараснаха.0.00
Затегнете монтажните болтове до 45 Nm в кръстосана последователност, преди да поставите обратно капака.0.00
Служителите натрупват 1.5 дни платен отпуск за всеки месец трудов стаж.0.00

Документите са взети от примерния код за стартиране на Cohere. Лентите за векторите и оценките за близостта са илюстративни, а не реален изход от модела.

2. Две нива, едно пространство за вграждане

Pro и Fast записват вектори в едно и също пространство. Изберете кой модел да индексира корпуса и кой да вгражда заявката. Качеството е нормализирано така, че Pro плюс Pro дава 100.

Индексиране на корпуса с

Вграждане на заявки с

Препоръчваният от Cohere модел: индексиране с Pro, заявки с Fast.

0относителен nDCG@10

Пръстенът е увеличен до диапазона от 90 до 100, за да се виждат малките разлики.

Производителност на документите (документи в секунда, измерено от Cohere)

Embed 5 Fast377.3
Embed 5 Pro159.7

Цена за 1 млн. текстови токена: Pro $0.12, Fast $0.08. Изображенията струват $0.40 за 1 млн. токена и при двете нива.

3. Намалете размера на вектора, не качеството

Обучението Matryoshka позволява съкращаване на измеренията. Изходите с по-ниска точност намаляват допълнително броя байтове. Променете настройките и вижте как се променя хранилището.

Изходни измерения

Точност

Фрагменти във вашия индекс: 100,000,000

8,192 Bбайта на вектор
819.2 GBнеобработено хранилище за вектори
1xпо-малко спрямо 2048 float32
Хранилище спрямо базовата стойност 2048 измерения и float32100%

Изчисление: измерения x байтове на стойност (4, 1 или 1/8). Cohere препоръчва 1024 измерения и int8 като оптималната стойност по подразбиране. Binary жертва част от точността и е подходящ за първи етап преди повторното класиране.

4. Как се представя спрямо конкурентите

Средни стойности, отчетени от Cohere, използващи новия показател RCP-nDCG@10. Приемайте ги като данни от производителя, докато не бъдат публикувани независими резултати.

Източник: публикация на Cohere за стартирането на Embed 5, 30 септември 2026 г. RCP-nDCG@10 пренарежда фиксиран набор от кандидати, така че отразява по-скоро качеството на повторното класиране, отколкото извличането на първия етап.

5. Колко съдържание се побира в един вход

По-дългият контекст означава по-малко фрагменти за дълги документи и ръководства. Натиснете „Пускане“, за да сравните максималната дължина на входа при едно извикване.

Cohere Embed 5 Pro / Fast128K токена
Voyage 4 Large32,000 токена
Gemini Embedding 28,192 токена
OpenAI text-embedding-3-large8,191 токена

Ограниченията са взети от документацията за моделите на всеки производител. 128K е показано като 131,072 токена за мащаба на лентата.

6. Може ли да се внедри? Да. Изберете начин.

И двете нива са общодостъпни. Докоснете даден начин, за да видите какво предлага.

Създадено от MarktechpostДанни: блогът на Cohere · документация на Cohere

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини