Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Cohere випустила North Small Translate: модель перекладу MoE на 218 млрд параметрів, що набирає 83,6 на WMT26 для 50 мов

Cohere випустила North Small Translate — модель машинного перекладу з відкритими вагами від Cohere та Cohere Labs. Це розріджена модель Mixture-of-Experts (MoE) із загалом 218 млрд і 25 млрд активних параметрів. Вона охоплює 50 мов — від албанської до в’єтнамської. За оцінюванням Cohere WMT26 її середній бал для всіх мов становить 83,6. У Cohere заявляють, що це перевершує DeepL і Google Translate, а також відкриті варіанти на кшталт GLM 5.2 і Mistral Large 3.

Чи придатна вона для розгортання? Так. Використовуйте її безкоштовно через API Cohere до досягнення лімітів частоти запитів, розгортайте самостійно в некомерційних цілях або ліцензуйте для комерційного використання.

Повернення до витоків Transformer

Дослідники Google представили Transformer у 2017 році в роботі Attention Is All You Need. Основні результати було отримано для перекладу з англійської на німецьку та з англійської на французьку в межах WMT 2014. Через 9 років Cohere повертається до цієї початкової проблеми зі спеціалізованою моделлю. У публікації Cohere про запуск у X переклад розглядається як питання суверенітету. Організації, які не можуть спілкуватися на глобальному рівні, не можуть залишатися суверенними.

North Small Translate — перша модель перекладу в сімействі Cohere North. Вона продовжує Tiny Aya і Command A Translate у багатомовній лінійці Cohere. Cohere створила її спільно з RWS, чиї науковці Language Weaver та мовні експерти вплинули на її якість у реальних умовах.

Архітектура

Структура моделі описує декодерну розріджену модель Transformer типу MoE. Ось ключові деталі:

  • Експерти: 128 експертів, 8 активуються для кожного токена, а також спільні експерти, що застосовуються до кожного токена.
  • Маршрутизатор: Сигмоїда над логітами експертів, нормалізована щодо вибраних top-k.
  • Механізм уваги: Шари з ковзним вікном (вікно 4096, RoPE) і глобальні шари без позиційних embedding’ів, чергування у співвідношенні 3:1.
  • Походження: Таку структуру механізму уваги вперше представили в Command A.
  • Контекст: 16 тис. вхідних і 16 тис. вихідних токенів, лише текст.
  • Навчання: Дообучена спеціально для якості перекладу.

Для кожного токена активними є близько 11,5% ваг. Обчислення на токен відповідають 25 млрд активних параметрів. Водночас у пам’яті все одно потрібно зберігати всі 218 млрд.

Бенчмарки

Команда Cohere повідомляє такі результати WMT26 для всіх мов у своєму матеріалі про запуск:

МодельБал WMT26
North Small Translate (Agentic)84.36
North Small Translate83.60
Qwen 3.5 397B A17B81.56
DeepL NextGen81.37
Gemma 4 31B (on)79.46
GLM 5.2 FP876.50
Google Translate68.20

Варіант Agentic виконує багатопрохідний процес, який знаходить і виправляє власні помилки. За шкалою Cohere результати від 80 до 100 означають ідеальний результат або лише незначні помилки. Тут важливе одне застереження. Це власні запуски Cohere, де оцінювачем виступав GPT-5.6-Sol. Вважайте їх даними від постачальника, доки не з’являться незалежні результати WMT26.

У регіональному розрізі обидві версії перевершують Gemma 4 31B (on) у всій Європі. Для мов ЄС стандартна модель набирає 82,17 проти 72,73 у Gemma. У Південній Азії результати близькі: 86,16 у North проти 88,04 у Gemma.

Швидкість, довгі документи та вартість

У тестах Cohere модель генерувала 112 вихідних токенів за секунду проти 81 у Gemma 4 31B. Це вимірювали за низької паралельності на ідентичному обладнанні. За високої паралельності показники становили 39 проти 30. Cohere називає це до 1,4 раза вищою пропускною здатністю.

Довгі документи — сильніша сторона моделі. Під час перекладу 2 розділів книги за 1 запит модель отримує 48,9 бала. Google Translate набирає 21,3, а Gemma 4 31B — 19,4. Якість вимірюється для кожного абзацу за допомогою xCOMET-XL.

На графіку вартості Cohere модель отримує 80,1 бала за ціни 0,000676 долара США за завдання, у середньому 661 токен. Gemini 3.1 Pro Preview (high) коштує 0,038928 долара за завдання — приблизно у 58 разів дорожче. Qwen 3.5 397B A17B коштує 0,004525 долара, а Command A+ — 0,005158 долара.

Як її запустити

Найшвидший спосіб — Chat V2 API від Cohere. Там модель безкоштовна до досягнення лімітів частоти запитів:

Copy CodeCopiedUse a different Browser
from cohere import ClientV2

co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
    model="north-small-translate-1-0",
    messages=[{"role": "user",
               "content": "Перекладіть усе наведене далі французькою:\n\nПідприємствам потрібні точні переклади документів, критично важливих для бізнесу."}],
)
print(response.message.content[0].text)

Для самостійного розгортання Cohere публікує 3 контрольні точки — ті самі, що використовуються у production:

Контрольна точкаBlackwellHopper
BF164x B2008x H100
FP82x B2004x H100
NVFP4 W4A161x B2002x H100

Основні висновки

  • North Small Translate від Cohere — це MoE-модель із 218 млрд параметрів, 25 млрд із яких активні.
  • Вона набирає 83,6 бала у WMT26 для всіх мов і 84,36 в агентному режимі.
  • Усі результати надані постачальником і оцінені GPT-5.6-Sol.
  • Контрольна точка з 4-бітним квантуванням працює на 1x B200 або 2x H100.

Перегляньте модель тут. Також можете стежити за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини