Cohere випустила North Small Translate: модель перекладу MoE на 218 млрд параметрів, що набирає 83,6 на WMT26 для 50 мов
Cohere випустила North Small Translate — модель машинного перекладу з відкритими вагами від Cohere та Cohere Labs. Це розріджена модель Mixture-of-Experts (MoE) із загалом 218 млрд і 25 млрд активних параметрів. Вона охоплює 50 мов — від албанської до в’єтнамської. За оцінюванням Cohere WMT26 її середній бал для всіх мов становить 83,6. У Cohere заявляють, що це перевершує DeepL і Google Translate, а також відкриті варіанти на кшталт GLM 5.2 і Mistral Large 3.
Чи придатна вона для розгортання? Так. Використовуйте її безкоштовно через API Cohere до досягнення лімітів частоти запитів, розгортайте самостійно в некомерційних цілях або ліцензуйте для комерційного використання.
Повернення до витоків Transformer
Дослідники Google представили Transformer у 2017 році в роботі Attention Is All You Need. Основні результати було отримано для перекладу з англійської на німецьку та з англійської на французьку в межах WMT 2014. Через 9 років Cohere повертається до цієї початкової проблеми зі спеціалізованою моделлю. У публікації Cohere про запуск у X переклад розглядається як питання суверенітету. Організації, які не можуть спілкуватися на глобальному рівні, не можуть залишатися суверенними.
North Small Translate — перша модель перекладу в сімействі Cohere North. Вона продовжує Tiny Aya і Command A Translate у багатомовній лінійці Cohere. Cohere створила її спільно з RWS, чиї науковці Language Weaver та мовні експерти вплинули на її якість у реальних умовах.
Архітектура
Структура моделі описує декодерну розріджену модель Transformer типу MoE. Ось ключові деталі:
- Експерти: 128 експертів, 8 активуються для кожного токена, а також спільні експерти, що застосовуються до кожного токена.
- Маршрутизатор: Сигмоїда над логітами експертів, нормалізована щодо вибраних top-k.
- Механізм уваги: Шари з ковзним вікном (вікно 4096, RoPE) і глобальні шари без позиційних embedding’ів, чергування у співвідношенні 3:1.
- Походження: Таку структуру механізму уваги вперше представили в Command A.
- Контекст: 16 тис. вхідних і 16 тис. вихідних токенів, лише текст.
- Навчання: Дообучена спеціально для якості перекладу.
Для кожного токена активними є близько 11,5% ваг. Обчислення на токен відповідають 25 млрд активних параметрів. Водночас у пам’яті все одно потрібно зберігати всі 218 млрд.
Бенчмарки
Команда Cohere повідомляє такі результати WMT26 для всіх мов у своєму матеріалі про запуск:
| Модель | Бал WMT26 |
|---|---|
| North Small Translate (Agentic) | 84.36 |
| North Small Translate | 83.60 |
| Qwen 3.5 397B A17B | 81.56 |
| DeepL NextGen | 81.37 |
| Gemma 4 31B (on) | 79.46 |
| GLM 5.2 FP8 | 76.50 |
| Google Translate | 68.20 |
Варіант Agentic виконує багатопрохідний процес, який знаходить і виправляє власні помилки. За шкалою Cohere результати від 80 до 100 означають ідеальний результат або лише незначні помилки. Тут важливе одне застереження. Це власні запуски Cohere, де оцінювачем виступав GPT-5.6-Sol. Вважайте їх даними від постачальника, доки не з’являться незалежні результати WMT26.
У регіональному розрізі обидві версії перевершують Gemma 4 31B (on) у всій Європі. Для мов ЄС стандартна модель набирає 82,17 проти 72,73 у Gemma. У Південній Азії результати близькі: 86,16 у North проти 88,04 у Gemma.
Швидкість, довгі документи та вартість
У тестах Cohere модель генерувала 112 вихідних токенів за секунду проти 81 у Gemma 4 31B. Це вимірювали за низької паралельності на ідентичному обладнанні. За високої паралельності показники становили 39 проти 30. Cohere називає це до 1,4 раза вищою пропускною здатністю.
Довгі документи — сильніша сторона моделі. Під час перекладу 2 розділів книги за 1 запит модель отримує 48,9 бала. Google Translate набирає 21,3, а Gemma 4 31B — 19,4. Якість вимірюється для кожного абзацу за допомогою xCOMET-XL.
На графіку вартості Cohere модель отримує 80,1 бала за ціни 0,000676 долара США за завдання, у середньому 661 токен. Gemini 3.1 Pro Preview (high) коштує 0,038928 долара за завдання — приблизно у 58 разів дорожче. Qwen 3.5 397B A17B коштує 0,004525 долара, а Command A+ — 0,005158 долара.
Як її запустити
Найшвидший спосіб — Chat V2 API від Cohere. Там модель безкоштовна до досягнення лімітів частоти запитів:
from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
model="north-small-translate-1-0",
messages=[{"role": "user",
"content": "Перекладіть усе наведене далі французькою:\n\nПідприємствам потрібні точні переклади документів, критично важливих для бізнесу."}],
)
print(response.message.content[0].text)Для самостійного розгортання Cohere публікує 3 контрольні точки — ті самі, що використовуються у production:
| Контрольна точка | Blackwell | Hopper |
|---|---|---|
| BF16 | 4x B200 | 8x H100 |
| FP8 | 2x B200 | 4x H100 |
| NVFP4 W4A16 | 1x B200 | 2x H100 |
Основні висновки
- North Small Translate від Cohere — це MoE-модель із 218 млрд параметрів, 25 млрд із яких активні.
- Вона набирає 83,6 бала у WMT26 для всіх мов і 84,36 в агентному режимі.
- Усі результати надані постачальником і оцінені GPT-5.6-Sol.
- Контрольна точка з 4-бітним квантуванням працює на 1x B200 або 2x H100.
Перегляньте модель тут. Також можете стежити за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.