Cohere выпустила North Small Translate: модель перевода MoE на 218 млрд параметров, набирающая 83,6 на WMT26 для 50 языков
Cohere выпустила North Small Translate — модель машинного перевода с открытыми весами от Cohere и Cohere Labs. Это разреженная модель Mixture-of-Experts (MoE) с общим числом параметров 218 млрд и 25 млрд активных параметров. Она охватывает 50 языков — от албанского до вьетнамского. В оценивании Cohere WMT26 модель набрала в среднем 83,6 балла по всем языкам. По словам Cohere, это превосходит DeepL и Google Translate, а также открытые решения вроде GLM 5.2 и Mistral Large 3.
Можно ли её развернуть? Да. Используйте её бесплатно через API Cohere до достижения лимитов запросов, разверните самостоятельно для некоммерческого использования или получите коммерческую лицензию.
Возвращение к истокам Transformer
Исследователи Google представили Transformer в 2017 году в работе Attention Is All You Need. Основные результаты были получены на задачах перевода с английского на немецкий и французский из WMT 2014. 9 лет спустя Cohere возвращается к этой исходной задаче с отдельной моделью. Публикация Cohere о запуске в X рассматривает перевод как вопрос суверенитета. Организации, которые не могут взаимодействовать на глобальном уровне, не могут оставаться суверенными.
North Small Translate — первая модель перевода в семействе North от Cohere. Она продолжает мультиязычную линию Cohere, представленную моделями Tiny Aya и Command A Translate. Cohere создала её совместно с RWS, чьи специалисты Language Weaver и эксперты по языкам помогли сформировать её качество в реальных условиях.
Архитектура
Структура модели описывает разреженный Transformer MoE только с декодером. Вот ключевые детали:
- Эксперты: 128 экспертов, 8 активируются для каждого токена, плюс общие эксперты, применяемые к каждому токену.
- Маршрутизатор: Сигмоида над логитами экспертов с нормализацией по выбранным экспертам top-k.
- Механизм внимания: Слои со скользящим окном (окно 4096, RoPE) и глобальные слои без позиционных эмбеддингов, чередующиеся в соотношении 3:1.
- Преемственность: Такая схема внимания впервые была представлена в Command A.
- Контекст: 16 тыс. входных и 16 тыс. выходных токенов, только текст.
- Обучение: Дополнительное обучение специально для повышения качества перевода.
Для каждого токена активны примерно 11,5% весов. Вычисления для каждого токена соответствуют 25 млрд активных параметров. При этом в памяти по-прежнему должны храниться все 218 млрд параметров.
Бенчмарки
Команда Cohere сообщает следующие результаты WMT26 по всем языкам в своём посте о запуске:
| Модель | Результат WMT26 |
|---|---|
| North Small Translate (Agentic) | 84.36 |
| North Small Translate | 83.60 |
| Qwen 3.5 397B A17B | 81.56 |
| DeepL NextGen | 81.37 |
| Gemma 4 31B (on) | 79.46 |
| GLM 5.2 FP8 | 76.50 |
| Google Translate | 68.20 |
Вариант Agentic выполняет многоэтапный процесс, в ходе которого находит и исправляет собственные ошибки. Согласно шкале Cohere, результаты от 80 до 100 означают идеальный перевод или наличие только незначительных ошибок. Здесь важно учитывать один нюанс. Это собственные прогоны Cohere, где в качестве оценщика использовалась GPT-5.6-Sol. Считайте эти результаты предоставленными разработчиком до появления независимых результатов WMT26.
В региональном разрезе обе версии превзошли Gemma 4 31B (on) по всей Европе. На языках ЕС стандартная модель набрала 82,17 балла против 72,73 у Gemma. В Южной Азии результаты близки: 86,16 у North против 88,04 у Gemma.
Скорость, длинные документы и стоимость
В тестах Cohere модель генерировала 112 выходных токенов в секунду против 81 у Gemma 4 31B. Тестирование проводилось при низкой степени параллелизма на идентичном оборудовании. При высокой степени параллелизма показатели составили 39 против 30. Cohere называет это увеличением пропускной способности до 1,4 раза.
Длинные документы — более сильная сторона модели. При переводе 2 глав книги за 1 запрос модель набирает 48,9 балла. Google Translate набирает 21,3, а Gemma 4 31B — 19,4. Качество измеряется для каждого абзаца с помощью xCOMET-XL.
На графике стоимости Cohere модель набирает 80,1 балла при цене $0.000676 за задачу и среднем количестве 661 токен. Gemini 3.1 Pro Preview (high) стоит $0.038928 за задачу — примерно в 58 раз дороже. Qwen 3.5 397B A17B стоит $0.004525, а Command A+ — $0.005158.
Как запустить модель
Самый быстрый способ — использовать Chat V2 API Cohere. Там модель бесплатна до достижения лимитов запросов:
from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
model="north-small-translate-1-0",
messages=[{"role": "user",
"content": "Translate everything that follows into French:\n\nEnterprises need accurate translations of business-critical documents."}],
)
print(response.message.content[0].text)Для самостоятельного развёртывания Cohere публикует 3 контрольные точки — те же, которые используются в рабочей среде:
| Контрольная точка | Blackwell | Hopper |
|---|---|---|
| BF16 | 4x B200 | 8x H100 |
| FP8 | 2x B200 | 4x H100 |
| NVFP4 W4A16 | 1x B200 | 2x H100 |
Главные выводы
- North Small Translate от Cohere — это MoE-модель с 218 млрд параметров, из которых 25 млрд активны.
- Она набирает 83,6 балла в WMT26 по всем языкам и 84,36 в агентном режиме.
- Все результаты предоставлены разработчиком и оценены с помощью GPT-5.6-Sol.
- 4-битная контрольная точка работает на 1x B200 или 2x H100.
Посмотрите модель здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.