Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Cohere выпустила North Small Translate: модель перевода MoE на 218 млрд параметров, набирающая 83,6 на WMT26 для 50 языков

Cohere выпустила North Small Translate — модель машинного перевода с открытыми весами от Cohere и Cohere Labs. Это разреженная модель Mixture-of-Experts (MoE) с общим числом параметров 218 млрд и 25 млрд активных параметров. Она охватывает 50 языков — от албанского до вьетнамского. В оценивании Cohere WMT26 модель набрала в среднем 83,6 балла по всем языкам. По словам Cohere, это превосходит DeepL и Google Translate, а также открытые решения вроде GLM 5.2 и Mistral Large 3.

Можно ли её развернуть? Да. Используйте её бесплатно через API Cohere до достижения лимитов запросов, разверните самостоятельно для некоммерческого использования или получите коммерческую лицензию.

Возвращение к истокам Transformer

Исследователи Google представили Transformer в 2017 году в работе Attention Is All You Need. Основные результаты были получены на задачах перевода с английского на немецкий и французский из WMT 2014. 9 лет спустя Cohere возвращается к этой исходной задаче с отдельной моделью. Публикация Cohere о запуске в X рассматривает перевод как вопрос суверенитета. Организации, которые не могут взаимодействовать на глобальном уровне, не могут оставаться суверенными.

North Small Translate — первая модель перевода в семействе North от Cohere. Она продолжает мультиязычную линию Cohere, представленную моделями Tiny Aya и Command A Translate. Cohere создала её совместно с RWS, чьи специалисты Language Weaver и эксперты по языкам помогли сформировать её качество в реальных условиях.

Архитектура

Структура модели описывает разреженный Transformer MoE только с декодером. Вот ключевые детали:

  • Эксперты: 128 экспертов, 8 активируются для каждого токена, плюс общие эксперты, применяемые к каждому токену.
  • Маршрутизатор: Сигмоида над логитами экспертов с нормализацией по выбранным экспертам top-k.
  • Механизм внимания: Слои со скользящим окном (окно 4096, RoPE) и глобальные слои без позиционных эмбеддингов, чередующиеся в соотношении 3:1.
  • Преемственность: Такая схема внимания впервые была представлена в Command A.
  • Контекст: 16 тыс. входных и 16 тыс. выходных токенов, только текст.
  • Обучение: Дополнительное обучение специально для повышения качества перевода.

Для каждого токена активны примерно 11,5% весов. Вычисления для каждого токена соответствуют 25 млрд активных параметров. При этом в памяти по-прежнему должны храниться все 218 млрд параметров.

Бенчмарки

Команда Cohere сообщает следующие результаты WMT26 по всем языкам в своём посте о запуске:

МодельРезультат WMT26
North Small Translate (Agentic)84.36
North Small Translate83.60
Qwen 3.5 397B A17B81.56
DeepL NextGen81.37
Gemma 4 31B (on)79.46
GLM 5.2 FP876.50
Google Translate68.20

Вариант Agentic выполняет многоэтапный процесс, в ходе которого находит и исправляет собственные ошибки. Согласно шкале Cohere, результаты от 80 до 100 означают идеальный перевод или наличие только незначительных ошибок. Здесь важно учитывать один нюанс. Это собственные прогоны Cohere, где в качестве оценщика использовалась GPT-5.6-Sol. Считайте эти результаты предоставленными разработчиком до появления независимых результатов WMT26.

В региональном разрезе обе версии превзошли Gemma 4 31B (on) по всей Европе. На языках ЕС стандартная модель набрала 82,17 балла против 72,73 у Gemma. В Южной Азии результаты близки: 86,16 у North против 88,04 у Gemma.

Скорость, длинные документы и стоимость

В тестах Cohere модель генерировала 112 выходных токенов в секунду против 81 у Gemma 4 31B. Тестирование проводилось при низкой степени параллелизма на идентичном оборудовании. При высокой степени параллелизма показатели составили 39 против 30. Cohere называет это увеличением пропускной способности до 1,4 раза.

Длинные документы — более сильная сторона модели. При переводе 2 глав книги за 1 запрос модель набирает 48,9 балла. Google Translate набирает 21,3, а Gemma 4 31B — 19,4. Качество измеряется для каждого абзаца с помощью xCOMET-XL.

На графике стоимости Cohere модель набирает 80,1 балла при цене $0.000676 за задачу и среднем количестве 661 токен. Gemini 3.1 Pro Preview (high) стоит $0.038928 за задачу — примерно в 58 раз дороже. Qwen 3.5 397B A17B стоит $0.004525, а Command A+ — $0.005158.

Как запустить модель

Самый быстрый способ — использовать Chat V2 API Cohere. Там модель бесплатна до достижения лимитов запросов:

Копировать кодСкопированоИспользовать другой браузер
from cohere import ClientV2

co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
    model="north-small-translate-1-0",
    messages=[{"role": "user",
               "content": "Translate everything that follows into French:\n\nEnterprises need accurate translations of business-critical documents."}],
)
print(response.message.content[0].text)

Для самостоятельного развёртывания Cohere публикует 3 контрольные точки — те же, которые используются в рабочей среде:

Контрольная точкаBlackwellHopper
BF164x B2008x H100
FP82x B2004x H100
NVFP4 W4A161x B2002x H100

Главные выводы

  • North Small Translate от Cohere — это MoE-модель с 218 млрд параметров, из которых 25 млрд активны.
  • Она набирает 83,6 балла в WMT26 по всем языкам и 84,36 в агентном режиме.
  • Все результаты предоставлены разработчиком и оценены с помощью GPT-5.6-Sol.
  • 4-битная контрольная точка работает на 1x B200 или 2x H100.

Посмотрите модель здесь. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости