Sakhanda Wire
NVDA $231.96 -2.32% MSFT $524.26 -1.04% GOOGL $348.41 -0.60% META $714.11 -1.00% AMZN $257.10 -1.08%
← К новостям

JetBrains выпустила Mellum2.1: открытую MoE-модель на 12 млрд параметров для агентов программирования

JetBrains выпустила Mellum2.1 — открытую модель, созданную для агентов программирования и быстрых субагентов. Mellum2.1 — это мыслящая модель класса mixture-of-experts с 12 млрд параметров от JetBrains, которая активирует 2,5 млрд параметров на токен. Она распространяется по лицензии Apache 2.0 на платформе Hugging Face. Архитектура не изменилась по сравнению с Mellum2. Обновление почти полностью обеспечено обучением с подкреплением (RL) в реальных программных средах. В результате получилась небольшая модель, которую можно разместить самостоятельно: она исследует репозиторий, редактирует файлы и проверяет собственные изменения.

Кратко

  • Размер: всего 12 млрд, 2,5 млрд активных параметров (64 эксперта, 8 активных), контекст на 131 072 токена
  • Запуск: на собственных GPU через vLLM или SGLang (скорость проверена на 1 NVIDIA H200). Сборки GGUF для llama.cpp, Ollama и LM Studio начинаются от 7,0 ГБ.
  • Производительность: превосходит Mellum2 в 15 из 17 перечисленных тестов; выигрывает у Qwen3.5-9B в 5 из 17
  • Лучший результат: 82,0 в LiveCodeBench v6, выше, чем у Qwen3.5-9B (75,4) и Gemma 4 E4B (69,4)
  • Худший результат: 17,4 в Terminal-Bench 2.1, ниже, чем у Qwen3.5-9B (21,7)
  • Итог (лучшее): высокие показатели в задачах программирования и высокая пропускная способность при всего 2,5 млрд активных параметров.
  • Итог (худшее): по-прежнему уступает Qwen3.5-9B в сложных агентских задачах разработки ПО и проверке знаний.

Что такое Mellum2.1?

Mellum2.1 — следующая версия Mellum2 Thinking, которую JetBrains открыла в июне 2026 года. Выпущенный чекпойнт называется Mellum2.1-12B-A2.5B-Thinking. Это рассуждающая модель, которая перед ответом выдает цепочку своих рассуждений. JetBrains нацеливает ее на 3 варианта использования: агент-исполнитель, универсальный помощник для рассуждений и частное самостоятельное развертывание.

Как работает архитектура Mellum2.1?

Модель имеет 28 слоев и 64 эксперта. Маршрутизатор активирует 8 экспертов на токен. В механизме внимания используется grouped-query attention с 32 головами запросов и 4 головами KV. В 3 из каждых 4 слоев используется скользящее окно размером 1 024 токена. Длина контекста составляет 131 072 токена, а словарь насчитывает 98 304 токена. Веса поставляются в формате bfloat16.

Как обучалась Mellum2.1?

Почти вся новая работа пришлась на этап дообучения. RL перестало быть коротким финальным этапом и стало основной частью обучения. JetBrains добавила задачи RL по математике, спортивному программированию, естественным наукам, использованию инструментов и разработке ПО. Из открытых наборов данных для RL отфильтровывались сломанные тесты, ответы, которые невозможно проверить, а также слишком легкие или невыполнимые задачи. В задачах разработки ПО модель обучается в реальных репозиториях с оболочкой и инструментами редактирования файлов. Она получает вознаграждение, когда тесты проходят. В процессе обучения были запущены миллионы песочниц в тысячах сред.

Как Mellum2.1 показывает себя в тестах?

JetBrains оценила Mellum2.1, Mellum2, Qwen3.5-9B и Gemma 4 E4B с помощью одного пайплайна в режиме рассуждений. Все показатели представлены самой JetBrains.

Наибольший скачок наблюдается в агентском программировании. Результат SWE-bench Verified вырос с 2,0 до 47,0. SWE-bench Pro вырос с 0,0 до 28,0. Terminal-Bench 2.1 вырос с 0,6 до 17,4. В агентских запусках использовался открытый набор инструментов Pi v0.73.1 с контекстом на 114 тыс. токенов.

Mellum2.1 лидирует среди представленных моделей в LiveCodeBench v6 (82,0), HumanEval+ (91,5), MBPP+ (79,4) и BFCL v4 (62,3). Qwen3.5-9B по-прежнему лидирует в SWE-bench Verified (50,0), SWE-bench Pro (38,0), AIME 25/26 (86,7) и GPQA Diamond (77,8). Показатели безопасности также улучшились: результат HarmBench снизился с 21,5 до 8,5, причем меньшее значение лучше.

Важно учитывать используемые пайплайны. В собственной карточке Qwen указаны результаты 65,6 в LiveCodeBench v6 и 81,7 в GPQA Diamond. JetBrains измерила для той же модели 75,4 и 77,8.

Насколько быстро работает Mellum2.1?

После обучения архитектура не менялась, поэтому скорость соответствует Mellum2. При высокой нагрузке на 1 H200 Mellum2.1 обрабатывает, по словам JetBrains, почти в 2 раза больше токенов, чем Qwen3.5-9B. Для одного запроса многотокенное предсказание (MTP) делает модель примерно в 1,6 раза быстрее. Голова MTP для спекулятивного декодирования в vLLM появится позже.

Как запустить Mellum2.1 локально?

Полная модель запускается в vLLM с параметром --reasoning-parser qwen3. Для вызова инструментов добавьте --enable-auto-tool-choice --tool-call-parser hermes. JetBrains рекомендует temperature 0.6, top_p 0.95 и top_k 20.

В примечаниях к выпуску JetBrains упоминается, что сборки GGUF находятся в процессе подготовки. В репозитории GGUF уже перечислены 5 файлов:

  • BF16: 24,3 ГБ (эталонная версия)
  • Q8_0: 12,9 ГБ, совпадение наиболее вероятного токена — 96,1%
  • Q6_K: 10,9 ГБ, совпадение наиболее вероятного токена — 93,9%
  • Q4_K_M: 8,1 ГБ, совпадение наиболее вероятного токена — 88,0% (рекомендуется)
  • MXFP4_MOE: 7,0 ГБ, совпадение наиболее вероятного токена — 85,6%

Mellum2.1 против Qwen3.5-9B и Gemma 4 E4B

ХарактеристикаMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
АрхитектураMoE, 64 эксперта, 8 активныхMoE (та же, что у 2.1)Hybrid Gated DeltaNet + gated attentionПлотная, с встраиваниями на уровне слоев
Всего параметров12 млрд12 млрд9 млрд (языковая модель)8 млрд со встраиваниями
Активные / эффективные параметры2,5 млрд активных2,5 млрд активных9 млрд (плотная модель)4,5 млрд эффективных
Контекст131 072131 072262 144 нативно, до 1 010 000128K
МодальностьТекстТекстТекст, изображения, видеоТекст, изображения, аудио
ЛицензияApache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82,069,475,469,4
SWE-bench Verified*47,02,050,023,0
Terminal-Bench 2.1*17,40,621,73,4
BFCL v4*62,349,658,552,5
GPQA Diamond*64,651,077,853,1
AIME 25/26*83,360,186,745,0

*Строки с результатами тестов: общий пайплайн JetBrains, режим рассуждений, данные из карточки модели Mellum2.1. В собственных карточках разработчиков для Qwen3.5-9B и Gemma 4 E4B указаны другие значения.

Ключевые выводы

  • Mellum2.1 — это мыслящая MoE-модель с 12 млрд параметров и 2,5 млрд активных параметров, распространяемая по лицензии Apache 2.0.
  • RL в реальных репозиториях повысило результат SWE-bench Verified с 2,0 до 47,0.
  • Она лидирует среди протестированных моделей в LiveCodeBench v6 (82,0) и BFCL v4 (62,3).
  • Qwen3.5-9B по-прежнему выигрывает в SWE-bench Pro, GPQA Diamond и AIME.
  • GGUF размером от 7,0 до 8,1 ГБ делает локальные субагенты для программирования практичными.

Ознакомьтесь с весами модели, сборками GGUF, техническим блогом и техническим отчетом Mellum2. Вся благодарность принадлежит исследователю, работавшему над этим проектом. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости