JetBrains выпустила Mellum2.1: открытую MoE-модель на 12 млрд параметров для агентов программирования
JetBrains выпустила Mellum2.1 — открытую модель, созданную для агентов программирования и быстрых субагентов. Mellum2.1 — это мыслящая модель класса mixture-of-experts с 12 млрд параметров от JetBrains, которая активирует 2,5 млрд параметров на токен. Она распространяется по лицензии Apache 2.0 на платформе Hugging Face. Архитектура не изменилась по сравнению с Mellum2. Обновление почти полностью обеспечено обучением с подкреплением (RL) в реальных программных средах. В результате получилась небольшая модель, которую можно разместить самостоятельно: она исследует репозиторий, редактирует файлы и проверяет собственные изменения.
Кратко
- Размер: всего 12 млрд, 2,5 млрд активных параметров (64 эксперта, 8 активных), контекст на 131 072 токена
- Запуск: на собственных GPU через vLLM или SGLang (скорость проверена на 1 NVIDIA H200). Сборки GGUF для llama.cpp, Ollama и LM Studio начинаются от 7,0 ГБ.
- Производительность: превосходит Mellum2 в 15 из 17 перечисленных тестов; выигрывает у Qwen3.5-9B в 5 из 17
- Лучший результат: 82,0 в LiveCodeBench v6, выше, чем у Qwen3.5-9B (75,4) и Gemma 4 E4B (69,4)
- Худший результат: 17,4 в Terminal-Bench 2.1, ниже, чем у Qwen3.5-9B (21,7)
- Итог (лучшее): высокие показатели в задачах программирования и высокая пропускная способность при всего 2,5 млрд активных параметров.
- Итог (худшее): по-прежнему уступает Qwen3.5-9B в сложных агентских задачах разработки ПО и проверке знаний.
Что такое Mellum2.1?
Mellum2.1 — следующая версия Mellum2 Thinking, которую JetBrains открыла в июне 2026 года. Выпущенный чекпойнт называется Mellum2.1-12B-A2.5B-Thinking. Это рассуждающая модель, которая перед ответом выдает цепочку своих рассуждений. JetBrains нацеливает ее на 3 варианта использования: агент-исполнитель, универсальный помощник для рассуждений и частное самостоятельное развертывание.
Как работает архитектура Mellum2.1?
Модель имеет 28 слоев и 64 эксперта. Маршрутизатор активирует 8 экспертов на токен. В механизме внимания используется grouped-query attention с 32 головами запросов и 4 головами KV. В 3 из каждых 4 слоев используется скользящее окно размером 1 024 токена. Длина контекста составляет 131 072 токена, а словарь насчитывает 98 304 токена. Веса поставляются в формате bfloat16.
Как обучалась Mellum2.1?
Почти вся новая работа пришлась на этап дообучения. RL перестало быть коротким финальным этапом и стало основной частью обучения. JetBrains добавила задачи RL по математике, спортивному программированию, естественным наукам, использованию инструментов и разработке ПО. Из открытых наборов данных для RL отфильтровывались сломанные тесты, ответы, которые невозможно проверить, а также слишком легкие или невыполнимые задачи. В задачах разработки ПО модель обучается в реальных репозиториях с оболочкой и инструментами редактирования файлов. Она получает вознаграждение, когда тесты проходят. В процессе обучения были запущены миллионы песочниц в тысячах сред.
Как Mellum2.1 показывает себя в тестах?
JetBrains оценила Mellum2.1, Mellum2, Qwen3.5-9B и Gemma 4 E4B с помощью одного пайплайна в режиме рассуждений. Все показатели представлены самой JetBrains.
Наибольший скачок наблюдается в агентском программировании. Результат SWE-bench Verified вырос с 2,0 до 47,0. SWE-bench Pro вырос с 0,0 до 28,0. Terminal-Bench 2.1 вырос с 0,6 до 17,4. В агентских запусках использовался открытый набор инструментов Pi v0.73.1 с контекстом на 114 тыс. токенов.
Mellum2.1 лидирует среди представленных моделей в LiveCodeBench v6 (82,0), HumanEval+ (91,5), MBPP+ (79,4) и BFCL v4 (62,3). Qwen3.5-9B по-прежнему лидирует в SWE-bench Verified (50,0), SWE-bench Pro (38,0), AIME 25/26 (86,7) и GPQA Diamond (77,8). Показатели безопасности также улучшились: результат HarmBench снизился с 21,5 до 8,5, причем меньшее значение лучше.
Важно учитывать используемые пайплайны. В собственной карточке Qwen указаны результаты 65,6 в LiveCodeBench v6 и 81,7 в GPQA Diamond. JetBrains измерила для той же модели 75,4 и 77,8.
Насколько быстро работает Mellum2.1?
После обучения архитектура не менялась, поэтому скорость соответствует Mellum2. При высокой нагрузке на 1 H200 Mellum2.1 обрабатывает, по словам JetBrains, почти в 2 раза больше токенов, чем Qwen3.5-9B. Для одного запроса многотокенное предсказание (MTP) делает модель примерно в 1,6 раза быстрее. Голова MTP для спекулятивного декодирования в vLLM появится позже.
Как запустить Mellum2.1 локально?
Полная модель запускается в vLLM с параметром --reasoning-parser qwen3. Для вызова инструментов добавьте --enable-auto-tool-choice --tool-call-parser hermes. JetBrains рекомендует temperature 0.6, top_p 0.95 и top_k 20.
В примечаниях к выпуску JetBrains упоминается, что сборки GGUF находятся в процессе подготовки. В репозитории GGUF уже перечислены 5 файлов:
- BF16: 24,3 ГБ (эталонная версия)
- Q8_0: 12,9 ГБ, совпадение наиболее вероятного токена — 96,1%
- Q6_K: 10,9 ГБ, совпадение наиболее вероятного токена — 93,9%
- Q4_K_M: 8,1 ГБ, совпадение наиболее вероятного токена — 88,0% (рекомендуется)
- MXFP4_MOE: 7,0 ГБ, совпадение наиболее вероятного токена — 85,6%
Mellum2.1 против Qwen3.5-9B и Gemma 4 E4B
| Характеристика | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| Архитектура | MoE, 64 эксперта, 8 активных | MoE (та же, что у 2.1) | Hybrid Gated DeltaNet + gated attention | Плотная, с встраиваниями на уровне слоев |
| Всего параметров | 12 млрд | 12 млрд | 9 млрд (языковая модель) | 8 млрд со встраиваниями |
| Активные / эффективные параметры | 2,5 млрд активных | 2,5 млрд активных | 9 млрд (плотная модель) | 4,5 млрд эффективных |
| Контекст | 131 072 | 131 072 | 262 144 нативно, до 1 010 000 | 128K |
| Модальность | Текст | Текст | Текст, изображения, видео | Текст, изображения, аудио |
| Лицензия | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82,0 | 69,4 | 75,4 | 69,4 |
| SWE-bench Verified* | 47,0 | 2,0 | 50,0 | 23,0 |
| Terminal-Bench 2.1* | 17,4 | 0,6 | 21,7 | 3,4 |
| BFCL v4* | 62,3 | 49,6 | 58,5 | 52,5 |
| GPQA Diamond* | 64,6 | 51,0 | 77,8 | 53,1 |
| AIME 25/26* | 83,3 | 60,1 | 86,7 | 45,0 |
*Строки с результатами тестов: общий пайплайн JetBrains, режим рассуждений, данные из карточки модели Mellum2.1. В собственных карточках разработчиков для Qwen3.5-9B и Gemma 4 E4B указаны другие значения.
Ключевые выводы
- Mellum2.1 — это мыслящая MoE-модель с 12 млрд параметров и 2,5 млрд активных параметров, распространяемая по лицензии Apache 2.0.
- RL в реальных репозиториях повысило результат SWE-bench Verified с 2,0 до 47,0.
- Она лидирует среди протестированных моделей в LiveCodeBench v6 (82,0) и BFCL v4 (62,3).
- Qwen3.5-9B по-прежнему выигрывает в SWE-bench Pro, GPQA Diamond и AIME.
- GGUF размером от 7,0 до 8,1 ГБ делает локальные субагенты для программирования практичными.
Ознакомьтесь с весами модели, сборками GGUF, техническим блогом и техническим отчетом Mellum2. Вся благодарность принадлежит исследователю, работавшему над этим проектом. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.