JetBrains представи Mellum2.1: отворен MoE модел с 12B параметъра за агенти за програмиране
JetBrains пусна Mellum2.1 — отворен модел, създаден за агенти за програмиране и бързи подагенти. Mellum2.1 е мислещ модел от типа mixture-of-experts с 12B параметъра от JetBrains, който активира 2.5B параметъра на токен. Разпространява се под лиценза Apache 2.0 в Hugging Face. Архитектурата е непроменена спрямо Mellum2. Подобрението идва почти изцяло от обучение с подсилване (RL) в реални софтуерни среди. Резултатът е малък модел, който може да се хоства самостоятелно, изследва хранилище, редактира файлове и проверява собствените си промени.
Накратко
- Размер: 12B общо, 2.5B активни (64 експерта, 8 активни), контекст от 131 072 токена
- Работи на: ваши собствени графични процесори чрез vLLM или SGLang (скоростта е тествана на 1 NVIDIA H200). GGUF версиите започват от 7.0 GB за llama.cpp, Ollama и LM Studio.
- Производителност: превъзхожда Mellum2 в 15 от 17 посочени бенчмарка; печели в 5 от 17 срещу Qwen3.5-9B
- Най-добър резултат: 82.0 в LiveCodeBench v6, пред Qwen3.5-9B (75.4) и Gemma 4 E4B (69.4)
- Най-слаб резултат: 17.4 в Terminal-Bench 2.1, под Qwen3.5-9B (21.7)
- Извод (най-доброто): силни резултати в програмирането и висока пропускателна способност само с 2.5B активни параметъра.
- Извод (най-слабото): все още изостава от Qwen3.5-9B при сложни агентни софтуерни задачи и задачи, изискващи знания.
Какво представлява Mellum2.1?
Mellum2.1 е следващата версия на Mellum2 Thinking, който JetBrains пусна с отворен код през юни 2026 г. Публикуваният чекпойнт е Mellum2.1-12B-A2.5B-Thinking. Това е модел за разсъждение, който извежда веригата си на мисли, преди да отговори. JetBrains го насочва към 3 приложения: агентен работник, асистент за общо разсъждение и частно внедряване на собствена инфраструктура.
Как работи архитектурата на Mellum2.1?
Моделът има 28 слоя и 64 експерта. Рутер активира 8 експерта на токен. Механизмът за внимание използва grouped-query attention с 32 заявочни глави и 4 KV глави. 3 от всеки 4 слоя използват плъзгащ се прозорец от 1 024 токена. Дължината на контекста е 131 072 токена, а речникът съдържа 98 304 токена. Теглата се предоставят във формат bfloat16.
Как е обучен Mellum2.1?
Почти цялата нова работа е вложена в дообучаването. RL премина от кратък финален етап към основна част от обучението. JetBrains добави RL задачи по математика, състезателно програмиране, наука, използване на инструменти и софтуерно инженерство. Компанията филтрира отворени RL набори от данни за повредени тестове, отговори, които не могат да бъдат проверени, както и задачи, които са твърде лесни или невъзможни. При софтуерното инженерство моделът се обучава в реални хранилища с инструменти за shell и редактиране на файлове. Той получава награда, когато тестовете преминат успешно. Обучението стартира милиони изолирани среди в хиляди среди.
Как се представя Mellum2.1 в бенчмарковете?
JetBrains оцени Mellum2.1, Mellum2, Qwen3.5-9B и Gemma 4 E4B с един и същ конвейер в режим на мислене. Всички резултати са предоставени от самия JetBrains.
Най-големият скок е при агентното програмиране. SWE-bench Verified се повиши от 2.0 на 47.0. SWE-bench Pro се повиши от 0.0 на 28.0. Terminal-Bench 2.1 се повиши от 0.6 на 17.4. Агентните изпълнения използваха конвейера с отворен код Pi v0.73.1 с контекст от 114K токена.
Mellum2.1 води групата в LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) и BFCL v4 (62.3). Qwen3.5-9B все още води в SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) и GPQA Diamond (77.8). Безопасността също се е подобрила: HarmBench спадна от 21.5 на 8.5, като по-ниската стойност е по-добра.
Важно е да се вземат предвид конвейерите. Собствената карта на Qwen посочва 65.6 в LiveCodeBench v6 и 81.7 в GPQA Diamond. JetBrains измери 75.4 и 77.8 за същия модел.
Колко бърз е Mellum2.1?
Дообучаването не промени архитектурата, така че скоростта съвпада с тази на Mellum2. При 1 H200 под сериозно натоварване JetBrains твърди, че Mellum2.1 обслужва почти 2 пъти повече токени от Qwen3.5-9B. При една заявка многотокенното предвиждане (MTP) го прави около 1.6 пъти по-бърз. Главата за MTP за спекулативно декодиране във vLLM е посочена като очаквана скоро.
Как да стартирате Mellum2.1 локално?
Пълният модел се обслужва във vLLM с --reasoning-parser qwen3. Извикването на инструменти добавя --enable-auto-tool-choice --tool-call-parser hermes. JetBrains препоръчва temperature 0.6, top_p 0.95 и top_k 20.
Бележките към версията на JetBrains споменават, че GGUF версиите са в процес на разработка. Вече съществуващо GGUF хранилище вече съдържа 5 файла:
- BF16: 24.3 GB (референтен вариант)
- Q8_0: 12.9 GB, 96.1% съвпадение на водещия токен
- Q6_K: 10.9 GB, 93.9% съвпадение на водещия токен
- Q4_K_M: 8.1 GB, 88.0% съвпадение на водещия токен (препоръчва се)
- MXFP4_MOE: 7.0 GB, 85.6% съвпадение на водещия токен
Mellum2.1 срещу Qwen3.5-9B срещу Gemma 4 E4B
| Характеристика | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| Архитектура | MoE, 64 експерта, 8 активни | MoE (същата като при 2.1) | Hybrid Gated DeltaNet + gated attention | Плътна, с вграждания на ниво слой |
| Общо параметри | 12B | 12B | 9B (езиков модел) | 8B с вграждания |
| Активни / ефективни параметри | 2.5B активни | 2.5B активни | 9B (плътен модел) | 4.5B ефективни |
| Контекст | 131 072 | 131 072 | 262 144 нативно, до 1 010 000 | 128K |
| Модалност | Текст | Текст | Текст, изображения, видео | Текст, изображения, аудио |
| Лиценз | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82.0 | 69.4 | 75.4 | 69.4 |
| SWE-bench Verified* | 47.0 | 2.0 | 50.0 | 23.0 |
| Terminal-Bench 2.1* | 17.4 | 0.6 | 21.7 | 3.4 |
| BFCL v4* | 62.3 | 49.6 | 58.5 | 52.5 |
| GPQA Diamond* | 64.6 | 51.0 | 77.8 | 53.1 |
| AIME 25/26* | 83.3 | 60.1 | 86.7 | 45.0 |
*Редове за бенчмаркове: общият конвейер на JetBrains, режим на мислене, от картата на модела Mellum2.1. Собствените карти на производителите посочват различни числа за Qwen3.5-9B и Gemma 4 E4B.
Основни изводи
- Mellum2.1 е мислещ MoE модел с 12B параметъра и 2.5B активни параметъра, разпространяван под Apache 2.0.
- RL в реални хранилища повиши резултата в SWE-bench Verified от 2.0 на 47.0.
- Той води тестваната група в LiveCodeBench v6 (82.0) и BFCL v4 (62.3).
- Qwen3.5-9B все още печели в SWE-bench Pro, GPQA Diamond и AIME.
- GGUF с размер от 7.0 GB до 8.1 GB прави локалните подагенти за програмиране практични.
Разгледайте теглата на модела, GGUF версиите, техническия блог и техническия доклад за Mellum2. Всички заслуги принадлежат на изследователя по този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.