Sakhanda Wire
NVDA $231.96 -2.32% MSFT $524.26 -1.04% GOOGL $348.41 -0.60% META $714.11 -1.00% AMZN $257.10 -1.08%
← Към новините

JetBrains представи Mellum2.1: отворен MoE модел с 12B параметъра за агенти за програмиране

JetBrains пусна Mellum2.1 — отворен модел, създаден за агенти за програмиране и бързи подагенти. Mellum2.1 е мислещ модел от типа mixture-of-experts с 12B параметъра от JetBrains, който активира 2.5B параметъра на токен. Разпространява се под лиценза Apache 2.0 в Hugging Face. Архитектурата е непроменена спрямо Mellum2. Подобрението идва почти изцяло от обучение с подсилване (RL) в реални софтуерни среди. Резултатът е малък модел, който може да се хоства самостоятелно, изследва хранилище, редактира файлове и проверява собствените си промени.

Накратко

  • Размер: 12B общо, 2.5B активни (64 експерта, 8 активни), контекст от 131 072 токена
  • Работи на: ваши собствени графични процесори чрез vLLM или SGLang (скоростта е тествана на 1 NVIDIA H200). GGUF версиите започват от 7.0 GB за llama.cpp, Ollama и LM Studio.
  • Производителност: превъзхожда Mellum2 в 15 от 17 посочени бенчмарка; печели в 5 от 17 срещу Qwen3.5-9B
  • Най-добър резултат: 82.0 в LiveCodeBench v6, пред Qwen3.5-9B (75.4) и Gemma 4 E4B (69.4)
  • Най-слаб резултат: 17.4 в Terminal-Bench 2.1, под Qwen3.5-9B (21.7)
  • Извод (най-доброто): силни резултати в програмирането и висока пропускателна способност само с 2.5B активни параметъра.
  • Извод (най-слабото): все още изостава от Qwen3.5-9B при сложни агентни софтуерни задачи и задачи, изискващи знания.

Какво представлява Mellum2.1?

Mellum2.1 е следващата версия на Mellum2 Thinking, който JetBrains пусна с отворен код през юни 2026 г. Публикуваният чекпойнт е Mellum2.1-12B-A2.5B-Thinking. Това е модел за разсъждение, който извежда веригата си на мисли, преди да отговори. JetBrains го насочва към 3 приложения: агентен работник, асистент за общо разсъждение и частно внедряване на собствена инфраструктура.

Как работи архитектурата на Mellum2.1?

Моделът има 28 слоя и 64 експерта. Рутер активира 8 експерта на токен. Механизмът за внимание използва grouped-query attention с 32 заявочни глави и 4 KV глави. 3 от всеки 4 слоя използват плъзгащ се прозорец от 1 024 токена. Дължината на контекста е 131 072 токена, а речникът съдържа 98 304 токена. Теглата се предоставят във формат bfloat16.

Как е обучен Mellum2.1?

Почти цялата нова работа е вложена в дообучаването. RL премина от кратък финален етап към основна част от обучението. JetBrains добави RL задачи по математика, състезателно програмиране, наука, използване на инструменти и софтуерно инженерство. Компанията филтрира отворени RL набори от данни за повредени тестове, отговори, които не могат да бъдат проверени, както и задачи, които са твърде лесни или невъзможни. При софтуерното инженерство моделът се обучава в реални хранилища с инструменти за shell и редактиране на файлове. Той получава награда, когато тестовете преминат успешно. Обучението стартира милиони изолирани среди в хиляди среди.

Как се представя Mellum2.1 в бенчмарковете?

JetBrains оцени Mellum2.1, Mellum2, Qwen3.5-9B и Gemma 4 E4B с един и същ конвейер в режим на мислене. Всички резултати са предоставени от самия JetBrains.

Най-големият скок е при агентното програмиране. SWE-bench Verified се повиши от 2.0 на 47.0. SWE-bench Pro се повиши от 0.0 на 28.0. Terminal-Bench 2.1 се повиши от 0.6 на 17.4. Агентните изпълнения използваха конвейера с отворен код Pi v0.73.1 с контекст от 114K токена.

Mellum2.1 води групата в LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) и BFCL v4 (62.3). Qwen3.5-9B все още води в SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) и GPQA Diamond (77.8). Безопасността също се е подобрила: HarmBench спадна от 21.5 на 8.5, като по-ниската стойност е по-добра.

Важно е да се вземат предвид конвейерите. Собствената карта на Qwen посочва 65.6 в LiveCodeBench v6 и 81.7 в GPQA Diamond. JetBrains измери 75.4 и 77.8 за същия модел.

Колко бърз е Mellum2.1?

Дообучаването не промени архитектурата, така че скоростта съвпада с тази на Mellum2. При 1 H200 под сериозно натоварване JetBrains твърди, че Mellum2.1 обслужва почти 2 пъти повече токени от Qwen3.5-9B. При една заявка многотокенното предвиждане (MTP) го прави около 1.6 пъти по-бърз. Главата за MTP за спекулативно декодиране във vLLM е посочена като очаквана скоро.

Как да стартирате Mellum2.1 локално?

Пълният модел се обслужва във vLLM с --reasoning-parser qwen3. Извикването на инструменти добавя --enable-auto-tool-choice --tool-call-parser hermes. JetBrains препоръчва temperature 0.6, top_p 0.95 и top_k 20.

Бележките към версията на JetBrains споменават, че GGUF версиите са в процес на разработка. Вече съществуващо GGUF хранилище вече съдържа 5 файла:

  • BF16: 24.3 GB (референтен вариант)
  • Q8_0: 12.9 GB, 96.1% съвпадение на водещия токен
  • Q6_K: 10.9 GB, 93.9% съвпадение на водещия токен
  • Q4_K_M: 8.1 GB, 88.0% съвпадение на водещия токен (препоръчва се)
  • MXFP4_MOE: 7.0 GB, 85.6% съвпадение на водещия токен

Mellum2.1 срещу Qwen3.5-9B срещу Gemma 4 E4B

ХарактеристикаMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
АрхитектураMoE, 64 експерта, 8 активниMoE (същата като при 2.1)Hybrid Gated DeltaNet + gated attentionПлътна, с вграждания на ниво слой
Общо параметри12B12B9B (езиков модел)8B с вграждания
Активни / ефективни параметри2.5B активни2.5B активни9B (плътен модел)4.5B ефективни
Контекст131 072131 072262 144 нативно, до 1 010 000128K
МодалностТекстТекстТекст, изображения, видеоТекст, изображения, аудио
ЛицензApache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
Terminal-Bench 2.1*17.40.621.73.4
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1
AIME 25/26*83.360.186.745.0

*Редове за бенчмаркове: общият конвейер на JetBrains, режим на мислене, от картата на модела Mellum2.1. Собствените карти на производителите посочват различни числа за Qwen3.5-9B и Gemma 4 E4B.

Основни изводи

  • Mellum2.1 е мислещ MoE модел с 12B параметъра и 2.5B активни параметъра, разпространяван под Apache 2.0.
  • RL в реални хранилища повиши резултата в SWE-bench Verified от 2.0 на 47.0.
  • Той води тестваната група в LiveCodeBench v6 (82.0) и BFCL v4 (62.3).
  • Qwen3.5-9B все още печели в SWE-bench Pro, GPQA Diamond и AIME.
  • GGUF с размер от 7.0 GB до 8.1 GB прави локалните подагенти за програмиране практични.

Разгледайте теглата на модела, GGUF версиите, техническия блог и техническия доклад за Mellum2. Всички заслуги принадлежат на изследователя по този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини