Sakhanda Wire
NVDA $229.57 -0.39% MSFT $534.30 +2.24% GOOGL $351.78 +1.00% META $722.98 +0.29% AMZN $260.18 +2.41%
← До новин

JetBrains представила Mellum2.1: відкриту MoE-модель на 12 млрд параметрів для агентів програмування

JetBrains випустила Mellum2.1 — відкриту модель, створену для агентів програмування та швидких субагентів. Mellum2.1 — це мисленнєва модель із сумішшю експертів на 12B параметрів від JetBrains, яка активує 2,5B параметрів на токен. Вона доступна за ліцензією Apache 2.0 на Hugging Face. Архітектура не змінилася порівняно з Mellum2. Оновлення майже повністю забезпечене навчанням із підкріпленням (RL) у реальних програмних середовищах. У результаті отримано невелику модель, яку можна розгортати самостійно: вона досліджує репозиторій, редагує файли та перевіряє власні зміни.

Коротко

  • Розмір: 12B загалом, 2,5B активних (64 експерти, 8 активних), контекст на 131 072 токени
  • Працює на: ваших власних GPU через vLLM або SGLang (швидкість протестовано на 1 NVIDIA H200). Збірки GGUF починаються від 7,0 ГБ для llama.cpp, Ollama та LM Studio.
  • Продуктивність: перевершує Mellum2 у 15 із 17 зазначених бенчмарків; перемагає Qwen3.5-9B у 5 із 17
  • Найкращий результат: 82,0 у LiveCodeBench v6, попереду Qwen3.5-9B (75,4) і Gemma 4 E4B (69,4)
  • Найгірший результат: 17,4 у Terminal-Bench 2.1, нижче за Qwen3.5-9B (21,7)
  • Підсумок (найкраще): високі результати в програмуванні та висока пропускна здатність лише з 2,5B активних параметрів.
  • Підсумок (найгірше): усе ще поступається Qwen3.5-9B у складних агентних програмних завданнях і знаннях.

Що таке Mellum2.1?

Mellum2.1 — це наступна версія Mellum2 Thinking, яку JetBrains відкрила у червні 2026 року. Опублікований чекпойнт — Mellum2.1-12B-A2.5B-Thinking. Це модель міркування, яка перед відповіддю видає свій ланцюжок міркувань. JetBrains орієнтує її на 3 способи використання: агент-робітник, універсальний помічник із міркувань і приватне самостійне розгортання.

Як працює архітектура Mellum2.1?

Модель має 28 шарів і 64 експерти. Маршрутизатор активує 8 експертів на токен. У механізмі уваги використовується увага з групованими запитами: 32 голови запитів і 4 голови KV. У 3 із кожних 4 шарів використовується ковзне вікно на 1 024 токени. Довжина контексту становить 131 072 токени, а словник має 98 304 токени. Ваги постачаються у форматі bfloat16.

Як навчали Mellum2.1?

Майже вся нова робота була зосереджена на донавчанні. RL перейшло з короткого фінального етапу до основної частини навчання. JetBrains додала завдання RL із математики, змагального програмування, науки, використання інструментів і програмної інженерії. Компанія відфільтрувала відкриті набори даних RL, вилучивши зламані тести, відповіді, які неможливо перевірити, а також надто прості або неможливі завдання. Для програмної інженерії модель навчається в реальних репозиторіях із доступом до оболонки та інструментів редагування файлів. Вона отримує винагороду, коли тести проходять. Під час навчання було запущено мільйони ізольованих середовищ у тисячах середовищ.

Як Mellum2.1 показує себе в бенчмарках?

JetBrains оцінила Mellum2.1, Mellum2, Qwen3.5-9B і Gemma 4 E4B за допомогою одного пайплайна в режимі мислення. Усі результати самостійно оприлюднені JetBrains.

Найбільший стрибок відбувся в агентному програмуванні. Результат SWE-bench Verified зріс із 2,0 до 47,0. SWE-bench Pro зріс із 0,0 до 28,0. Terminal-Bench 2.1 зріс із 0,6 до 17,4. Для агентних запусків використовувався рушій із відкритим кодом Pi v0.73.1 із контекстом на 114 тисяч токенів.

Mellum2.1 очолює групу в LiveCodeBench v6 (82,0), HumanEval+ (91,5), MBPP+ (79,4) і BFCL v4 (62,3). Qwen3.5-9B усе ще лідирує в SWE-bench Verified (50,0), SWE-bench Pro (38,0), AIME 25/26 (86,7) і GPQA Diamond (77,8). Безпека також покращилася: показник HarmBench знизився з 21,5 до 8,5, а менше значення є кращим.

Важливо враховувати пайплайни. У власній картці Qwen зазначено 65,6 у LiveCodeBench v6 і 81,7 у GPQA Diamond. JetBrains виміряла для тієї самої моделі 75,4 і 77,8.

Наскільки швидка Mellum2.1?

Донавчання не змінило архітектуру, тож швидкість відповідає Mellum2. На 1 H200 під значним навантаженням JetBrains заявляє, що Mellum2.1 обслуговує майже вдвічі більше токенів, ніж Qwen3.5-9B. Для одного запиту багатотокенове передбачення (MTP) робить її приблизно в 1,6 раза швидшою. Головку MTP для спекулятивного декодування у vLLM обіцяють додати найближчим часом.

Як запустити Mellum2.1 локально?

Повна модель запускається у vLLM із параметром --reasoning-parser qwen3. Виклик інструментів додає --enable-auto-tool-choice --tool-call-parser hermes. JetBrains рекомендує temperature 0,6, top_p 0,95 і top_k 20.

У примітках до випуску JetBrains зазначено, що збірки GGUF перебувають у процесі підготовки. У репозиторії GGUF уже перелічено 5 файлів:

  • BF16: 24,3 ГБ (еталон)
  • Q8_0: 12,9 ГБ, 96,1% збігу топового токена
  • Q6_K: 10,9 ГБ, 93,9% збігу топового токена
  • Q4_K_M: 8,1 ГБ, 88,0% збігу топового токена (рекомендовано)
  • MXFP4_MOE: 7,0 ГБ, 85,6% збігу топового токена

Mellum2.1 проти Qwen3.5-9B і Gemma 4 E4B

ХарактеристикаMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
АрхітектураMoE, 64 експерти, 8 активнихMoE (така сама, як у 2.1)Hybrid Gated DeltaNet + gated attentionЩільна, з вбудовуваннями для кожного шару
Загальна кількість параметрів12B12B9B (мовна модель)8B із вбудовуваннями
Активні / ефективні параметри2,5B активних2,5B активних9B (щільна)4,5B ефективних
Контекст131 072131 072262 144 нативно, до 1 010 000128K
МодальністьТекстТекстТекст, зображення, відеоТекст, зображення, аудіо
ЛіцензіяApache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82,069,475,469,4
SWE-bench Verified*47,02,050,023,0
Terminal-Bench 2.1*17,40,621,73,4
BFCL v4*62,349,658,552,5
GPQA Diamond*64,651,077,853,1
AIME 25/26*83,360,186,745,0

*Рядки з бенчмарками: спільний пайплайн JetBrains, режим мислення, із картки моделі Mellum2.1. У власних картках розробники наводять інші результати для Qwen3.5-9B і Gemma 4 E4B.

Основні висновки

  • Mellum2.1 — це мисленнєва модель MoE на 12B параметрів із 2,5B активних параметрів, доступна за ліцензією Apache 2.0.
  • RL у реальних репозиторіях підвищило результат SWE-bench Verified із 2,0 до 47,0.
  • Вона очолює протестовану групу в LiveCodeBench v6 (82,0) і BFCL v4 (62,3).
  • Qwen3.5-9B усе ще перемагає в SWE-bench Pro, GPQA Diamond і AIME.
  • GGUF-версія розміром від 7,0 до 8,1 ГБ робить локальні субагенти для програмування практичними.

Перегляньте ваги моделі, збірки GGUF, технічний блог і технічний звіт Mellum2. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини