Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

OpenBMB випустила MiniCPM5-2B: щільна модель із 2,52 млрд параметрів, що в середньому набирає 53,9 бала в 34 тестах і створена для роботи на пристрої

OpenBMB випустила MiniCPM5-2B, другу контрольну версію в серії MiniCPM5 і наступника MiniCPM5-1B. Це щільна причинна мовна модель із 2 516 756 480 параметрами, з яких 1 981 982 720 розташовані поза ембедингами. Вона використовує 42 шари, увагу з групованими запитами — 16 головок запитів і 2 головки ключів/значень — та нативне контекстне вікно на 131 072 токени. Архітектура є стандартною LlamaForCausalLM, тому основні рушії завантажують її без спеціальних ядер і без окремої версії коду моделі.

Чи придатна вона до розгортання? Так. Ваги поширюються за ліцензією Apache 2.0 і працюють через vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX та FlagOS.

Що насправді показує таблиця бенчмарків

OpenBMB порівнює MiniCPM5-2B з LFM2.5-2.6B, Qwen3.5-2B і Gemma-4-E2B-it у тому самому класі розміру, а також наводить Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it і LFM2.5-8B-A1B для довідки. У 34 рядках бенчмарків її середній результат становить 53,9. Найкращий базовий показник у цій групі має Qwen3.5-4B — 51,1, далі йдуть granite-4.2-3B із 42,7 та LFM2.5-2.6B із 33,2.

У міркуванні під час написання коду MiniCPM5-2B набирає 69,1 у LiveCodeBench v6 проти 56,4, а також 46,4 у SWE-bench Verified проти 33,6. Найбільша перевага спостерігається у використанні інструментів: 97,1 у τ²-Bench Telecom, 66,6 у BFCL v4 і 20,8 у τ³-Bench Banking проти 6,8. Результати для довгого контексту неоднозначні: 68,1 у NoLiMa проти 43,5, але 59,0 у AA-LCR проти 61,0 і 43,7 у LongBench v2 проти 47,3. Саме в загальних знаннях помітна різниця в розмірі моделей: 70,8 у MMLU-Pro проти 78,0 та 8,9 у Humanity’s Last Exam проти 9,9. OpenBMB окремо позначає рядки, дані для яких взято з Artificial Analysis, і ті, що були відтворені власними силами.

Рецепт навчання: SFT, потім RL, а потім дистиляція за власною політикою

Навчання відбувається за методом багаторівневого керування даними UltraData, описаним у оригінальному дослідженні. Базове навчання проходить у стабільній фазі та фазі спадання, після чого під час проміжного навчання модель адаптується до цільового розподілу даних. Подальше навчання починається з SFT на 400 млрд токенів для глибокого мислення, а потім спеціалізовані вчителі RL навчаються для математики, коду, агентних завдань і написання текстів за допомогою алгоритму JustRL II на основі критика.

Останній етап — дистиляція за власною політикою. OPD об’єднує 16 експертів RL, п’ять із яких є агентними, в одну готову модель. Для кожної позиції відповіді вона обчислює повну дивергенцію зворотної KL між логітами учня та вчителя як оцінку переваги, замінюючи перевагу на основі верифікації. Для дистиляції повторно використовуються запити RL, тому новий корпус не створюється. OpenBMB оцінює внесок етапів RL та OPD у 10,96 середнього бала на завданнях із міркування та загальних бенчмарках і в 6,96 бала на агентних завданнях.

Дані також відкриті

Разом із вагами OpenBMB випустила Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 із 500 тис. агентних прикладів, а також UltraData-RL-2609 із понад 80 тис. прикладів RL. Проміжні контрольні версії також опубліковані: Base, Midtrain і SFT-only, тож внесок кожного етапу можна безпосередньо виміряти.

Підсумок

MiniCPM5-2B — переконливий варіант для роботи на пристроях із агентними завданнями та викликом інструментів, але не модель для загальних знань. Її перевага найвиразніша у використанні інструментів, агентному програмуванні та пошуку в довгому контексті у стилі NoLiMa, тоді як на MMLU-Pro, GPQA-Diamond і MATH-500 вона поступається більшим моделям. Відкриті дані та проміжні контрольні версії дають змогу перевірити твердження щодо RL і OPD, що важливіше за загальний показник у заголовку.

Основні висновки

  • Щільна модель на 2,52 млрд параметрів, контекст на 131 072 токени, Apache 2.0, стандартна архітектура Llama.
  • Середній результат — 53,9 у 34 бенчмарках, що вище за 51,1 у Qwen3.5-4B.
  • Найсильніші сторони — використання інструментів, агентне програмування та пошук у довгому контексті; найслабша — загальні знання.
  • Подальше навчання поєднує 400 млрд токенів SFT із вчителями RL та дистиляцією за власною політикою.
  • Набори даних для попереднього навчання, SFT і RL випускаються разом із вагами.

Ознайомтеся з HF, репозиторієм GitHub і вебсайтом. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини