Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

OpenBMB выпустила MiniCPM5-2B: плотная модель с 2,52 млрд параметров, набирающая в среднем 53,9 балла в 34 тестах и предназначенная для работы на устройстве

OpenBMB выпустила MiniCPM5-2B — второй чекпойнт в серии MiniCPM5 и продолжение MiniCPM5-1B. Это плотная авторегрессионная языковая модель с 2 516 756 480 параметрами, из которых 1 981 982 720 находятся за пределами эмбеддингов. Она использует 42 слоя, внимание с группированными запросами (grouped-query attention) с 16 головами запросов и 2 головами ключей/значений, а также нативное контекстное окно размером 131 072 токена. Архитектура представляет собой стандартную LlamaForCausalLM, поэтому основные движки загружают её без пользовательских ядер и отдельной версии кода модели.

Можно ли её развернуть? Да. Веса распространяются по лицензии Apache 2.0 и работают через vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX и FlagOS.

Что на самом деле показывает таблица бенчмарков

OpenBMB сравнивает MiniCPM5-2B с LFM2.5-2.6B, Qwen3.5-2B и Gemma-4-E2B-it в том же размерном классе, а также приводит для справки Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it и LFM2.5-8B-A1B. В 34 строках бенчмарков её средний результат составляет 53,9. Лучший базовый показатель в этом наборе у Qwen3.5-4B — 51,1, далее следуют granite-4.2-3B с 42,7 и LFM2.5-2.6B с 33,2.

В задачах рассуждения при написании кода MiniCPM5-2B набирает 69,1 против 56,4 на LiveCodeBench v6 и 46,4 против 33,6 на SWE-bench Verified. Наибольшая разница наблюдается в использовании инструментов: 97,1 против 6,8 на τ²-Bench Telecom, 66,6 на BFCL v4 и 20,8 против 6,8 на τ³-Bench Banking. Результаты для длинного контекста неоднозначны: 68,1 против 43,5 на NoLiMa, но 59,0 против 61,0 на AA-LCR и 43,7 против 47,3 на LongBench v2. Именно в общих знаниях проявляется разница в размере: 70,8 против 78,0 на MMLU-Pro и 8,9 против 9,9 на Humanity’s Last Exam. OpenBMB отдельно отмечает строки, основанные на данных Artificial Analysis, и строки, воспроизведённые внутри компании.

Рецепт обучения: SFT, затем RL, затем дистилляция на данных собственного распределения

Обучение следует методу управления многоуровневыми данными UltraData, описанному в оригинальном исследовании. Базовое обучение проходит в стабильной фазе и фазе затухания, после чего на этапе промежуточного обучения модель адаптируется к целевому распределению данных. Постобучение начинается с SFT на 400 млрд токенов для глубокого мышления, затем обучаются специализированные учителя RL для математики, программирования, агентных задач и написания текстов с использованием алгоритма JustRL II на основе критика.

Финальный этап — дистилляция на данных собственного распределения. OPD объединяет 16 экспертов RL, пять из которых специализируются на агентных задачах, в одну выпускаемую модель. На каждой позиции ответа вычисляется полная обратная KL-дивергенция по словарю между логитами ученика и учителя в качестве оценки преимущества, заменяющая преимущество на основе верификации. Для дистилляции повторно используются промпты RL, поэтому новый корпус не создаётся. OpenBMB оценивает прирост от этапов RL и OPD в среднем в 10,96 балла на задачах рассуждения и общих бенчмарках и в 6,96 балла на агентных задачах.

Данные тоже открыты

Вместе с весами OpenBMB выпустила Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 с 500 тыс. агентных примеров и UltraData-RL-2609 более чем с 80 тыс. примеров RL. Также опубликованы промежуточные чекпойнты, охватывающие этапы Base, Midtrain и только SFT, поэтому вклад каждого этапа можно измерить напрямую.

Итоги

MiniCPM5-2B — достойный вариант для устройств с ограниченными ресурсами в задачах, связанных с агентами и вызовом инструментов, но не модель для общих знаний. Её преимущество особенно заметно в использовании инструментов, программных агентах и поиске в длинном контексте в стиле NoLiMa, однако на MMLU-Pro, GPQA-Diamond и MATH-500 она уступает более крупным моделям. Открытые данные и промежуточные чекпойнты позволяют проверить заявления о сочетании RL и OPD, что важнее рекламного среднего показателя.

Ключевые выводы

  • Плотная модель с 2,52 млрд параметров, контекстом на 131 072 токена, лицензией Apache 2.0 и стандартной архитектурой Llama.
  • Средний результат — 53,9 в 34 бенчмарках, выше, чем у Qwen3.5-4B с результатом 51,1.
  • Лучшие результаты — в использовании инструментов, программных агентах и поиске в длинном контексте; слабейшие — в знаниях.
  • Постобучение объединяет 400 млрд токенов SFT с учителями RL и дистилляцией на данных собственного распределения.
  • Наборы данных для предварительного обучения, SFT и RL публикуются вместе с весами.

Посмотрите HF, репозиторий GitHub и сайт. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости