OpenBMB пуска MiniCPM5-2B: плътен модел с 2,52 млрд. параметъра, постигащ средно 53,9 точки в 34 теста и създаден за работа на устройство
OpenBMB пусна MiniCPM5-2B — втората контролна точка от серията MiniCPM5 и продължение на MiniCPM5-1B. Това е плътен каузален езиков модел с 2 516 756 480 параметъра, от които 1 981 982 720 са извън embedding-ите. Използва 42 слоя, внимание с групирани заявки с 16 глави за заявки и 2 глави за ключове/стойности, както и нативен контекстен прозорец от 131 072 токена. Архитектурата е стандартна LlamaForCausalLM, така че основните енджини го зареждат без персонализирани ядра и без отделен форк на кода на модела.
Може ли да бъде внедрен? Да. Теглата са под лиценз Apache 2.0 и работят чрез vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX и FlagOS.
Какво всъщност показва таблицата с бенчмарковете
OpenBMB сравнява MiniCPM5-2B с LFM2.5-2.6B, Qwen3.5-2B и Gemma-4-E2B-it в същия размерен клас и включва Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it и LFM2.5-8B-A1B за справка. В 34-те реда с бенчмаркове средният му резултат е 53.9. Най-добрият базов модел в този набор е Qwen3.5-4B с 51.1, следван от granite-4.2-3B с 42.7 и LFM2.5-2.6B с 33.2.
При разсъжденията върху код MiniCPM5-2B постига 69.1 на LiveCodeBench v6 спрямо 56.4 и 46.4 на SWE-bench Verified спрямо 33.6. Използването на инструменти показва най-голямата разлика: 97.1 на τ²-Bench Telecom, 66.6 на BFCL v4 и 20.8 на τ³-Bench Banking спрямо 6.8. Резултатите при дълъг контекст са смесени — 68.1 на NoLiMa спрямо 43.5, но 59.0 на AA-LCR спрямо 61.0 и 43.7 на LongBench v2 спрямо 47.3. Общите знания са областта, в която се проявява разликата в размера: 70.8 на MMLU-Pro спрямо 78.0 и 8.9 на Humanity’s Last Exam спрямо 9.9. OpenBMB обозначава отделно редовете, чиито данни са взети от Artificial Analysis, и тези, възпроизведени вътрешно.
Рецепта за обучение: SFT, след това RL, а после дистилация на база on-policy данни
Обучението следва метода за йерархично управление на данни UltraData, описан в оригиналното изследване. Базовото обучение преминава през стабилна фаза и фаза на затихване, след което междинното обучение адаптира модела към целевото разпределение на данните. Дообучението започва с 400 млрд. токена SFT за задълбочено разсъждение, след което се обучават специализирани RL учители за математика, код, агентни задачи и писане чрез алгоритъма JustRL II, базиран на критик.
Последната стъпка е дистилация на база on-policy данни. OPD обединява 16 RL експерта, петима от които са агентни, в единен модел, който се предоставя на потребителите. За всяка позиция в отговора той изчислява пълната обратна KL дивергенция върху речника между логитите на ученика и учителя като оценка на предимството, заменяйки предимството, базирано на верификация. Използва повторно RL подсказките като данни за дистилация, така че не се създава нов корпус. OpenBMB измерва подобрението от етапа RL плюс OPD на средно 10.96 точки при бенчмарковете за разсъждение и общи способности и 6.96 точки при агентните бенчмаркове.
Данните също са отворени
Наред с теглата OpenBMB пусна Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 с 500 хил. агентни примера и UltraData-RL-2609 с над 80 хил. RL примера. Публикувани са и междинни контролни точки, обхващащи Base, Midtrain и само SFT, така че приносът на всеки етап може да бъде измерен директно.
Обобщение
MiniCPM5-2B е убедителна опция за устройства с ограничени ресурси при агентни задачи и извикване на инструменти, но не е модел за общи знания. Предимството му е най-ясно при използването на инструменти, кодиращите агенти и извличането на информация от дълъг контекст в стил NoLiMa, а изостава от по-големите модели при MMLU-Pro, GPQA-Diamond и MATH-500. Отворените данни и междинните контролни точки правят твърдението за RL плюс OPD проверимо, което е по-важно от водещата средна стойност.
Основни изводи
- Плътен модел с 2.52 млрд. параметъра, контекст от 131 072 токена, лиценз Apache 2.0 и стандартна Llama архитектура.
- Среден резултат 53.9 в 34 бенчмарка, пред Qwen3.5-4B с 51.1.
- Най-силен при използването на инструменти, кодиращите агенти и извличането от дълъг контекст; най-слаб при знанията.
- Дообучаването съчетава 400 млрд. SFT токена с RL учители и on-policy дистилация.
- Наборите от данни за предварително обучение, SFT и RL се предоставят заедно с теглата.
Разгледайте HF, GitHub хранилището и уебсайта. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.