Aleph Alpha представи Kolibri: 78,1-милиарден англо-германски MoE модел с отворени тегла и само 3,46 млрд активни параметри
Aleph Alpha пусна Kolibri — езиков модел с отворени тегла и смес от експерти (MoE), създаден за немски и английски език. Kolibri има общо 78,1 млрд. параметъра, но активира само 3,46 млрд., или 4,4%, за всеки токен. Той приема контекст до 1 048 576 токена, позволява на потребителите да задават нивото на разсъждение за всяка заявка и се разпространява под лиценза Apache 2.0 в Hugging Face. Целта е суверенно внедряване в регулирани сектори като публичната администрация, индустрията и космическата промишленост.
Може ли да бъде внедрен? Да. FP8 контролният пункт е с размер около 78 GB и работи на един B200, B300 или H200, или на 2 H100 SXM5 GPU, като се обслужва чрез vLLM със специализирани парсери за разсъждение и извикване на инструменти на Kolibri.
Какво представлява Kolibri?
Kolibri (Kolibri-1) е двуезичен английско-немски MoE трансформатор, разработен изцяло от екипи в Германия. Според техническия изследователски доклад екипът на Aleph Alpha е контролирал целия процес: данните, архитектурата, инфраструктурата за обучение, дообучението и оценяването. Обучението е проведено върху инфраструктура в Германия и Финландия. Дизайнът е съобразен с Кодекса за добри практики на ЕС за модели с общо предназначение на ИИ, Закона на ЕС за ИИ и GDPR. Aleph Alpha е подписала този Кодекс, а нейният конвейер за данни премахва личните данни преди обучението.
Архитектура: разредени експерти и хибридно внимание
Kolibri включва 50 трансформаторни блока с ширина на модела 2 560. Всеки MoE слой оценява всичките 384 маршрутизирани експерти със сигмоиден маршрутизатор, изпраща всеки токен към най-добрите 6 и винаги използва 1 споделен експерт. Натоварването на експертите се балансира чрез Exact Quantile Balancing и Load-Error Injection.
Механизмът за внимание използва grouped-query attention с 48 заявкиращи глави и 4 KV глави. Всеки пети блок използва пълно внимание без позиционно кодиране. Останалите 40 блока използват внимание с плъзгащ се прозорец върху предходните 512 токена, с RoPE. Слоевете с плъзгащ се прозорец поддържат KV кеш с фиксиран размер, така че само 10 слоя се разрастват с дължината на контекста. При еднакъв изчислителен ресурс екипът на Aleph Alpha съобщава, че хибридният модел поддържа последователности 4 пъти по-дълги от модел с пълно внимание.
Токенизатор, създаден за немски език
Речникът от 128 000 токена е обучен с UniBPE, който създава сли merge като BPE, но оценява всяко сливане чрез загубата на Unigram. При текст на немски език той достига 4,90 байта на токен спрямо 4,35 за токенизатора GPT-5. Това означава 11,2% по-малко токени при немски уеб текст. На английски Kolibri достига 4,58 байта на токен спрямо 4,67 за GPT-5.
Обучение: 24 трлн. токена, последвани от SFT и RL
Предварителното обучение обхваща 20 трлн. токена върху 768 NVIDIA B200 GPU, последвано от междинно обучение с 3,44 трлн. токена при дължина на последователността 65 536. След това етап с дълъг контекст от 201 млрд. токена е обучен върху последователности от 262 144 токена. Aleph Alpha е добавила над 2 трлн. немски токена, подбрани от интернет или генерирани синтетично. Дообучението комбинира контролирано фино настройване, смесено с MergeMix, с обучение с подсилване върху повече от 1,2 млн. вътрешни задачи. Протоколът Merlin-Arthur обучава модела да се въздържа от отговор, когато извлеченият контекст не го подкрепя.
Интерактивно обяснение: как работи Kolibri
Бенчмаркове
Екипът на Aleph Alpha е оценил всеки модел с една и съща конфигурация на eval-framework. На английски Kolibri води в GPQA Diamond (84,3), AIME 2025 (96,9) и AIME 2026 (96,0). Той е наравно с Qwen3.5 35B-A3B по средния резултат за агентни задачи на английски — 63,4. Изостава при BFCL v4, като постига 61,4 спрямо 70,5 за Qwen3.5. Плътният Qwen3.8 27B постига по-висок общ резултат (80,2 EN, 79,9 DE), но активира около 8 пъти повече параметри за токен. Спрямо вътрешния си предшественик Kolibri Origin Kolibri декодира около 2,7 пъти повече текст на GPU, като същевременно постига с 21,4 точки по-висок резултат на английски.
Kolibri спрямо най-близките конкуренти
| Характеристика | Kolibri-1 | Qwen3.6 35B-A3B | Nemotron 3 Super | Mistral Small 4 |
|---|---|---|---|---|
| Разработчик | Aleph Alpha (Германия) | Alibaba Qwen | NVIDIA | Mistral AI (Франция) |
| Общо / активни параметри | 78,1 млрд. / 3,46 млрд. | ~35 млрд. / 3 млрд. | 120 млрд. / 12 млрд. | 119 млрд. / 6,5 млрд. |
| Архитектура | MoE, внимание с плъзгащ се прозорец + пълно внимание | MoE, хибрид Gated DeltaNet | Mamba-2 + MoE + внимание | MoE |
| Максимален контекст | 1 048 576 токена | 262 144 нативно, ~1 млн. с YaRN | 1 млн. токена | 256 хил. токена |
| Контрол на разсъждението | няма / ниско / средно / високо | Мисленето включено / изключено | Включено / изключено, режим с ниско усилие | няма / високо |
| Лиценз | Apache 2.0 | Apache 2.0 | NVIDIA Nemotron Open Model License | Apache 2.0 |
| Общ резултат (EN / DE) | 75,5 / 70,8 | 71,4 / 67,3 | 73,0 / 67,9 | 63,1 / 61,4 |
| Среден резултат за агентни задачи (EN) | 63,4 | 62,1 | 54,9 | 40,7 |
| Среден резултат за индустриален RAG (DE) | 67,5 | 65,8 | 57,6 | 53,4 |
| Среден резултат за кодиране (EN) | 89,3 | 87,7 | 88,3 | 82,0 |
Спецификации: картите на моделите за Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super и Mistral Small 4.
Как да внедрите Kolibri
Инсталирайте пакета aleph-alpha-inference, след което го стартирайте с vLLM:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 --tool-call-parser kolibri1 \
--enable-auto-tool-choiceКонтекстът по подразбиране е 262 144 токена. Подайте --max-model-len 1048576 с override на max_position_embeddings за пълния прозорец от 1 млн. токена. Задайте reasoning_effort чрез chat_template_kwargs. Aleph Alpha препоръчва temperature 1,0, top-p 0,97 и top-k 128.
Основни изводи
- 78,1 млрд. общо, 3,46 млрд. активни: всеки токен използва 6 от 384 маршрутизирани експерти плюс 1 споделен експерт.
- 40 слоя с плъзгащ се прозорец и 10 слоя с пълно внимание поддържат контекст от 1 млн. токена на приемлива цена.
- Обучен върху 24 трлн. токена, като немският език съставлява над 20% от набора.
- Най-висок общ резултат на английски (75,5) и немски (70,8) сред 12-те MoE модела, сравнени от Aleph Alpha.
- FP8 тегла под лиценз Apache 2.0, които могат да се обслужват на един B200 или H200 чрез vLLM.
Разгледайте теглата на модела и техническия доклад. Всички заслуги са на изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.