Aleph Alpha выпустила Kolibri: англо-немецкая MoE-модель с открытыми весами на 78,1 млрд параметров и лишь 3,46 млрд активных параметров
Aleph Alpha выпустила Kolibri — языковую модель Mixture-of-Experts (MoE) с открытыми весами, созданную для немецкого и английского языков. Kolibri содержит 78,1 млрд параметров, но активирует только 3,46 млрд, то есть 4,4%, на каждый токен. Модель поддерживает контекст длиной до 1 048 576 токенов, позволяет задавать интенсивность рассуждений для каждого запроса и распространяется по лицензии Apache 2.0 на платформе Hugging Face. Цель проекта — обеспечить суверенное развёртывание в регулируемых секторах, таких как государственное управление, промышленность и аэрокосмическая отрасль.
Можно ли её развернуть? Да. Контрольная точка FP8 занимает около 78 ГБ и работает на одном B200, B300 или H200 либо на 2 графических процессорах H100 SXM5, обслуживаясь через vLLM с выделенными парсерами рассуждений и вызовов инструментов Kolibri.
Что такое Kolibri?
Kolibri (Kolibri-1) — двуязычный англо-немецкий трансформер MoE, полностью разработанный командами в Германии. Согласно техническому исследовательскому отчёту, команда Aleph Alpha контролировала весь конвейер: данные, архитектуру, инфраструктуру обучения, дообучение и оценку. Обучение проводилось на инфраструктуре в Германии и Финляндии. Архитектура ориентирована на соблюдение Общего кодекса практик ЕС в области ИИ, Закона ЕС об ИИ и GDPR. Aleph Alpha подписала этот Кодекс, а её конвейер обработки данных удаляет персональные данные до начала обучения.
Архитектура: разреженные эксперты и гибридное внимание
Kolibri состоит из 50 блоков трансформера с шириной модели 2 560. Каждый слой MoE оценивает все 384 маршрутизируемых эксперта с помощью маршрутизатора на основе сигмоиды, направляет каждый токен к 6 лучшим экспертам и всегда задействует 1 общего эксперта. Нагрузка экспертов балансируется с помощью Exact Quantile Balancing и Load-Error Injection.
В механизме внимания используется grouped-query attention с 48 головами запросов и 4 головами KV. Каждый пятый блок использует полное внимание без позиционного кодирования. Остальные 40 блоков используют внимание со скользящим окном по 512 предшествующим токенам и RoPE. В слоях со скользящим окном используется KV-кэш фиксированного размера, поэтому с увеличением длины контекста растут только 10 слоёв. При одинаковых вычислительных затратах команда Aleph Alpha сообщает, что гибридная архитектура поддерживает последовательности в 4 раза длиннее, чем модель с полным вниманием.
Токенизатор, созданный для немецкого языка
Словарь размером 128 000 токенов обучен с помощью UniBPE, который формирует слияния, как BPE, но оценивает каждое слияние по потерям Unigram. На немецких текстах он достигает показателя 4,90 байта на токен против 4,35 у токенизатора GPT-5. Это означает на 11,2% меньше токенов в немецких веб-текстах. В английском языке Kolibri достигает 4,58 байта на токен против 4,67 у GPT-5.
Обучение: 24 трлн токенов, затем SFT и RL
Предварительное обучение охватило 20 трлн токенов на 768 графических процессорах NVIDIA B200, после чего последовал этап промежуточного обучения на 3,44 трлн токенов с длиной последовательности 65 536. Затем этап работы с длинным контекстом на 201 млрд токенов проходил на последовательностях длиной 262 144 токена. Aleph Alpha добавила более 2 трлн немецких токенов, отобранных из интернета или сгенерированных синтетически. Постобучение сочетало supervised fine-tuning с использованием MergeMix и обучение с подкреплением на более чем 1,2 млн внутренних задач. Протокол Merlin-Arthur обучает модель воздерживаться от ответа, если извлечённый контекст не подтверждает его.
Интерактивное объяснение: как работает Kolibri
Результаты тестирования
Команда Aleph Alpha оценивала каждую модель с использованием одинаковой конфигурации eval-framework. В английском языке Kolibri лидирует в GPQA Diamond (84,3), AIME 2025 (96,9) и AIME 2026 (96,0). В среднем показателе для агентных задач на английском языке она сравнялась с Qwen3.5 35B-A3B, набрав 63,4. В BFCL v4 модель уступает, набирая 61,4 против 70,5 у Qwen3.5. Плотная модель Qwen3.8 27B в целом набирает больше (80,2 для EN, 79,9 для DE), но активирует примерно в 8 раз больше параметров на токен. По сравнению со своей предшественницей Kolibri Origin, Kolibri декодирует примерно в 2,7 раза больше текста на один графический процессор, набирая при этом на 21,4 балла больше в английском языке.
Kolibri против ближайших конкурентов
| Характеристика | Kolibri-1 | Qwen3.6 35B-A3B | Nemotron 3 Super | Mistral Small 4 |
|---|---|---|---|---|
| Разработчик | Aleph Alpha (Германия) | Alibaba Qwen | NVIDIA | Mistral AI (Франция) |
| Всего / активных параметров | 78,1 млрд / 3,46 млрд | ~35 млрд / 3 млрд | 120 млрд / 12 млрд | 119 млрд / 6,5 млрд |
| Архитектура | MoE, скользящее окно + полное внимание | MoE, гибрид Gated DeltaNet | Mamba-2 + MoE + внимание | MoE |
| Максимальный контекст | 1 048 576 токенов | 262 144 нативно, ~1 млн с YaRN | 1 млн токенов | 256 тыс. токенов |
| Управление рассуждениями | нет / низкий / средний / высокий | Мышление вкл. / выкл. | Вкл. / выкл., режим с низкой интенсивностью | нет / высокий |
| Лицензия | Apache 2.0 | Apache 2.0 | NVIDIA Nemotron Open Model License | Apache 2.0 |
| Общий балл (EN / DE) | 75,5 / 70,8 | 71,4 / 67,3 | 73,0 / 67,9 | 63,1 / 61,4 |
| Средний показатель для агентных задач (EN) | 63,4 | 62,1 | 54,9 | 40,7 |
| Средний показатель Industry RAG (DE) | 67,5 | 65,8 | 57,6 | 53,4 |
| Средний показатель по программированию (EN) | 89,3 | 87,7 | 88,3 | 82,0 |
Характеристики: карточки моделей Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super и Mistral Small 4.
Как развернуть Kolibri
Установите пакет aleph-alpha-inference, затем запустите обслуживание через vLLM:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 --tool-call-parser kolibri1 \
--enable-auto-tool-choiceПо умолчанию контекст составляет 262 144 токена. Передайте --max-model-len 1048576 вместе с переопределением max_position_embeddings, чтобы использовать окно размером 1 млн токенов. Задайте reasoning_effort через chat_template_kwargs. Aleph Alpha рекомендует temperature 1.0, top-p 0.97 и top-k 128.
Основные выводы
- Всего 78,1 млрд параметров, активных — 3,46 млрд: каждый токен использует 6 из 384 маршрутизируемых экспертов и 1 общего эксперта.
- 40 слоёв со скользящим окном и 10 слоёв с полным вниманием делают контекст длиной 1 млн токенов доступным по затратам.
- Обучение проводилось на 24 трлн токенов, при этом доля немецкого языка в наборе превышала 20%.
- Лучший общий результат на английском (75,5) и немецком (70,8) среди 12 моделей MoE, сравнённых Aleph Alpha.
- Веса FP8 по лицензии Apache 2.0, модель можно запустить на одном B200 или H200 через vLLM.
Ознакомьтесь с весами модели и техническим отчётом. Вся заслуга принадлежит исследователю, работавшему над этим проектом. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.