Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← К новостям

Aleph Alpha выпустила Kolibri: англо-немецкая MoE-модель с открытыми весами на 78,1 млрд параметров и лишь 3,46 млрд активных параметров

Aleph Alpha выпустила Kolibri — языковую модель Mixture-of-Experts (MoE) с открытыми весами, созданную для немецкого и английского языков. Kolibri содержит 78,1 млрд параметров, но активирует только 3,46 млрд, то есть 4,4%, на каждый токен. Модель поддерживает контекст длиной до 1 048 576 токенов, позволяет задавать интенсивность рассуждений для каждого запроса и распространяется по лицензии Apache 2.0 на платформе Hugging Face. Цель проекта — обеспечить суверенное развёртывание в регулируемых секторах, таких как государственное управление, промышленность и аэрокосмическая отрасль.

Можно ли её развернуть? Да. Контрольная точка FP8 занимает около 78 ГБ и работает на одном B200, B300 или H200 либо на 2 графических процессорах H100 SXM5, обслуживаясь через vLLM с выделенными парсерами рассуждений и вызовов инструментов Kolibri.

Что такое Kolibri?

Kolibri (Kolibri-1) — двуязычный англо-немецкий трансформер MoE, полностью разработанный командами в Германии. Согласно техническому исследовательскому отчёту, команда Aleph Alpha контролировала весь конвейер: данные, архитектуру, инфраструктуру обучения, дообучение и оценку. Обучение проводилось на инфраструктуре в Германии и Финляндии. Архитектура ориентирована на соблюдение Общего кодекса практик ЕС в области ИИ, Закона ЕС об ИИ и GDPR. Aleph Alpha подписала этот Кодекс, а её конвейер обработки данных удаляет персональные данные до начала обучения.

Архитектура: разреженные эксперты и гибридное внимание

Kolibri состоит из 50 блоков трансформера с шириной модели 2 560. Каждый слой MoE оценивает все 384 маршрутизируемых эксперта с помощью маршрутизатора на основе сигмоиды, направляет каждый токен к 6 лучшим экспертам и всегда задействует 1 общего эксперта. Нагрузка экспертов балансируется с помощью Exact Quantile Balancing и Load-Error Injection.

В механизме внимания используется grouped-query attention с 48 головами запросов и 4 головами KV. Каждый пятый блок использует полное внимание без позиционного кодирования. Остальные 40 блоков используют внимание со скользящим окном по 512 предшествующим токенам и RoPE. В слоях со скользящим окном используется KV-кэш фиксированного размера, поэтому с увеличением длины контекста растут только 10 слоёв. При одинаковых вычислительных затратах команда Aleph Alpha сообщает, что гибридная архитектура поддерживает последовательности в 4 раза длиннее, чем модель с полным вниманием.

Токенизатор, созданный для немецкого языка

Словарь размером 128 000 токенов обучен с помощью UniBPE, который формирует слияния, как BPE, но оценивает каждое слияние по потерям Unigram. На немецких текстах он достигает показателя 4,90 байта на токен против 4,35 у токенизатора GPT-5. Это означает на 11,2% меньше токенов в немецких веб-текстах. В английском языке Kolibri достигает 4,58 байта на токен против 4,67 у GPT-5.

Обучение: 24 трлн токенов, затем SFT и RL

Предварительное обучение охватило 20 трлн токенов на 768 графических процессорах NVIDIA B200, после чего последовал этап промежуточного обучения на 3,44 трлн токенов с длиной последовательности 65 536. Затем этап работы с длинным контекстом на 201 млрд токенов проходил на последовательностях длиной 262 144 токена. Aleph Alpha добавила более 2 трлн немецких токенов, отобранных из интернета или сгенерированных синтетически. Постобучение сочетало supervised fine-tuning с использованием MergeMix и обучение с подкреплением на более чем 1,2 млн внутренних задач. Протокол Merlin-Arthur обучает модель воздерживаться от ответа, если извлечённый контекст не подтверждает его.

Интерактивное объяснение: как работает Kolibri

Результаты тестирования

Команда Aleph Alpha оценивала каждую модель с использованием одинаковой конфигурации eval-framework. В английском языке Kolibri лидирует в GPQA Diamond (84,3), AIME 2025 (96,9) и AIME 2026 (96,0). В среднем показателе для агентных задач на английском языке она сравнялась с Qwen3.5 35B-A3B, набрав 63,4. В BFCL v4 модель уступает, набирая 61,4 против 70,5 у Qwen3.5. Плотная модель Qwen3.8 27B в целом набирает больше (80,2 для EN, 79,9 для DE), но активирует примерно в 8 раз больше параметров на токен. По сравнению со своей предшественницей Kolibri Origin, Kolibri декодирует примерно в 2,7 раза больше текста на один графический процессор, набирая при этом на 21,4 балла больше в английском языке.

Kolibri против ближайших конкурентов

ХарактеристикаKolibri-1Qwen3.6 35B-A3BNemotron 3 SuperMistral Small 4
РазработчикAleph Alpha (Германия)Alibaba QwenNVIDIAMistral AI (Франция)
Всего / активных параметров78,1 млрд / 3,46 млрд~35 млрд / 3 млрд120 млрд / 12 млрд119 млрд / 6,5 млрд
АрхитектураMoE, скользящее окно + полное вниманиеMoE, гибрид Gated DeltaNetMamba-2 + MoE + вниманиеMoE
Максимальный контекст1 048 576 токенов262 144 нативно, ~1 млн с YaRN1 млн токенов256 тыс. токенов
Управление рассужденияминет / низкий / средний / высокийМышление вкл. / выкл.Вкл. / выкл., режим с низкой интенсивностьюнет / высокий
ЛицензияApache 2.0Apache 2.0NVIDIA Nemotron Open Model LicenseApache 2.0
Общий балл (EN / DE)75,5 / 70,871,4 / 67,373,0 / 67,963,1 / 61,4
Средний показатель для агентных задач (EN)63,462,154,940,7
Средний показатель Industry RAG (DE)67,565,857,653,4
Средний показатель по программированию (EN)89,387,788,382,0

Характеристики: карточки моделей Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super и Mistral Small 4.

Как развернуть Kolibri

Установите пакет aleph-alpha-inference, затем запустите обслуживание через vLLM:

Копировать кодСкопированоИспользуйте другой браузер
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

По умолчанию контекст составляет 262 144 токена. Передайте --max-model-len 1048576 вместе с переопределением max_position_embeddings, чтобы использовать окно размером 1 млн токенов. Задайте reasoning_effort через chat_template_kwargs. Aleph Alpha рекомендует temperature 1.0, top-p 0.97 и top-k 128.

Основные выводы

  • Всего 78,1 млрд параметров, активных — 3,46 млрд: каждый токен использует 6 из 384 маршрутизируемых экспертов и 1 общего эксперта.
  • 40 слоёв со скользящим окном и 10 слоёв с полным вниманием делают контекст длиной 1 млн токенов доступным по затратам.
  • Обучение проводилось на 24 трлн токенов, при этом доля немецкого языка в наборе превышала 20%.
  • Лучший общий результат на английском (75,5) и немецком (70,8) среди 12 моделей MoE, сравнённых Aleph Alpha.
  • Веса FP8 по лицензии Apache 2.0, модель можно запустить на одном B200 или H200 через vLLM.

Ознакомьтесь с весами модели и техническим отчётом. Вся заслуга принадлежит исследователю, работавшему над этим проектом. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости