Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← Към новините

Aleph Alpha представи Kolibri: 78,1-милиарден англо-германски MoE модел с отворени тегла и само 3,46 млрд активни параметри

Aleph Alpha пусна Kolibri — езиков модел с отворени тегла и смес от експерти (MoE), създаден за немски и английски език. Kolibri има общо 78,1 млрд. параметъра, но активира само 3,46 млрд., или 4,4%, за всеки токен. Той приема контекст до 1 048 576 токена, позволява на потребителите да задават нивото на разсъждение за всяка заявка и се разпространява под лиценза Apache 2.0 в Hugging Face. Целта е суверенно внедряване в регулирани сектори като публичната администрация, индустрията и космическата промишленост.

Може ли да бъде внедрен? Да. FP8 контролният пункт е с размер около 78 GB и работи на един B200, B300 или H200, или на 2 H100 SXM5 GPU, като се обслужва чрез vLLM със специализирани парсери за разсъждение и извикване на инструменти на Kolibri.

Какво представлява Kolibri?

Kolibri (Kolibri-1) е двуезичен английско-немски MoE трансформатор, разработен изцяло от екипи в Германия. Според техническия изследователски доклад екипът на Aleph Alpha е контролирал целия процес: данните, архитектурата, инфраструктурата за обучение, дообучението и оценяването. Обучението е проведено върху инфраструктура в Германия и Финландия. Дизайнът е съобразен с Кодекса за добри практики на ЕС за модели с общо предназначение на ИИ, Закона на ЕС за ИИ и GDPR. Aleph Alpha е подписала този Кодекс, а нейният конвейер за данни премахва личните данни преди обучението.

Архитектура: разредени експерти и хибридно внимание

Kolibri включва 50 трансформаторни блока с ширина на модела 2 560. Всеки MoE слой оценява всичките 384 маршрутизирани експерти със сигмоиден маршрутизатор, изпраща всеки токен към най-добрите 6 и винаги използва 1 споделен експерт. Натоварването на експертите се балансира чрез Exact Quantile Balancing и Load-Error Injection.

Механизмът за внимание използва grouped-query attention с 48 заявкиращи глави и 4 KV глави. Всеки пети блок използва пълно внимание без позиционно кодиране. Останалите 40 блока използват внимание с плъзгащ се прозорец върху предходните 512 токена, с RoPE. Слоевете с плъзгащ се прозорец поддържат KV кеш с фиксиран размер, така че само 10 слоя се разрастват с дължината на контекста. При еднакъв изчислителен ресурс екипът на Aleph Alpha съобщава, че хибридният модел поддържа последователности 4 пъти по-дълги от модел с пълно внимание.

Токенизатор, създаден за немски език

Речникът от 128 000 токена е обучен с UniBPE, който създава сли merge като BPE, но оценява всяко сливане чрез загубата на Unigram. При текст на немски език той достига 4,90 байта на токен спрямо 4,35 за токенизатора GPT-5. Това означава 11,2% по-малко токени при немски уеб текст. На английски Kolibri достига 4,58 байта на токен спрямо 4,67 за GPT-5.

Обучение: 24 трлн. токена, последвани от SFT и RL

Предварителното обучение обхваща 20 трлн. токена върху 768 NVIDIA B200 GPU, последвано от междинно обучение с 3,44 трлн. токена при дължина на последователността 65 536. След това етап с дълъг контекст от 201 млрд. токена е обучен върху последователности от 262 144 токена. Aleph Alpha е добавила над 2 трлн. немски токена, подбрани от интернет или генерирани синтетично. Дообучението комбинира контролирано фино настройване, смесено с MergeMix, с обучение с подсилване върху повече от 1,2 млн. вътрешни задачи. Протоколът Merlin-Arthur обучава модела да се въздържа от отговор, когато извлеченият контекст не го подкрепя.

Интерактивно обяснение: как работи Kolibri

Бенчмаркове

Екипът на Aleph Alpha е оценил всеки модел с една и съща конфигурация на eval-framework. На английски Kolibri води в GPQA Diamond (84,3), AIME 2025 (96,9) и AIME 2026 (96,0). Той е наравно с Qwen3.5 35B-A3B по средния резултат за агентни задачи на английски — 63,4. Изостава при BFCL v4, като постига 61,4 спрямо 70,5 за Qwen3.5. Плътният Qwen3.8 27B постига по-висок общ резултат (80,2 EN, 79,9 DE), но активира около 8 пъти повече параметри за токен. Спрямо вътрешния си предшественик Kolibri Origin Kolibri декодира около 2,7 пъти повече текст на GPU, като същевременно постига с 21,4 точки по-висок резултат на английски.

Kolibri спрямо най-близките конкуренти

ХарактеристикаKolibri-1Qwen3.6 35B-A3BNemotron 3 SuperMistral Small 4
РазработчикAleph Alpha (Германия)Alibaba QwenNVIDIAMistral AI (Франция)
Общо / активни параметри78,1 млрд. / 3,46 млрд.~35 млрд. / 3 млрд.120 млрд. / 12 млрд.119 млрд. / 6,5 млрд.
АрхитектураMoE, внимание с плъзгащ се прозорец + пълно вниманиеMoE, хибрид Gated DeltaNetMamba-2 + MoE + вниманиеMoE
Максимален контекст1 048 576 токена262 144 нативно, ~1 млн. с YaRN1 млн. токена256 хил. токена
Контрол на разсъждениетоняма / ниско / средно / високоМисленето включено / изключеноВключено / изключено, режим с ниско усилиеняма / високо
ЛицензApache 2.0Apache 2.0NVIDIA Nemotron Open Model LicenseApache 2.0
Общ резултат (EN / DE)75,5 / 70,871,4 / 67,373,0 / 67,963,1 / 61,4
Среден резултат за агентни задачи (EN)63,462,154,940,7
Среден резултат за индустриален RAG (DE)67,565,857,653,4
Среден резултат за кодиране (EN)89,387,788,382,0

Спецификации: картите на моделите за Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super и Mistral Small 4.

Как да внедрите Kolibri

Инсталирайте пакета aleph-alpha-inference, след което го стартирайте с vLLM:

Копиране на кодаКодът е копиранИзползвайте друг браузър
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Контекстът по подразбиране е 262 144 токена. Подайте --max-model-len 1048576 с override на max_position_embeddings за пълния прозорец от 1 млн. токена. Задайте reasoning_effort чрез chat_template_kwargs. Aleph Alpha препоръчва temperature 1,0, top-p 0,97 и top-k 128.

Основни изводи

  • 78,1 млрд. общо, 3,46 млрд. активни: всеки токен използва 6 от 384 маршрутизирани експерти плюс 1 споделен експерт.
  • 40 слоя с плъзгащ се прозорец и 10 слоя с пълно внимание поддържат контекст от 1 млн. токена на приемлива цена.
  • Обучен върху 24 трлн. токена, като немският език съставлява над 20% от набора.
  • Най-висок общ резултат на английски (75,5) и немски (70,8) сред 12-те MoE модела, сравнени от Aleph Alpha.
  • FP8 тегла под лиценз Apache 2.0, които могат да се обслужват на един B200 или H200 чрез vLLM.

Разгледайте теглата на модела и техническия доклад. Всички заслуги са на изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини