Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← До новин

Aleph Alpha випустила Kolibri: англо-німецька MoE-модель із відкритими вагами на 78,1 млрд параметрів і лише 3,46 млрд активних параметрів

Aleph Alpha випустила Kolibri — мовну модель із відкритими вагами та сумішшю експертів (MoE), розроблену для німецької й англійської мов. Kolibri має загалом 78,1 млрд параметрів, але активує лише 3,46 млрд, або 4,4%, для кожного токена. Модель підтримує контекст до 1 048 576 токенів, дає змогу налаштовувати рівень міркування для кожного запиту та поширюється за ліцензією Apache 2.0 на Hugging Face. Мета — суверенне розгортання у регульованих галузях, таких як державне управління, промисловість і аерокосмічна галузь.

Чи можна її розгорнути? Так. Контрольна точка у форматі FP8 займає близько 78 ГБ і працює на одному B200, B300 або H200 чи на 2 графічних процесорах H100 SXM5; обслуговування здійснюється через vLLM із виділеними парсерами міркувань і викликів інструментів Kolibri.

Що таке Kolibri?

Kolibri (Kolibri-1) — двомовний англо-німецький трансформер MoE, повністю розроблений командами в Німеччині. Згідно з технічним дослідницьким звітом, команда Aleph Alpha контролювала весь конвеєр: дані, архітектуру, інфраструктуру навчання, донавчання та оцінювання. Навчання проводилося на інфраструктурі в Німеччині та Фінляндії. Архітектура орієнтована на відповідність Кодексу практик ЄС для універсального штучного інтелекту, Закону ЄС про штучний інтелект і GDPR. Aleph Alpha є підписантом цього Кодексу, а її конвеєр даних видаляє персональні дані перед навчанням.

Архітектура: розріджені експерти та гібридна увага

Kolibri містить 50 трансформерних блоків із шириною моделі 2 560. Кожен MoE-шар оцінює всіх 384 маршрутизованих експертів за допомогою сигмоїдального маршрутизатора, спрямовує кожен токен до 6 найкращих і завжди задіює 1 спільного експерта. Навантаження на експертів збалансовується за допомогою Exact Quantile Balancing і Load-Error Injection.

У механізмі уваги використовується увага з групованими запитами, що має 48 голів запитів і 4 голови KV. Кожен п’ятий блок використовує повну увагу без позиційного кодування. Інші 40 блоків використовують увагу зі змінним вікном на 512 попередніх токенів із RoPE. Шари з ковзним вікном мають кеш KV фіксованого розміру, тому зі збільшенням довжини контексту зростають лише 10 шарів. За однакових обчислювальних ресурсів команда Aleph Alpha повідомляє, що гібридна архітектура підтримує послідовності, у 4 рази довші за модель із повною увагою.

Токенізатор, розроблений для німецької мови

Словник на 128 000 токенів навчено за допомогою UniBPE, який створює злиття на кшталт BPE, але оцінює кожне злиття за втратою Unigram. На німецьких текстах він досягає показника 4,90 байта на токен проти 4,35 у токенізатора GPT-5. Це означає на 11,2% менше токенів у німецькомовних вебтекстах. В англійській мові Kolibri досягає 4,58 байта на токен проти 4,67 у GPT-5.

Навчання: 24 трлн токенів, потім SFT і RL

Попереднє навчання охоплювало 20 трлн токенів на 768 графічних процесорах NVIDIA B200, після чого відбулося проміжне навчання на 3,44 трлн токенів із довжиною послідовності 65 536. Потім етап роботи з довгим контекстом на 201 млрд токенів проводився на послідовностях із 262 144 токенів. Aleph Alpha додала понад 2 трлн німецькомовних токенів, відібраних із вебу або синтетично згенерованих. Післянавчання поєднувало контрольоване донавчання, змішане з MergeMix, із навчанням із підкріпленням на понад 1,2 млн внутрішніх завдань. Протокол Merlin-Arthur навчає модель утримуватися від відповіді, коли отриманий контекст не підтверджує її.

Інтерактивне пояснення: як працює Kolibri

Бенчмарки

Команда Aleph Alpha оцінювала кожну модель за допомогою однакової конфігурації eval-framework. В англійській мові Kolibri лідирує в GPQA Diamond (84,3), AIME 2025 (96,9) і AIME 2026 (96,0). За середнім показником для англомовних агентних завдань модель ділить перше місце з Qwen3.5 35B-A3B — 63,4. Вона поступається в BFCL v4, набираючи 61,4 проти 70,5 у Qwen3.5. Щільна модель Qwen3.8 27B має вищі загальні показники (80,2 EN, 79,9 DE), але активує приблизно у 8 разів більше параметрів на токен. Порівняно зі своєю попередницею Kolibri Origin, Kolibri генерує приблизно у 2,7 раза більше тексту на один графічний процесор, водночас набираючи на 21,4 бала більше в англійській мові.

Kolibri проти найближчих конкурентів

ХарактеристикаKolibri-1Qwen3.6 35B-A3BNemotron 3 SuperMistral Small 4
РозробникAleph Alpha (Німеччина)Alibaba QwenNVIDIAMistral AI (Франція)
Загальна / активна кількість параметрів78,1B / 3,46B~35B / 3B120B / 12B119B / 6,5B
АрхітектураMoE, ковзне вікно + повна увагаMoE, гібрид Gated DeltaNetMamba-2 + MoE + увагаMoE
Максимальний контекст1 048 576 токенів262 144 нативно, ~1M із YaRN1M токенів256k токенів
Керування міркуваннямивідсутнє / низьке / середнє / високеМіркування увімкнено / вимкненоУвімкнено / вимкнено, режим низьких зусильвідсутнє / високе
ЛіцензіяApache 2.0Apache 2.0NVIDIA Nemotron Open Model LicenseApache 2.0
Загальний показник (EN / DE)75,5 / 70,871,4 / 67,373,0 / 67,963,1 / 61,4
Середній агентний показник (EN)63,462,154,940,7
Середній показник Industry RAG (DE)67,565,857,653,4
Середній показник програмування (EN)89,387,788,382,0

Специфікації: картки моделей для Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super і Mistral Small 4.

Як розгорнути Kolibri

Встановіть пакет aleph-alpha-inference, а потім запустіть обслуговування через vLLM:

Копіювати кодСкопійованоВикористати інший браузер
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Типовий контекст становить 262 144 токени. Передайте --max-model-len 1048576 разом із перевизначенням max_position_embeddings для повного вікна на 1M токенів. Встановіть reasoning_effort через chat_template_kwargs. Aleph Alpha рекомендує temperature 1.0, top-p 0.97 і top-k 128.

Ключові висновки

  • 78,1B загалом, 3,46B активних: для кожного токена використовуються 6 із 384 маршрутизованих експертів плюс 1 спільний експерт.
  • 40 шарів із ковзним вікном і 10 шарів із повною увагою забезпечують доступність контексту на 1M токенів.
  • Модель навчено на 24 трлн токенів, причому частка німецької мови в суміші перевищує 20%.
  • Найвищий загальний показник англійською (75,5) і німецькою (70,8) серед 12 моделей MoE, порівняних Aleph Alpha.
  • Ваги FP8 за ліцензією Apache 2.0, модель можна обслуговувати на одному B200 або H200 через vLLM.

Перегляньте ваги моделі та технічний звіт. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини