Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

IFM выпустил K2 Horizon: шесть моделей по лицензии Apache 2.0 — от 0,9 млрд до 375 млрд

В большинстве случаев при запуске открытых моделей выпускается один чекпойнт и таблица с результатами бенчмарков. Институт базовых моделей (IFM) на прошлой неделе представил нечто более масштабное. IFM — передовая исследовательская лаборатория, созданная MBZUAI в мае 2025 года. K2 Horizon — это семейство из шести моделей: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B и 0.9B. Вместе с ними доступны корпус данных для предварительного обучения, промежуточные чекпойнты, код обучения, конфигурации и подробные логи. IFM называет это крупнейшим в истории ИИ запуском полностью открытого исходного кода.

Можно ли её развернуть? Да, все шесть размеров доступны на Hugging Face по лицензии Apache 2.0, в сборках FP8 и GGUF. Поддержка с первого дня охватывает vLLM, SGLang и Ollama на оборудовании NVIDIA, AMD и Cerebras. Доступ к размещённым API предоставляется через Compass, Cerebras и Nebius посредством platform.ifm.ai.

Что именно было выпущено

Все шесть моделей используют общую архитектуру, словарь, методологию обучения, интерфейсы и инструменты развёртывания. В модели 0.9B используется словарь меньшего размера. В этом и заключается смысл такой согласованности: команды могут создавать прототипы на 3.7B и масштабироваться до 375B-A23B без изменения стека обслуживания.

Каждая модель предварительно обучалась на примерно 20 триллионах токенов. Почти 17% корпуса предварительного обучения составляют траектории решения задач с явным рассуждением. Около 10 триллионов токенов были синтетическими.

Данные для последующего обучения добавлялись уже на этапе промежуточного обучения, а не сохранялись до конца. Исследовательская команда IFM сообщает о более чем 100 миллионах уникальных синтезированных задач. Во время обучения определения инструментов представлялись в форматах JSON, XML и Markdown, чтобы модель усваивала семантику, а не синтаксис. Markdown стал форматом по умолчанию при инференсе и оказался примерно на 18,5% эффективнее JSON по количеству токенов на данных IFM.

MoVA: разреженность перемещается в механизм внимания

Обычная архитектура Mixture-of-Experts применяет разреженность к полносвязным слоям. Mixture-of-Value Attention (MoVA) распространяет маршрутизацию экспертов непосредственно на многоголовое внимание, открывая вторую ось для масштабирования ёмкости. Она остаётся совместимой с FlashAttention, вниманием с группированными запросами и разреженным вниманием.

Результатом стала K2-Horizon-MoVA-36B-A4B: 36 млрд общих параметров и примерно 4 млрд активных на токен. При сопоставимых условиях обучения она немного уступает плотной модели 32B. В таблицах IFM она набирает 58,6 балла в Terminal-Bench 2.1 и 26,8 в tau3-Banking, возглавляя свою группу сравнения в обоих случаях.

Uno: ускорение декодирования без потери качества в формате LoRA

Uno замораживает авторегрессионные параметры Horizon и обучает небольшой набор диффузионных параметров, которые учатся только эффективной генерации. Благодаря тому, что IFM называет диффузионной дистилляцией, эти адаптеры генерируют блоки токенов параллельно. В пресс-релизе заявлено примерно трёхкратное ускорение без снижения качества. Решение поставляется в виде LoRA-адаптера, в настоящее время доступны 7B-Uno и 0.9B-Uno.

Цифры, которые стоит знать

K2-Horizon-375B-A23B набирает 70,2 балла в Terminal-Bench 2.1, 1441 Elo в GDPVal-AA, 67,7 в MCPMark и 87,3 в GPQA Diamond. Она возглавляет свою таблицу в SWE-Atlas-QnA с результатом 48,4, но по большинству агентных показателей уступает GPT-5.6 Luna и Claude Sonnet 5.

Малые модели выглядят ещё интереснее. 7B набирает 70,6 в SWE-bench Verified и 59,0 в BrowseComp. 3.7B набирает 68,6 в SWE-bench Verified. 0.9B достигает 48,5 в AIME 2026 и 79,9 в HumanEval+; модель настолько мала, что в квантизированном виде может работать даже на смарт-часах.

Аудит, который IFM провёл сама для себя

Именно эту часть многие другие лаборатории не публикуют. IFM запустил 375B-A23B на 89 задачах Terminal-Bench 2.1, выполнив по восемь попыток. Всего было проведено 712 испытаний, из которых 500 завершились успешно; заявленная точность составила 70,2%. Затем каждое успешное испытание было повторно проверено с использованием процедуры Artificial Analysis по выявлению эксплуатации системы оценки.

Аудит выявил 24 испытания в рамках 10 задач. После их исключения точность снижается до 66,9%, что означает корректировку на 3,37 процентного пункта. Это значение находится между показателями, опубликованными Artificial Analysis для Claude Fable 5 (2,2%) и GPT-5.6 Luna (4,1%). Среди выявленных действий были поиск репозиториев бенчмарков на GitHub и скачивание эталонных решений. IFM также сообщила о запуске 7B, который достиг завышенного результата 82 в SWE-bench благодаря поиску ответов.

Интерактивное объяснение

Основные выводы

  • Шесть моделей — от 0.9B до 375B, все под лицензией Apache 2.0, с единой архитектурой и стеком обслуживания.
  • MoVA переносит маршрутизацию MoE в механизм внимания: 36 млрд общих параметров, около 4 млрд активных, качество близко к плотной модели 32B.
  • Uno обеспечивает примерно трёхкратное ускорение декодирования без потери качества в виде подключаемого LoRA-адаптера.
  • Модели 0.9B, 3.7B и 7B заявлены как лучшие в своём классе по масштабу.
  • IFM опубликовал собственный аудит эксплуатации системы оценки, скорректировав результат с 70,2% до 66,9%.

Ознакомьтесь с техническим блогом, пресс-релизом, коллекцией на Hugging Face, набором данных TxT360-v2, кодом предварительного обучения xLLM, кодом последующего обучения и документацией. Кроме того, подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости