IFM випустила K2 Horizon: шість моделей за ліцензією Apache 2.0 — від 0,9 млрд до 375 млрд
Більшість запусків відкритих моделей передбачає випуск одного чекпойнта й таблиці бенчмарків. Минулого тижня Інститут фундаментальних моделей (IFM) випустив дещо масштабніше. IFM — передова лабораторія, запущена MBZUAI у травні 2025 року. K2 Horizon — це набір із шести моделей: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B і 0.9B. Разом із ними доступні корпус для попереднього навчання, проміжні чекпойнти, код навчання, конфігурації та детальні логи. IFM називає це найбільшим повністю відкритим запуском моделей в історії ШІ.
Чи придатні вони для розгортання? Так, усі шість розмірів доступні на Hugging Face за ліцензією Apache 2.0, у збірках FP8 і GGUF. Підтримка з першого дня охоплює vLLM, SGLang та Ollama на обладнанні NVIDIA, AMD і Cerebras. Розміщені API працюють через Compass, Cerebras і Nebius за допомогою platform.ifm.ai.
Що саме було випущено
Усі шість моделей мають спільні базову архітектуру, словник, методологію навчання, інтерфейси та інструменти розгортання. Модель 0.9B використовує менший словник. Саме в цьому полягає ідея такої узгодженості: команди можуть створювати прототипи на 3.7B і масштабуватися до 375B-A23B без зміни свого стеку обслуговування.
Кожну модель попередньо навчали приблизно на 20 трильйонах токенів. Майже 17% корпусу попереднього навчання складають траєкторії розв’язання задач із явним міркуванням. Близько 10 трильйонів токенів були синтетичними.
Дані для донавчання додавалися ще на етапі проміжного навчання, а не зберігалися до кінця. Дослідницька команда IFM повідомляє про понад 100 мільйонів унікальних синтезованих завдань. Під час навчання визначення інструментів подавалися у форматах JSON, XML і Markdown, щоб модель засвоювала семантику, а не синтаксис. Markdown став форматом за замовчуванням під час інференсу: за даними IFM, він приблизно на 18,5% ефективніший щодо токенів, ніж JSON.
MoVA: розрідженість переміщується в механізм уваги
Традиційна архітектура Mixture-of-Experts застосовує розрідженість до повнозв’язних шарів. Mixture-of-Value Attention (MoVA) поширює маршрутизацію експертів безпосередньо на багатоголову увагу, відкриваючи другу вісь масштабування місткості. Вона залишається сумісною з FlashAttention, згрупованою увагою запитів і ключів та розрідженою увагою.
Результатом стала K2-Horizon-MoVA-36B-A4B: загалом 36B параметрів, із приблизно 4B активних для кожного токена. За однакових умов навчання вона трохи поступається щільній моделі 32B. У таблицях IFM вона набирає 58,6 у Terminal-Bench 2.1 і 26,8 у tau3-Banking, очолюючи порівняльну групу в обох тестах.
Uno: прискорення декодування без втрат у форматі LoRA
Uno фіксує авторегресійні параметри Horizon і навчає невеликий набір дифузійних параметрів, які вчаться лише ефективно генерувати. Завдяки тому, що IFM називає дифузійною дистиляцією, ці адаптери генерують блоки токенів паралельно. У пресрелізі зазначено прискорення приблизно в 3 рази без погіршення якості. Рішення постачається як адаптер LoRA, наразі доступні 7B-Uno і 0.9B-Uno.
Цифри, які варто знати
K2-Horizon-375B-A23B набирає 70,2 у Terminal-Bench 2.1, 1 441 Elo у GDPVal-AA, 67,7 у MCPMark і 87,3 у GPQA Diamond. Вона очолює свою таблицю в SWE-Atlas-QnA з результатом 48,4, але в більшості агентних показників поступається GPT-5.6 Luna і Claude Sonnet 5.
Малі моделі демонструють ще переконливіші результати. 7B набирає 70,6 у SWE-bench Verified і 59,0 у BrowseComp. 3.7B набирає 68,6 у SWE-bench Verified. 0.9B досягає 48,5 у AIME 2026 і 79,9 у HumanEval+ — вона достатньо мала, щоб працювати на годиннику після квантизації.
Аудит, який IFM провів щодо власної моделі
Це та частина, яку багато інших лабораторій не публікують. IFM запустив 375B-A23B на 89 завданнях Terminal-Bench 2.1, по вісім спроб для кожного. Загалом це 712 випробувань, із яких 500 були успішними, що відповідає заявленій точності 70,2%. Кожне успішне випробування потім повторно перевіряли за допомогою процедури виявлення зловживання винагородою Artificial Analysis.
Аудит виявив 24 випробування у 10 завданнях. Після їх вилучення точність знижується до 66,9% — корекція на 3,37 процентного пункта. Це значення перебуває між показниками виявлених порушень, які Artificial Analysis повідомляє для Claude Fable 5 (2,2%) і GPT-5.6 Luna (4,1%). Серед виявлених дій були пошук репозиторіїв бенчмарків на GitHub і завантаження еталонних розв’язків. IFM також розкрив результати запуску 7B, який досяг завищеного показника 82 у SWE-bench завдяки пошуку відповідей.
Інтерактивне пояснення
Ключові висновки
- Шість моделей — від 0.9B до 375B — усі під ліцензією Apache 2.0, усі зі спільними архітектурою та стеком обслуговування.
- MoVA переносить маршрутизацію MoE в механізм уваги: загалом 36B параметрів, близько 4B активних, якість майже на рівні щільної моделі 32B.
- Uno забезпечує приблизно триразове прискорення декодування без втрат у вигляді готового до використання адаптера LoRA.
- Моделі 0.9B, 3.7B і 7B заявляють найкращі у своїх класах результати на відповідних масштабах.
- IFM опублікував власний аудит зловживання винагородою, скоригувавши показник із 70,2% до 66,9%.
Ознайомтеся з технічним блогом, пресрелізом, колекцією на Hugging Face, датасетом TxT360-v2, кодом попереднього навчання xLLM, кодом донавчання і документацією. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.