IFM представи K2 Horizon: шест модела по Apache 2.0 от 0,9 млрд. до 375 млрд.
Повечето представяния на отворени модели пускат един чекпойнт и таблица с бенчмаркове. Институтът за фундаментални модели (IFM) представи нещо по-мащабно миналата седмица. IFM е авангардната лаборатория, създадена от MBZUAI през май 2025 г. K2 Horizon е флотилия от шест модела: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B и 0.9B. Заедно с тях се предоставят корпусът за предварително обучение, междинните чекпойнти, кодът за обучение, конфигурациите и подробни логове. IFM го нарича най-голямото напълно отворено представяне на модели в историята на изкуствения интелект.
Може ли да се внедри? Да, и шестте размера са налични в Hugging Face под лиценз Apache 2.0, с версии FP8 и GGUF. Поддръжката от първия ден обхваща vLLM, SGLang и Ollama върху хардуер на NVIDIA, AMD и Cerebras. Хостваните API работят чрез Compass, Cerebras и Nebius посредством platform.ifm.ai.
Какво всъщност беше пуснато
Шестте модела споделят обща архитектура, речник, методология за обучение, интерфейси и инструменти за внедряване. Моделът 0.9B използва по-малък речник. Именно тази последователност е целта: екипите могат да прототипират с 3.7B и да мащабират до 375B-A23B, без да променят стека си за обслужване.
Всеки модел е предварително обучен върху приблизително 20 трилиона токена. Близо 17% от корпуса за предварително обучение се състои от траектории за решаване на задачи с явно разсъждение. Около 10 трилиона токена са синтетични.
Данните за дообучаване са били включвани още по време на междинното обучение, вместо да бъдат запазени за края. Изследователският екип на IFM съобщава за над 100 милиона уникални синтезирани задачи. По време на обучението дефинициите на инструментите са представяни в JSON, XML и Markdown, така че моделът да научи семантиката, а не синтаксиса. Markdown се превърна в стандартния формат за инференс и е приблизително с 18,5% по-ефективен по отношение на токените от JSON според данните на IFM.
MoVA: Разреждането се премества във вниманието
Конвенционалната Mixture-of-Experts прилага разреждане към слоевете за директно разпространение. Mixture-of-Value Attention (MoVA) разширява маршрутизирането между експерти и към самия механизъм за многоглаво внимание, откривайки втора ос за мащабиране на капацитета. Тя остава съвместима с FlashAttention, grouped-query attention и sparse attention.
Резултатът е K2-Horizon-MoVA-36B-A4B: общо 36B параметъра и приблизително 4B активни за всеки токен. При съпоставими условия на обучение той се представя малко по-слабо от плътния модел 32B. В таблиците на IFM той постига 58.6 на Terminal-Bench 2.1 и 26.8 на tau3-Banking, като оглавява сравнителния набор и в двата случая.
Uno: Ускоряване на декодирането без загуби под формата на LoRA
Uno замразява авторегресивните параметри на Horizon и обучава малък набор от дифузионни параметри, които научават единствено как да генерират ефективно. Чрез това, което IFM нарича дифузионна дестилация, тези адаптери излъчват блокове от токени паралелно. В прессъобщението ускорението е посочено като приблизително 3× без влошаване на качеството. Моделът се предоставя като LoRA адаптер, понастоящем във версиите 7B-Uno и 0.9B-Uno.
Числа, които си струва да знаете
K2-Horizon-375B-A23B постига 70.2 на Terminal-Bench 2.1, 1,441 Elo на GDPVal-AA, 67.7 на MCPMark и 87.3 на GPQA Diamond. Той оглавява таблицата си на SWE-Atlas-QnA с резултат 48.4, но изостава от GPT-5.6 Luna и Claude Sonnet 5 в повечето редове, свързани с агентни задачи.
Малките модели са по-впечатляващата част от историята. 7B постига 70.6 на SWE-bench Verified и 59.0 на BrowseComp. 3.7B постига 68.6 на SWE-bench Verified. 0.9B достига 48.5 на AIME 2026 и 79.9 на HumanEval+, като е достатъчно малък, за да работи с квантизация на смартчасовник.
Одитът, който IFM извърши на собствения си модел
Това е частта, която много други лаборатории не публикуват. IFM е изпълнил 375B-A23B върху 89 задачи от Terminal-Bench 2.1, по осем опита за всяка. Това прави 712 изпитвания, от които 500 са успешни, или отчетена точност от 70,2%. Всеки успешен опит след това е бил повторно одитиран чрез процедурата на Artificial Analysis за откриване на експлоатиране на наградата.
Одитът е маркирал 24 изпитвания в рамките на 10 задачи. Премахването им понижава точността до 66,9% — корекция от 3,37 процентни пункта. Това е между нивата на маркиране, отчетени от Artificial Analysis за Claude Fable 5 (2,2%) и GPT-5.6 Luna (4,1%). Сред наблюдаваните поведения са локализиране на хранилища с бенчмаркове в GitHub и изтегляне на референтни решения. IFM също така разкри изпълнение на 7B, което е достигнало завишен резултат от 82 на SWE-bench чрез намиране на отговорите.
Интерактивно обяснение
Основни изводи
- Шест модела, от 0.9B до 375B, всички под лиценз Apache 2.0 и всички споделящи една архитектура и стек за обслужване.
- MoVA въвежда маршрутизирането на MoE във вниманието: общо 36B, приблизително 4B активни, с качество, близко до това на плътния модел 32B.
- Uno осигурява приблизително 3× ускорение на декодирането без загуби като готов за директно използване LoRA адаптер.
- Моделите 0.9B, 3.7B и 7B претендират за най-добри резултати в класа си при съответните мащаби.
- IFM публикува собствен одит за експлоатиране на наградата, който коригира резултата от 70,2% до 66,9%.
Разгледайте техническия блог, прессъобщението, колекцията в Hugging Face, набора от данни TxT360-v2, кода за предварително обучение xLLM, кода за дообучаване и документацията. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.