Стан відкритих моделей: спостереження за літо 2026 року
Моделі та набори даних на хабі HF щодня зростають. За цей період кількість публічних репозиторіїв моделей зросла з 2,43 до 2,96 мільйона, наборів даних — із 711 000 до 1 мільйона, а Spaces — із 1,00 до 1,44 мільйона. Розподіл залишається надзвичайно нерівномірним: приблизно 85,6% моделей мають менш як 200 завантажень за весь час, а 1,5% репозиторіїв припадає на 99,2% усіх завантажень. Усе, про що йдеться далі, відбувається в межах цієї структури.
1. Передовий фронт швидко рухається
Раніше існував чіткий шлях розвитку: лабораторії починали з випуску менших моделей і поступово просувалися до верхнього кінця шкали. У 2026 році кілька китайських лабораторій повністю оминули цей етап.
Майже щомісяця у 2026 році найбільша та найпродуктивніша відкрита модель китайської лабораторії була більшою за будь-яку модель, яку самостійно випустила американська лабораторія. Щомісячна верхня межа Китаю становила від 754 млрд до 2,78 трлн параметрів; власна верхня межа Америки залишалася нижчою за 130 млрд у п’ятьох із семи місяців. Винятками були Nemotron 3 Ultra від NVIDIA із 561 млрд параметрів у травні та червні, а також Inkling від Thinking Machines Lab.
Діаграма поділяє лабораторії на два табори. Moonshot, MiniMax, Xiaomi і Z.ai майже не публікують моделей менш як 70B, тож перше знайомство розробника з ними — це модель, надто велика для запуску на будь-якому його власному обладнанні. Натомість Tencent і Alibaba Qwen охоплюють увесь діапазон — від менш як 1B і вище.
Перший табір став можливим завдяки двом чинникам. Створення великих моделей перестало бути відмінною рисою. Цього року Xiaomi та Meituan обидві подолали позначку в трильйон параметрів, хоча ще дванадцять місяців тому жодна з них не була широко відомою у сфері відкритих ваг. Крім того, лабораторії більше не потрібно випускати малу модель, щоб залишатися доступною: спільнотний шар квантизації зробить велику модель придатною до запуску протягом кількох днів — до цієї залежності ми повернемося нижче.
Отже, профіль розмірів є радше заявою про наміри, ніж про можливості. Портфоліо, зосереджене лише на передових моделях, робить ставку на позицію в бенчмарках і попит на API. Портфоліо повного спектра — це спроба зробити свою лінійку стандартом для розробників. Обидва підходи раціональні, просто вони змагаються за різні винагороди.
Тим часом Сполучені Штати не відсутні у сфері відкритого коду.
Дві організації, які цього року опублікували найбільше нових відкритих моделей, — це також компанії, що виробляють обладнання: AMD і NVIDIA. Кожна випустила понад 200 нових репозиторіїв моделей, значно випередивши решту, а LiquidAI посіла третє місце приблизно зі 100. Постачальники обладнання зрозуміли, що відкриті моделі — це спосіб продавати чипи: модель, оптимізована для вашого обладнання й доступна безкоштовно, є найпереконливішим доказом того, що обладнання працює.
Якщо врахувати менші моделі та моделі вкладень, де Google, Microsoft, IBM Granite і старіші моделі OpenAI для роботи із зображеннями та мовленням генерують сотні мільйонів завантажень щороку, участь США у відкритому ШІ все ще зростає.
Однак центр ваги змістився. Google і Meta тепер значно відстають від NVIDIA за кількістю нових випусків моделей, хоча саме ці компанії визначали розвиток публікації відкритих моделей у попередні роки. Перехід Meta до закритих флагманських моделей ще більше підкреслює цю зміну. Відкритий код перемістився від лабораторій моделей до компаній, що працюють з обладнанням та інфраструктурою.
На передовому масштабі картина зовсім інша. Більшість американських випусків понад 100B параметрів цього року — це не нові моделі, а моделі, побудовані на основі китайських. На цьому рівні є лише кілька великих оригінальних американських моделей: Inkling від Thinking Machines (952B), Nemotron 3 Ultra від NVIDIA (561B), Nemotron 3 Super (124B) і Trinity-Large від Arcee AI (399B).
AMD зробила чимало конвертацій, але не випустила оригінальної моделі такого масштабу. Ця робота все одно важлива: вона дає змогу ефективно запускати китайські моделі з трильйонами параметрів на американському обладнанні. Але це радше шар дистрибуції та оптимізації, а не створення моделей.
Водночас китайські відкриті моделі дедалі частіше оптимізують для вітчизняних чипів — це та сама конкуренція у зворотному напрямку, коли моделі проєктуються під конкретні екосистеми обладнання.
2. Увага ≠ прийняття
Ми взяли 25 найпопулярніших репозиторіїв моделей за кількістю завантажень, накопичених цього року, і 25 лідерів за вподобаннями. Усього один репозиторій присутній в обох списках.
Ми рахували завантаження в межах цього періоду, а не за весь час, тож моделі не отримували переваги лише через те, що існували довше; контроль за віком робить розподіл ще чіткішим. Жодна модель, опублікована у 2026 році, не потрапила до топ-25 за завантаженнями, тоді як тринадцять із двадцяти п’яти датуються 2022 роком. all-MiniLM-L6-v2 завантажили 1,55 мільярда разів за сім місяців, хоча вона має 5 156 вподобань; Kimi-K3 завантажували приблизно 60 разів на кожне отримане вподобання.
Ці два показники фіксують різні дії. Вподобання означає, що випуск має значення, і припадає на передові моделі в перші тижні після їхнього виходу. Завантаження означає, що щось інтегровано в конвеєр, який працює за розкладом, і протягом років накопичується для малих стабільних моделей. Вподобання — правильний інструмент для розуміння того, що захоплює галузь, а завантаження — того, від чого вона наразі залежить. Вважати один показник замінником іншого — найпоширеніша помилка, яку ми бачимо в матеріалах про Hub, зокрема й у наших попередніх роботах. Такий самий розрив спостерігається на рівні видавця.
Китайські лабораторії передових моделей — єдині акаунти на Hub, де великі моделі забезпечують основний обсяг. Практично всі завантаження MiniMax у 2026 році припадають на моделі понад 70B, як і 88% завантажень Moonshot, 55% DeepSeek і 39% Z.ai. Жоден великий американський акаунт не має такого вигляду: Google, Microsoft та IBM Granite фактично не мають завантажень моделей понад 70B у 2026 році, а для NVIDIA і Meta цей показник становить лише 14% і 9% відповідно.
Різниця стає ще очевиднішою в загальній кількості завантажень. Портфоліо Moonshot, що складається лише з передових моделей, за рік отримало 37 млн завантажень, тоді як ширша стратегія Qwen, що охоплює різні розміри моделей, досягла 2 045 млн (у репозиторіях із заявленою кількістю параметрів; з урахуванням усіх репозиторіїв — 2 061 млн), тобто приблизно у 55 разів більше. Подальше розширення сімейства — від Qwen 3.8 Max із 2,4 трлн параметрів до менших варіантів, таких як 27B, — демонструє таку саму орієнтацію на охоплення різних сценаріїв використання.
Час також відіграє важливу роль. Більшість моделей переживає різке падіння використання після випуску, за яким настає довгий період стабільної активності. Прийняття моделі значною мірою визначається протягом перших кількох місяців.
Це допомагає пояснити, чому сьогоднішній обсяг завантажень часто визначається не найновішими випусками, а меншою групою моделей, які з часом стали усталеною інфраструктурою.
3. Відкриті ваги змінюють місце накопичення цінності
Якби передові моделі були ліцензійним бізнесом, можна було б очікувати, що найбільші випуски матимуть найжорсткіші умови. Проте наведені нижче дані показують іншу картину.
Із 178 китайських випусків понад 20B параметрів цього року 59% мають ліцензію Apache 2.0, а 22% — MIT; рівно жоден не має обмеження на некомерційне використання.
DeepSeek і Z.ai випускають моделі від 700 мільярдів до 1,65 трлн параметрів за звичайною ліцензією MIT. Китайські лабораторії ліцензують свої найбільші моделі приблизно так само вільно, як і найменші, і вільніше, ніж американські лабораторії ліцензують свої: серед американських моделей у тому самому діапазоні 29% мають Apache або MIT, 41% поширюються за власними умовами, а 30% взагалі не вказують ліцензію.
Хоч би для чого були призначені ці випуски, це не дохід від ліцензій. Ваги передаються на найліберальніших доступних умовах. Віддача має надходити звідкись іще: від бізнесу API та хмарних сервісів, позиціонування обладнання й платформ або самої екосистеми. Наприклад, оцінки Z.ai та Kimi свідчать про ефективну стратегію відкритого коду, що забезпечує залучення й можливості зростання у спільноті. Однак надалі галузь, імовірно, рухатиметься до чіткіших шляхів монетизації прийняття відкритого коду.
4. Qwen стала базовою моделлю спільноти
Позиція моделі в екосистемі визначається не лише її власними випусками, а й тим, наскільки активно спільнота будує на її основі. Як зазначалося вище, Qwen є одним із винятків, що отримує і увагу, і прийняття.
Дані Hugging Face
За цим показником Qwen стала однією з найбільших основ в екосистемі відкритих моделей. Моделі на базі Qwen тепер становлять 151 448 похідних моделей на Hub — у 2,6 раза більше за загальну кількість похідних моделей Meta і в 4,7 раза більше за репозиторії Llama окремо. Далі йде Google із 82 506 похідними моделями. Третім за величиною джерелом є Unsloth — спільнотний акаунт, що публікує квантизовані збірки та збірки, готові до донавчання, багато з яких іще більше розширюють екосистему Qwen.
Кількість похідних моделей Qwen протягом перших семи місяців 2026 року зростала приблизно на 180–210 нових репозиторіїв на день, що свідчить: прийняття визначається не лише окремими випусками. Qwen стала частиною стандартного робочого процесу розробників, які вирішують, які моделі донавчати та розгортати.
Цій позиції сприяло кілька чинників. По-перше, послідовність. Qwen дотримується регулярного графіка випусків, постійно оновлюючи сімейство моделей замість того, щоб покладатися на поодинокі флагманські релізи. По-друге, охоплення. Вона публікує моделі широкого діапазону розмірів і для різних сценаріїв використання, даючи розробникам змогу залишатися в одній екосистемі — незалежно від того, потрібна їм мала локальна модель чи більша модель для розгортання. По-третє, відкритість. Ліцензія Apache 2.0 зменшує перешкоди для модифікації, повторного поширення та комерційного використання.
Ці чинники взаємно посилюють один одного. Широке сімейство моделей приваблює більше розробників; більше розробників створюють більше похідних моделей; а ці похідні моделі роблять екосистему привабливішою для майбутніх користувачів.
Цю позицію значною мірою створила спільнота. 151 448 похідних моделей — це результати роботи інших розробників, а не випуски, створені самою Qwen. Навіть серед 28 531 конвертації моделей Qwen у GGUF на Hub Qwen опублікувала лише 54.
5. Малі моделі залишаються практичним рівнем
Серед моделей, що вказують кількість параметрів, на моделі менш як 1B припадає 83% усіх завантажень за весь час, а на все, що перевищує 100B, — 1%. Якщо обмежитися завантаженнями, накопиченими у 2026 році, нічого не змінюється: моделі понад 70B отримують 3% обсягу. Це висновок березня, який найкраще підтвердився з тієї самої причини, що й раніше: малі моделі — єдині, що працюють на обладнанні, яке насправді має більшість розробників.
То як модель із трильйоном параметрів узагалі досягає користувачів? Через llama.cpp.
У лютому команда ggml приєдналася до Hugging Face, а проєкт залишився повністю відкритим, керованим спільнотою та розвивається в тому самому технічному напрямку. Змінилося лише те, що найважливіший проєкт для локального інференсу тепер має стабільні ресурси.
Разом із llama.cpp змістилася й верхня межа. Липневий знімок містить збірки GGUF для DeepSeek-V4-Flash приблизно з 284B параметрів і Kimi-K3 приблизно з 2,8 трлн. Раніше локальний інференс означав модель 8B на ноутбуці. Тепер він означає суміш експертів із трильйоном параметрів, розподілену між кількома споживчими комп’ютерами. Це альтернативний шлях, якого передовий фронт не мав рік тому, і причина, чому стратегія випуску лише передових моделей узагалі стала життєздатною.
І цей шлях працює на Qwen: 39,6 мільйона завантажень GGUF на місяць — майже вдвічі більше за 20,8 мільйона Gemma і більш ніж у п’ять разів більше за 7,5 мільйона Llama. Розрив із Llama не пов’язаний із браком пропозиції: репозиторії GGUF на основі Llama навіть трохи численніші за репозиторії Qwen. Те саме місце на полиці, але п’ята частина трафіку.
За ці сім місяців кількість репозиторіїв моделей зросла на 21,5%. Кілька пов’язаних із ними напрямів зросли в кілька разів швидше.
Кількість репозиторіїв, що вказують бібліотеку gguf, зросла на 464%, lerobot — на 194%, а Apple's mlx — на 148%, тоді як transformers і peft зросли на 16%, а diffusers — на 21%. Ядро моделювання зростає приблизно із середньою швидкістю платформи. Рівень, який визначає, де модель фізично може виконувати локальний інференс — формати для Apple silicon, стеки керування роботами — зростає у три-сім разів швидше.
Серед десяти найбільших сімейств моделей лабораторії, що стоять за ними, публікують дуже мало офіційних конвертацій у GGUF. Проте саме версії GGUF часто використовують розробники, які запускають моделі локально. Надання офіційної конвертації під час випуску, документування параметрів квантизації та підписування артефактів потребували б небагато додаткових зусиль. Замість підтримки цього процесу власними силами лабораторії могли б співпрацювати з уже наявними учасниками екосистеми, такими як Unsloth. Це зменшило б розрив між вагами, які тестують творці моделей, і версіями, які обирає ширша спільнота.
6. Агенти — це новий користувач
У березні ми не могли написати цей розділ, оскільки відповідного інструмента ще не існувало. Набір даних agent-usage, опублікований у липні, фіксує токен agent/<name>, який агенти для програмування надсилають, коли звертаються до Hub через huggingface_hub або CLI hf — шукають моделі, завантажують набори даних, запускають Jobs, створюють Spaces. Вперше ми можемо побачити, скільки агентського трафіку отримує Hub і з яких оболонок він надходить.
У липні лідирував Claude Code із 44,4%, але один місяць приховує справжній висновок: у квітні його частка становила 67,8%, а в травні — 6,4%, тоді як Codex стабільно зростав із 10,4% до 20,8%. Це ринок без усталеного лідера, де один випуск або одна змінена настройка за місяць може перемістити половину трафіку.
Другий висновок — незареєстрований рядок. Майже чверть трафіку з агентськими тегами в липні надійшла від оболонок, які ще не мають назви в наборі даних, а в травні цей показник становив 59,8%. У період із квітня до липня з’явилося понад десяток нових ідентифікаторів клієнтів. Нові учасники з’являються швидше, ніж будь-який реєстр встигає їх називати, — і це само по собі є висновком.
Значну частину року ми розробляли для цього читача, а не лише для людей, які переглядають сторінки. У березні статті почали надавати машиночитаний Markdown. У квітні з’явилися трейси агентів як повноцінний тип набору даних та кінцева точка agents.md у кожному Gradio Space, щоб агент міг прочитати API Space і безпосередньо викликати його. У липні на нашому MCP-сервері з’явився інструмент hf_fs, який відкриває доступ до репозиторіїв, сховища, документації та статей через єдиний інтерфейс трохи більш як за тисячу токенів, а також до підключуваних пісочниць для безпечного виконання. Така сама консолідація відбулася на рівні протоколу: MCP перейшов до Agentic AI Foundation при Linux Foundation.
А потім у липні агент перестав бути читачем і став зловмисником. Схоже, перший задокументований випадок, коли автономний агент за власною ініціативою здійснив тривале вторгнення, стався саме з нами. Поки наша команда намагалася використати передові закриті моделі для аналізу перехопленого коду атаки, їхні запобіжники безпеки відмовилися виконувати цю роботу. Зрештою аналіз завершили на квантизованій відкритій моделі GLM-5.2, що працювала на нашій власній інфраструктурі. Ми опублікували повідомлення про інцидент і повну технічну хронологію.
Погляд у майбутнє
Порівняно з весняним звітом географічне переформатування сил і далі пришвидшується. Відкриті моделі США продовжують розвиватися, але перегони між кількома китайськими передовими моделями також привертають значну увагу спільноти. Численні вподобання цих передових моделей вказують на те, що найбільше захоплює спільноту, а також на можливості зростання для компаній, які використовують цю увагу для підвищення оцінки.
Однак перегони у сфері ШІ — це не лише спринт, а й марафон. Інструменти на кшталт llama.cpp допомагають розгортати великі моделі локально, але широке сімейство моделей і його прийняття все ще є ключовими для створення позитивного зворотного зв’язку між розробниками, видавцями та майбутніми користувачами. Моделі, інтегровані в інфраструктуру та включені до екосистеми, зрештою можуть привести до комерційно успішного результату.
Зрештою, оскільки агенти вперше стали користувачами №1 на HF Hub, наступний звіт також може мати зовсім інший вигляд.
Як і у випадку зі ШІ, кілька місяців можуть перебудувати екосистему.
Методологічні примітки
Цей аналіз ґрунтується на активності, зафіксованій на Hugging Face Hub протягом перших семи місяців 2026 року.
Показники, використані у цьому звіті, зокрема завантаження, вподобання, похідні моделі та випуски моделей, відображають різні аспекти активності екосистеми. Їх не слід трактувати як прямі показники якості моделей, комерційного прийняття або загальної частки ринку.
Завантаження свідчать про використання в екосистемі Hub, але не охоплюють використання API, приватні розгортання чи моделі, що поширюються іншими каналами.
Вподобання відображають увагу та інтерес спільноти, тоді як похідні моделі є показником того, наскільки розробники будують на основі наявної моделі.
Оскільки прийняття відкритого ШІ відбувається через багато каналів, активність Hub слід розглядати як один із поглядів на розвиток екосистеми, а не як повний вимір ринку ШІ.
Моделі, згадані в цій статті 2
Набори даних, згадані в цій статті 1
Колекції, згадані в цій статті 3
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Моделі, згадані в цій статті 2
Набори даних, згадані в цій статті 1
Колекції, згадані в цій статті 3
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.












