Состояние открытых моделей: наблюдения лета 2026 года
Модели и датасеты на Hub HF растут ежедневно. За этот период число общедоступных репозиториев моделей выросло с 2,43 до 2,96 млн, датасетов — с 711 000 до 1 млн, Spaces — с 1,00 до 1,44 млн. При этом распределение остаётся крайне неравномерным: примерно 85,6% моделей имеют менее 200 загрузок за всё время, а 1,5% репозиториев обеспечивают 99,2% всех загрузок. Всё описанное ниже происходит внутри этой структуры.
1. Передовой край быстро движется
Раньше существовал понятный путь развития: лаборатории начинали с выпуска небольших моделей и постепенно продвигались к верхнему пределу масштаба. В 2026 году несколько китайских лабораторий полностью пропустили этот этап.
Почти в каждом месяце 2026 года крупнейшая и наиболее производительная открытая модель китайской лаборатории была крупнее любой самостоятельно выпущенной американской лабораторией. Ежемесячный максимум Китая составлял от 754 млрд до 2,78 трлн параметров; собственный максимум США оставался ниже 130 млрд в пяти из семи месяцев. Исключениями стали Nemotron 3 Ultra от NVIDIA с 561 млрд параметров в мае и июне, а также Inkling от Thinking Machines Lab.
Диаграмма разделяет лаборатории на два лагеря. Moonshot, MiniMax, Xiaomi и Z.ai почти ничего не публикуют ниже 70 млрд параметров, поэтому первое знакомство разработчика с ними — это модель, слишком большая для запуска на принадлежащем ему оборудовании. Tencent и Alibaba Qwen, напротив, охватывают весь диапазон — от менее 1 млрд параметров и выше.
Первый лагерь стал возможен благодаря двум обстоятельствам. Создание большой модели перестало быть отличительным преимуществом. Xiaomi и Meituan в этом году обе преодолели отметку в триллион параметров, хотя ещё двенадцать месяцев назад ни одна из них не была широко известна в сфере открытых весов. Кроме того, лаборатории больше не нужно выпускать маленькую модель, чтобы быть доступной: слой квантования, созданный сообществом, позволяет запустить большую модель в течение нескольких дней — к этой зависимости мы вернёмся ниже.
Таким образом, профиль размеров становится скорее заявлением о намерениях, чем показателем возможностей. Портфолио, ориентированное только на передовой край, делает ставку на позиции в бенчмарках и спрос на API. Портфолио полного спектра стремится сделать конкретное семейство стандартом для разработчиков. Оба подхода рациональны — просто они рассчитаны на разные цели.
Тем временем Соединённые Штаты не исчезли из мира открытого исходного кода.
Две организации, выпустившие в этом году больше всего новых открытых моделей, — это также компании, производящие оборудование: AMD и NVIDIA. Каждая выпустила более 200 новых репозиториев моделей, значительно опередив остальных; третье место заняла LiquidAI примерно со 100 репозиториями. Производители оборудования поняли, что открытые модели помогают продавать чипы: модель, оптимизированная под ваше оборудование и свободно доступная, — самое убедительное доказательство того, что оборудование работает.
Если учитывать небольшие модели и модели эмбеддингов, где Google, Microsoft, IBM Granite и более старые модели зрения и речи OpenAI ежегодно генерируют сотни миллионов загрузок, участие США в открытом ИИ по-прежнему растёт.
Однако центр тяжести сместился. Google и Meta теперь значительно уступают NVIDIA по числу новых выпусков моделей, несмотря на то что именно эти компании определяли публикацию открытых моделей в предыдущие годы. Переход Meta к закрытым флагманским моделям ещё сильнее подчёркивает эту перемену. Открытый исходный код переместился от лабораторий моделей к компаниям, занимающимся оборудованием и инфраструктурой.
На передовом уровне масштабов картина совершенно иная. Большинство американских выпусков этого года с числом параметров свыше 100 млрд — это не новые модели, а модели, построенные на основе китайских. В этом масштабе представлены лишь несколько крупных оригинальных американских моделей: Inkling Thinking Machines (952 млрд), Nemotron 3 Ultra NVIDIA (561 млрд), Nemotron 3 Super (124 млрд) и Trinity-Large Arcee AI (399 млрд).
AMD внесла множество конвертаций, но не создала оригинальной модели такого масштаба. Эта работа по-прежнему важна: она позволяет эффективно запускать китайские модели с триллионами параметров на американском оборудовании. Но она представляет собой слой распространения и оптимизации, а не создание моделей.
Тем временем китайские открытые модели всё чаще оптимизируются под отечественные чипы — это та же конкуренция в обратном направлении, когда модели проектируются с учётом конкретных экосистем оборудования.
2. Внимание ≠ принятие
Мы взяли 25 крупнейших репозиториев моделей по числу загрузок, накопленных в этом году, и 25 крупнейших по числу отметок «Нравится». Ровно один репозиторий присутствует в обоих списках.
Мы считали загрузки внутри рассматриваемого периода, а не за всё время, поэтому более старые модели не получают преимущество лишь за счёт более длительного существования; с учётом возраста разделение становится ещё заметнее. Ни одна модель, опубликованная в 2026 году, не вошла в топ-25 по загрузкам, тогда как тринадцать из двадцати пяти датируются 2022 годом. all-MiniLM-L6-v2 загрузили 1,55 млрд раз за семь месяцев при 5156 отметках «Нравится»; Kimi-K3 загружали примерно 60 раз на каждую полученную им отметку «Нравится».
Эти два числа отражают разные действия. Отметка «Нравится» говорит о значимости выпуска и достаётся передовым моделям в первые недели после публикации. Загрузка говорит о том, что модель подключена к регулярно работающему конвейеру, и со временем накапливается у небольших стабильных моделей. Отметки «Нравится» подходят для оценки того, что вызывает интерес в отрасли, а загрузки — для понимания того, от чего она уже зависит. Использование одного показателя как заменителя другого — самая распространённая ошибка, которую мы видим в освещении Hub, включая наши собственные предыдущие работы. То же разделение наблюдается и на уровне издателя.
Китайские лаборатории передового уровня — единственные аккаунты на Hub, где основная часть объёма приходится на тяжёлый сегмент. Практически все загрузки моделей MiniMax за 2026 год относятся к моделям свыше 70 млрд параметров, как и 88% загрузок Moonshot, 55% DeepSeek и 39% Z.ai. Ни один крупный американский аккаунт не выглядит так: у Google, Microsoft и IBM Granite практически отсутствуют загрузки моделей свыше 70 млрд, а у NVIDIA и Meta их доля составляет лишь 14% и 9% соответственно.
Разница ещё заметнее в общем числе загрузок. Ориентированное только на передовые модели портфолио Moonshot получило за год 37 млн загрузок, тогда как более широкая стратегия Qwen, охватывающая разные размеры моделей, достигла 2045 млн загрузок (2045 млн в репозиториях с заявленным числом параметров и 2061 млн с учётом всех репозиториев) — примерно в 55 раз больше. Продолжающееся расширение семейства — от Qwen 3.8 Max с 2,4 трлн параметров до небольших вариантов, таких как 27B, — демонстрирует тот же акцент на охвате различных сценариев использования.
Время также играет важную роль. После выпуска большинство моделей переживает резкое падение использования, за которым следует долгий хвост стабильной активности. Принятие модели в значительной степени определяется в первые несколько месяцев.
Это помогает объяснить, почему сегодняшний объём загрузок часто обеспечивают не самые новые выпуски, а небольшая группа моделей, которые со временем превратились в устоявшуюся инфраструктуру.
3. Открытые веса меняют место накопления ценности
Если бы передовые модели представляли собой лицензионный бизнес, можно было бы ожидать, что крупнейшие выпуски будут распространяться на самых строгих условиях. Однако приведённые ниже данные показывают иную картину.
Из 178 китайских выпусков с числом параметров свыше 20 млрд в этом году 59% распространяются по Apache 2.0, а 22% — по MIT; ровно ни один не содержит ограничения на некоммерческое использование.
DeepSeek и Z.ai выпускают модели размером от 700 млрд до 1,65 трлн параметров под обычной лицензией MIT. Китайские лаборатории лицензируют свои крупнейшие модели примерно так же свободно, как и самые маленькие, и свободнее, чем американские лаборатории лицензируют свои модели: в американском сегменте того же диапазона размеров 29% работают по Apache или MIT, 41% — по индивидуальным условиям, а 30% вообще не указывают лицензию.
Каково бы ни было предназначение этих выпусков, это не лицензионная выручка. Веса предоставляются на наиболее разрешительных условиях. Доход должен поступать из другого источника: бизнеса API и облачных сервисов, позиционирования оборудования и платформы либо самой экосистемы. Например, оценки стоимости Z.ai и Kimi указывают на эффективную стратегию открытого исходного кода, позволяющую получать признание и возможности роста в сообществе. Однако в дальнейшем отрасль, вероятно, будет двигаться к более понятным путям монетизации принятия открытого исходного кода.
4. Qwen стала базовой моделью сообщества
Положение модели в экосистеме определяется не только её собственными выпусками, но и тем, сколько разработок сообщество создаёт на её основе. Как упоминалось выше, Qwen — одно из исключений, получающих и внимание, и широкое применение.
Данные Hugging Face
По этому показателю Qwen стала одной из крупнейших основ экосистемы открытых моделей. На модели Qwen теперь приходится 151 448 производных моделей на Hub — в 2,6 раза больше общего показателя Meta и в 4,7 раза больше числа репозиториев именно Llama. Следом идёт Google с 82 506 производными моделями. Третий по величине источник — Unsloth, аккаунт сообщества, публикующий квантованные модели и сборки, готовые к дообучению; многие из них дополнительно расширяют экосистему Qwen.
Число производных моделей Qwen в первые семь месяцев 2026 года увеличивалось примерно на 180–210 новых репозиториев в день, показывая, что принятие модели обусловлено не только отдельными запусками. Qwen стала частью рабочего процесса по умолчанию для разработчиков, решающих, какие модели дообучать и развёртывать.
Этому положению способствовало несколько факторов. Во-первых, последовательность. Qwen поддерживает регулярный темп выпусков, постоянно обновляя семейство моделей вместо того, чтобы полагаться на редкие флагманские релизы. Во-вторых, охват. Компания публикует модели самых разных размеров и назначения, позволяя разработчикам оставаться в одной экосистеме — независимо от того, нужна ли им небольшая локальная модель или более крупная модель для развёртывания. В-третьих, открытость. Лицензия Apache 2.0 снижает барьеры для модификации, распространения и коммерческого использования.
Эти факторы усиливают друг друга. Широкое семейство моделей привлекает больше разработчиков; больше разработчиков создают больше производных моделей; а эти производные модели делают экосистему привлекательнее для будущих пользователей.
Это положение было в значительной степени создано сообществом. 151 448 производных моделей — это работы, созданные другими разработчиками, а не выпуски самой Qwen. Даже среди 28 531 конвертации моделей Qwen в GGUF на Hub сама Qwen опубликовала лишь 54.
5. Небольшие модели остаются практическим уровнем
Среди моделей, указывающих число параметров, модели с числом параметров менее 1 млрд обеспечивают 83% всех загрузок за всё время, а на модели свыше 100 млрд приходится 1%. Ограничение загрузками, накопленными в 2026 году, ничего не меняет: на модели свыше 70 млрд приходится 3% объёма. Это мартовское наблюдение сохранилось наиболее убедительно по той же причине, что и раньше: небольшие модели — единственные, которые работают на оборудовании, действительно имеющемся у большинства разработчиков.
Так как же модель с триллионом параметров вообще достигает пользователей? Благодаря llama.cpp.
В феврале команда ggml присоединилась к Hugging Face, при этом проект остаётся полностью открытым, управляемым сообществом и движется в том же техническом направлении. Изменилось лишь то, что важнейший проект для локального вывода теперь располагает устойчивыми ресурсами.
С llama.cpp поднялся и верхний предел. Июльский снимок содержит сборки GGUF DeepSeek-V4-Flash примерно с 284 млрд параметров и Kimi-K3 примерно с 2,8 трлн. Раньше локальный вывод означал 8-миллиардную модель на ноутбуке. Теперь это может быть смесь экспертов с триллионом параметров, распределённая между несколькими пользовательскими компьютерами. Это альтернативный путь для передовых моделей, которого год назад не существовало, и именно он делает жизнеспособной стратегию выпуска моделей, ориентированную прежде всего на передовой край.
И этот путь работает на Qwen: 39,6 млн загрузок GGUF в месяц — почти вдвое больше 20,8 млн у Gemma и более чем в пять раз больше 7,5 млн у Llama. Разрыв с Llama связан не с нехваткой предложения: репозитории GGUF на основе Llama немногочисленнее репозиториев Qwen. То же место на полке, но лишь пятая часть трафика.
За эти семь месяцев число репозиториев моделей выросло на 21,5%. Несколько связанных с ними компонентов росли в несколько раз быстрее.
Число репозиториев, указывающих библиотеку gguf, выросло на 464%, lerobot — на 194%, а Apple's mlx — на 148%, тогда как transformers и peft выросли на 16%, а diffusers — на 21%. Ядро моделирования растёт примерно со средней по платформе скоростью. А слой, определяющий, где физически может работать модель — форматы локального вывода, Apple Silicon, стеки управления роботами, — растёт в три–семь раз быстрее.
Среди десяти крупнейших семейств моделей лаборатории, стоящие за ними, публикуют очень мало официальных конвертаций GGUF. Однако именно версии GGUF часто используют разработчики, запускающие модели локально. Предоставление официальной конвертации при выпуске, документирование вариантов квантования и подпись артефактов потребовали бы немного дополнительных усилий. Вместо поддержки этого процесса внутри компании лаборатории могли бы сотрудничать с уже существующими участниками экосистемы, такими как Unsloth. Это сократило бы разрыв между весами, протестированными создателями моделей, и версиями, которые принимает более широкое сообщество.
6. Агенты — новый пользователь
В марте мы не могли написать этот раздел, поскольку необходимого инструмента ещё не существовало. Датасет agent-usage, опубликованный в июле, фиксирует токен agent/<name>, который агенты для программирования отправляют при обращении к Hub через huggingface_hub или hf CLI — при поиске моделей, загрузке датасетов, запуске Jobs и создании Spaces. Впервые мы можем увидеть, сколько агентского трафика получает Hub и из каких оболочек он поступает.
В июле лидировал Claude Code с 44,4%, но один месяц скрывает главный вывод: в апреле его доля составляла 67,8%, а в мае — 6,4%, тогда как Codex стабильно вырос с 10,4% до 20,8%. Это рынок без признанного лидера, где один выпуск или изменение настройки по умолчанию может за месяц перераспределить половину трафика.
Второй вывод связан с незарегистрированной строкой. Почти четверть агентского трафика в июле пришла от оболочек, ещё не указанных в датасете, а в мае этот показатель составлял 59,8%. С апреля по июль появилось более десятка новых идентификаторов клиентов. Новые участники приходят быстрее, чем любой реестр успевает их регистрировать, — и это само по себе важный вывод.
Значительную часть года мы создавали продукты для этого читателя, а не только для людей, просматривающих страницы. В марте статьи начали предоставлять машиночитаемый Markdown. В апреле появились трассировки агентов как полноценный тип датасетов и endpoint agents.md в каждом Gradio Space, благодаря чему агент может прочитать API Space и напрямую вызвать его. В июле на нашем MCP-сервере появился инструмент hf_fs, предоставляющий доступ к репозиториям, хранилищу, документации и статьям через единый интерфейс чуть более чем за тысячу токенов, а также подключаемые песочницы для безопасного выполнения. Та же консолидация произошла на уровне протокола: MCP перешёл под управление Agentic AI Foundation при Linux Foundation.
Затем, в июле, агент перестал быть читателем и стал нарушителем. С нами произошёл, по-видимому, первый задокументированный случай, когда автономный агент по собственной инициативе осуществлял продолжительное вторжение. Пока наша команда пыталась использовать передовые закрытые модели для анализа перехваченного кода атаки, их защитные механизмы отказались выполнять эту работу. В итоге анализ был завершён с помощью квантованной открытой модели GLM-5.2, работавшей на нашей собственной инфраструктуре. Мы опубликовали раскрытие информации и полную техническую хронологию.
Взгляд в будущее
По сравнению с весенним отчётом географический перерасчёт сил продолжает ускоряться. Американские открытые модели по-прежнему развиваются, однако между несколькими китайскими передовыми моделями идёт гонка, привлекающая значительное внимание сообщества. Многочисленные отметки «Нравится» у этих передовых моделей показывают, что именно сильнее всего волнует сообщество, а также создают возможности для роста компаний, использующих это внимание для повышения оценок.
Однако гонка ИИ — это не только спринт, но и марафон. Такие инструменты, как llama.cpp, помогают развёртывать крупные модели локально, но широкое семейство моделей и его принятие по-прежнему остаются ключевыми для создания положительной обратной связи между разработчиками, издателями и будущими пользователями. Модели, встроенные в инфраструктуру и ставшие частью экосистемы, в конечном счёте могут привести к коммерчески успешному результату.
В итоге тот факт, что агенты впервые стали пользователем номер один на Hub HF, означает, что следующий отчёт также может выглядеть совершенно иначе.
Как и в ИИ в целом, несколько месяцев способны изменить экосистему.
Методологические примечания
Этот анализ основан на активности, наблюдавшейся на Hugging Face Hub в течение первых семи месяцев 2026 года.
Метрики, использованные в этом отчёте, включая загрузки, отметки «Нравится», производные модели и выпуски моделей, отражают разные аспекты активности экосистемы. Их не следует интерпретировать как прямые показатели качества моделей, коммерческого принятия или общей доли рынка.
Загрузки отражают использование внутри экосистемы Hub, но не учитывают использование API, частные развёртывания или модели, распространяемые по другим каналам.
Отметки «Нравится» отражают внимание и интерес сообщества, а производные модели служат показателем того, насколько активно разработчики строят решения на основе существующей модели.
Поскольку принятие открытого ИИ происходит по множеству каналов, активность на Hub следует рассматривать как один из аспектов развития экосистемы, а не как полное измерение рынка ИИ.
Модели, упомянутые в этой статье 2
Датасеты, упомянутые в этой статье 1
Коллекции, упомянутые в этой статье 3
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 2
Датасеты, упомянутые в этой статье 1
Коллекции, упомянутые в этой статье 3
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.











