Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← До новин

Історія Qwen: ШІ-моделі Alibaba від 7B до 2,4T

У квітні 2023 року Alibaba Cloud продемонструвала чат-бота, назва якого приблизно означає «істина з тисячі запитань». Через три з половиною роки його нащадок постачається з відкритими вагами та 2,4 трильйона параметрів. Це історія того, як Qwen дійшов до цього — випуск за випуском.

Розділ 1 — 2023: тисяча запитань

Alibaba розпочала після ChatGPT, але ненабагато пізніше. 7 квітня 2023 року Alibaba Cloud почала роздавати коди-запрошення корпоративним клієнтам для моделі під назвою Tongyi Qianwen. Назва частково походить від імені філософа Мен-цзи.

Через чотири дні на саміті Alibaba Cloud у Пекіні тодішній генеральний директор Деніел Чжан представив її публічно. Alibaba заявила, що вбудує модель у всі свої бізнеси, почавши з DingTalk і голосового асистента Tmall Genie (China Daily).

Справжній поворот відбувся в серпні. 3 серпня 2023 року Alibaba відкрила код Qwen-7B і Qwen-7B-Chat — пряму відповідь Llama 2 від Meta. Qwen-7B попередньо навчали на понад 2,2 трильйона токенів із контекстом у 2048 токенів. Її ліцензія дозволяла безплатне комерційне використання для продуктів із менш ніж 100 мільйонами щомісячних користувачів.

За кілька тижнів з’явився й зір. Qwen-VL, перша гілка моделей для роботи з баченням і мовою, вийшла наприкінці серпня 2023 року.

13 вересня 2023 року Tongyi Qianwen стала доступною для широкої публіки, що свідчило про схвалення китайських регуляторів. Того ж місяця команда опублікувала на arXiv технічний звіт Qwen.

Рік завершився масштабуванням. Приблизно 1 грудня 2023 року Alibaba випустила для завантаження моделі 72B і 1.8B. Тепер Qwen охоплювала відкриті ваги — від придатних для ноутбука до моделей передового рівня.

Розділ 2 — 2024: машина відкритих ваг

2024 рік став роком, коли Qwen перетворилася на стандартний вибір розробників. Команда випустила 3 покоління за 8 місяців.

Qwen1.5 (лютий): 5 лютого 2024 року команда випустила Qwen1.5, позиціонуючи її як бета-версію Qwen2. Вона охоплювала щільні моделі від 0.5B до 72B зі стабільним контекстом у 32K на кожному розмірі. Згодом з’явилася MoE-модель 14B із 2.7B активних параметрів. Також було випущено щільну модель 110B — першу в сімействі понад 100B.

Qwen2 (червень): На початку червня 2024 року команда анонсувала Qwen2 у 5 розмірах — від 0.5B до 72B. До лінійки увійшла Qwen2-57B-A14B, перша відкрита флагманська модель із сумішшю експертів. Навчальні дані додали 27 мов на додачу до англійської та китайської. Інструктивні моделі 7B і 72B працювали з контекстом до 128K токенів. Найважливішою стала зміна ліцензування: усі розміри, крім 72B, перейшли на Apache 2.0.

Улітку з’явилися спеціалізовані моделі. Qwen2-Math вийшла в серпні разом із Qwen2-Audio. Наприкінці серпня з’явилася Qwen2-VL, здатна аналізувати відео тривалістю понад 20 хвилин.

Qwen2.5 (вересень): На конференції Apsara 19 вересня 2024 року Alibaba одночасно випустила понад 100 моделей із відкритим кодом. У технічному звіті Qwen2.5 зазначено, що обсяг даних для попереднього навчання зріс із 7 до 18 трильйонів токенів. Розміри варіювалися від 0.5B до 72B, із контекстом 128K і генерацією до 8K токенів.

Застосування вже було реальним. Alibaba заявила, що моделі Qwen перевищили 40 мільйонів завантажень і надихнули на створення понад 50 000 похідних моделей на Hugging Face.

Кодування та міркування (листопад–грудень): Qwen2.5-Coder отримала повну лінійку 11 листопада 2024 року. Потім з’явилася перша модель для міркувань. QwQ-32B-Preview вийшла наприкінці листопада під ліцензією Apache 2.0 як відкритий конкурент o1 від OpenAI. QVQ-72B-Preview, експериментальна модель візуального міркування, завершила рік 24 грудня.

Розділ 3 — Початок 2025 року: відповідь DeepSeek

Січень 2025 року належав DeepSeek-R1. Qwen відповіла за кілька тижнів, а не місяців.

26 січня команда випустила Qwen2.5-VL у розмірах 3B, 7B і 72B. TechCrunch зазначив, що вона могла керувати комп’ютерами й телефонами. Через три дні, у перший день Місячного Нового року, Alibaba запустила Qwen2.5-Max, великомасштабну MoE-модель. Reuters повідомило про заяву Alibaba, що вона перевершила DeepSeek-V3.

Важливішою заявою стало оголошення 6 березня. QwQ-32B, створена на основі Qwen2.5-32B і навчена з підкріпленням, вийшла під ліцензією Apache 2.0. Qwen заявила про продуктивність, порівнянну з DeepSeek-R1 — моделлю 671B. VentureBeat оцінив різницю в апаратних вимогах як приблизно 24 ГБ VRAM проти понад 1500 ГБ. Того дня гонконзькі акції Alibaba зросли більш ніж на 7%.

Мультимодальність не відставала. Qwen2.5-Omni-7B вийшла 26 березня під ліцензією Apache 2.0. Вона приймала на вхід текст, зображення, аудіо та відео, а відповідала текстом або мовленням. CNBC назвала її моделлю для економічно ефективних AI-агентів.

Розділ 4 — 2025: Qwen3 і трильйон параметрів

Qwen3 (квітень): 29 квітня 2025 року за пекінським часом команда випустила Qwen3: 6 щільних моделей від 0.6B до 32B і 2 MoE-моделі. Флагманом стала Qwen3-235B-A22B із 22B активних параметрів. Усі моделі вийшли під ліцензією Apache 2.0.

Ключовою функцією стало гібридне мислення. Одна модель могла міркувати крок за кроком або відповідати миттєво — режим перемикав користувач. У технічному звіті Qwen3 зазначено, що попереднє навчання проводилося приблизно на 36 трильйонах токенів. Мовне охоплення зросло з 29 до 119 мов і діалектів. TechCrunch назвав її сімейством «гібридних» моделей міркування.

Оновлення 2507 (липень): 21 липня 2025 року Qwen знову розділила гібридне мислення на окремі компоненти. Qwen3-235B-A22B-Instruct-2507 вийшла як модель без режиму мислення з нативним контекстом 262K. Окремі контрольні точки Thinking-2507 з’явилися згодом (колекція Hugging Face).

Агенти та зображення (липень–серпень): Qwen3-Coder-480B-A35B вийшла 22 липня 2025 року для агентного кодування. Alibaba представила її разом із Qwen Code — агентом для кодування у терміналі з відкритим кодом (Computerworld). 4 серпня команда відкрила код Qwen-Image — моделі MMDiT із 20B параметрів, створеної для відтворення тексту всередині зображень.

Варіант для редагування, Qwen-Image-Edit, було відкрито 18 серпня 2025 року.

Вересневий ривок: Qwen3-Max-Preview, перша модель Qwen із понад 1 трильйоном параметрів, з’явилася 5 вересня. На відміну від попередніх флагманів, вона була доступна лише через API.

Через кілька днів з’явилася Qwen3-Next-80B-A3B — ставка на нову архітектуру. Вона поєднала лінійну увагу Gated DeltaNet із gated attention у співвідношенні 3:1. У картці моделі заявлено 10% вартості навчання Qwen3-32B і в 10 разів вищу пропускну здатність під час інференсу після 32K токенів.

22 вересня з’явилися Qwen3-Omni і Qwen3-VL. На конференції Apsara 24 вересня Alibaba офіційно запустила Qwen3-Max. Генеральний директор Едді Ву заявив, що витрати перевищать 380 мільярдів юанів (53 мільярди доларів США), передбачених трирічним планом розвитку ШІ та хмарних технологій.

До кінця року Qwen стала національною інфраструктурою для інших. У листопаді 2025 року AI Singapore заявила, що її модель Sea-Lion перейде з Llama на Qwen як на базову модель.

Qwen також стала споживчим брендом. Застосунок Qwen увійшов у публічну бета-версію 17 листопада 2025 року. Alibaba заявила, що за перший тиждень його завантажили понад 10 мільйонів разів.

Розділ 5 — 2026: 4 покоління за 6 місяців

Швидкий старт (січень–лютий): 26 січня 2026 року Qwen випустила Qwen3-Max-Thinking, закриту модель міркування. Qwen заявила, що за 19 тестами вона порівнянна з GPT-5.2-Thinking, Claude Opus 4.5 і Gemini 3 Pro (TestingCatalog). Qwen3-Coder-Next, мала гібридна модель для агентного кодування, з’явилася 2 лютого. Qwen-Image-2.0 об’єднала генерацію та редагування в одній моделі 10 лютого.

Qwen3.5 (лютий): 16 лютого 2026 року, напередодні Місячного Нового року, Alibaba представила Qwen3.5 для того, що назвала епохою агентного ШІ. Відкрита Qwen3.5-397B-A17B активує 17B із 397B параметрів. Вона працює на гібридній архітектурі з лінійною увагою, яку раніше продемонструвала Qwen3-Next. Хостингова Qwen3.5-Plus отримала контекст у 1 мільйон токенів.

Середня серія з’явилася 24 лютого. Qwen заявила, що Qwen3.5-35B-A3B перевершила старішу Qwen3-235B-A22B-2507. Малі моделі для пристроїв з’явилися 2 березня.

Зміна керівництва (березень): 3 березня технічний керівник Цзюньян Лінь повідомив, що залишає посаду. Reuters повідомило, що він був третьою керівною фігурою Qwen, яка залишила компанію у 2026 році. Керівник постнавчання Юй Бовень також пішов, а керівник напряму кодування Хуей Біньюань у січні приєднався до Meta (Yicai).

За даними 36Kr, причиною став план розділити Qwen на команди горизонтального попереднього навчання, постнавчання та модальностей. 16 березня Alibaba передала свої підрозділи ШІ під керівництво нової групи на чолі з генеральним директором Едді Ву. На той час Alibaba випустила понад 400 відкритих моделей Qwen, які завантажили понад 1 мільярд разів.

Qwen3.6 (квітень): Темп не сповільнився. Qwen3.6-Plus вийшла 2 квітня як пропрієтарна хостингова модель. Це відповідало ширшому тренду: SCMP повідомляло, що китайські технологічні гіганти ШІ переходять до пропрієтарних моделей заради доходів. Відкритий напрям продовжив розвиватися. Qwen3.6-35B-A3B вийшла під ліцензією Apache 2.0 16 квітня, орієнтуючись на агентне кодування.

Протягом наступного тижня з’явилися ще дві моделі. Qwen3.6-Max-Preview, закритий попередній варіант флагманської моделі, вийшла 20 квітня. 22 квітня щільна Qwen3.6-27B вийшла під ліцензією Apache 2.0. Qwen заявила, що вона перевершила Qwen3.5-397B-A17B у ключових тестах із кодування.

Qwen3.7 (травень–червень): На саміті Alibaba Cloud 20 травня Alibaba представила Qwen3.7-Max, створену для агентних завдань із довгим горизонтом планування. Alibaba заявила, що Artificial Analysis поставила її на п’яте місце у світі та на перше серед китайських моделей. Qwen3.7-Plus з’явилася на початку червня за ціною 0,4/1,6 долара за 1 млн токенів. Обидві моделі залишилися закритими.

У липні CNBC повідомило, що Qwen буде інтегрована в Apple Intelligence у Китаї.

Qwen3.8 (липень–серпень): Bloomberg повідомило про попередній перегляд нового флагмана 19 липня. Хостингова Qwen3.8-Max вийшла на початку серпня. 12 серпня Alibaba відкрила її базову модель як Qwen3.8-2.4T-A95B: 2,4 трильйона параметрів, 95B активних (Gigazine).

У ліцензії з’явилося нове обмеження. Провайдерам із доходом понад 50 мільйонів доларів США за 12 місяців потрібна комерційна ліцензія. Через два дні Qwen3.8-27B вийшла під звичайною ліцензією Apache 2.0. 26 серпня Reuters повідомило про Qwen3.8-Flash. Її відкритий побратим Qwen3.8-Flash-Next позиціонувався як ранній попередній варіант архітектури Qwen4.

Вересень: 20 вересня Qwen-Image-2.1 з’явилася як генератор із 7B параметрів. На відміну від попередніх відкритих моделей Qwen для роботи із зображеннями, вона призначена лише для досліджень.

Через два дні, на Apsara 2026, Alibaba заявила, що Qwen 4 «нині перебуває на етапі навчання». Компанія спрогнозувала для Qwen 4.5 і Qwen 5 від 5 до 10 трильйонів параметрів. Для Qwen 4 не назвали ні дату, ні розміри, ні ліцензію.

Розділ 6 — Екосистема та еволюція ліцензій

Охоплення Qwen зростало швидше, ніж кількість її параметрів. У вересні 2024 року Alibaba повідомила про 40 мільйонів завантажень і понад 50 000 похідних моделей. До березня 2026 року Reuters оцінювало показники як понад 400 відкритих моделей і понад 1 мільярд завантажень. У тому ж матеріалі зазначалося, що застосунок Qwen у лютому 2026 року досяг 203 мільйонів активних користувачів на місяць.

Під час запуску Qwen3-Max-Thinking у січні 2026 року Alibaba також заявила, що Qwen стала першим сімейством відкритих моделей із понад 200 000 похідних моделей на Hugging Face.

Ліцензії розповідають тихішу історію. Qwen пройшла шлях від обмежень до відкритості, а потім до свідомого дворівневого поділу.

ПеріодЩо змінилосяПриклад
Серпень 2023Власна ліцензія, безплатне використання для продуктів із менш ніж 100 млн щомісячних користувачівQwen-7B
Червень 2024Більшість розмірів переходить на Apache 2.0; 72B зберігає ліцензію QianwenQwen2
Квітень 2025Усі відкриті моделі під ліцензією Apache 2.0Qwen3
Вересень 2025Флагман доступний лише через APIQwen3-Max
Квітень–червень 2026Рівні Plus і Max пропрієтарні; моделі середнього розміру відкритіQwen3.6, Qwen3.7-Plus
Серпень 2026Ваги моделі 2.4T відкриті, але діє поріг доходу в 50 млн доларів СШАQwen3.8-2.4T-A95B
Вересень 2026Модель зображень під ліцензією лише для дослідженьQwen-Image-2.1

Закономірність послідовна. Малі та середні моделі залишаються доступними, щоб розробники продовжували будувати на Qwen. Передовий рівень приносить дохід через Alibaba Cloud.

Хронологія

Усі наведені нижче дати пов’язані з розділами вище. Від найновіших до найстаріших.

Ключові висновки

  • Qwen почалася як Tongyi Qianwen — корпоративна бета-версія лише за запрошеннями, оголошена 11 квітня 2023 року.
  • Відкриті ваги з’явилися швидко: Qwen-7B у серпні 2023 року, Qwen-72B — до кінця того ж року.
  • Qwen3 (квітень 2025 року) додала гібридне мислення, 36 трильйонів навчальних токенів і 119 мов під ліцензією Apache 2.0.
  • У 2026 році з’явилися 4 покоління за 6 місяців (від Qwen3.5 до Qwen3.8) і стратегія поділу на відкриті та пропрієтарні моделі.
  • Qwen 4 перебуває на етапі навчання; дорожня карта Alibaba передбачає для Qwen 4.5 і Qwen 5 від 5 до 10 трильйонів параметрів.

Ресурси:

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини