Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Команда Qwen в Alibaba випустила Qwen3.8-Flash-Next: мультимодальну MoE-модель зі 125B параметрів і 6B активних параметрів — попередній огляд архітектури Qwen4

Команда Alibaba Qwen випустила Qwen3.8-Flash-Next — мультимодальну модель Mixture-of-Experts із відкритими вагами, створену з урахуванням вартості токена. Чекпойнт поєднує основу на 125B параметрів із таблицею N-грамових ембедингів на 51B параметрів і модулем багатотокенного передбачення на 4B параметрів. На кожен токен активуються лише 6B параметрів. Команда позиціонує її як ранній попередній перегляд архітектури, на якій базуватиметься Qwen4, — у тій самій ролі, яку Qwen3-Next відіграла для Qwen3.5. Реліз ґрунтується на чотирьох змінах: гібриді Gated DeltaNet і Qwen Sparse Attention, Gated Residual, N-gram Embedding та оптимізаторі Muon. Команда Qwen повідомляє, що вартість навчання становила приблизно одну дев’яту від вартості Qwen3.7-Plus.

Чи придатна вона для розгортання?

Так, але не на робочій станції. Розмір чекпойнта FP8 становить 172.78 GiB, а чекпойнта BF16 — 335.28 GiB. Згідно з рецептами vLLM, TP2 є мінімальною перевіреною конфігурацією FP8 на GB300, а рекомендованою — TP4. На вузлі з 8×H200 використовуйте TEP8; звичайний TP8 несумісний із блоками квантизації шириною 128 у цьому чекпойнті. Розріджена активація скорочує обчислення, але не обсяг сховища.

Що насправді нового

Qwen3.8-Flash-Next поєднує основну модель на 125B параметрів із 51B параметрів N-грамових ембедингів і модулем багатотокенного передбачення на 4B параметрів, що загалом займає 180B параметрів на диску. На кожен токен активуються лише 6B параметрів. Основу становлять чотири зміни:

  • Гібридна увага (GDN + QSA): у трьох із кожних чотирьох шарів використовується Gated DeltaNet — шар лінійної уваги, який стискає історію у рекурентний стан фіксованого розміру. Четвертий шар використовує Qwen Sparse Attention (QSA), що за допомогою легкого індексатора вибирає контекст на рівні мікроблоків, а не окремих токенів. Структура шарів — 12 × (3 × GDN → 1 × QSA) у 48 шарах, із бюджетом QSA у 512 блоків або 2048 токенів.
  • Gated Residual: залишковий потік розширюється до 4 паралельних гілок, із поелементним вентилем читання та скалярним вентилем запису для кожної гілки, із рангом вузького місця 320.
  • N-gram Embedding: таблиця біграм/триграм на 20 000 000 записів у шарі 2 додає ємність завдяки детермінованим пошукам. Її можна вивантажити в оперативну пам’ять хоста з асинхронним попереднім завантаженням — хоча наразі вивантаження працює лише на пристроях NVIDIA.
  • Рецепт навчання.:Оптимізатор Muon застосовується разом з AdamW до певних категорій ваг, прогрівання розміру батчу усунуто, а закони масштабування переналаштовано.

Шар MoE містить 512 експертів, із яких активуються 10 маршрутизованих і 1 спільний, а проміжна розмірність експертів становить 640.

Бенчмарки

Qwen повідомляє про результат 58.7 у DeepSWE 1.1, 62.5 у SWE-bench Pro, 81.0 у SWE-bench Multilingual і 91.9 у LiveCodeBench v6. У агентних завданнях модель отримує 73.9 у CoWorkBench, 55.7 у JobBench і 73.5 у Toolathlon Verified. Мультимодальні результати включають 84.5 в AndroidWorld, 76.6 у LVBench, 88.5 у RealWorldQA і 95.7 у MathVision з інтерпретатором коду.

Модель не лідирує в усіх категоріях. Claude Opus 4.6 (Max) отримує 40.0 у HLE проти 35.9 у Qwen, а DeepSeek-V4-Flash-0731 лідирує в NL2Repo-Bench із результатом 54.2 проти 48.1. Розрив у фронтирному міркуванні зберігається.

Ефективність

Qwen зазначає, що вартість навчання становила приблизно 1/9 від вартості Qwen3.7-Plus. Щодо обслуговування, в анонсі вказано прискорення ядра QSA до 7.6× під час попереднього заповнення і 4.9× під час декодування на 1M токенів, тоді як у рецепті SGLang і рецептах vLLM наведено показники 10.2× і 6.6×. Сприймайте цей діапазон як заявлені постачальником дані, доки їх не буде незалежно виміряно. Qwen також повідомляє про 8.6× вищу пропускну здатність попереднього заповнення порівняно з Qwen3.7-Plus за коефіцієнта попадання в кеш префікса 90%.

Контекст нативно становить 262 144 токени і може бути розширений до 1 000 000 за допомогою YaRN.

Запуск моделі

Модель працює через vLLM, SGLang, TokenSpeed, transformers serve і llama.cpp для GGUF-квантів. Дообучення підтримується через Unsloth, Swift і LLaMA-Factory. Вона вже працює в режимі «Standard» на QwenWork і сумісна з Qwen Code.

Режим міркування за замовчуванням увімкнено, а параметр reasoning_effort може мати значення xhigh, medium або low. Для режиму міркування Qwen рекомендує temperature 1.0 і top_p 0.95, а для instruct-режиму — temperature 0.7 і top_p 0.80.

Ключові висновки

  • Основа на 125B параметрів + 51B параметрів N-грамових ембедингів + 4B параметрів MTP, із лише 6B активних параметрів на токен.
  • Три з чотирьох шарів використовують Gated DeltaNet; четвертий працює з Qwen Sparse Attention на рівні мікроблоків.
  • Модель навчено приблизно за 1/9 вартості Qwen3.7-Plus, із нативним контекстом 262K, який можна розширити до 1M за допомогою YaRN.
  • Ваги FP8 займають 172.78 GiB, тому для самостійного розгортання потрібен вузол із кількома GPU, а не робоча станція.
  • Ліцензія — qwen-community-1.0, а не Apache-2.0; перед комерційним використанням перевірте умови.

Відвідайте сторінку на GitHub, картку моделі на HF і технічні деталі. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150k+ учасників та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини