Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Команда Qwen в Alibaba выпустила Qwen3.8-Flash-Next: мультимодальную MoE-модель со 125B параметров и 6B активных параметров — предварительный обзор архитектуры Qwen4

Команда Qwen компании Alibaba выпустила Qwen3.8-Flash-Next — мультимодальную модель Mixture-of-Experts с открытыми весами, созданную с учётом стоимости токена. Чекпойнт сочетает основу на 125B параметров с таблицей N-граммовых эмбеддингов на 51B параметров и модулем многотокенного предсказания на 4B параметров. На каждый токен активируются только 6B параметров. Команда позиционирует её как ранний предварительный вариант архитектуры, которая ляжет в основу Qwen4, — в той же роли, которую Qwen3-Next сыграла для Qwen3.5. Релиз основан на четырёх изменениях: гибриде Gated DeltaNet и Qwen Sparse Attention, Gated Residual, N-gram Embedding и оптимизаторе Muon. Команда Qwen сообщает, что стоимость обучения составила примерно одну девятую от стоимости Qwen3.7-Plus.

Можно ли её развернуть?

Да, но не на рабочей станции. Чекпойнт FP8 занимает 172.78 GiB, а чекпойнт BF16 — 335.28 GiB. Согласно рецептам vLLM, TP2 — минимальная проверенная конфигурация FP8 на GB300, а TP4 рекомендуется. На узле с 8×H200 следует использовать TEP8; обычный TP8 несовместим с блоками квантования шириной 128, используемыми в чекпойнте. Разреженная активация снижает вычислительную нагрузку, но не объём хранилища.

Что именно нового

Qwen3.8-Flash-Next сочетает основную модель на 125B параметров с 51B параметров N-граммовых эмбеддингов и модулем многотокенного предсказания на 4B параметров — всего 180B параметров на диске. На каждый токен активируются только 6B параметров. В основе лежат четыре изменения:

  • Гибридное внимание (GDN + QSA): три из каждых четырёх слоёв используют Gated DeltaNet — слой линейного внимания, который сжимает историю в рекуррентное состояние фиксированного размера. Четвёртый слой работает на основе Qwen Sparse Attention (QSA), использующего облегчённый индексатор для выбора контекста на уровне микроблоков, а не отдельных токенов. Структура слоёв — 12 × (3 × GDN → 1 × QSA) в 48 слоях, с бюджетом QSA в 512 блоков или 2048 токенов.
  • Gated Residual: остаточный поток расширяется до 4 параллельных ветвей с поэлементными гейтами чтения и скалярным гейтом записи для каждой ветви, при ранге узкого места 320.
  • N-gram Embedding: таблица биграмм и триграмм на 20 000 000 записей на втором слое добавляет ёмкость за счёт детерминированных обращений. Её можно выгрузить в оперативную память хоста с асинхронной предварительной загрузкой — однако в настоящее время выгрузка работает только на устройствах NVIDIA.
  • Рецепт обучения.: оптимизатор Muon применяется совместно с AdamW к определённым категориям весов; разогрев размера пакета был исключён, а законы масштабирования переопределены.

Слой MoE содержит 512 экспертов, из которых активируются 10 маршрутизируемых и 1 общий, при промежуточной размерности эксперта 640.

Бенчмарки

Qwen сообщает результат 58.7 в DeepSWE 1.1, 62.5 в SWE-bench Pro, 81.0 в SWE-bench Multilingual и 91.9 в LiveCodeBench v6. В агентских задачах модель получает 73.9 в CoWorkBench, 55.7 в JobBench и 73.5 в Toolathlon Verified. Мультимодальные результаты включают 84.5 в AndroidWorld, 76.6 в LVBench, 88.5 в RealWorldQA и 95.7 в MathVision с интерпретатором кода.

Модель не лидирует во всех категориях. Claude Opus 4.6 (Max) получает 40.0 в HLE против 35.9 у Qwen, а DeepSeek-V4-Flash-0731 лидирует в NL2Repo-Bench с результатом 54.2 против 48.1. Передовые возможности рассуждения остаются слабым местом.

Эффективность

Qwen заявляет, что стоимость обучения составила примерно 1/9 от стоимости Qwen3.7-Plus. Что касается обслуживания, в анонсе говорится об ускорении ядер QSA до 7.6× при заполнении контекста и 4.9× при декодировании на 1M токенов, тогда как в руководстве SGLang и рецептах vLLM указаны значения 10.2× и 6.6×. До независимых измерений этот диапазон следует считать заявленным поставщиком. Qwen также сообщает о 8.6× большей пропускной способности при заполнении контекста по сравнению с Qwen3.7-Plus при коэффициенте попаданий в кэш префикса 90%.

Контекст составляет 262 144 токена изначально и может быть расширен до 1 000 000 с помощью YaRN.

Запуск модели

Модель работает через vLLM, SGLang, TokenSpeed, transformers serve и llama.cpp для квантованных версий GGUF. Тонкая настройка поддерживается через Unsloth, Swift и LLaMA-Factory. Модель уже используется в режиме «Standard» на платформе QwenWork и работает с Qwen Code.

Режим рассуждения включён по умолчанию, а параметр reasoning_effort может иметь значения xhigh, medium или low. Для режима рассуждения Qwen рекомендует temperature 1.0 и top_p 0.95, а для режима instruct — temperature 0.7 и top_p 0.80.

Ключевые выводы

  • Основа на 125B параметров + 51B параметров N-граммовых эмбеддингов + 4B параметров MTP; на каждый токен активируются только 6B параметров.
  • Три из четырёх слоёв используют Gated DeltaNet; в четвёртом работает Qwen Sparse Attention на уровне микроблоков.
  • Модель обучена примерно за 1/9 стоимости Qwen3.7-Plus, с нативным контекстом 262K, расширяемым до 1M с помощью YaRN.
  • Веса FP8 занимают 172.78 GiB, поэтому для самостоятельного размещения потребуется узел с несколькими GPU, а не рабочая станция.
  • Лицензия — qwen-community-1.0, а не Apache-2.0; перед коммерческим использованием проверьте условия.

Посетите страницу на GitHub, карточку модели на HF и технические подробности. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости