Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Екипът Qwen на Alibaba пуска Qwen3.8-Flash-Next: мултимодален MoE модел със 125B параметъра и 6B активни параметъра, предварителен преглед на архитектурата Qwen4

Екипът на Qwen на Alibaba пусна Qwen3.8-Flash-Next — мултимоделен модел с Mixture-of-Experts и отворени тегла, създаден с фокус върху разхода на токен. Чекпойнтът комбинира 125B гръбнак с 51B таблица за N-gram embeddings и 4B модул за предсказване на множество токени. Само 6B параметри се активират за всеки токен. Екипът го представя като ранен преглед на архитектурата, която ще стои в основата на Qwen4, по същия начин, по който Qwen3-Next послужи като основа за Qwen3.5. Четири промени са в основата на изданието: хибрид от Gated DeltaNet и Qwen Sparse Attention, Gated Residual, N-gram Embedding и оптимизаторът Muon. Екипът на Qwen съобщава, че разходите за обучение са приблизително една девета от тези на Qwen3.7-Plus.

Може ли да бъде внедрен?

Да, но не на работна станция. FP8 чекпойнтът е 172.78 GiB, а BF16 чекпойнтът е 335.28 GiB. Според рецептите за vLLM TP2 е минималната валидирана FP8 конфигурация на GB300, а се препоръчва TP4. На възел с 8×H200 използвайте TEP8; стандартният TP8 е несъвместим с квантизационните блокове с ширина 128 на чекпойнта. Рядката активация намалява изчисленията, но не и обема за съхранение.

Какво всъщност е ново

Qwen3.8-Flash-Next комбинира 125B основен модел с 51B параметри за N-gram embedding и 4B модул за предсказване на множество токени, което прави общо 180B параметри на диска. Само 6B параметри се активират за всеки токен. Четири промени са в основата му:

  • Хибридно внимание (GDN + QSA): Три от всеки четири слоя използват Gated DeltaNet — слой с линейно внимание, който компресира историята във фиксиран по размер рекурентен стейт. Четвъртият слой използва Qwen Sparse Attention (QSA), който чрез лек индексатор избира контекст на ниво микроблокове, а не на ниво отделни токени. Подредбата на слоевете е 12 × (3 × GDN → 1 × QSA) в 48 слоя, с бюджет на QSA от 512 блока или 2048 токена.
  • Gated Residual: Резидуалният поток се разширява до 4 паралелни клона, с поелементен гейт за четене и скаларен гейт за запис за всеки клон, при ранг на тесния участък 320.
  • N-gram Embedding: Таблица с 20 000 000 записа за биграми и триграми на слой 2 добавя капацитет чрез детерминистични справки. Тя може да бъде изнесена в хост памет с асинхронно предварително извличане — макар че в момента изнасянето работи само на устройства NVIDIA.
  • Рецепта за обучение.:Оптимизаторът Muon се прилага заедно с AdamW към определени категории тегла, като загряването на размера на партидата е премахнато, а законите за мащабиране са преизчислени.

MoE слоят разполага с 512 експерта, като активира 10 маршрутизирани и 1 споделен експерт, при междинна размерност на експерта 640.

Бенчмаркове

Qwen съобщава резултат 58.7 на DeepSWE 1.1, 62.5 на SWE-bench Pro, 81.0 на SWE-bench Multilingual и 91.9 на LiveCodeBench v6. При агентски задачи моделът постига 73.9 на CoWorkBench, 55.7 на JobBench и 73.5 на Toolathlon Verified. Мултимодалните резултати включват 84.5 на AndroidWorld, 76.6 на LVBench, 88.5 на RealWorldQA и 95.7 на MathVision с интерпретатор на код.

Моделът не води във всички категории. Claude Opus 4.6 (Max) постига 40.0 на HLE срещу 35.9 за Qwen, а DeepSeek-V4-Flash-0731 води при NL2Repo-Bench с 54.2 срещу 48.1. Разсъжденията на фронтирните модели остават разлика.

Ефективност

Qwen посочва, че разходите за обучение са приблизително 1/9 от тези на Qwen3.7-Plus. При обслужването съобщението цитира ускорения на QSA ядрото до 7.6× при prefill и 4.9× при decode при 1M токена, докато рецептата за SGLang и рецептите за vLLM посочват съответно 10.2× и 6.6×. Приемайте диапазона като данни, съобщени от доставчика, докато не бъдат измерени независимо. Qwen също съобщава 8.6× по-висока пропускателна способност при prefill от Qwen3.7-Plus при 90% попадения в кеша на префикса.

Контекстът е 262,144 токена по подразбиране и може да бъде разширен до 1,000,000 с YaRN.

Стартиране

Моделът работи чрез vLLM, SGLang, TokenSpeed, transformers serve и llama.cpp за GGUF квантизации. Дообучаването се поддържа чрез Unsloth, Swift и LLaMA-Factory. Моделът вече захранва режима „Standard“ в QwenWork и работи с Qwen Code.

Режимът на разсъждение е включен по подразбиране, като reasoning_effort може да бъде xhigh, medium или low. Qwen препоръчва temperature 1.0 и top_p 0.95 за режима на разсъждение, както и temperature 0.7 с top_p 0.80 за instruct режима.

Основни изводи

  • 125B гръбнак + 51B N-gram embeddings + 4B MTP, като само 6B параметри са активни за всеки токен.
  • Три от всеки четири слоя използват Gated DeltaNet; четвъртият използва Qwen Sparse Attention на ниво микроблокове.
  • Обучен е на приблизително 1/9 от разходите за Qwen3.7-Plus, с естествен контекст от 262K, разширим до 1M чрез YaRN.
  • FP8 теглата са 172.78 GiB, така че самостоятелното хостване изисква многографичен възел, а не работна станция.
  • Лицензиран е под qwen-community-1.0, а не под Apache-2.0 — проверете условията преди комерсиална употреба.

Разгледайте страницата в GitHub, моделната карта в HF и техническите подробности. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини