Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

GLM-5.3-Flash срещу Qwen3.8-Flash-Next: Две китайски AI лаборатории независимо стигат до една и съща архитектура на модела

Тази седмица два авангардни модела с отворени тегла излязоха в рамките на един ден. Z.ai пусна GLM-5.3-Flash — мултимодален MoE модел с 320 млрд. параметъра, от които 18 млрд. са активни. Екипът на Qwen към Alibaba пусна Qwen3.8-Flash-Next — модел със 125 млрд. параметъра и 6 млрд. активни параметъра, който представя предварително архитектурата Qwen4.

Двата екипа са проектирали тези системи независимо един от друг. И все пак конфигурациите им изглеждат почти като копия. И двата модела използват хибрид 3:1 от линейно и пълно внимание. И двата избират контекста с компресиран индексатор, ограничен до 2048 токена. И двата разширяват остатъчния поток до 4 управлявани клона. И двата се обучават с оптимизатора Muon, като слетите матрици от параметри се разделят преди ортогонализацията. В тази статия разглеждаме общата рецепта, единствената точка на несъгласие и единствената лаборатория, която заема различна позиция.

Двата модела накратко

GLM-5.3-Flash е първият изначално мултимодален модел от серията GLM-5, пуснат под лиценза MIT в Hugging Face. Z.ai го тества анонимно като Ox Alpha в OpenRouter, където той стана най-популярният модел за седмицата. Обучен е върху мултимодален корпус от 30 трлн. токена и предлага контекстов прозорец от 1 млн. токена. Z.ai твърди, че моделът превъзхожда GLM-5.2 в различни бенчмаркове на една десета от цената, като същевременно се доближава до Claude Opus 4.8 в бенчмаркове за програмиране и агентни задачи. Публичната цена е 0,15 долара на милион входни токена и 0,50 долара на милион изходни токена.

Qwen3.8-Flash-Next изпълнява ролята, която Qwen3-Next изпълняваше за Qwen3.5: ранен публичен преглед на следващото архитектурно семейство. В картата на модела е посочен основен модел със 125 млрд. параметъра и допълнителна таблица за n-грамови вграждания с 51 млрд. параметъра, като за всеки токен се активират 6 млрд. параметъра. Нативният контекст е 262 144 токена, а с YaRN може да бъде разширен до 1 млн. токена. Екипът на Qwen съобщава, че обучението е изисквало само около една девета от изчислителния ресурс на Qwen3.7-Plus. Придружаващият технически доклад е озаглавен „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability.“

Точка на сближаване 1: Три от всеки четири слоя за внимание са линейни

GLM-5.3-Flash има 45 слоя: 34 слоя с линейно внимание и 11 слоя с пълно внимание според публикуваната конфигурация. Qwen3.8-Flash-Next има 48 слоя, подредени в повтарящ се блок от 3 слоя Gated DeltaNet плюс 1 слой Qwen Sparse Attention според рецептата на vLLM. И двата модела достигат съотношение 3:1.

Линейните слоеве са евтините слоеве. Вместо кеш на ключове и стойности (KV), който нараства с текста, те компресират цялата история в рекурентно състояние с фиксиран размер. Изчисленията за токен остават постоянни независимо от дължината на контекста. GLM използва Kimi Delta Attention (KDA) — дизайн за линейно внимание, въведен от Kimi Linear на Moonshot AI, който прилага финозърнест коефициент на затихване на канал. Qwen използва собствения си Gated DeltaNet (GDN), който управлява на ниво глава. Различна гранулярност на управляването, едно и също семейство delta-rule, една и съща задача.

Останалата четвърт от слоевете извършва прецизно извличане на данни от далечния контекст. GLM използва NoPE многоглаво латентно внимание (MLA) в стила на DeepSeek. Qwen използва внимание с групирани заявки в QSA. Именно тук реално се намира кешът KV и именно тук се появява вторият общ трик.

Точка на сближаване 2: Компресирайте 4 пъти, оценете, запазете 2048 токена

Нито един от двата модела не позволява на слоевете с пълно внимание да се фокусират върху целия контекст. И двата добавят малък обучен индексатор, който оценява части от историята и запазва само победителите. Параметрите почти напълно съвпадат.

Разредените слоеве на GLM използват 32-глав индексатор за мълниеносно внимание с избор на топ 2048, произлязъл от DSA на DeepSeek. За да намали разходите за индексатора при контекст от 1 млн. токена, Z.ai въвежда IndexPool, който компресира четири ключови вектора на индексатора в един чрез претеглено обединяване преди оценяването. QSA на Qwen работи на ниво микроблокове: компресираният лек индексатор оценява блокове от по 4 токена и запазва 512-те най-добри блока, което е точно 2048 токена. Така и двата модела компресират контекста 4 пъти преди оценяването, а и двата ограничават бюджета за внимание до 2048 токена. Qwen приписва на QSA до 7,6 пъти по-бързо предварително подаване и 4,9 пъти по-бързо декодиране спрямо пълното внимание при 1 млн. токена.

Комбинираният ефект от страна на GLM е значителен. В сравнение с пълния модел GLM-5.3, Z.ai съобщава, че архитектурата Flash намалява изчисленията за внимание приблизително 3 пъти и размера на кеша KV 4,4 пъти, като същевременно почти наполовина намалява активните параметри (18 млрд. спрямо 32 млрд.) и броя на слоевете (45 спрямо 92).

Точка на сближаване 3: Четири остатъчни потока вместо един

И двата модела изоставят единичния остатъчен поток, който определя трансформърите от 2017 г. насам. И двата го разширяват до четири паралелни клона, като управляващи механизми контролират какво всеки блок прочита обратно и записва навън.

GLM възприема Manifold-Constrained Hyper-Connections (mHC) — дизайн, произлязъл от DeepSeek, конфигуриран с 4 клона в публикуваните тегла. Qwen разработва собствен вариант, Gated Residual, който управлява потока през 4 разширени потока посредством елементно управляван от данните гейт за прочитане и скаларен гейт за записване за всеки клон. Според екипа на Qwen Gated Residual премахва допълнителната стъпка за смесване на клоновете, използвана от Hyper-Connections, което намалява разходите за достъп до паметта, а гейтът потиска достатъчно добре отклоненията на активациите, за да позволи съхранение на остатъците във FP8. Показателно е, че екипът на Qwen е тествал двата подхода поотделно и е установил, че по качество са приблизително равни. Две лаборатории, две реализации, един и същ извод: четири управлявани потока превъзхождат един.

Точка на сближаване 4: Muon със разделяне на слетите матрици по компоненти

И двата модела се обучават с оптимизатора Muon. И двата прилагат едно и също фино усъвършенстване: слетите матрици на проекциите се разделят на независимите си преобразувания, преди Muon да ги ортогонализира. Qwen документира разделянето на слетите проекции QKV, SwiGLU и GDN, като прилага Muon към истински двумерни линейни преобразувания, а AdamW — към вграждания, маршрутизатори и параметри с нисък ранг. Qwen също така преизчислява законите си за мащабиране за новата архитектура и изцяло премахва загряването на размера на партидата, след като установява, че загряването изисква с 18,8% повече стъпки на оптимизатора, без да подобрява резултатите.

Къде се разминават: позиционно кодиране

Единственото ясно разминаване е при ротационните позиционни вграждания в слоевете с пълно внимание. GLM-5.3-Flash ги премахва: конфигурацията задава qk_rope_head_dim = 0, което прави разредените му MLA слоеве изцяло NoPE. Позиционната информация преминава имплицитно през рекурентните линейни слоеве.

Qwen изпробва същото и запазва RoPE. Според техническия доклад за Qwen3.8-Next NoPE не е довел до измерима разлика по време на предварителното обучение. Проблемът се е появил по-късно: след дообучаването вариантът без NoPE често не е успявал да спре генерирането. Това е полезен предупредителен резултат за цялата област. Кривите на загубите при предварителното обучение могат да прикрият поведенчески дефекти, които се проявяват едва след настройването на етапа RLHF.

По-широкото сближаване и единственият несъгласен

Тази рецепта не е ограничена до две лаборатории. DeepSeek постави началото на модела с разреден индексатор и бюджет от 2048 токена чрез DSA в DeepSeek-V3.2-Exp, а mHC е дизайн на DeepSeek, който сега се използва в GLM. Kimi на Moonshot допринесе с KDA — точния слой за линейно внимание, възприет от GLM. Китайските модели с отворен код видимо обменят архитектурни компоненти и се сближават към общи настройки.

Забележимият несъгласен е MiniMax. По време на разработката на M2 екипът изпробва подробно линейно внимание и внимание с плъзгащ се прозорец в голям мащаб и установи сериозни дефицити при многостъпковото разсъждение, особено отвъд контекст от 32K след SFT. M2 беше пуснат с пълно softmax внимание във всеки слой. За M3 MiniMax възприе MiniMax Sparse Attention (MSA), което разрежда softmax вниманието чрез избор на блокове, но изобщо не включва слоеве с линейно внимание. Следователно областта все още не е достигнала пълен консенсус. Z.ai, Qwen, DeepSeek и Kimi залагат, че хибридът 3:1 с линейно внимание запазва способността за разсъждение. Аблационните изследвания на MiniMax показват обратното — поне при тяхната конфигурация.

Основни изводи

  • GLM-5.3-Flash (34:11) и Qwen3.8-Flash-Next (36:12) независимо са достигнали едно и също съотношение 3:1 между линейно и пълно внимание.
  • И двата модела компресират контекста 4 пъти и ограничават разреденото внимание до бюджет от 2048 токена — модел, поставен в началото от DSA на DeepSeek.
  • И двата заменят единичния остатъчен поток с 4 управлявани клона; Qwen е сравнил чрез аблация своя Gated Residual с mHC и е установил, че са равностойни.
  • Разминават се при позиционното кодиране: GLM премахва RoPE (NoPE), докато Qwen го запазва, след като моделите без NoPE не са успели да спрат генерирането след дообучаването.
  • MiniMax е несъгласният: неговите мащабни аблационни изследвания показват, че линейното внимание вреди на многостъпковото разсъждение, затова M3 използва само разредено softmax внимание.

Източници: GLM-5.3-Flash в Hugging Face, документация на Z.ai за GLM-5.3-Flash, Технически доклад за GLM-5 (arXiv:2602.15763), Qwen3.8-Flash-Next в Hugging Face, Qwen3.8-Flash-Next в GitHub, Технически блог на NVIDIA, Доклад за MiniMax-M2 (arXiv:2605.26494), и MiniMax Sparse Attention (arXiv:2606.13392)

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини