GLM-5.3-Flash против Qwen3.8-Flash-Next: две китайские ИИ-лаборатории независимо пришли к одной и той же архитектуре модели
На этой неделе две передовые модели с открытыми весами вышли с разницей менее чем в сутки. Z.ai выпустила GLM-5.3-Flash — мультимодальную MoE-модель со 320 млрд параметров, из которых активно 18 млрд. Команда Qwen из Alibaba выпустила Qwen3.8-Flash-Next — модель со 125 млрд параметров, из которых активно 6 млрд, предварительно демонстрирующую архитектуру Qwen4.
Две команды разрабатывали эти системы независимо друг от друга. И всё же их конфигурации выглядят почти как копии. Обе используют гибридную схему 3:1 из линейного и полного внимания. Обе выбирают контекст с помощью сжатого индексатора, ограниченного 2048 токенами. Обе расширяют остаточный поток до 4 ветвей с управляющими механизмами. Обе обучаются с оптимизатором Muon, причём объединённые матрицы параметров разделяются перед ортогонализацией. В этой статье рассматриваются общая схема, единственный пункт разногласий и единственная лаборатория, придерживающаяся иной позиции.
Кратко о двух релизах
GLM-5.3-Flash — первая изначально мультимодальная модель в серии GLM-5, выпущенная под лицензией MIT на Hugging Face. Z.ai анонимно тестировала её под названием Ox Alpha на OpenRouter, где она стала самой популярной моделью недели. Она обучалась на мультимодальном корпусе из 30 трлн токенов и поддерживает контекстное окно на 1 млн токенов. В Z.ai утверждают, что модель превосходит GLM-5.2 в тестах при одной десятой стоимости, одновременно приближаясь к Claude Opus 4.8 в тестах на программирование и агентные задачи. Стоимость по прайс-листу составляет $0,15 за миллион входных токенов и $0,50 за миллион выходных токенов.
Qwen3.8-Flash-Next выполняет ту же роль для Qwen3.5, которую Qwen3-Next выполняла для Qwen3: это ранний публичный предварительный релиз следующего семейства архитектур. В карточке модели указана основная модель со 125 млрд параметров и дополнительная таблица n-граммовых эмбеддингов на 51 млрд параметров, при этом на каждый токен активируются 6 млрд параметров. Нативный контекст составляет 262 144 токена и может быть расширен до 1 млн с помощью YaRN. Команда Qwen сообщает, что обучение потребовало лишь около одной девятой вычислительных ресурсов, необходимых для Qwen3.7-Plus. Сопутствующий технический отчёт озаглавлен «О проектировании архитектуры Qwen3.8-Next: оценка, эффективность и стабильность обучения».
Точка схождения 1: три из каждых четырёх слоёв внимания являются линейными
GLM-5.3-Flash состоит из 45 слоёв: 34 слоя линейного внимания и 11 слоёв полного внимания, согласно опубликованной конфигурации. Qwen3.8-Flash-Next состоит из 48 слоёв, объединённых в повторяющийся блок из 3 слоёв Gated DeltaNet и 1 слоя Qwen Sparse Attention, согласно рецепту vLLM. Обе модели используют одно и то же соотношение 3:1.
Линейные слои являются дешёвыми с вычислительной точки зрения. Вместо KV-кэша, растущего вместе с текстом, они сжимают всю историю в рекуррентное состояние фиксированного размера. Вычисления на токен остаются постоянными независимо от длины контекста. GLM использует Kimi Delta Attention (KDA) — архитектуру линейного внимания, представленную в Kimi Linear от Moonshot AI и применяющую мелкозернистый затвор затухания для каждого канала. Qwen использует собственную Gated DeltaNet (GDN), в которой управление осуществляется на уровне каждой головы. Разная гранулярность управления, одно и то же семейство delta-rule и одна и та же задача.
Оставшаяся четверть слоёв обеспечивает точное извлечение данных на большом расстоянии. GLM использует многоголовое латентное внимание NoPE (MLA) в стиле DeepSeek. Qwen использует групповое внимание к запросам внутри QSA. Именно здесь фактически находится KV-кэш и применяется второй общий приём.
Точка схождения 2: сжать в 4 раза, оценить, оставить 2048 токенов
Ни одна из моделей не позволяет своим слоям полного внимания обращаться ко всему контексту. Обе подключают небольшой обучаемый индексатор, который оценивает фрагменты истории и оставляет только лучшие. Параметры почти полностью совпадают.
Разреженные слои GLM используют 32-головый индексатор lightning с выбором top-2048, унаследованный от DSA компании DeepSeek. Чтобы снизить стоимость индексатора при контексте в 1 млн токенов, Z.ai внедрила IndexPool, который перед оценкой объединяет четыре ключевых вектора индексатора в один с помощью взвешенного усреднения. QSA от Qwen работает на уровне микроблоков: сжатый облегчённый индексатор оценивает блоки по 4 токена и оставляет 512 лучших блоков, что составляет ровно 2048 токенов. Таким образом, обе модели сжимают контекст в 4 раза перед оценкой, а также ограничивают бюджет внимания 2048 токенами. Qwen заявляет, что QSA обеспечивает ускорение предварительного заполнения до 7,6 раза и декодирования до 4,9 раза по сравнению с полным вниманием при контексте в 1 млн токенов.
Для GLM совокупный эффект оказывается значительным. По сравнению с полной моделью GLM-5.3 компания Z.ai сообщает, что архитектура Flash сокращает вычисления внимания примерно втрое, а размер KV-кэша — в 4,4 раза, при этом почти вдвое уменьшая число активных параметров (18 млрд против 32 млрд) и количество слоёв (45 против 92).
Точка схождения 3: четыре остаточных потока вместо одного
Обе модели отказываются от единого остаточного потока, который определял архитектуру трансформеров с 2017 года. Обе расширяют его до четырёх параллельных ветвей, причём затворы управляют тем, что каждый блок считывает обратно и записывает наружу.
GLM использует Manifold-Constrained Hyper-Connections (mHC) — разработку, возникшую в DeepSeek; в опубликованных весах она настроена на 4 ветви. Qwen разработала собственный вариант — Gated Residual, который регулирует поток через 4 расширенных потока с помощью поэлементного зависящего от данных затвора чтения и скалярного затвора записи для каждой ветви. По словам команды Qwen, Gated Residual устраняет дополнительный этап смешивания ветвей, используемый Hyper-Connections, снижая накладные расходы на доступ к памяти, а затвор достаточно хорошо подавляет выбросы активаций, чтобы разрешить хранение остаточных значений в FP8. Примечательно, что команда Qwen провела абляционные исследования обоих подходов и обнаружила, что по качеству они примерно равны. Две лаборатории, две реализации, один и тот же вывод: четыре управляемых потока лучше одного.
Точка схождения 4: Muon с разделением объединённых матриц по компонентам
Обе модели обучаются с помощью оптимизатора Muon. И обе применяют одно и то же тонкое усовершенствование: объединённые проекционные матрицы разделяются на независимые преобразования до того, как Muon их ортогонализирует. Qwen документирует разделение объединённых проекций QKV, SwiGLU и GDN, назначая Muon настоящим двумерным линейным преобразованиям, а AdamW — эмбеддингам, маршрутизаторам и параметрам низкого ранга. Qwen также заново подогнала законы масштабирования под новую архитектуру и полностью отказалась от разогрева размера батча, измерив, что разогрев увеличивал количество шагов оптимизатора на 18,8% без улучшения результатов.
В чём они расходятся: позиционное кодирование
Единственное чёткое различие касается вращательных позиционных эмбеддингов в слоях полного внимания. GLM-5.3-Flash отказывается от них: конфигурация устанавливает qk_rope_head_dim = 0, делая её разреженные MLA-слои полностью NoPE. Информация о позиции передаётся неявно через рекуррентные линейные слои.
Qwen попробовала сделать то же самое, но сохранила RoPE. Согласно техническому отчёту о Qwen3.8-Next, NoPE не давала измеримой разницы во время предварительного обучения. Проблема проявилась позднее: после дообучения вариант NoPE часто не прекращал генерацию. Это полезное предостережение для всей отрасли. Кривые потерь на этапе предварительного обучения могут скрывать поведенческие дефекты, проявляющиеся только после настройки на этапе RLHF.
Более широкая точка схождения и один несогласный участник
Эта схема не ограничивается двумя лабораториями. DeepSeek стала первопроходцем в использовании разреженного индексатора и бюджета в 2048 токенов, внедрив DSA в DeepSeek-V3.2-Exp, а mHC — это разработка DeepSeek, которая теперь используется в GLM. Kimi от Moonshot внесла KDA — точный вариант слоя линейного внимания, который переняла GLM. Китайские модели с открытым исходным кодом явно обмениваются архитектурными компонентами и сходятся к общим настройкам.
Заметным несогласным участником является MiniMax. В ходе разработки M2 команда масштабно протестировала линейное внимание и внимание с окном скользящего контекста и обнаружила серьёзные недостатки в многошаговом рассуждении, особенно за пределами контекста в 32K после SFT. M2 вышла с полным вниманием softmax в каждом слое. Для M3 MiniMax внедрила MiniMax Sparse Attention (MSA), которая разреживает внимание softmax посредством выбора блоков, но вообще не включает слои линейного внимания. Таким образом, отрасль ещё не пришла к окончательному решению. Z.ai, Qwen, DeepSeek и Kimi делают ставку на то, что гибридная схема 3:1 с линейным вниманием сохраняет способность к рассуждению. Абляционные исследования MiniMax показывают, что это не так — по крайней мере для их стека.
Основные выводы
- GLM-5.3-Flash (34:11) и Qwen3.8-Flash-Next (36:12) независимо пришли к одному и тому же соотношению линейного и полного внимания 3:1.
- Обе модели сжимают контекст в 4 раза и ограничивают разреженное внимание бюджетом в 2048 токенов — схема, впервые применённая в DSA компании DeepSeek.
- Обе заменяют единый остаточный поток 4 управляемыми ветвями; Qwen провела абляционное сравнение своего Gated Residual с mHC и обнаружила равенство их качества.
- В позиционном кодировании модели расходятся: GLM отказывается от RoPE (NoPE), тогда как Qwen сохранила его после того, как модели NoPE переставали прекращать генерацию после дообучения.
- MiniMax придерживается иной позиции: её масштабные абляционные исследования показали, что линейное внимание ухудшает многошаговое рассуждение, поэтому M3 использует только разреженное внимание softmax.
Источники: GLM-5.3-Flash на Hugging Face, документация Z.ai по GLM-5.3-Flash, технический отчёт GLM-5 (arXiv:2602.15763), Qwen3.8-Flash-Next на Hugging Face, Qwen3.8-Flash-Next на GitHub, технический блог NVIDIA, отчёт MiniMax-M2 (arXiv:2605.26494), и MiniMax Sparse Attention (arXiv:2606.13392)
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.