GLM-5.3-Flash проти Qwen3.8-Flash-Next: дві китайські ШІ-лабораторії незалежно дійшли тієї самої архітектури моделі
Цього тижня дві передові моделі з відкритими вагами вийшли з різницею в один день. Z.ai випустила GLM-5.3-Flash — мультимодальну MoE-модель із 320 млрд параметрів, з яких 18 млрд є активними. Команда Qwen з Alibaba випустила Qwen3.8-Flash-Next — модель зі 125 млрд параметрів і 6 млрд активних параметрів, яка демонструє архітектуру Qwen4.
Команди розробляли ці системи незалежно одна від одної. Проте їхні конфігурації виглядають майже як копії одна одної. Обидві використовують гібридне співвідношення лінійної та повної уваги 3:1. Обидві обирають контекст за допомогою стисненого індексатора, обмеженого 2048 токенами. Обидві розширюють залишковий потік до 4 керованих гілок. Обидві навчаються з оптимізатором Muon, розділяючи об’єднані матриці параметрів перед ортогоналізацією. У цій статті розглядаються спільний рецепт, єдина розбіжність і єдина лабораторія, яка не погоджується з цим підходом.
Коротко про два релізи
GLM-5.3-Flash — перша нативно мультимодальна модель у серії GLM-5, випущена за ліцензією MIT на Hugging Face. Z.ai анонімно тестувала її під назвою Ox Alpha на OpenRouter, де вона стала найпопулярнішою моделлю тижня. Модель навчали на мультимодальному корпусі обсягом 30 трлн токенів, а її контекстне вікно становить 1 млн токенів. За словами Z.ai, за результатами бенчмарків вона перевершує GLM-5.2 за ціною, меншою вдесятеро, водночас наближаючись до Claude Opus 4.8 у бенчмарках кодування та агентних завдань. Ціна за прейскурантом становить $0,15 за мільйон вхідних токенів і $0,50 за мільйон вихідних токенів.
Qwen3.8-Flash-Next відіграє ту саму роль для Qwen3.5, яку Qwen3-Next відігравала для Qwen3: це ранній загальнодоступний попередній перегляд наступного сімейства архітектур. У картці моделі зазначено основну модель зі 125 млрд параметрів і додаткову таблицю n-грамових embedding-векторів обсягом 51 млрд параметрів, при цьому на кожен токен активується 6 млрд параметрів. Нативний контекст становить 262 144 токени, а за допомогою YaRN його можна розширити до 1 млн. Команда Qwen повідомляє, що для навчання знадобилося лише близько однієї дев’ятої обчислювальних ресурсів, потрібних для Qwen3.7-Plus. Супровідний технічний звіт має назву «Про проєктування архітектури Qwen3.8-Next: оцінювання, ефективність і стабільність навчання».
Точка збіжності 1: три з кожних чотирьох шарів уваги є лінійними
GLM-5.3-Flash складається з 45 шарів: 34 шарів лінійної уваги та 11 шарів повної уваги, згідно з опублікованою конфігурацією. Qwen3.8-Flash-Next складається з 48 шарів, об’єднаних у повторюваний блок із 3 шарів Gated DeltaNet і 1 шару Qwen Sparse Attention, згідно з рецептом vLLM. Обидві моделі мають однакове співвідношення 3:1.
Лінійні шари є дешевшими. Замість KV-кешу, який зростає разом із текстом, вони стискають усю історію в рекурентний стан фіксованого розміру. Обчислення на токен залишаються сталими незалежно від довжини контексту. GLM використовує Kimi Delta Attention (KDA) — дизайн лінійної уваги, представлений Kimi Linear від Moonshot AI, який застосовує дрібнозернистий коефіцієнт затухання для кожного каналу. Qwen використовує власну Gated DeltaNet (GDN), яка застосовує керування на рівні кожної голови. Різна гранулярність керування, одна родина delta-rule, те саме завдання.
Чверть шарів, що залишилася, забезпечує точне вилучення інформації на великих відстанях. GLM використовує багатоголову латентну увагу NoPE (MLA) у стилі DeepSeek. Qwen використовує згруповану увагу із запитами всередині QSA. Саме тут фактично зберігається KV-кеш і застосовується друга спільна хитрість.
Точка збіжності 2: стиснути у 4 рази, оцінити, залишити 2048 токенів
Жодна з моделей не дозволяє своїм шарам повної уваги працювати з усім контекстом. Обидві використовують невеликий навчений індексатор, який оцінює фрагменти історії та залишає лише найкращі. Параметри майже повністю збігаються.
Розріджені шари GLM використовують індексатор lightning із 32 головами та вибором top-2048, успадкований від DSA компанії DeepSeek. Щоб зменшити вартість індексації для контекстів обсягом 1 млн токенів, Z.ai запровадила IndexPool, який перед оцінюванням стискає чотири ключові вектори індексатора в один за допомогою зваженого об’єднання. QSA від Qwen працює на рівні мікроблоків: стиснений легкий індексатор оцінює блоки по 4 токени та залишає 512 найкращих блоків, що становить рівно 2048 токенів. Отже, обидві моделі стискають контекст у 4 рази перед оцінюванням і обидві обмежують бюджет уваги 2048 токенами. Qwen приписує QSA прискорення попереднього заповнення до 7,6 раза та декодування до 4,9 раза порівняно з повною увагою на контексті в 1 млн токенів.
Сукупний ефект для GLM є значним. Порівняно з повною моделлю GLM-5.3, Z.ai повідомляє, що архітектура Flash скорочує обчислення уваги приблизно втричі, а розмір KV-кешу — у 4,4 раза, водночас майже вдвічі зменшуючи кількість активних параметрів (18 млрд проти 32 млрд) і кількість шарів (45 проти 92).
Точка збіжності 3: чотири залишкові потоки замість одного
Обидві моделі відмовляються від єдиного залишкового потоку, який визначав трансформери з 2017 року. Обидві розширюють його до чотирьох паралельних гілок, а керувальні механізми визначають, що кожен блок зчитує назад і записує назовні.
GLM використовує Manifold-Constrained Hyper-Connections (mHC) — дизайн, що походить від DeepSeek, налаштований на 4 гілки в опублікованих вагових коефіцієнтах. Qwen розробила власний варіант — Gated Residual, який модулює потік через 4 розширені потоки за допомогою поелементного залежного від даних керувального механізму зчитування та скалярного керувального механізму запису для кожної гілки. За словами команди Qwen, Gated Residual усуває додатковий етап змішування гілок, який використовується Hyper-Connections, зменшуючи накладні витрати на доступ до пам’яті, а керувальний механізм достатньо добре пригнічує викиди активацій, щоб уможливити зберігання залишкових значень у FP8. Примітно, що команда Qwen протестувала обидва підходи в абляційних дослідженнях і виявила, що за якістю вони приблизно однакові. Дві лабораторії, дві реалізації, один ідентичний висновок: чотири керовані потоки кращі за один.
Точка збіжності 4: Muon із розділенням об’єднаних матриць за компонентами
Обидві моделі навчаються з оптимізатором Muon. І обидві застосовують те саме тонке вдосконалення: об’єднані проєкційні матриці розділяються на незалежні перетворення перед їхньою ортогоналізацією оптимізатором Muon. Qwen документує розділення об’єднаних проєкцій QKV, SwiGLU і GDN, призначаючи Muon для справжніх двовимірних лінійних перетворень, а AdamW — для embedding-векторів, маршрутизаторів і параметрів низького рангу. Qwen також повторно підігнала закони масштабування для нової архітектури та повністю відмовилася від прогрівання розміру батчу після вимірювання, яке показало, що прогрівання потребує на 18,8% більше кроків оптимізатора без покращення результатів.
У чому вони розходяться: позиційне кодування
Єдина чітка розбіжність стосується ротаційних позиційних embedding-векторів у шарах повної уваги. GLM-5.3-Flash відмовляється від них: конфігурація встановлює значення qk_rope_head_dim = 0, роблячи її розріджені шари MLA повністю NoPE. Інформація про позицію передається неявно через рекурентні лінійні шари.
Qwen спробувала зробити те саме, але залишила RoPE. Згідно з технічним звітом Qwen3.8-Next, під час попереднього навчання NoPE не давала вимірюваної різниці. Проблема проявилася пізніше: після донавчання варіант NoPE часто не припиняв генерувати текст. Це важливий застережний результат для всієї галузі. Криві втрат під час попереднього навчання можуть приховувати поведінкові дефекти, які проявляються лише після налаштування на етапі RLHF.
Ширша збіжність і єдина незгодна сторона
Цей рецепт не обмежується двома лабораторіями. DeepSeek започаткувала підхід зі sparse-індексатором і бюджетом у 2048 токенів, представивши DSA у DeepSeek-V3.2-Exp, а mHC є дизайном DeepSeek, який тепер використовується в GLM. Kimi від Moonshot зробила внесок у вигляді KDA — саме такого шару лінійної уваги, який перейняла GLM. Китайські моделі з відкритим кодом помітно обмінюються архітектурними компонентами та збігаються на спільних налаштуваннях.
Помітною незгодною стороною є MiniMax. Під час розробки M2 команда масштабно тестувала лінійну увагу та увагу зі sliding window і виявила значні недоліки в багатокроковому міркуванні, особливо за контексту понад 32K після SFT. M2 вийшла з повною softmax-увагою в кожному шарі. Для M3 MiniMax запровадила MiniMax Sparse Attention (MSA), яка розріджує softmax-увагу за допомогою вибору блоків, але взагалі не містить шарів лінійної уваги. Отже, галузь ще не дійшла остаточного висновку. Z.ai, Qwen, DeepSeek і Kimi роблять ставку на те, що гібрид лінійної уваги зі співвідношенням 3:1 зберігає здатність до міркування. Абляційні дослідження MiniMax свідчать, що це не так — принаймні для їхнього стеку.
Ключові висновки
- GLM-5.3-Flash (34:11) і Qwen3.8-Flash-Next (36:12) незалежно одна від одної дійшли однакового співвідношення лінійної та повної уваги 3:1.
- Обидві моделі стискають контекст у 4 рази й обмежують розріджену увагу бюджетом у 2048 токенів — підхід, започаткований DSA від DeepSeek.
- Обидві замінюють єдиний залишковий потік 4 керованими гілками; Qwen порівняла свій Gated Residual із mHC в абляційному дослідженні та виявила, що вони рівноцінні.
- Щодо позиційного кодування їхні підходи розходяться: GLM відмовляється від RoPE (NoPE), тоді як Qwen залишила його після того, як моделі NoPE після навчання не припиняли генерувати текст.
- MiniMax не погоджується з цим підходом: її масштабні абляційні дослідження показали, що лінійна увага погіршує багатокрокове міркування, тому M3 використовує лише розріджену softmax-увагу.
Джерела: GLM-5.3-Flash на Hugging Face, документація Z.ai щодо GLM-5.3-Flash, технічний звіт GLM-5 (arXiv:2602.15763), Qwen3.8-Flash-Next на Hugging Face, Qwen3.8-Flash-Next на GitHub, технічний блог NVIDIA, звіт MiniMax-M2 (arXiv:2605.26494), і MiniMax Sparse Attention (arXiv:2606.13392)
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.