Z.ai выпустила GLM-5.3-Flash: нативно мультимодальную MoE-модель 320B-A18B с контекстом в 1 млн токенов
Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель в серии GLM-5 и самую доступную из эффективных моделей для программирования, выпущенных лабораторией. Это модель типа mixture-of-experts с 320 млрд общих параметров и 18 млрд активных параметров на токен, контекстным окном на 1 048 576 токенов, поддержкой изображений и видео — она выпущена под лицензией MIT, а её веса доступны на Hugging Face. Согласно отчётам Z.ai, модель превосходит GLM-5.2 в бенчмарках и реальных рабочих нагрузках примерно при одной десятой стоимости, а во внутреннем бенчмарке программирования уступает Claude Opus 4.8 менее половины балла. Первую неделю модель анонимно работала под названием «Ox Alpha» на OpenCode и OpenRouter, полностью используя искусственные интеллектуальные чипы китайского производства.
Готова ли она к развёртыванию?
Да, по двум направлениям. Веса доступны на Hugging Face под лицензией MIT, а размещённый API уже запущен и имеет установленную стоимость.
- Какие компании реально могут разместить модель самостоятельно? Не все. Контрольная точка FP8 по умолчанию занимает около 306 ГиБ весов без учёта KV-кэша, а текущий путь через vLLM поддерживает только NVIDIA Hopper и более новые архитектуры. Это делает самостоятельное размещение доступным для средних и крупных организаций, располагающих как минимум узлом с 8 GPU (или стойкой GB200 в конфигурации TP4), а также для AI-стартапов, арендующих GPU-мощности. Все остальные используют модель через API — и здесь ключевую роль играет экономика, а не оборудование.
- Отрасли с немедленными перспективами применения: разработка программного обеспечения и инструменты для разработчиков, автоматизация IT/BPO, операции с документами в финансовом секторе и страховании, корпоративная BI-аналитика и внутренние офисные процессы, электронная коммерция и любые команды, массово выпускающие пользовательские интерфейсы.
- Применения: агенты для программирования на уровне репозиториев, агенты для работы с терминалом, браузером и компьютером, анализ журналов и контрактов объёмом в миллион токенов, проверка регрессий пользовательского интерфейса по скриншотам, а также анализ электронных таблиц, презентаций и дашбордов, для которого в противном случае потребовался бы конвейер OCR-to-text.
Именно архитектура обеспечивает эффективность
GLM-5.3-Flash создана на основе недавно обученной базовой модели, использовавшей мультимодальный корпус из 30 трлн токенов. Стоит знать о трёх изменениях:
- Гибридное внимание: впервые в серии GLM Z.ai объединила линейное и разреженное внимание. Согласно рецепту vLLM, языковая модель с 45 слоями чередует слои линейного внимания KDA со слоями разреженного внимания MLA без NoPE, направляет каждый токен через 8 из 288 экспертов и поставляется с нативными весами FP8 и одним черновым слоем MTP. Линейное внимание обрабатывает локальные зависимости, а разреженное внимание извлекает глобально релевантный контекст.
- IndexPool: при контексте на миллион токенов узким местом становится сам процесс извлечения информации. IndexPool сжимает группы ключевых векторов индексатора посредством взвешенного объединения, снижая задержку и потребление памяти. Z.ai сообщает о примерно втрое меньших вычислительных затратах на внимание и в 4,4 раза меньшем KV-кэше по сравнению с GLM-5.3.
- mHC: модель использует гиперсвязи с ограничениями на многообразии (Manifold-Constrained Hyper-Connections) для повышения эффективности масштабирования. По сравнению с GLM-4.5, при сопоставимом общем числе параметров GLM-5.3-Flash примерно вдвое сокращает как число активируемых параметров, так и количество слоёв.
Бенчмарки
Большинство приведённых в таблице ниже показателей сообщены Z.ai, а используемые тестовые стенды различаются в зависимости от теста — в сносках к карточке модели указаны температура, ограничения контекста и модели-судьи для каждого бенчмарка, поэтому межмодельные сравнения следует рассматривать с учётом особенностей конфигурации.
| Бенчмарк | GLM-5.3-Flash | Сравнение |
|---|---|---|
| Terminal-Bench 2.1 | 84,3 | Opus 4.8: 85,0 · GPT-5.6 Terra: 87,4 |
| DeepSWE v1.1 | 63,4 | GLM-5.2: 46,2 |
| AutomationBench | 48,8 | GLM-5.2: 26,2 |
| HLE | 55,3 | — |
| OfficeQA Pro | 62,4 | опережает Opus 4.8 |
| Z.ai Code Bench v1.0 (макс.) | 29,0 | Opus 4.8: 29,5 |
Независимо от этого, Artificial Analysis оценивает её в 57 баллов по индексу интеллекта, при 48,7 выходного токена в секунду и 1,52 с до выдачи первого токена (TTFT) в API Z.ai — это высокий уровень интеллекта на доллар, но модель работает медленно и многословно. Слабое место — зрение: по показателям BabyVision и MVbench она уступает Gemini 3.7 Flash.
Особенности обслуживания модели освещены недостаточно
Z.ai заявляет, что весь предварительный запуск Ox Alpha выполнялся на искусственных интеллектуальных чипах китайского производства с использованием специализированного движка на базе SGLang, который разделяет кодирование, предварительное заполнение и декодирование, обеспечивая, по заявлению компании, трёхкратное улучшение обслуживания от начала до конца на десятках тысяч ускорителей.
Стоимость и доступ
Стандартная стоимость API составляет $0,15 за 1 млн входных токенов, $0,03 за 1 млн кэшированных входных токенов и $0,50 за 1 млн выходных токенов. Z.ai сообщает о показателе 57 в Artificial Analysis Intelligence Index v4.1.1 при стоимости $0,045 за задачу на тарифе со скидкой. Модель доступна на всех уровнях GLM Coding Plan — Lite ($18 в месяц), Pro ($80), Max ($168) — с трёхкратно увеличенной доступной квотой по сравнению с GLM-5.3, а её мультимодальные возможности доступны в ZCode через Browser Use и Computer Use. Локальное развёртывание поддерживается в SGLang, vLLM, TokenSpeed и KTransformers.
Основные выводы
- Нативно мультимодальная MoE-модель 320B-A18B, контекст на 1 млн токенов, веса под лицензией MIT на Hugging Face.
- Гибридное внимание KDA (линейное) + NoPE MLA (разреженное): примерно втрое меньшие вычислительные затраты на внимание и в 4,4 раза меньший KV-кэш.
- 84,3 в Terminal-Bench 2.1 и 63,4 в DeepSWE v1.1 — близко к Opus 4.8 и значительно выше GLM-5.2.
- $0,15/$0,50 за 1 млн токенов; трёхкратная квота GLM-5.3 для каждого уровня GLM Coding Plan.
- Для самостоятельного размещения требуется около 306 ГиБ весов FP8 на Hopper или более новой архитектуре; все остальные используют API.
Ознакомьтесь с весами модели и блогом. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, запуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.