GLM-5.3-Flash сопоставим с ведущими моделями при в семь раз меньшей стоимости и работает без Nvidia
Ключевые моменты
- Z.ai выпустила GLM-5.3-Flash — модель с 320 миллиардами параметров и контекстным окном в один миллион токенов.
- В Intelligence Index она почти не уступает более крупной GLM-5.3, но при стоимости 0,09 доллара за задачу примерно в 7,5 раза дешевле.
- Модель полностью работала на китайских ИИ-чипах, а собственное программное обеспечение Z.ai обеспечило эффективность на уровне графических процессоров Nvidia.
Новая модель GLM-5.3-Flash от Z.ai предлагает отличное соотношение цены и качества, имеет очевидные слабые стороны и примечательна с точки зрения инфраструктуры.
По данным Z.ai, GLM-5.3-Flash — первая изначально мультимодальная модель в серии GLM-5. Она имеет в общей сложности 320 миллиардов параметров, из которых активны только 18 миллиардов, распространяется по лицензии MIT и предлагает контекстное окно в один миллион токенов. Веса доступны на Hugging Face.
Измерения Artificial Analysis ставят модель на отметку 57 баллов в Intelligence Index при максимальном уровне усилий на рассуждение. Это всего на три балла меньше, чем у более крупной GLM-5.3, набравшей 60 баллов, и столько же, сколько у GPT-5.6 Terra и Muse Spark 1.2.
Именно цена выделяет модель на фоне остальных. Стоимость одной задачи в индексе составляет 0,09 доллара против 0,68 доллара у GLM-5.3, то есть примерно в 7,5 раза меньше. По данным Artificial Analysis, это выводит модель на границу Парето по интеллекту и стоимости и добавляет её к растущему списку китайских моделей, которые в последнее время оказывают серьёзное ценовое давление на западных поставщиков.

В API Z.ai модель GLM-5.3-Flash стоит 0,15 доллара за миллион входных токенов и 0,50 доллара за миллион выходных токенов — немногим более десяти процентов от цены GLM-5.3. В агентных задачах модель не отстаёт от своего более крупного собрата. В GDPval-AA v2 она набирает около 1770 баллов Elo, наравне с GLM-5.3 и Grok 4.6, уступая только Claude Opus 5. Однако по эффективности использования токенов она всё ещё проигрывает. Artificial Analysis выяснила, что примерно 90 процентов использованных выходных токенов ушли на рассуждение.
Китайские чипы вместо Nvidia
До запуска Z.ai анонимно тестировала модель под названием «ox-alpha» на OpenCode и OpenRouter, где она стала самой популярной моделью недели. Интересно, что весь этот трафик, по данным Z.ai, обрабатывался на китайских ИИ-чипах.
SemiAnalysis сообщает, что модель обрабатывала 100 триллионов токенов в день — такой уровень производительности до сих пор считался возможным только для передовых исследовательских лабораторий. По словам Z.ai, эффективность оборудования и стоимость токена сопоставимы с распространёнными графическими процессорами Nvidia. SemiAnalysis рассматривает это как ещё одну проверку «рва CUDA» после недавних результатов, показанных новым чипом OpenAI.
CUDA — это программный слой Nvidia между ИИ-программным обеспечением и графическим процессором. Он развивается уже почти 20 лет, и практически каждый фреймворк для ИИ оптимизирован под него. Переход на другие чипы означает необходимость заново выполнять эту работу, перепрограммировать вычислительные операции, настраивать доступ к памяти и искать узкие места.
Поэтому Z.ai создала собственное программное обеспечение для обслуживания моделей поверх SGLang и разбила обработку на этапы, которые масштабируются независимо друг от друга. Команда утверждает, что это утроило пропускную способность по сравнению с первой попыткой на том же оборудовании. В оптимизации помогал агент на базе GLM-5.3.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать статьи без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.