GLM-5.3-Flash зрівнялася з найкращими моделями за частину вартості й працює без Nvidia
Ключові моменти
- Z.ai випустила GLM-5.3-Flash — модель із 320 мільярдами параметрів і контекстним вікном на один мільйон токенів.
- Вона майже зрівнялася з більшою GLM-5.3 за індексом інтелекту, але за ціни 0,09 долара за завдання коштує приблизно у 7,5 раза дешевше.
- Модель повністю працювала на китайських ШІ-чипах, а власне програмне забезпечення Z.ai забезпечило ефективність на рівні графічних процесорів Nvidia.
Нова модель GLM-5.3-Flash від Z.ai пропонує високу цінність за свої гроші, має очевидні слабкі сторони та привертає увагу своїм інфраструктурним аспектом.
За даними Z.ai, GLM-5.3-Flash — перша нативно мультимодальна модель у серії GLM-5. Вона має загалом 320 мільярдів параметрів, з яких активними є лише 18 мільярдів, поширюється за ліцензією MIT і пропонує контекстне вікно на один мільйон токенів. Ваги доступні на Hugging Face.
Вимірювання Artificial Analysis показують, що за максимального рівня міркувань модель набирає 57 балів за індексом інтелекту. Це лише на три бали менше за більшу GLM-5.3, яка набирає 60 балів, і стільки ж, скільки GPT-5.6 Terra та Muse Spark 1.2.
Найбільше вирізняється ціна. Вартість одного завдання в індексі становить 0,09 долара проти 0,68 долара для GLM-5.3 — приблизно у 7,5 раза дешевше. За даними Artificial Analysis, це виводить модель на фронтир Парето за співвідношенням інтелекту та вартості й додає її до дедалі довшого списку китайських моделей, які останнім часом чинять значний ціновий тиск на західних постачальників.

В API Z.ai GLM-5.3-Flash коштує 0,15 долара за мільйон вхідних токенів і 0,50 долара за мільйон вихідних токенів — трохи більше ніж десята частина ціни GLM-5.3. У агентних завданнях модель не відстає від свого старшого побратима. У GDPval-AA v2 вона досягає рейтингу Elo близько 1770, зрівнюючись із GLM-5.3 та Grok 4.6 і поступаючись лише Claude Opus 5. Втім, вона менш ефективна щодо використання токенів. Artificial Analysis виявила, що приблизно 90 відсотків використаних нею вихідних токенів припало на міркування.
Китайські чипи замість Nvidia
До запуску Z.ai анонімно тестувала модель під назвою «ox-alpha» на OpenCode та OpenRouter, де вона стала найпопулярнішою моделлю тижня. Цікаво, що весь цей трафік, за даними Z.ai, працював на китайських ШІ-чипах.
SemiAnalysis повідомляє, що модель обробляла 100 трильйонів токенів на день — рівень потужності, який досі вважався можливим лише для передових лабораторій. Z.ai стверджує, що ефективність її обладнання та вартість токена відповідають показникам поширених графічних процесорів Nvidia. SemiAnalysis розглядає це як чергове випробування для «рову CUDA» після нещодавніх результатів, продемонстрованих новим чипом OpenAI.
CUDA — це програмний рівень Nvidia між програмним забезпеченням ШІ та графічною картою. Він розвивається майже 20 років, і практично кожен фреймворк для ШІ оптимізований під нього. Перехід на інші чипи означає повторне виконання цієї роботи, перепрограмування обчислювальних операцій, налаштування доступу до пам’яті та пошук вузьких місць.
Тож Z.ai створила власне програмне забезпечення для обслуговування моделей на базі SGLang і розділила обробку на етапи, які масштабуються незалежно. Команда стверджує, що це втричі збільшило пропускну здатність порівняно з першою спробою на тому самому обладнанні. В оптимізації допоміг агент на базі GLM-5.3.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний передовий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву та можливість залишати коментарі.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.