GLM-5.3-Flash се изравнява с водещите модели на част от цената и работи без Nvidia
Основни моменти
- Z.ai представи GLM-5.3-Flash — модел с 320 милиарда параметъра и контекстен прозорец от един милион токена.
- В Индекса за интелигентност той почти се изравнява с по-големия GLM-5.3, но при 0,09 долара на задача е около 7,5 пъти по-евтин.
- Моделът работи изцяло върху китайски AI чипове, а собственият софтуер на Z.ai постига ефективност, сравнима с тази на графичните процесори на Nvidia.
Новият модел GLM-5.3-Flash на Z.ai предлага отлично съотношение цена-качество, има ясни слабости и поставя интересен инфраструктурен акцент.
GLM-5.3-Flash е първият изначално мултимодален модел в серията GLM-5, според Z.ai. Той разполага с общо 320 милиарда параметъра, от които само 18 милиарда са активни, разпространява се под MIT лиценз и предлага контекстен прозорец от един милион токена. Теглата са налични в Hugging Face.
Измерванията на Artificial Analysis поставят модела на 57 точки в Индекса за интелигентност при максимално усилие за разсъждение. Това е само с три точки зад по-големия GLM-5.3, който получава 60 точки, и е наравно с GPT-5.6 Terra и Muse Spark 1.2.
Цената е това, което се откроява. Разходът на задача в индекса е 0,09 долара спрямо 0,68 долара за GLM-5.3 — приблизително 7,5 пъти по-евтино. Според Artificial Analysis това поставя модела на границата на Парето между интелигентност и цена и го добавя към нарастващия списък от китайски модели, които наскоро оказаха силен ценови натиск върху западните доставчици.

В API интерфейса на Z.ai GLM-5.3-Flash струва 0,15 долара за милион входни токена и 0,50 долара за милион изходни токена — малко над една десета от цената на GLM-5.3. При агентни задачи моделът не изостава от по-големия си събрат. В GDPval-AA v2 той постига Elo резултат от около 1770, изравнявайки се с GLM-5.3 и Grok 4.6, и отстъпва единствено на Claude Opus 5. Все пак той е по-малко ефективен по отношение на токените. Artificial Analysis установи, че приблизително 90 процента от изразходваните изходни токени са били използвани за разсъждение.
Китайски чипове вместо Nvidia
Преди пускането си Z.ai тества модела анонимно под името „ox-alpha“ в OpenCode и OpenRouter, където той стана най-популярният модел за седмицата. Интересното е, че целият този трафик е работил върху китайски AI чипове, според Z.ai.
SemiAnalysis съобщава, че моделът е обслужвал 100 трилиона токена дневно — ниво на капацитет, което досега се смяташе за възможно само за водещите лаборатории. Z.ai поставя хардуерната си ефективност и разхода на токен наравно с тези на широко използваните графични процесори на Nvidia. SemiAnalysis възприема това като поредно изпитание за „рва на CUDA“, след последните резултати от новия чип на OpenAI.
CUDA е програмният слой на Nvidia между AI софтуера и графичната карта. Той се развива от почти 20 години и практически всяка AI рамка е оптимизирана за него. Преминаването към други чипове означава повторно извършване на тази работа, препрограмиране на изчислителните операции, адаптиране на достъпа до паметта и откриване на тесните места.
Затова Z.ai изгради собствен софтуер за обслужване върху SGLang и раздели обработката на етапи, които се мащабират независимо. Екипът заявява, че това е утроило пропускателната способност спрямо първия им опит със същия хардуер. Агент, базиран на GLM-5.3, е помогнал с оптимизацията.
AI новини без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен AI бюлетин, нашия ексклузивен годишен доклад за водещите модели „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.