Sakhanda Wire
NVDA $225.01 -0.07% MSFT $480.35 -3.04% GOOGL $344.00 -0.55% META $568.97 -3.54% AMZN $261.31 -0.51%
← Към новините

Какво показват резултатите на GLM-5.3 на Zhipu отвъд водещата цифра

Бележката за пускането на GLM-5.3 от Zhipu съдържа изречение, което не намери място в повечето публикации. Описвайки собствените си резултати в областта на киберсигурността, базираната в Пекин компания пише, че тази способност „се развива най-бързо точно там, където изоставаме най-много“.

Zhipu, която търгува и под името Z.ai, е една от шепата китайски лаборатории, които пускат модели, конкуриращи се с американските водещи модели. На 14 август компанията пусна GLM-5.3 — модел, фокусиран върху програмирането — и публикува техническа бележка за пускането, в която описва представянето на модела спрямо конкурентите му. Именно тази бележка е източникът на всичко, съобщено тук.

Твърдението, което привлече внимание, беше свързано със сигурността. Наред с резултатите в програмирането Zhipu заяви, че GLM-5.3 неочаквано се е справил добре с откриването на уязвимости в софтуера, като е постигнал 84,5% в бенчмарка CyberGym спрямо 83,8% за Mythos 5 на Anthropic и 83,6% за GPT-5.6 Sol на OpenAI. Последваха заглавия, според които китайски модел вече открива повече грешки от американските модели.

Причината това да звучи по-впечатляващо от обичаен резултат от бенчмарк е в това какво представлява откриването на уязвимости днес. Модел, който може да прочете кодова база и да открие експлоатируеми слабости, е полезен както на защитник, одитиращ собствения си софтуер, така и на всеки, който прави същото с чуждия. Еквивалентната работа на Anthropic е с ограничен достъп именно поради тази причина, докато Zhipu възнамерява да публикува теглата на GLM-5.3, така че всеки да може да ги изтегли.

Собственото съобщение на Zhipu е по-премерено от публикациите, които породи. Числото за CyberGym е реално и присъства в документа. То обаче е най-тясното от трите резултата в областта на киберсигурността, публикувани от компанията, а Zhipu откровено признава, че при другите два резултата картината е обратната.

Три бенчмарка, три различни картини

CyberGym започва с изходен код, който моделът може да прочете, и проверява дали той може да открие уязвимост и да потвърди, че дефектът е реален. Това е резултатът, който привлече внимание, а разликата е седем десети от процентния пункт.

ExploitBench поставя по-трудна задача, като изисква от модела да разсъждава за реална уязвимост и за начина, по който тя би била експлоатирана. GLM-5.3 постига 54,4% — повече от два пъти резултата на предшественика си от 24,4%. Mythos 5 постига 78,0%, а GPT-5.6 Sol — 76,5%.

ExploitGym отчита колко задачи за експлоатация завършва моделът в рамките на фиксиран времеви бюджет. GLM-5.3 завършва 105 задачи за два часа и 130 за шест часа. Mythos 5 завършва съответно 181 и 247.

Тези два резултата бяха отразени бегло, а именно те описват разликата. Откриването на дефект и създаването на работещ експлойт за него са различни задачи. Според Zhipu колкото по-напред по тази верига се намира даден тест, толкова повече изостава моделът ѝ — и компанията го заявява в съобщението, вместо да оставя това да бъде открито от читателите.

Кой модел на Anthropic и защо това продължава да се променя

Част от объркването в публикациите идва от това, че Zhipu сравнява три различни модела на Anthropic на три различни места. Основната таблица с бенчмарковете поставя GLM-5.3 срещу Opus 4.8. В графиките за представянето се използва Fable 5. Разделът за киберсигурността използва Mythos 5. Всеки, който чете набързо, остава с впечатлението за едно-единствено сравнение, което всъщност не съществува.

При програмирането картината е смесена, а не доминираща. GLM-5.3 води пред Opus 4.8 в някои тестове и изостава от него в други, а Zhipu ясно заявява, че нейният модел все още изостава от Claude Fable 5 във вътрешния бенчмарк за програмиране на компанията.

Как са проведени тестовете

Бележките под линия за методологията съдържат нещо, което обобщенията пропускат. Zhipu е оценила GLM-5.3 в CyberGym, ExploitGym, ExploitBench, Terminal Bench и няколко други задачи в рамките на Claude Code 2.1.207 — програмния агент на Anthropic.

Това не е неправомерно. Използването на обща среда за изпълнение на тестовете при различни модели е начин сравнението да остане честно, а Zhipu документира използваните настройки. Все пак това заслужава внимание. Водещите твърдения за китайски модел с отворени тегла се измерват чрез американски агентски софтуер — факт, който говори нещо за мястото на инструменталния слой в това състезание, което резултатите на моделите сами по себе си не показват.

Още два детайла заслужават внимание, преди резултатът от CyberGym да бъде приет за окончателен. Резултатът е от едно-единствено изпълнение, отчетен като pass@1 при 1507 задачи, без посочени данни за вариацията. Разлика от седем десети от процентния пункт между две единични изпълнения не е разлика, на която някой би трябвало да се опира. Освен това времевите бюджети на ExploitGym са нормализирани чрез коефициенти на пропускателна способност от Artificial Analysis, като са посочени коефициенти за преизчисляване за GLM-5.3, Kimi K3 и Qwen3.8 Max, но не и за Mythos 5.

Броят на уязвимостите и липсващото число

Освен резултатите от бенчмарковете Zhipu заявява, че е работила със звена по сигурността в Китай, за да тества моделите си върху реални кодови бази, като е идентифицирала 2436 уязвимости в 269 проекта с отворен код. Разпределението по степен на сериозност е 107 критични, 990 с висока, 1286 със средна и 53 с ниска сериозност. Най-старият дефект датира от 1981 г., а средната уязвимост е съществувала в кода 26,6 години, преди да бъде открита.

Обобщаващ панел от съобщението на Zhipu, показващ 2436 проследени находки, 53 публично оповестени, 2383 под ембарго и 1097, обозначени като критични и с висока степен на сериозност.
Обобщение на оповестяването от Zhipu. Панелът обозначава 1097 находки като критични и с висока степен на сериозност, което съвпада с разбивката по сериозност от 107 критични и 990 с висока степен. В основния текст на същото съобщение тази цифра е описана като находки със средна до висока степен. Източник: Z.ai.

Едно несъответствие заслужава внимателно отбелязване. Обобщаващият панел на Zhipu обозначава 1097 находки като критични и с висока степен на сериозност, което съвпада с таблицата за степента на сериозност. В основния текст на същото съобщение тези 1097 находки са описани като такива със средна до висока степен. Няколко медии са възпроизвели втората версия.

Броят е получен след експертен преглед, проверка и премахване на дублирания, както описва Zhipu, така че не се съобщава необработеният резултат от модела. От 2436 находки 53 са публично оповестени, а 2383 остават под ембарго. В съобщението не се посочва колко от тях са били неизвестни дотогава, нито колко са били независимо възпроизведени. Именно тези две цифри биха превърнали твърдението за обем в твърдение за способности.

Какво е по-важно от таблицата с резултатите

Две неща в съобщението имат по-дългосрочни последици от разликата в CyberGym.

Първото е ефективността. Zhipu съобщава, че GLM-5.3 достига 31,4% във вътрешния ѝ бенчмарк за програмиране при около 50 000 изходни токена на задача, докато Opus 4.8 постига 29,5% при използването на 120 000. Малко по-добра работа с по-малко от половината токени е аргумент в полза на по-ниските разходи, а именно разходите определят дали екипите по сигурността извън тези с най-големи бюджети изобщо могат да използват такива инструменти.

Второто е разпространението. Zhipu заявява, че теглата ще бъдат публикувани, след като оценката на сигурността и укрепването на модела приключат. Това все още не се е случило и докато не стане, твърдението за отворени тегла е ангажимент, а не факт. Ако бъде изпълнен, модел с документирана способност за откриване на уязвимости ще се превърне в нещо, което всеки екип може да изтегли и стартира локално, включително на пазари, които никога няма да получат достъп до американски модел, обект на експортен контрол.

Теглата се очакват в края на август.

Вижте също: Anthropic влиза в Белия дом, а Mythos е причината Вашингтон да я допусне

Банер за поредицата от събития AI & Big Data Expo.

Искате ли да научите повече за изкуствения интелект и големите данни от лидери в индустрията? Посетете AI & Big Data Expo, което се провежда в Амстердам, Калифорния и Лондон. Всеобхватното събитие е част от TechEx и се провежда едновременно с други водещи технологични събития, включително Cyber Security & Cloud Expo. Кликнете тук за повече информация.

AI News се поддържа от TechForge Media. Разгледайте други предстоящи събития и уебинари за корпоративни технологии тук.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от AI News на

Прочетете оригинала в AI News ↗

Текстът и изображенията са собственост на AI News и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини