Что показывают результаты GLM-5.3 от Zhipu помимо заголовочной цифры
В примечании к выпуску Zhipu, посвящённом GLM-5.3, содержится предложение, которое не попало в большинство публикаций. Описывая собственные результаты в области кибербезопасности, пекинская компания пишет, что эта способность «быстрее всего растёт именно там, где мы отстаём сильнее всего».
Zhipu, также работающая под брендом Z.ai, — одна из немногих китайских лабораторий, выпускающих модели, конкурирующие с американскими передовыми разработками. 14 августа компания запустила GLM-5.3 — модель, ориентированную на программирование, — и опубликовала техническое примечание к выпуску, в котором описала результаты модели в сравнении с конкурентами. Именно это примечание является источником всей изложенной здесь информации.
В заголовки попала информация о безопасности. Наряду с результатами в программировании Zhipu заявила, что GLM-5.3 неожиданно хорошо находит уязвимости в программном обеспечении, набрав 84,5% в тесте CyberGym против 83,8% у Mythos 5 от Anthropic и 83,6% у GPT-5.6 Sol от OpenAI. После этого появились заголовки о том, что китайская модель теперь лучше американских ищет ошибки в коде.
Причина, по которой это звучит весомее обычного результата тестирования, заключается в том, во что превратился поиск уязвимостей. Модель, способная прочитать кодовую базу и обнаружить эксплуатируемые уязвимости, полезна защитнику, проверяющему собственное программное обеспечение, и тому, кто делает то же самое с чужим. Эквивалентная разработка Anthropic по этой причине доступна только в ограниченном режиме, тогда как Zhipu намерена опубликовать веса GLM-5.3 для свободного скачивания.
Собственное сообщение Zhipu более взвешенно, чем созданное вокруг него освещение. Показатель CyberGym реален и приведён в документе. Однако это самый узкий из трёх опубликованных компанией результатов в области кибербезопасности, и Zhipu открыто признаёт, что по двум другим показателям ситуация складывается иначе.
Три теста — три разные картины
CyberGym начинается с исходного кода, который модель может прочитать, и проверяет, способна ли она найти уязвимость и подтвердить, что дефект реален. Именно этот результат получил распространение, а разрыв составляет семь десятых процентного пункта.
ExploitBench ставит более сложную задачу: модель должна рассуждать о реальной уязвимости и о том, как её можно было бы эксплуатировать. GLM-5.3 набирает 54,4% — более чем вдвое больше, чем её предшественник, набравший 24,4%. Mythos 5 получает 78,0%, а GPT-5.6 Sol — 76,5%.
ExploitGym подсчитывает, сколько задач по эксплуатации модель выполняет за фиксированное время. GLM-5.3 выполняет 105 задач за два часа и 130 за шесть. Mythos 5 выполняет 181 и 247 задач соответственно.
Этим двум результатам уделили мало внимания, хотя именно они описывают разрыв. Найти уязвимость и создать на её основе работающий эксплойт — разные задачи. По оценке Zhipu, чем дальше по этой цепочке находится тест, тем сильнее отстаёт её модель; компания прямо говорит об этом в примечании к выпуску, вместо того чтобы оставлять выводы читателям.
Какая именно модель Anthropic — и почему это постоянно меняется
Часть путаницы в публикациях связана с тем, что Zhipu сравнивает три разные модели Anthropic в трёх разных местах. В основной таблице тестов GLM-5.3 сопоставляется с Opus 4.8. В графиках производительности используется Fable 5. В разделе о кибербезопасности — Mythos 5. При беглом чтении складывается впечатление, будто существует одно сравнение, которого на самом деле нет.
В программировании картина скорее смешанная, чем однозначно превосходящая. GLM-5.3 опережает Opus 4.8 в одних тестах и уступает ему в других, а Zhipu прямо заявляет, что её модель всё ещё отстаёт от Claude Fable 5 во внутреннем тесте компании на программирование.
Как проводились тесты
Сноски к методологии содержат то, что упустили краткие обзоры. Zhipu оценивала GLM-5.3 в CyberGym, ExploitGym, ExploitBench, Terminal Bench и ряде других задач внутри Claude Code 2.1.207 — программного агента Anthropic для написания кода.
В этом нет ничего некорректного. Использование общего инструментария для разных моделей — способ сохранить справедливость сравнения, и Zhipu документирует использованные настройки. Тем не менее на это стоит обратить внимание. Заявления китайской модели с открытыми весами о передовых возможностях измеряются с помощью американского программного агента, что говорит о положении инструментального уровня в этой конкуренции больше, чем показатели самих моделей.
Прежде чем считать результат CyberGym окончательным, стоит обратить внимание ещё на две детали. Показатель получен за один запуск и представлен как pass@1 по 1507 задачам, при этом данные о разбросе не приводятся. На разницу в семь десятых пункта между двумя единичными запусками не следует опираться. Кроме того, временные интервалы ExploitGym были нормализованы с использованием показателей пропускной способности от Artificial Analysis; коэффициенты пересчёта указаны для GLM-5.3, Kimi K3 и Qwen3.8 Max, но не для Mythos 5.
Количество уязвимостей и недостающее число
Помимо результатов тестов, Zhipu сообщает, что сотрудничала с командами по безопасности в Китае и запускала свои модели на реальных кодовых базах, выявив 2436 уязвимостей в 269 проектах с открытым исходным кодом. Распределение по степени серьёзности выглядит так: 107 критических, 990 высоких, 1286 средних и 53 низких. Самая старая уязвимость датируется 1981 годом, а средняя уязвимость находилась в коде 26,6 года до того, как её обнаружили.

Одно расхождение стоит упомянуть аккуратно. На сводной панели Zhipu 1097 находок обозначены как критические и высокие, что соответствует таблице по степени серьёзности. В основном тексте того же сообщения эти 1097 находок описаны как уязвимости средней и высокой степени. Несколько изданий воспроизвели второй вариант.
Это количество также приводится после экспертной проверки, фильтрации и устранения дубликатов, как описывает Zhipu, поэтому речь идёт не о необработанном результате работы модели. Из 2436 находок 53 были раскрыты публично, а 2383 остаются под эмбарго. В сообщении не говорится, сколько из них ранее были неизвестны, а также сколько были независимо воспроизведены. Именно эти два показателя превратили бы заявление о количестве в заявление о возможностях.
Что важнее таблицы с результатами тестов
В сообщении есть два момента, последствия которых будут более долгосрочными, чем разрыв в CyberGym.
Первый — эффективность. Zhipu сообщает, что GLM-5.3 достигает 31,4% во внутреннем тесте компании на программирование примерно при 50 000 выходных токенов на задачу, тогда как Opus 4.8 получает 29,5%, используя 120 000 токенов. Немного лучшая работа при менее чем половине числа токенов — это аргумент в пользу экономии, а стоимость определяет, смогут ли команды по безопасности за пределами крупнейших бюджетов вообще запускать такие инструменты.
Второй — распространение. Zhipu заявляет, что веса будут опубликованы после завершения оценки безопасности и усиления защиты. Пока этого не произошло, и до этого момента заявление об открытых весах остаётся обещанием, а не фактом. Если оно будет выполнено, модель с документированными возможностями поиска уязвимостей станет доступна для скачивания и локального запуска любой командой, в том числе на рынках, где никогда не будет доступа к американской модели, подпадающей под экспортные ограничения.
Публикация весов ожидается в конце августа.
См. также: Anthropic приходит в Белый дом — и именно Mythos объясняет, почему Вашингтон её впустил

Хотите больше узнать об ИИ и больших данных от лидеров отрасли? Посетите AI & Big Data Expo, который проходит в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими мероприятиями, включая Cyber Security & Cloud Expo. Нажмите здесь, чтобы узнать больше.
AI News работает при поддержке TechForge Media. Узнайте о других предстоящих мероприятиях и вебинарах в области корпоративных технологий здесь.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.