Sakhanda Wire
NVDA $225.01 -0.07% MSFT $480.35 -3.04% GOOGL $344.00 -0.55% META $568.97 -3.54% AMZN $261.31 -0.51%
← К новостям

Что показывают результаты GLM-5.3 от Zhipu помимо заголовочной цифры

В примечании к выпуску Zhipu, посвящённом GLM-5.3, содержится предложение, которое не попало в большинство публикаций. Описывая собственные результаты в области кибербезопасности, пекинская компания пишет, что эта способность «быстрее всего растёт именно там, где мы отстаём сильнее всего».

Zhipu, также работающая под брендом Z.ai, — одна из немногих китайских лабораторий, выпускающих модели, конкурирующие с американскими передовыми разработками. 14 августа компания запустила GLM-5.3 — модель, ориентированную на программирование, — и опубликовала техническое примечание к выпуску, в котором описала результаты модели в сравнении с конкурентами. Именно это примечание является источником всей изложенной здесь информации.

В заголовки попала информация о безопасности. Наряду с результатами в программировании Zhipu заявила, что GLM-5.3 неожиданно хорошо находит уязвимости в программном обеспечении, набрав 84,5% в тесте CyberGym против 83,8% у Mythos 5 от Anthropic и 83,6% у GPT-5.6 Sol от OpenAI. После этого появились заголовки о том, что китайская модель теперь лучше американских ищет ошибки в коде.

Причина, по которой это звучит весомее обычного результата тестирования, заключается в том, во что превратился поиск уязвимостей. Модель, способная прочитать кодовую базу и обнаружить эксплуатируемые уязвимости, полезна защитнику, проверяющему собственное программное обеспечение, и тому, кто делает то же самое с чужим. Эквивалентная разработка Anthropic по этой причине доступна только в ограниченном режиме, тогда как Zhipu намерена опубликовать веса GLM-5.3 для свободного скачивания.

Собственное сообщение Zhipu более взвешенно, чем созданное вокруг него освещение. Показатель CyberGym реален и приведён в документе. Однако это самый узкий из трёх опубликованных компанией результатов в области кибербезопасности, и Zhipu открыто признаёт, что по двум другим показателям ситуация складывается иначе.

Три теста — три разные картины

CyberGym начинается с исходного кода, который модель может прочитать, и проверяет, способна ли она найти уязвимость и подтвердить, что дефект реален. Именно этот результат получил распространение, а разрыв составляет семь десятых процентного пункта.

ExploitBench ставит более сложную задачу: модель должна рассуждать о реальной уязвимости и о том, как её можно было бы эксплуатировать. GLM-5.3 набирает 54,4% — более чем вдвое больше, чем её предшественник, набравший 24,4%. Mythos 5 получает 78,0%, а GPT-5.6 Sol — 76,5%.

ExploitGym подсчитывает, сколько задач по эксплуатации модель выполняет за фиксированное время. GLM-5.3 выполняет 105 задач за два часа и 130 за шесть. Mythos 5 выполняет 181 и 247 задач соответственно.

Этим двум результатам уделили мало внимания, хотя именно они описывают разрыв. Найти уязвимость и создать на её основе работающий эксплойт — разные задачи. По оценке Zhipu, чем дальше по этой цепочке находится тест, тем сильнее отстаёт её модель; компания прямо говорит об этом в примечании к выпуску, вместо того чтобы оставлять выводы читателям.

Какая именно модель Anthropic — и почему это постоянно меняется

Часть путаницы в публикациях связана с тем, что Zhipu сравнивает три разные модели Anthropic в трёх разных местах. В основной таблице тестов GLM-5.3 сопоставляется с Opus 4.8. В графиках производительности используется Fable 5. В разделе о кибербезопасности — Mythos 5. При беглом чтении складывается впечатление, будто существует одно сравнение, которого на самом деле нет.

В программировании картина скорее смешанная, чем однозначно превосходящая. GLM-5.3 опережает Opus 4.8 в одних тестах и уступает ему в других, а Zhipu прямо заявляет, что её модель всё ещё отстаёт от Claude Fable 5 во внутреннем тесте компании на программирование.

Как проводились тесты

Сноски к методологии содержат то, что упустили краткие обзоры. Zhipu оценивала GLM-5.3 в CyberGym, ExploitGym, ExploitBench, Terminal Bench и ряде других задач внутри Claude Code 2.1.207 — программного агента Anthropic для написания кода.

В этом нет ничего некорректного. Использование общего инструментария для разных моделей — способ сохранить справедливость сравнения, и Zhipu документирует использованные настройки. Тем не менее на это стоит обратить внимание. Заявления китайской модели с открытыми весами о передовых возможностях измеряются с помощью американского программного агента, что говорит о положении инструментального уровня в этой конкуренции больше, чем показатели самих моделей.

Прежде чем считать результат CyberGym окончательным, стоит обратить внимание ещё на две детали. Показатель получен за один запуск и представлен как pass@1 по 1507 задачам, при этом данные о разбросе не приводятся. На разницу в семь десятых пункта между двумя единичными запусками не следует опираться. Кроме того, временные интервалы ExploitGym были нормализованы с использованием показателей пропускной способности от Artificial Analysis; коэффициенты пересчёта указаны для GLM-5.3, Kimi K3 и Qwen3.8 Max, но не для Mythos 5.

Количество уязвимостей и недостающее число

Помимо результатов тестов, Zhipu сообщает, что сотрудничала с командами по безопасности в Китае и запускала свои модели на реальных кодовых базах, выявив 2436 уязвимостей в 269 проектах с открытым исходным кодом. Распределение по степени серьёзности выглядит так: 107 критических, 990 высоких, 1286 средних и 53 низких. Самая старая уязвимость датируется 1981 годом, а средняя уязвимость находилась в коде 26,6 года до того, как её обнаружили.

Summary panel from Zhipu's release showing 2,436 findings tracked, 53 publicly disclosed, 2,383 under embargo and 1,097 labelled critical and high.
Сводка раскрытия информации от Zhipu. На панели 1097 находок обозначены как критические и высокие, что соответствует распределению по степени серьёзности: 107 критических и 990 высоких. В основном тексте того же сообщения эти 1097 находок описаны как уязвимости средней и высокой степени. Источник: Z.ai.

Одно расхождение стоит упомянуть аккуратно. На сводной панели Zhipu 1097 находок обозначены как критические и высокие, что соответствует таблице по степени серьёзности. В основном тексте того же сообщения эти 1097 находок описаны как уязвимости средней и высокой степени. Несколько изданий воспроизвели второй вариант.

Это количество также приводится после экспертной проверки, фильтрации и устранения дубликатов, как описывает Zhipu, поэтому речь идёт не о необработанном результате работы модели. Из 2436 находок 53 были раскрыты публично, а 2383 остаются под эмбарго. В сообщении не говорится, сколько из них ранее были неизвестны, а также сколько были независимо воспроизведены. Именно эти два показателя превратили бы заявление о количестве в заявление о возможностях.

Что важнее таблицы с результатами тестов

В сообщении есть два момента, последствия которых будут более долгосрочными, чем разрыв в CyberGym.

Первый — эффективность. Zhipu сообщает, что GLM-5.3 достигает 31,4% во внутреннем тесте компании на программирование примерно при 50 000 выходных токенов на задачу, тогда как Opus 4.8 получает 29,5%, используя 120 000 токенов. Немного лучшая работа при менее чем половине числа токенов — это аргумент в пользу экономии, а стоимость определяет, смогут ли команды по безопасности за пределами крупнейших бюджетов вообще запускать такие инструменты.

Второй — распространение. Zhipu заявляет, что веса будут опубликованы после завершения оценки безопасности и усиления защиты. Пока этого не произошло, и до этого момента заявление об открытых весах остаётся обещанием, а не фактом. Если оно будет выполнено, модель с документированными возможностями поиска уязвимостей станет доступна для скачивания и локального запуска любой командой, в том числе на рынках, где никогда не будет доступа к американской модели, подпадающей под экспортные ограничения.

Публикация весов ожидается в конце августа.

См. также: Anthropic приходит в Белый дом — и именно Mythos объясняет, почему Вашингтон её впустил

Banner for the AI & Big Data Expo event series.

Хотите больше узнать об ИИ и больших данных от лидеров отрасли? Посетите AI & Big Data Expo, который проходит в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими мероприятиями, включая Cyber Security & Cloud Expo. Нажмите здесь, чтобы узнать больше.

AI News работает при поддержке TechForge Media. Узнайте о других предстоящих мероприятиях и вебинарах в области корпоративных технологий здесь.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием AI News

Читать оригинал на AI News ↗

Текст и изображения принадлежат AI News и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости