Що показують результати GLM-5.3 від Zhipu за межами заголовкової цифри
Примітка до випуску Zhipu щодо GLM-5.3 містить речення, яке не потрапило до більшості публікацій. Описуючи власні результати у сфері кібербезпеки, пекінська компанія пише, що ця здатність «зростає найшвидше саме там, де ми відстаємо найбільше».
Zhipu, яка також працює під назвою Z.ai, є однією з небагатьох китайських лабораторій, що випускають моделі, здатні конкурувати з американськими передовими розробками. 14 серпня компанія запустила GLM-5.3 — модель, орієнтовану на програмування, — і опублікувала технічну примітку до випуску, у якій описала результати моделі у порівнянні з конкурентами. Саме ця примітка є джерелом усієї наведеної тут інформації.
Поширена заява стосувалася безпеки. Поряд із результатами програмування Zhipu повідомила, що GLM-5.3 несподівано добре знаходить вразливості в програмному забезпеченні: модель набрала 84,5% у тесті CyberGym проти 83,8% у Mythos 5 від Anthropic і 83,6% у GPT-5.6 Sol від OpenAI. З’явилися заголовки про те, що китайська модель тепер краще за американські знаходить помилки.
Це сприймається гостріше, ніж звичайний результат тестування, через те, чим стало виявлення вразливостей. Модель, здатна прочитати кодову базу й знайти вразливі місця, корисна захиснику, який перевіряє власне програмне забезпечення, і будь-кому, хто робить те саме із чужим. Еквівалентна робота Anthropic з цієї причини доступна лише в обмеженому режимі, тоді як Zhipu має намір опублікувати ваги GLM-5.3 для завантаження всіма охочими.
Власний реліз Zhipu містить більш виважену оцінку, ніж публікації, які він породив. Показник CyberGym реальний і наведений у документі. Водночас це найвужчий із трьох результатів у сфері кібербезпеки, опублікованих компанією, і Zhipu прямо визнає, що за двома іншими показниками ситуація протилежна.
Три тести — три різні картини
CyberGym починається з вихідного коду, який модель може прочитати, і перевіряє, чи здатна вона знайти вразливість та підтвердити, що вада справжня. Саме цей результат набув розголосу, а перевага становить сім десятих відсоткового пункту.
ExploitBench ставить складніше завдання: модель має міркувати про реальну вразливість і спосіб її експлуатації. GLM-5.3 набрала 54,4% — більш ніж удвічі більше, ніж її попередниця з результатом 24,4%. Mythos 5 набрала 78,0%, а GPT-5.6 Sol — 76,5%.
ExploitGym підраховує, скільки завдань з експлуатації модель виконує за фіксований проміжок часу. GLM-5.3 виконує 105 завдань за дві години та 130 за шість. Mythos 5 виконує 181 і 247 відповідно.
Ці два результати висвітлювалися мало, хоча саме вони описують розрив. Знайти ваду та створити на її основі робочий експлойт — це різні завдання. Zhipu вважає, що чим далі в цьому ланцюжку розташований тест, тим більше відстає її модель, і компанія прямо пише про це у релізі, а не залишає читачам можливість виявити це самостійно.
Яка саме модель Anthropic і чому це постійно змінюється
Частина плутанини в публікаціях виникає через те, що Zhipu порівнює три різні моделі Anthropic у трьох різних місцях. Основна таблиця тестів зіставляє GLM-5.3 з Opus 4.8. На графіках продуктивності використовується Fable 5. У розділі про кібербезпеку — Mythos 5. Той, хто читає швидко, отримує єдине порівняння, якого насправді не існує.
У програмуванні картина неоднозначна, а не домінуюча. GLM-5.3 випереджає Opus 4.8 в одних тестах і поступається їй в інших, а Zhipu прямо зазначає, що її модель усе ще відстає від Claude Fable 5 у власному внутрішньому тесті програмування компанії.
Як проводилися тести
Примітки до методології містять те, що пропустили короткі огляди. Zhipu оцінювала GLM-5.3 у CyberGym, ExploitGym, ExploitBench, Terminal Bench та кількох інших завданнях усередині Claude Code 2.1.207 — програмного агента Anthropic для написання коду.
Це не є неналежним підходом. Використання спільного середовища для різних моделей — саме так зберігається чесність порівняння, і Zhipu документує використані налаштування. Проте на це варто звернути увагу. Передові заяви китайської моделі з відкритими вагами вимірюються за допомогою американського програмного забезпечення для агентів, і це дещо говорить про місце інструментального рівня в цій конкуренції — те, чого не показують оцінки моделей.
Перш ніж вважати результат CyberGym остаточним, варто звернути увагу ще на дві деталі. Показник отримано за один запуск і наведено як pass@1 для 1 507 завдань, без зазначення показників варіативності. Різниця у сім десятих пункту між двома одиничними запусками — не той розрив, на який варто спиратися. Крім того, часові обмеження ExploitGym було нормалізовано за допомогою показників пропускної здатності від Artificial Analysis, із зазначеними коефіцієнтами масштабування для GLM-5.3, Kimi K3 та Qwen3.8 Max, але не для Mythos 5.
Кількість вразливостей і відсутнє число
Окрім результатів тестів, Zhipu повідомляє, що працювала з командами безпеки в Китаї, щоб перевірити свої моделі на реальних кодових базах, виявивши 2 436 вразливостей у 269 проєктах із відкритим вихідним кодом. Розподіл за рівнем критичності такий: 107 критичних, 990 високих, 1 286 середніх і 53 низького рівня. Найстаріша вада датується 1981 роком, а середня вразливість перебувала в коді 26,6 року, перш ніж її виявили.

На одну розбіжність варто звернути увагу. У підсумковій панелі Zhipu 1 097 знахідок позначено як критичні та високого рівня, що відповідає таблиці серйозності. В основному тексті того самого релізу ці 1 097 описано як вразливості середнього та високого рівнів. Кілька видань відтворили другий варіант.
Ця кількість також наведена після експертної перевірки, відбору та усунення дублікатів, як описує Zhipu, тож повідомляється не сирий результат роботи моделі. Із 2 436 знахідок 53 були оприлюднені, а 2 383 залишаються під ембарго. У релізі не сказано, скільки з них були раніше невідомими, і не вказано, скільки було незалежно відтворено. Саме ці два показники перетворили б заяву про обсяг на заяву про можливості.
Що важливіше за таблицю результатів
У релізі є дві речі, наслідки яких будуть тривалішими, ніж різниця в CyberGym.
Перша — ефективність. Zhipu повідомляє, що GLM-5.3 досягла 31,4% у внутрішньому тесті програмування компанії, використовуючи близько 50 000 вихідних токенів на завдання, тоді як Opus 4.8 набрала 29,5% із використанням 120 000 токенів. Трохи кращий результат менш ніж за половину токенів — це аргумент на користь економії, а саме вартість визначає, чи зможуть команди безпеки за межами найбільших бюджетів узагалі запускати такі інструменти.
Друга — поширення. Zhipu заявляє, що ваги буде опубліковано після завершення оцінювання безпеки та посилення захисту. Поки цього не сталося, і твердження про відкриті ваги є радше зобов’язанням, ніж фактом. Якщо обіцянку буде виконано, модель із документально підтвердженою здатністю виявляти вразливості зможе завантажити й запускати локально будь-яка команда, зокрема на ринках, які ніколи не матимуть доступу до американської моделі, експорт якої контролюється.
Вихід ваг очікується наприкінці серпня.
Дивіться також: Anthropic приходить до Білого дому, і саме Mythos пояснює, чому Вашингтон її впустив

Хочете дізнатися більше про ШІ та великі дані від лідерів галузі? Відвідайте AI & Big Data Expo, що відбудеться в Амстердамі, Каліфорнії та Лондоні. Цей масштабний захід є частиною TechEx і проходитиме одночасно з іншими провідними технологічними заходами, зокрема Cyber Security & Cloud Expo. Натисніть тут, щоб отримати більше інформації.
AI News працює на базі TechForge Media. Ознайомтеся з іншими майбутніми заходами та вебінарами у сфері корпоративних технологій тут.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.