Z.ai выпустила GLM-5.3 без переобучения базовой модели: лучше справляется со сложным программированием и задачами с длинным горизонтом
Z.ai только что выпустила GLM-5.3. GLM-5.3 работает на той же базовой модели 743B, что и GLM-5.2. Все заявленные улучшения достигнуты за счёт масштабирования постобучения: большего числа сред для выполнения задач, большего разнообразия типов сред и более продолжительного обучения. Результаты проявились в двух направлениях. Наибольший прирост в программировании наблюдается на бенчмарках с самым длинным горизонтом планирования: показатель Terminal-Bench 3.0 вырос с 4,6 до 28,3. В области кибербезопасности результаты оказались выше ожиданий Z.ai: на CyberGym достигнуто 84,5%. Веса пока не опубликованы.
Готов ли он к развёртыванию?
Частично: GLM-5.3 уже доступна через API Z.ai, тарифный план GLM Coding Plan и ZCode. Веса пока не опубликованы. Z.ai заявляет, что опубликует их примерно через две недели после запуска, когда завершатся оценка безопасности и усиление защиты.
- Какие компании могут начать использовать модель уже сейчас: Стартапы и инженерные подразделения компаний среднего размера могут внедрить её уже сегодня через Coding Plan или API. Предприятиям, на которые распространяются требования к локализации данных или проверке поставщиков, следует дождаться публикации весов. Наибольший интерес, а также наибольшие регуляторные риски модель представляет для поставщиков решений безопасности и MSSP.
- Отрасли: Инструменты для разработчиков, облачная инфраструктура, безопасность приложений, разработка решений для финтеха и электронной коммерции, а также поставщики, выпускающие ядра операционных систем, браузерные движки или сетевые стеки.
- Применение: Рефакторинг на уровне репозитория, CLI-агенты с длинным горизонтом планирования, анализ сбоев CI, поиск уязвимостей методом белого ящика, анализ причин сбоев и безопасное ревью кода.
Результаты в программировании
Показатель Terminal-Bench 3.0 вырос с 4,6 до 28,3 по сравнению с GLM-5.2. DeepSWE v1.1 вырос с 46,2 до 66,9. Agents’ Last Exam (CLI) вырос с 23,8 до 28,5. На GDPval-AA v2, охватывающем 44 профессии, GLM-5.3 набирает 1 769 баллов.
На внутреннем тесте Z.ai Code Bench компания сообщает об улучшении на 50% по сравнению с GLM-5.2. Для модели заявлен результат 31,4% при примерно 50 000 выходных токенов на задачу. Claude Opus 4.8 набирает 29,5% при 120 000 токенов. Claude Fable 5 по-прежнему лидирует с результатом 39,5% при максимальном уровне усилий. Z.ai утверждает, что закрытый бенчмарк снижает риск загрязнения данных.
В общедоступных наборах тестов GLM-5.3 уступает GPT-5.6 Sol и Fable 5 в нескольких более сложных оценках программирования. Все показатели предоставлены поставщиками; параметры тестовых обвязок, длина контекста и настройки выборки задокументированы в объявлении.
Результат в области кибербезопасности
Z.ai отмечает, что этот результат не был запланирован. Компания добавила данные для поиска уязвимостей, рассчитывая улучшить рассуждения при работе с отдельными ошибками. Однако по мере масштабирования обучения возможности модели продолжали накапливаться. Модель начала формировать последовательные планы, охватывающие полные цепочки эксплуатации.
Показатель CyberGym, проверяющего поиск и валидацию уязвимостей на основе исходного кода методом белого ящика, вырос с 77,2% до 84,5%. Это немного выше, чем у Mythos 5 — 83,8% и GPT-5.6 Sol — 83,6%. Показатель ExploitBench, требующего определить первопричину и создать работающий эксплойт, вырос с 24,4% до 54,4%. У Mythos 5 — 78,0%. На ExploitGym GLM-5.3 выполняет 105 задач за два часа и 130 за шесть часов. GLM-5.2 выполняет 29 и 39 задач соответственно. Mythos 5 выполняет 181 и 247 задач.
Картина последовательна. Чем глубже бенчмарк погружается в цепочку эксплуатации, тем больше преимущество над GLM-5.2. Разрыв с закрытыми передовыми моделями также увеличивается.
Интерактивное объяснение
Основные выводы
- GLM-5.3 использует базовую модель GLM-5.2; весь прирост достигнут за счёт масштабирования постобучения.
- Показатель Terminal-Bench 3.0 вырос с 4,6 до 28,3, а DeepSWE v1.1 — с 46,2 до 66,9.
- CyberGym достиг 84,5%, опередив Mythos 5 (83,8%) и GPT-5.6 Sol (83,6%).
- Результат ExploitBench более чем удвоился и достиг 54,4%, но всё ещё уступает Mythos 5 с его 78,0%.
- Веса будут опубликованы примерно через две недели после оценки безопасности и усиления защиты.
Ознакомьтесь с техническим блогом Z.ai о GLM-5.3, объявлением Zai_org, реестром раскрытия информации об уязвимостях Z.ai и репозиторием zai-org/GLM-5 на GitHub. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему субреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнёром для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.