Z.ai пуска GLM-5.3 без дообучаване на базовия модел: по-добър в сложното програмиране и задачите с дълъг хоризонт
Z.ai току-що пусна GLM-5.3. GLM-5.3 работи със същия базов модел с 743 млрд. параметъра като GLM-5.2. Всички отчетени подобрения идват от мащабирано дообучаване: повече среди за задачи, повече типове среди и по-продължително обучение. Резултатите се проявяват в две области. Кодиращите способности се подобряват най-много при бенчмарковете с най-дълъг хоризонт, като Terminal-Bench 3.0 се повишава от 4.6 на 28.3. Киберсигурността се е подобрила повече, отколкото Z.ai е очаквала, като CyberGym достига 84.5%. Теглата все още не са публично достъпни.
Готов ли е за внедряване?
Частично, GLM-5.3 е достъпен чрез API на Z.ai, GLM Coding Plan и ZCode. Теглата все още не са публикувани. Z.ai заявява, че ще ги публикува приблизително две седмици след старта, след приключването на оценката на безопасността и укрепването на защитите.
- Кои компании могат да започнат веднага: Стартъпи и инженерни организации от средния пазар могат да го използват още днес чрез Coding Plan или API. Предприятията с изисквания за локализация на данните или правила за одобрение на доставчици трябва да изчакат теглата. Доставчиците на решения за сигурност и MSSP получават най-много сигнали, но са изложени и на най-много регулаторни и политически рискове.
- Индустрии: Инструменти за разработчици, облачна инфраструктура, сигурност на приложенията, инженеринг във финтех и електронната търговия, както и доставчици, разработващи ядра, браузърни енджини или мрежови стекове.
- Приложения: Рефакториране в мащаба на хранилища, CLI агенти с дълъг хоризонт на работа, триаж на грешки в CI, откриване на уязвимости чрез анализ на изходния код, триаж на сривове и преглед на сигурността на кода.
Резултати при кодиране
Terminal-Bench 3.0 се повишава от 4.6 на 28.3 спрямо GLM-5.2. DeepSWE v1.1 се повишава от 46.2 на 66.9. Agents’ Last Exam (CLI) се повишава от 23.8 на 28.5. При GDPval-AA v2, който обхваща 44 професии, GLM-5.3 постига 1 769 точки.
При Z.ai Code Bench, вътрешна оценка, компанията отчита 50% подобрение спрямо GLM-5.2. Тя отчита 31.4% при приблизително 50 000 изходни токена на задача. Claude Opus 4.8 постига 29.5% при 120 000 токена. Claude Fable 5 все още води с 39.5% при максимално усилие. Z.ai твърди, че частният бенчмарк намалява риска от замърсяване на данните.
При публичните набори GLM-5.3 изостава от GPT-5.6 Sol и Fable 5 при няколко по-трудни оценки на кодиращи способности. Всички стойности са отчетени от доставчиците, като в съобщението са документирани настройките на тестовата рамка, дължината на контекста и семплирането.
Резултатът в киберсигурността
Z.ai определя този резултат като непланиран. Компанията е добавила данни за откриване на уязвимости с очакването да подобри разсъжденията при единични грешки. Вместо това способностите са продължили да се натрупват с мащабирането на обучението. Моделът е започнал да изгражда последователни планове през пълни вериги за експлоатация.
CyberGym, който тества откриването и валидирането чрез анализ на изходния код, се повишава от 77.2% на 84.5%. Това е малко над Mythos 5 с 83.8% и GPT-5.6 Sol с 83.6%. ExploitBench, който изисква разсъждение за първопричината и работещ експлойт, се повишава от 24.4% на 54.4%. Mythos 5 е на 78.0%. При ExploitGym GLM-5.3 изпълнява 105 задачи за два часа и 130 за шест часа. GLM-5.2 изпълнява съответно 29 и 39. Mythos 5 изпълнява съответно 181 и 247.
Моделът е последователен. Колкото по-дълбоко във веригата за експлоатация се намира даден бенчмарк, толкова по-голямо е подобрението спрямо GLM-5.2. Разликата спрямо затворените водещи модели също се увеличава.
Интерактивно обяснение
Основни изводи
- GLM-5.3 използва повторно базовия модел GLM-5.2; всички подобрения идват от мащабиране на дообучаването.
- Terminal-Bench 3.0 се повишава от 4.6 на 28.3; DeepSWE v1.1 — от 46.2 на 66.9.
- CyberGym достига 84.5%, пред Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%).
- ExploitBench се увеличава повече от два пъти до 54.4%, но изостава от Mythos 5 с 78.0%.
- Теглата ще бъдат публикувани след около две седмици, след оценката на безопасността и укрепването на защитите.
Вижте техническия блог на Z.ai за GLM-5.3, съобщението на Zai_org, регистъра за уведомяване за уязвимости на Z.ai и zai-org/GLM-5 в GitHub.Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.