Sakhanda Wire
NVDA $225.30 +0.54% MSFT $496.88 +0.90% GOOGL $346.36 +0.82% META $594.97 +2.78% AMZN $265.13 -0.80%
← До новин

Z.ai випустила GLM-5.3 без перенавчання базової моделі: краще виконує складне програмування та завдання з довгим горизонтом

Z.ai щойно випустила GLM-5.3. GLM-5.3 працює на тій самій базовій моделі 743B, що й GLM-5.2. Усі заявлені покращення є результатом масштабування посттренування: більше середовищ завдань, більше типів середовищ, довше навчання. Результати проявляються у двох сферах. Найбільший стрибок у програмуванні спостерігається на бенчмарках із найдовшим горизонтом, причому показник Terminal-Bench 3.0 зріс із 4.6 до 28.3. У кібербезпеці результати перевищили очікування Z.ai: CyberGym досяг 84.5%. Ваги моделі поки що не оприлюднені.

Чи придатна до розгортання?

Частково, GLM-5.3 доступна через API Z.ai, GLM Coding Plan і ZCode. Ваги моделі ще не опубліковані. Z.ai повідомляє, що оприлюднить їх приблизно через два тижні після запуску, щойно завершаться оцінювання безпеки та посилення захисту.

  • Які компанії можуть почати вже зараз: Стартапи та інженерні організації середнього бізнесу можуть використовувати модель уже сьогодні через Coding Plan або API. Підприємствам із вимогами щодо локалізації даних або процедурами перевірки постачальників варто зачекати на ваги. Постачальники рішень із безпеки та MSSP отримують найбільше сигналів, а також стикаються з найбільшими політичними ризиками.
  • Галузі: Інструменти для розробників, хмарна інфраструктура, безпека застосунків, інженерія у фінтеху та електронній комерції, а також постачальники ядер операційних систем, браузерних рушіїв або мережевих стеків.
  • Застосування: Рефакторинг на рівні репозиторіїв, CLI-агенти з довгим горизонтом, тріаж збоїв CI, пошук вразливостей методом white-box, тріаж аварійних завершень і безпечний аналіз коду.

Результати програмування

Показник Terminal-Bench 3.0 зріс із 4.6 до 28.3 порівняно з GLM-5.2. DeepSWE v1.1 зріс із 46.2 до 66.9. Agents’ Last Exam (CLI) зріс із 23.8 до 28.5. На GDPval-AA v2, який охоплює 44 професії, GLM-5.3 набирає 1,769 балів.

У внутрішньому оцінюванні Z.ai Code Bench компанія повідомляє про покращення на 50% порівняно з GLM-5.2. За її даними, результат становить 31.4% приблизно за 50,000 вихідних токенів на завдання. Claude Opus 4.8 набирає 29.5% за 120,000 токенів. Claude Fable 5, як і раніше, лідирує з результатом 39.5% за максимального рівня зусиль. Z.ai стверджує, що приватний бенчмарк зменшує ризик забруднення даних.

У відкритих наборах тестів GLM-5.3 поступається GPT-5.6 Sol і Fable 5 у кількох складніших оцінюваннях програмування. Усі показники надані постачальниками; параметри тестового середовища, довжина контексту та налаштування семплінгу задокументовані в оголошенні.

Результат у сфері кібербезпеки

Z.ai називає цей результат непередбаченим. Компанія додала дані для пошуку вразливостей, очікуючи покращення міркувань щодо окремих помилок. Натомість зі збільшенням масштабу навчання здатності продовжували накопичуватися. Модель почала формувати узгоджені плани для повних ланцюгів експлуатації.

Показник CyberGym, який перевіряє пошук і валідацію на основі вихідного коду white-box, зріс із 77.2% до 84.5%. Це трохи вище за Mythos 5 із результатом 83.8% і GPT-5.6 Sol із 83.6%. ExploitBench, який вимагає встановлення першопричини та створення робочого експлойту, зріс із 24.4% до 54.4%. Mythos 5 має результат 78.0%. На ExploitGym GLM-5.3 виконує 105 завдань за дві години та 130 за шість годин. GLM-5.2 виконує 29 і 39 відповідно. Mythos 5 виконує 181 і 247.

Картина послідовна. Що глибше в ланцюжку експлуатації розташований бенчмарк, то більший приріст порівняно з GLM-5.2. Розрив із закритими передовими моделями також збільшується.

Інтерактивне пояснення

Основні висновки

  • GLM-5.3 повторно використовує базову модель GLM-5.2; усі покращення є результатом масштабування посттренування.
  • Показник Terminal-Bench 3.0 зріс із 4.6 до 28.3; DeepSWE v1.1 — із 46.2 до 66.9.
  • CyberGym досяг 84.5%, випередивши Mythos 5 (83.8%) і GPT-5.6 Sol (83.6%).
  • Показник ExploitBench більш ніж подвоївся — до 54.4%, але все ще поступається Mythos 5 із результатом 78.0%.
  • Ваги моделі будуть опубліковані приблизно через два тижні після оцінювання безпеки та посилення захисту.

Ознайомтеся з технічним блогом Z.ai про GLM-5.3, оголошенням Zai_org, реєстром розкриття інформації про безпеку Z.ai та репозиторієм zai-org/GLM-5 на GitHub. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Хочете стати нашим партнером для просування свого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини