Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← К новостям

Может ли открытая модель заниматься исследованиями в области безопасности? apex-flash-1 от Cantina решает 40 из 60 отложенных задач по поиску уязвимостей

Cantina Security совместно с Yeta Labs выпустила apex-flash-1 — модель с открытыми весами, специально обученную для исследования уязвимостей. Это дообученная с подкреплением версия GLM-5.3-Flash от Z.ai, выпущенная на Hugging Face под лицензией MIT.

Можно ли её развернуть? Да, веса MIT поддерживают запуск через vLLM, SGLang или Transformers, однако для BF16 требуется примерно 640 ГБ памяти GPU.

Что создала Cantina

Согласно метаданным safetensors на Hugging Face, apex-flash-1 имеет в общей сложности 321,3 млрд параметров. Базовая GLM-5.3-Flash представляет собой модель со смесью экспертов с 18 млрд активных параметров.

Cantina обучала её с помощью GRPO, используя LoRA ранга 256, а также выборочное обучение всех параметров. Данные охватывают 150 задач, созданных на основе 50 реальных случаев уязвимостей.

Каждый случай представлен в 3 вариантах: управляемый whitebox, сфокусированный whitebox и сфокусированный blackbox.

Уязвимости авторизации, идентификации и определения области действия составляют 72% случаев. На ошибки учёта и численной точности приходится ещё 18%. Остальные случаи связаны с проверкой времени, бизнес-правилами и SSRF.

Согласно карточке модели на HF, запуски RL выполнялись внутри агентского окружения Codex на программном обеспечении и протокольных окружениях, близких к производственным.

Результаты бенчмарка

Cantina оценила 60 задач из 20 отложенных случаев уязвимостей. Каждая модель прошла набор один раз, а стоимость оценивалась на основе тарифов провайдеров.

  • apex-flash-1: решено 40 из 60 (66,7% pass@1), около $2,38
  • GLM-5.3-Flash (базовая): решено 36 из 60 (60,0%), около $4,56
  • Claude Opus 5 High: решено 43 из 60 (71,7%), около $74,68

Opus решил на 3 задачи больше, но его запуск стоил примерно в 31 раз дороже. Это составляет примерно $0,06 за решённую задачу для apex-flash-1 против $1,74 для Opus. Эти цифры предоставлены компанией и получены на внутреннем бенчмарке.

Рабочая модель, а не оркестратор

Cantina позиционирует apex-flash-1 как рабочую модель, которой управляет более крупная модель. В карточке перечислены чтение кода, использование инструментов, разработка эксплойтов и проверка в качестве целевых навыков.

Экспериментальный вариант apex-flash-1-abliterated поставляется с изменённым поведением при отказе. Отдельно он не оценивался.

Обоснование Cantina заключается в том, что защитникам нужны мощные модели, которые можно запускать и контролировать локально.

Интерактивное объяснение

Сравнение

Характеристикаapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
РазработчикCantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
Базовая модельGLM-5.3-FlashGLM-5.3 (сокращённая)Llama 3.1 8BСобственное предварительное обучение
Размер321,3 млрд всего, BF16328 ГБ, INT4 (W4A16)8 млрд320 млрд всего, 18 млрд активных
ЛицензияMITНаследует лицензию GLM-5.3Специальная (см. NOTICE.md)MIT
Метод обеспечения безопасностиRL с GRPO на 50 реальных случаях уязвимостейОтбор экспертов (REAP) + квантованиеДообучение на инструкциях + RLHF на вопросах и ответах по безопасностиБазовая модель общего назначения
Основное применениеАгентный рабочий инструмент для исследования уязвимостейАвтономное пентестирование в изолированной средеТриаж в SOC и защита от угрозОбщее программирование и агенты
ОборудованиеМного-GPU-узел (около 642 ГБ весов BF16)4x H200 с vLLMОдин GPUМного-GPU-узел
Опубликованный результат по безопасности66,7% pass@1, 60 задач60,4% полноты, внутренний набор из 32 CVEБенчмарки безопасности по данным Cisco60,0% на наборе Cantina

Источники: Cantina, Aikido, Cisco, карточки моделей на Hugging Face. © Marktechpost

Ключевые выводы

  • apex-flash-1 — модель безопасности с открытыми весами объёмом 321,3 млрд параметров под лицензией MIT.
  • Обучение с GRPO на 50 реальных случаях уязвимостей позволило создать 150 задач.
  • Она набрала 66,7% pass@1 против 71,7% у Claude Opus 5 High.
  • Запуск на 60 задач стоил около $2,38 против $74,68 для Opus.
  • Для BF16 требуется много-GPU-узел; существуют версии сообщества с 4-битным представлением.

Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией 150k+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости