Может ли открытая модель заниматься исследованиями в области безопасности? apex-flash-1 от Cantina решает 40 из 60 отложенных задач по поиску уязвимостей
Cantina Security совместно с Yeta Labs выпустила apex-flash-1 — модель с открытыми весами, специально обученную для исследования уязвимостей. Это дообученная с подкреплением версия GLM-5.3-Flash от Z.ai, выпущенная на Hugging Face под лицензией MIT.
Можно ли её развернуть? Да, веса MIT поддерживают запуск через vLLM, SGLang или Transformers, однако для BF16 требуется примерно 640 ГБ памяти GPU.
Что создала Cantina
Согласно метаданным safetensors на Hugging Face, apex-flash-1 имеет в общей сложности 321,3 млрд параметров. Базовая GLM-5.3-Flash представляет собой модель со смесью экспертов с 18 млрд активных параметров.
Cantina обучала её с помощью GRPO, используя LoRA ранга 256, а также выборочное обучение всех параметров. Данные охватывают 150 задач, созданных на основе 50 реальных случаев уязвимостей.
Каждый случай представлен в 3 вариантах: управляемый whitebox, сфокусированный whitebox и сфокусированный blackbox.
Уязвимости авторизации, идентификации и определения области действия составляют 72% случаев. На ошибки учёта и численной точности приходится ещё 18%. Остальные случаи связаны с проверкой времени, бизнес-правилами и SSRF.
Согласно карточке модели на HF, запуски RL выполнялись внутри агентского окружения Codex на программном обеспечении и протокольных окружениях, близких к производственным.
Результаты бенчмарка
Cantina оценила 60 задач из 20 отложенных случаев уязвимостей. Каждая модель прошла набор один раз, а стоимость оценивалась на основе тарифов провайдеров.
- apex-flash-1: решено 40 из 60 (66,7% pass@1), около $2,38
- GLM-5.3-Flash (базовая): решено 36 из 60 (60,0%), около $4,56
- Claude Opus 5 High: решено 43 из 60 (71,7%), около $74,68
Opus решил на 3 задачи больше, но его запуск стоил примерно в 31 раз дороже. Это составляет примерно $0,06 за решённую задачу для apex-flash-1 против $1,74 для Opus. Эти цифры предоставлены компанией и получены на внутреннем бенчмарке.
Рабочая модель, а не оркестратор
Cantina позиционирует apex-flash-1 как рабочую модель, которой управляет более крупная модель. В карточке перечислены чтение кода, использование инструментов, разработка эксплойтов и проверка в качестве целевых навыков.
Экспериментальный вариант apex-flash-1-abliterated поставляется с изменённым поведением при отказе. Отдельно он не оценивался.
Обоснование Cantina заключается в том, что защитникам нужны мощные модели, которые можно запускать и контролировать локально.
Интерактивное объяснение
Сравнение
| Характеристика | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Разработчик | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| Базовая модель | GLM-5.3-Flash | GLM-5.3 (сокращённая) | Llama 3.1 8B | Собственное предварительное обучение |
| Размер | 321,3 млрд всего, BF16 | 328 ГБ, INT4 (W4A16) | 8 млрд | 320 млрд всего, 18 млрд активных |
| Лицензия | MIT | Наследует лицензию GLM-5.3 | Специальная (см. NOTICE.md) | MIT |
| Метод обеспечения безопасности | RL с GRPO на 50 реальных случаях уязвимостей | Отбор экспертов (REAP) + квантование | Дообучение на инструкциях + RLHF на вопросах и ответах по безопасности | Базовая модель общего назначения |
| Основное применение | Агентный рабочий инструмент для исследования уязвимостей | Автономное пентестирование в изолированной среде | Триаж в SOC и защита от угроз | Общее программирование и агенты |
| Оборудование | Много-GPU-узел (около 642 ГБ весов BF16) | 4x H200 с vLLM | Один GPU | Много-GPU-узел |
| Опубликованный результат по безопасности | 66,7% pass@1, 60 задач | 60,4% полноты, внутренний набор из 32 CVE | Бенчмарки безопасности по данным Cisco | 60,0% на наборе Cantina |
Источники: Cantina, Aikido, Cisco, карточки моделей на Hugging Face. © Marktechpost
Ключевые выводы
- apex-flash-1 — модель безопасности с открытыми весами объёмом 321,3 млрд параметров под лицензией MIT.
- Обучение с GRPO на 50 реальных случаях уязвимостей позволило создать 150 задач.
- Она набрала 66,7% pass@1 против 71,7% у Claude Opus 5 High.
- Запуск на 60 задач стоил около $2,38 против $74,68 для Opus.
- Для BF16 требуется много-GPU-узел; существуют версии сообщества с 4-битным представлением.
Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией 150k+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.