Може ли отворен модел да извършва изследвания в областта на сигурността? apex-flash-1 на Cantina решава 40 от 60 задачи за откриване на уязвимости, неизползвани при обучението
Cantina Security, съвместно с Yeta Labs, представи apex-flash-1 — модел с отворени тегла, обучен специално за изследване на уязвимости. Той представлява фино дообучена чрез обучение с подсилване версия на GLM-5.3-Flash на Z.ai, публикувана в Hugging Face под лиценза MIT.
Може ли да бъде внедрен? Да, теглата по лиценз MIT могат да се изпълняват чрез vLLM, SGLang или Transformers, но BF16 изисква приблизително 640 GB GPU памет.
Какво създаде Cantina
apex-flash-1 разполага с общо 321,3 млрд. параметъра според метаданните на safetensors в Hugging Face. Базовият GLM-5.3-Flash е модел тип Mixture-of-Experts с 18 млрд. активни параметъра.
Cantina го обучи с помощта на GRPO, използвайки LoRA с ранг 256, комбинирана със селективно обучение на всички параметри. Данните обхващат 150 задачи, изградени върху 50 реални случая на уязвимости.
Всеки случай се появява в 3 варианта: насочен whitebox, фокусиран whitebox и фокусиран blackbox.
Пропуските в оторизацията, идентичността и обхвата съставляват 72% от случаите. Бъговете в счетоводството и числената точност добавят 18%. Останалите случаи обхващат проверка на времето, бизнес правила и SSRF.
Според картата на модела в HF, RL развръщанията са изпълнявани в рамките на агентския хънес Codex върху среди за софтуер и протоколи, подобни на производствени.
Резултати от бенчмарка
Cantina оцени 60 задачи от 20 задържани случая на уязвимости. Всеки модел изпълни набора по веднъж, като разходите бяха изчислени въз основа на цените на доставчиците.
- apex-flash-1: решени 40/60 (66,7% pass@1), приблизително $2,38
- GLM-5.3-Flash (базов): решени 36/60 (60,0%), приблизително $4,56
- Claude Opus 5 High: решени 43/60 (71,7%), приблизително $74,68
Opus реши 3 задачи повече, но струва приблизително 31 пъти повече за едно изпълнение. Това е приблизително $0,06 на решена задача за apex-flash-1 спрямо $1,74 за Opus. Това са данни, докладвани от компанията, от вътрешен бенчмарк.
Работен модел, а не оркестратор
Cantina позиционира apex-flash-1 като работен модел, оркестриран от по-голям модел. В картата са посочени четенето на код, използването на инструменти, разработването на експлойти и проверката като целеви умения.
Експерименталният вариант apex-flash-1-abliterated се предлага с модифицирано поведение при отказ. Той не е оценяван отделно.
Мотивът на Cantina е, че защитниците се нуждаят от способни модели, които могат да изпълняват и контролират локално.
Интерактивно обяснение
Как се сравнява
| Характеристика | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Разработчик | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| Базов модел | GLM-5.3-Flash | GLM-5.3 (със съкратен брой параметри) | Llama 3.1 8B | Собствено предварително обучение |
| Размер | 321,3 млрд. общо, BF16 | 328 GB, INT4 (W4A16) | 8 млрд. | 320 млрд. общо, 18 млрд. активни |
| Лиценз | MIT | Наследява лиценза на GLM-5.3 | Персонализиран (вижте NOTICE.md) | MIT |
| Метод за сигурност | GRPO RL върху 50 реални случая на уязвимости | Експертно прецизиране (REAP) + квантизация | Дообучаване с инструкции + RLHF върху въпроси и отговори за сигурността | Базов модел с общо предназначение |
| Основна употреба | Агентски работник за изследване на уязвимости | Автономно тестване за проникване в изолирани среди | Триаж в SOC и защита от заплахи | Общо програмиране и агенти |
| Хардуер | Много-GPU възел (приблизително 642 GB BF16 тегла) | 4x H200 с vLLM | Един GPU | Много-GPU възел |
| Публикуван резултат за сигурността | 66,7% pass@1, 60 задачи | 60,4% recall, вътрешен набор от 32 CVE | Бенчмаркове за сигурност, докладвани от Cisco | 60,0% в набора на Cantina |
Източници: Cantina, Aikido, Cisco, картите на моделите в Hugging Face. © Marktechpost
Основни изводи
- apex-flash-1 е модел за сигурност с 321,3 млрд. параметъра и отворени тегла под лиценз MIT.
- Обучението с GRPO върху 50 реални случая на уязвимости е създало 150 задачи.
- Той постигна 66,7% pass@1 спрямо 71,7% за Claude Opus 5 High.
- Изпълнението на 60-те задачи струва приблизително $2,38 спрямо $74,68 за Opus.
- BF16 изисква много-GPU възел; налични са общностни 4-битови портове.
Разгледайте техническите подробности. Цялата заслуга е за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова премиера ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.