Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← Към новините

Може ли отворен модел да извършва изследвания в областта на сигурността? apex-flash-1 на Cantina решава 40 от 60 задачи за откриване на уязвимости, неизползвани при обучението

Cantina Security, съвместно с Yeta Labs, представи apex-flash-1 — модел с отворени тегла, обучен специално за изследване на уязвимости. Той представлява фино дообучена чрез обучение с подсилване версия на GLM-5.3-Flash на Z.ai, публикувана в Hugging Face под лиценза MIT.

Може ли да бъде внедрен? Да, теглата по лиценз MIT могат да се изпълняват чрез vLLM, SGLang или Transformers, но BF16 изисква приблизително 640 GB GPU памет.

Какво създаде Cantina

apex-flash-1 разполага с общо 321,3 млрд. параметъра според метаданните на safetensors в Hugging Face. Базовият GLM-5.3-Flash е модел тип Mixture-of-Experts с 18 млрд. активни параметъра.

Cantina го обучи с помощта на GRPO, използвайки LoRA с ранг 256, комбинирана със селективно обучение на всички параметри. Данните обхващат 150 задачи, изградени върху 50 реални случая на уязвимости.

Всеки случай се появява в 3 варианта: насочен whitebox, фокусиран whitebox и фокусиран blackbox.

Пропуските в оторизацията, идентичността и обхвата съставляват 72% от случаите. Бъговете в счетоводството и числената точност добавят 18%. Останалите случаи обхващат проверка на времето, бизнес правила и SSRF.

Според картата на модела в HF, RL развръщанията са изпълнявани в рамките на агентския хънес Codex върху среди за софтуер и протоколи, подобни на производствени.

Резултати от бенчмарка

Cantina оцени 60 задачи от 20 задържани случая на уязвимости. Всеки модел изпълни набора по веднъж, като разходите бяха изчислени въз основа на цените на доставчиците.

  • apex-flash-1: решени 40/60 (66,7% pass@1), приблизително $2,38
  • GLM-5.3-Flash (базов): решени 36/60 (60,0%), приблизително $4,56
  • Claude Opus 5 High: решени 43/60 (71,7%), приблизително $74,68

Opus реши 3 задачи повече, но струва приблизително 31 пъти повече за едно изпълнение. Това е приблизително $0,06 на решена задача за apex-flash-1 спрямо $1,74 за Opus. Това са данни, докладвани от компанията, от вътрешен бенчмарк.

Работен модел, а не оркестратор

Cantina позиционира apex-flash-1 като работен модел, оркестриран от по-голям модел. В картата са посочени четенето на код, използването на инструменти, разработването на експлойти и проверката като целеви умения.

Експерименталният вариант apex-flash-1-abliterated се предлага с модифицирано поведение при отказ. Той не е оценяван отделно.

Мотивът на Cantina е, че защитниците се нуждаят от способни модели, които могат да изпълняват и контролират локално.

Интерактивно обяснение

Как се сравнява

Характеристикаapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
РазработчикCantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
Базов моделGLM-5.3-FlashGLM-5.3 (със съкратен брой параметри)Llama 3.1 8BСобствено предварително обучение
Размер321,3 млрд. общо, BF16328 GB, INT4 (W4A16)8 млрд.320 млрд. общо, 18 млрд. активни
ЛицензMITНаследява лиценза на GLM-5.3Персонализиран (вижте NOTICE.md)MIT
Метод за сигурностGRPO RL върху 50 реални случая на уязвимостиЕкспертно прецизиране (REAP) + квантизацияДообучаване с инструкции + RLHF върху въпроси и отговори за сигурносттаБазов модел с общо предназначение
Основна употребаАгентски работник за изследване на уязвимостиАвтономно тестване за проникване в изолирани средиТриаж в SOC и защита от заплахиОбщо програмиране и агенти
ХардуерМного-GPU възел (приблизително 642 GB BF16 тегла)4x H200 с vLLMЕдин GPUМного-GPU възел
Публикуван резултат за сигурността66,7% pass@1, 60 задачи60,4% recall, вътрешен набор от 32 CVEБенчмаркове за сигурност, докладвани от Cisco60,0% в набора на Cantina

Източници: Cantina, Aikido, Cisco, картите на моделите в Hugging Face. © Marktechpost

Основни изводи

  • apex-flash-1 е модел за сигурност с 321,3 млрд. параметъра и отворени тегла под лиценз MIT.
  • Обучението с GRPO върху 50 реални случая на уязвимости е създало 150 задачи.
  • Той постигна 66,7% pass@1 спрямо 71,7% за Claude Opus 5 High.
  • Изпълнението на 60-те задачи струва приблизително $2,38 спрямо $74,68 за Opus.
  • BF16 изисква много-GPU възел; налични са общностни 4-битови портове.

Разгледайте техническите подробности. Цялата заслуга е за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова премиера ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини