Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← До новин

Чи може відкрита модель проводити дослідження безпеки? apex-flash-1 від Cantina розв’язує 40 із 60 відкладених завдань із пошуку вразливостей

Cantina Security спільно з Yeta Labs випустила apex-flash-1 — модель із відкритими вагами, спеціально навчену для дослідження вразливостей. Це доопрацьована за допомогою підсилювального навчання версія GLM-5.3-Flash від Z.ai, випущена на Hugging Face за ліцензією MIT.

Чи придатна вона до розгортання? Так, ваги MIT можна обслуговувати за допомогою vLLM, SGLang або Transformers, але для BF16 потрібно приблизно 640 ГБ пам’яті GPU.

Що створила Cantina

apex-flash-1 має 321,3 млрд загальних параметрів, згідно з метаданими safetensors на Hugging Face. Базова модель GLM-5.3-Flash є моделлю суміші експертів із 18 млрд активних параметрів.

Cantina навчала її за допомогою GRPO, використовуючи LoRA рангу 256 разом із вибірковим навчанням усіх параметрів. Дані охоплюють 150 завдань, створених на основі 50 реальних випадків вразливостей.

Кожен випадок представлений у 3 варіантах: керований whitebox, сфокусований whitebox і сфокусований blackbox.

Вразливості авторизації, ідентифікації та визначення області дії становлять 72% випадків. На помилки обліку та числової точності припадає ще 18%. Решту охоплюють перевірка часу, бізнес-правила та SSRF.

Згідно з карткою моделі на HF, запуски RL виконувалися всередині агентського середовища Codex на програмному забезпеченні та протокольних середовищах, подібних до виробничих.

Результати бенчмарку

Cantina оцінила 60 завдань із 20 відкладених випадків вразливостей. Кожна модель виконала набір один раз, а витрати оцінювалися на основі цін постачальників.

  • apex-flash-1: виконано 40 із 60 (66,7% pass@1), приблизно $2,38
  • GLM-5.3-Flash (базова): виконано 36 із 60 (60,0%), приблизно $4,56
  • Claude Opus 5 High: виконано 43 із 60 (71,7%), приблизно $74,68

Opus виконав на 3 завдання більше, але коштував приблизно у 31 раз більше за один запуск. Це становить приблизно $0,06 за виконане завдання для apex-flash-1 проти $1,74 для Opus. Це показники, надані компанією, отримані на внутрішньому бенчмарку.

Робоча модель, а не оркестратор

Cantina позиціонує apex-flash-1 як робочу модель, якою керує більша модель. У картці зазначено читання коду, використання інструментів, розробку експлойтів і перевірку як цільові навички.

Експериментальний варіант apex-flash-1-abliterated постачається зі зміненою поведінкою щодо відмов. Окремо його не оцінювали.

Обґрунтування Cantina полягає в тому, що захисникам потрібні потужні моделі, які вони можуть запускати й контролювати локально.

Інтерактивне пояснення

Як вона порівнюється

Характеристикаapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
РозробникCantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
Базова модельGLM-5.3-FlashGLM-5.3 (обрізана)Llama 3.1 8BВласне попереднє навчання
Розмір321,3 млрд загалом, BF16328 ГБ, INT4 (W4A16)8 млрд320 млрд загалом, 18 млрд активних
ЛіцензіяMITУспадковує ліцензію GLM-5.3Спеціальна (див. NOTICE.md)MIT
Метод забезпечення безпекиRL із GRPO на 50 реальних випадках вразливостейОбрізання експертів (REAP) + квантуванняДоопрацювання за інструкціями + RLHF на запитаннях і відповідях із безпекиБазова модель загального призначення
Основне використанняАгентський робочий інструмент для дослідження вразливостейАвтономне тестування на проникнення в ізольованих середовищахТріаж SOC і захист від загрозКодування та агенти загального призначення
ОбладнанняВузол із кількома GPU (приблизно 642 ГБ ваг BF16)4 H200 із vLLMОдна GPUВузол із кількома GPU
Опублікований результат у сфері безпеки66,7% pass@1, 60 завдань60,4% повноти, внутрішній набір із 32 CVEБенчмарки безпеки, про які повідомила Cisco60,0% на наборі Cantina

Джерела: Cantina, Aikido, Cisco, картки моделей Hugging Face. © Marktechpost

Основні висновки

  • apex-flash-1 — це модель безпеки з 321,3 млрд параметрів і відкритими вагами за ліцензією MIT.
  • Навчання GRPO на 50 реальних випадках вразливостей дало 150 завдань.
  • Вона отримала 66,7% pass@1 проти 71,7% у Claude Opus 5 High.
  • Запуск на 60 завданнях коштував приблизно $2,38 проти $74,68 для Opus.
  • Для BF16 потрібен вузол із кількома GPU; існують 4-бітні порти від спільноти.

Ознайомтеся з технічними деталями. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини