Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Mistral AI пусна Shieldstral 1.0 3B: мултимодален класификатор за безопасност с отворени тегла и адаптация към политики, съпоставим с модели 7 пъти по-големи

Mistral AI пусна Shieldstral 1.0 3B — мултимодален класификатор за безопасност с отворени тегла и адаптивни политики, който разглежда модерацията на съдържание като един-единствен въпрос с отговор „да/не“, вместо като фиксирана таксономия от категории вредно съдържание. Повечето модели за защитни механизми вграждат списъка си с категории в теглата, така че пренасочването им към нов контекст на внедряване изисква повторно обучение — а едно и също съдържание може да е приемливо в инструмент за изследване на киберсигурността, но вредно в платформа за психично здраве. Shieldstral обръща този подход: операторите формулират политиката като въпрос на разбираем език по време на инференция, а моделът връща калибриран резултат за безопасност с едно-единствено предаване напред. Изграден върху Ministral-3-3B-Base-2512 с вграден Pixtral визуален енкодер и публикуван под лиценза Apache 2.0, той отчита среден F1 резултат от 84,9% при текстова безопасност — наравно с GPT-OSS-Safeguard-20B — и 83,8% при мултимодална безопасност, изпреварвайки всички базови модели, оценени от Mistral.

Може ли да бъде внедрен?

Да, включително локално. Shieldstral-1.0-3B се побира в 16 GB VRAM при BF16, работи на един графичен процесор и е лицензиран под Apache 2.0 за комерсиална и некомерсиална употреба. Вече са налични начини за обслужване: vLLM (≥0.26.0, препоръчително), llama.cpp чрез конвертиране към GGUF с квантизация Q8_0/Q5_K_M/Q4_K_M, SGLang и Transformers — като фината настройка се поддържа чрез Axolotl. Класификаторът генерира един токен, така че латентността и разходите са значително по-ниски от тези на защитни механизми, базирани на разсъждение, като GPT-OSS-Safeguard-20B.

  • За какъв размер компании: изискването за 16 GB памет го прави достъпен за екипи, разработващи AI продукти на етап seed, които не могат да оправдаят договор с външен доставчик на модерация, докато отвореният лиценз и възможността за самостоятелно хостване са подходящи за компании от средния и корпоративния сегмент, които се нуждаят от защитни механизми във VPC или локална инфраструктура поради изисквания за локализация на данните и одит. Доставчиците на многотенантни SaaS решения получават конкретно предимство — един контролен пункт може да налага различна политика за всеки клиент.
  • Индустрии: потребителски социални платформи и платформи за съдържание, генерирано от потребители, образователни технологии и среди за защита на деца, приложения за здравеопазване и психично здраве, автоматизация на поддръжката във финансовите технологии и застраховането, игри и гласов чат, онлайн пазари и преглед на реклами/креативи, както и внедрявания в публичния сектор с изисквания за суверенитет.
  • Приложения: модерация на потребителски подкани, модерация на отговори от модели, класификация на откази, преглед на изображения с надписи за реклами и мемета, подбор на обучителни данни и RAG корпуси, контролиране на изхода в агентни конвейери и налагане на политики за отделни клиенти. Тъй като изходът е непрекъснат резултат, а не етикет, екипите могат да настройват прага за всяка среда или да насочват граничните резултати към човешки преглед, вместо автоматично да блокират съдържанието.

Модерация като бинарен въпрос

Shieldstral свежда модерацията до един въпрос с отговор „да/не“. Фиксирано системно съобщение задава задачата; потребителското съобщение съдържа три полета: <Instruct> (контекстът на оценяването и строгостта), <Query> (политиката, формулирана като един въпрос с отговор „да/не“) и <Document> (подкана, отговор, двойка подкана–отговор или изображение с незадължителен текст).

При инференция моделът премахва вгражданията само към идентификаторите на токените yes и no, а след това ги нормализира чрез softmax до непрекъснат резултат с праг τ=0.5. Това обединява класификацията на подкани, модерацията на отговори, откриването на откази и откриването на токсичност в един проблем — и означава, че политиката се съдържа изцяло в подкана. Препоръката на Mistral е да се използва една политика на заявка; за широко заключение „безопасно/опасно“ изброете категориите в <Instruct> и задайте един общ <Query>.

Рецептата за данните

Твърдяното предимство идва от данните, а не от мащаба: приблизително 54,1 млн. примера — 45,2 млн. текста с отворен код, 4,4 млн. синтетични контрастивни текстови примера и 4,5 млн. мултимодални примера. Слой за унифициране, базиран на шаблони, преобразува всеки набор от данни в един и същ формат инструкция–заявка–документ чрез процесори за отделните набори, със случайно генерирани формулировки и калибрирана строгост (строга при adversarial jailbreak атаки, по-либерална при данни за качеството на отговорите).

По-интересната част е контрастивното генериране. Езиков модел пренаписва безопасен текст в небезопасен вариант, който нарушава целева категория, но умишлено не нарушава нейната съседна категория, като с едно извикване създава положителен и труден отрицателен пример върху идентично съдържание. Това учи модела коя политика е нарушена, вместо да го ограничава до грубо разделение на безопасно/небезопасно. Данните за изображения — които не могат да бъдат синтезирани по същия начин като текста — се допълват с универсални набори от изображения като отрицателни примери, мутация на заявките в рамките на визуална таксономия с 14 подкатегории и филтриране чрез reranker за зрение и език.

Обучението представлява фина настройка с LoRA, последвана от трипосочно сливане чрез SLERP: 0,6 публични+генерирани данни, 0,3 само публични данни, 0,1 Ministral-3B-Instruct.

Резултати

При текстова безопасност Shieldstral отчита среден F1 резултат от 84,9%, наравно с GPT-OSS-Safeguard-20B (84,9%) като най-малкия модел в сравнението, с по-добри резултати при ToxicChat (84,1), HarmBench (99,4) и Aegis v2 response (87,2). При мултимодална безопасност той отчита 83,8% общ резултат спрямо 77,6% за OmniGuard-7B, като води при VLGuard (97,7) и UnsafeBench (81,8); LlavaGuard-7B все още води в едноименния си бенчмарк с 81,4.

При бенчмарка за адаптивност — изграден върху умишлено различаваща се таксономия с 12 суперкиласа, 26 подкатегории и 52 крайни категории с 90 фиксирани заявки, при което нито една крайна категория не съответства едно към едно на категориите от обучението — Shieldstral постига F1 резултат от 91,3%, зад GPT-OSS-Safeguard-20B (94,1%) и Nemotron-3.5-Safety-4B (91,8%), но без да генерира следа от разсъждение. Откриването на откази достига общо 91,5% спрямо 93,7% за GPT-OSS-Safeguard-20B.

Къде е по-слаб: класификацията на многоезични подкани изостава при арабски и индонезийски език, както и при подкани от RTP-LX (70,3 спрямо 86,1 за Nemotron-3.5-Safety-4B). Mistral също отчита понижена надеждност при adversarial или замаскирани входове и много дълги документи. Контекстът, използван при обучението, е 32k токена на 12 езика.

Основни изводи

  • Мултимодален защитен механизъм с 3B параметъра и лиценз Apache 2.0; политиката е въпрос на разбираем език по време на инференция, без повторно обучение.
  • F1 резултатът от 84,9% при текстова безопасност е наравно с модел с 20B параметъра; мултимодалният F1 резултат от 83,8% е най-добрият сред оценените базови модели.
  • 54,1 млн. примера със sibling-контрастивни пренаписвания са реалният механизъм зад генерализацията на политиките.
  • Едно предаване напред, един изходен токен, непрекъснат резултат при τ=0.5 — достатъчно евтино за контрол в реално време.
  • Слаби места: езици с малко ресурси, замаскирани входове и дълги документи.

Разгледайте научната статия, модела в Hugging Face и техническите подробности. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, представяне на продукт, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини