Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Mistral AI выпустила Shieldstral 1.0 3B: мультимодальный классификатор безопасности с открытыми весами и адаптацией к политикам, сопоставимый с моделями в 7 раз большего размера

Mistral AI выпустила Shieldstral 1.0 3B — мультимодальный классификатор безопасности с открытыми весами и адаптацией к политикам, который рассматривает модерацию контента как единый вопрос «да/нет», а не как фиксированную таксономию категорий вреда. Большинство моделей для защитных механизмов встраивают список категорий непосредственно в веса, поэтому для адаптации модели к новому контексту развертывания требуется повторное обучение — при этом один и тот же контент может быть приемлемым для инструмента исследования кибербезопасности и вредным для платформы психического здоровья. Shieldstral меняет этот подход: операторы формулируют политику в виде вопроса на естественном языке во время инференса, а модель возвращает калиброванный показатель безопасности за один прямой проход. Построенная на базе Ministral-3B-Base-2512 с нативным визуальным энкодером Pixtral и выпущенная по лицензии Apache 2.0, модель показывает средний F1 84,9% в области безопасности текста — на уровне GPT-OSS-Safeguard-20B — и 83,8% в мультимодальной безопасности, опережая все базовые модели, оцененные Mistral.

Можно ли ее развернуть?

Да, в том числе локально. Shieldstral-1.0-3B помещается в 16 ГБ видеопамяти в формате BF16, работает на одном GPU и лицензируется по Apache 2.0 для коммерческого и некоммерческого использования. Варианты запуска уже доступны: vLLM (≥0.26.0, рекомендуется), llama.cpp через конвертацию в GGUF с квантованием Q8_0/Q5_K_M/Q4_K_M, SGLang и Transformers — при этом тонкая настройка поддерживается через Axolotl. Классификатор выдает один токен, поэтому задержка и стоимость значительно ниже, чем у защитных механизмов на основе рассуждений, таких как GPT-OSS-Safeguard-20B.

  • Для компаний какого уровня: объем памяти в 16 ГБ делает модель доступной для команд, создающих продукты на базе ИИ на посевной стадии и не способных оправдать расходы на контракт с поставщиком услуг модерации, а открытая лицензия и возможность самостоятельного размещения подходят компаниям среднего и крупного бизнеса, которым нужны защитные механизмы внутри VPC или в локальной инфраструктуре по причинам, связанным с локализацией данных и аудитом. Поставщики SaaS с несколькими арендаторами получают особое преимущество: одна контрольная точка может применять отдельную политику к каждому клиенту.
  • Отрасли: потребительские социальные платформы и платформы пользовательского контента, образовательные технологии и интерфейсы для безопасности детей, приложения для здравоохранения и психического здоровья, автоматизация поддержки в финтехе и страховании, игры и голосовые чаты, маркетплейсы и проверка рекламы/креативов, а также государственные развертывания с требованиями к суверенитету данных.
  • Применение: модерация пользовательских запросов, модерация ответов моделей, классификация отказов, проверка изображений с подписями для рекламы и мемов, отбор обучающих данных и корпусов RAG, фильтрация результатов в агентных конвейерах и применение политик для отдельных арендаторов. Поскольку результатом является непрерывный показатель, а не метка, команды могут настраивать порог для каждого интерфейса или направлять пограничные значения на проверку человеком вместо жесткой блокировки.

Модерация как бинарный вопрос

Shieldstral сводит модерацию к одному вопросу «да/нет». Фиксированное системное сообщение задает задачу; пользовательское сообщение содержит три поля: <Instruct> (контекст оценки и строгость), <Query> (политика, сформулированная как единый вопрос «да/нет») и <Document> (запрос, ответ, пара запрос–ответ или изображение с необязательным текстом).

Во время инференса модель выполняет развертывание только в направлении идентификаторов токенов yes и no, а затем нормализует их с помощью softmax в непрерывный показатель, используя порог τ=0,5. Это объединяет классификацию запросов, модерацию ответов, обнаружение отказов и обнаружение токсичности в одну задачу — и означает, что политика целиком задается в промпте. Mistral рекомендует использовать одну политику за вызов; для общего вердикта «безопасно/небезопасно» следует перечислить категории в <Instruct> и задать один широкий <Query>.

Рецепт подготовки данных

Заявленное преимущество обеспечивается данными, а не масштабом: около 54,1 млн образцов — 45,2 млн текстовых образцов с открытым исходным кодом, 4,4 млн синтетических контрастивных текстовых образцов и 4,5 млн мультимодальных образцов. Слой унификации на основе шаблонов преобразует каждый набор данных в единый формат «инструкция–запрос–документ» с помощью процессоров для отдельных наборов данных, используя случайные формулировки и калиброванную строгость (строгую для состязательных джейлбрейков, мягкую для данных о качестве ответов).

Наиболее интересная часть — контрастивная генерация. LLM переписывает безопасный текст в небезопасный вариант, нарушающий целевую категорию, но намеренно не нарушающий родственную категорию, создавая положительный и сложный отрицательный пример на основе идентичного контента за один вызов. Это обучает модель понимать, какая именно политика нарушена, а не разделять данные на грубые категории «безопасно/небезопасно». Данные изображений — которые невозможно синтезировать так же, как текст, — дополняются универсальными наборами изображений в качестве отрицательных примеров, мутацией запросов по визуальной таксономии из 14 подкатегорий и фильтрацией с помощью переранжировщика «зрение–язык».

Обучение состоит из тонкой настройки LoRA с последующим трехсторонним объединением SLERP: 0,6 — открытые и сгенерированные данные, 0,3 — только открытые данные, 0,1 — Ministral-3B-Instruct.

Результаты

В области безопасности текста Shieldstral показывает средний F1 84,9%, сравниваясь с GPT-OSS-Safeguard-20B (84,9%) как самая компактная модель в сравнении; при этом она превосходит другие модели на ToxicChat (84,1), HarmBench (99,4) и Aegis v2 response (87,2). В мультимодальной безопасности результат составляет 83,8% в целом против 77,6% у OmniGuard-7B; модель лидирует на VLGuard (97,7) и UnsafeBench (81,8), тогда как LlavaGuard-7B по-прежнему лидирует на одноименном бенчмарке с результатом 81,4.

В бенчмарке адаптивности — построенном на намеренно отличающейся таксономии из 12 суперкатегорий, 26 подкатегорий и 52 конечных категорий с 90 фиксированными запросами, где ни одна конечная категория не соответствует обучающим данным один к одному, — Shieldstral получает F1 91,3%, уступая GPT-OSS-Safeguard-20B (94,1%) и Nemotron-3.5-Safety-4B (91,8%), но не генерируя цепочку рассуждений. Обнаружение отказов достигает 91,5% в целом против 93,7% у GPT-OSS-Safeguard-20B.

В чем модель слабее: классификация многоязычных запросов отстает для арабского и индонезийского языков, а также для запросов RTP-LX (70,3 против 86,1 у Nemotron-3.5-Safety-4B). Mistral также отмечает снижение надежности на состязательных или обфусцированных входных данных и очень длинных документах. Обученный контекст составляет 32 тыс. токенов для 12 языков.

Основные выводы

  • Мультимодальный защитный механизм с 3B параметров и лицензией Apache 2.0; политика задается вопросом на естественном языке во время инференса, повторное обучение не требуется.
  • F1 84,9% для текста соответствует показателю модели с 20B параметров; мультимодальный F1 83,8% — лучший результат среди оцененных базовых моделей.
  • 54,1 млн образцов с контрастивными перефразированиями родственных категорий — это фактический механизм, обеспечивающий обобщение политик.
  • Один прямой проход, один выходной токен, непрерывный показатель при τ=0,5 — достаточно дешево для фильтрации в реальном времени.
  • Слабые места: языки с недостатком ресурсов, обфусцированные входные данные и длинные документы.

Ознакомьтесь с научной статьей, моделью на Hugging Face и техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости