Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Безопасность для кого? Отказ от правильного подмножества темы, а не от темы целиком

Безопасность для кого? Отказ от правильного подмножества темы, а не от всей темы
Команда Статья
Опубликовано 8 сентября 2026 года
Большинство работ по выравниванию безопасности рассматривает вред как свойство темы. Запрос небезопасен, потому что относится к общей категории, такой как оружие, мошенничество или самоповреждение, а защитные модели вроде LlamaGuard-3 кодируют именно такую таксономию на уровне тем. Затем бенчмарки вроде XSTest и OR-Bench исследуют порождаемую этим ошибку: модели отказываются от безопасных запросов, потому что те содержат слово, выглядящее опасным, а работы по калибровке отказов пытаются снизить этот показатель.

Реальные развёртывания редко соответствуют картине на уровне тем. Одна и та же базовая модель может быть адаптирована для универсального помощника, образовательного продукта, корпоративной системы или государственной службы, и в каждой среде требуются разные границы внутри одной и той же темы. Преподаватель граждановедения и государственный помощник могут использовать одну модель, но требовать противоположного поведения в вопросах политики: оба должны отвечать на фактические вопросы о выборах, но только одному может потребоваться отказать в просьбе написать текст для целевой политической манипуляции. Защитный механизм, работающий на уровне тем, не может выразить это различие. Например, LlamaGuard-3 рассматривает выборы только в контексте «фактически неверной информации об избирательных системах и процессах», что исключает убеждение и манипуляцию и одновременно исключает фактические запросы, на которые развёрнутая система должна продолжать отвечать.

В нашей последней статье, Безопасность для кого? Самодистилляция с учётом границ для контролируемых отказов LLM в целях безопасности, этот более узкий вопрос изучается напрямую. Вопрос заключается не в том, следует ли отказывать по всей теме целиком, а в том, какое подмножество этой темы несовместимо с политикой конкретного развёртывания и как обучать и оценивать модель с учётом этой границы.

Безопасность с узкой границей

Мы формализуем эту ситуацию как универсум темы — все политические запросы в наших экспериментах, — содержащий целевое вредоносное подмножество, от которого система должна отказываться. Предполагаемая политика заключается не в отказе от всей политики, а в отказе от вредоносного подмножества при продолжении ответов на безопасные запросы из дополнения. Идеальное поведение представляет собой резкий переход: отказ внутри подмножества и ответ в остальных случаях в рамках темы.

Narrow-boundary safety. The topic universe of political prompts contains a smaller subset that the deployment should refuse, while the benign complement should still be answered. The ideal refusal is a sharp step, but a trained model's refusal probability is smoother and can overshoot into benign territory near the boundary.

Ситуация с узкой границей. Развёрнутой системе может потребоваться отказывать только на политические запросы, направленные на манипуляцию или адресное убеждение, продолжая отвечать на другие политические запросы, а не отказываться от политики в целом. Отказ обученной модели более плавный, чем идеальное разделение, и может распространяться на безопасную область вблизи границы. Источник: рисунок 1 статьи.

Обученная модель никогда не усваивает этот резкий переход. Она учится вероятности отказа, лишь приближённо соответствующей целевой, а обучение с перекрёстной энропией, повышающее вероятность отказа внутри вредоносного подмножества, также может расширить отказ в сторону безопасного дополнения. Поэтому реальная проблема заключается не только в повышении доли отказов на вредоносные запросы, но и в формировании поведения непосредственно возле границы. Мы операционализируем эту границу как пары запросов, имеющих общий тематический якорь и различающихся только намерением: один должен получить отказ, а на другой следует ответить.

В качестве тестовой области мы используем политическое убеждение, поскольку манипулятивное убеждение может причинять реальный вред, тогда как фактическая политическая информация остаётся легитимной. Это как раз тот случай, когда отказ на уровне темы оказывается слишком грубым инструментом.

Где ломается настройка безопасности на основе самогенерации

Естественный способ создать здесь обучающие данные — самогенерация: взять целевую модель, направить её к отказу для каждого вредоносного запроса и сохранить трассировки, которые защитная модель проверяет как подлинные отказы. Именно на этом основаны такие методы, как ThinkSafe, и мы принимаем его за эталон, применяем к политическим запросам и измеряем по компонентам. Рассмотрение проблемы как границы, а не темы выявляет три слабых места стандартного конвейера.

Первое — пробел в охвате. Одна попытка управления не всегда приводит к принятому отказу, и такие запросы молча исключаются из обучающей выборки. В нашей проверенной совокупности однократная генерация исключает 19,88% запросов — 8 009 из них, — и эти неудачные запросы вполне могут быть самыми сложными примерами. Вместо отбрасывания мы исправляем эту проблему: стратегия повторных попыток с наращиванием, при которой один и тот же запрос проходит повторную выборку с постепенно усиливающимся управлением, снижает остаточное число неудач до 0,20%, или 79 запросов. Исправление охвата оставляет 40 293 вредоносных обучающих запроса, тогда как наивный конвейер выбросил бы тысячи.

Второе — нежелательные реакции. Настройка безопасности склонна порождать ложные отказы на безопасные запросы, которые внешне выглядят опасными. Чтобы компенсировать это, мы добавляем безопасные данные из того же распределения, включая 11 955 проверенных безопасных запросов, опасных на вид, 18 семантических типов, чтобы во время обучения модель видела безопасные запросы с опасными формулировками, а не только на этапе оценки.

Третье — обычные разделения на вредоносные и безопасные данные вообще не измеряют форму границы. Модель может улучшить показатель отказов на вредоносные запросы, просто расширив отказы на соседние допустимые запросы, и метрика на уровне темы назовёт это улучшением. Отложенные пары «вредоносный — безопасный» — по 1 539 с каждой стороны — позволяют напрямую измерить обе стороны границы.

Компромисс и скрытая в нём ловушка

Обучение на данных об отказах в политической области работает в очевидном смысле. На модели Qwen3-8B модель с расширенным охватом повышает долю отказов на политические запросы из того же распределения с 9,47% до 84,75%, и это также переносится: средняя доля небезопасных ответов по трём более широким бенчмаркам вредоносности — HarmBench, StrongREJECT и WildJailbreak, оценённая с помощью LlamaGuard-3, — падает с 26,26% до 0,14% в наиболее сильной конфигурации.

Если приводить только эти числа, результат выглядит однозначной победой. Но это не так. На том же этапе переотказы на XSTest возрастают с 2,00% до 74,00%. Конфигурация с самой низкой долей вредоносных ответов одновременно отказывается почти от трёх четвертей явно безопасных запросов. Это машина для грубых отказов, а не более безопасная модель, и увидеть это можно только при измерении безопасной стороны. Главный вывод таков: состав данных определяет положение контрольной точки в пространстве безопасности и переотказов, поэтому обе оси необходимо представлять вместе.

Два компонента наших данных снижают показатель переотказов, не отказываясь от достигнутого прироста безопасности. Замена внешне заимствованных ответов о соблюдении инструкций на проверенные ответы, сгенерированные самой целевой моделью, снижает переотказы на XSTest с 15,20% до 5,20% при однократной генерации, при умеренной цене в показателе вредоносности. А пары на границе «вредоносный — безопасный» выполняют наиболее точную работу.

Pairwise boundary data reduces over-refusal at the boundary. Adding the benign side of the boundary pairs drops comply-side over-refusal from roughly 0.49 down to 0.03 to 0.08, while harmful-side refusal falls only slightly, from about 0.92 to 0.88.

Слева: переотказы на стороне отложенной границы, где требуется ответ, чем ниже, тем лучше. В запусках с безопасными данными границы (PB) показатель снижается до 0,03–0,08; без них он приближается к 0,49. Справа: отказы на вредоносной стороне, чем выше, тем лучше, — этот показатель снижается лишь незначительно. Источник: рисунок 6 статьи.

В частности, добавление безопасных данных границы снижает переотказы на стороне отложенных пар, где требуется ответ, с 32,94% до 4,16%. Доля отказов на вредоносной стороне снижается лишь с 91,88% до 87,72%. Иными словами, большинство ложных отказов вблизи границы исчезает, тогда как почти все настоящие отказы сохраняются. Реальная цена в полноте есть, и она мала и измерима — в этом и заключается смысл: намеренно управлять этим компромиссом можно только при измерении обеих сторон.

Что это меняет

Практический вывод заключается в том, что настройку безопасности не следует оценивать только по доле отказов на вредоносные запросы. Модель, которая чаще отказывает, не становится автоматически безопаснее, а на узкой границе то же действие, которое повышает долю отказов на вредоносные запросы, может незаметно сделать модель бесполезной для легитимных запросов непосредственно рядом с ними. Именно состав обучающих данных, исправление охвата, компенсация внутри распределения и пары на границе определяют этот компромисс, и для осмысленности показателей необходимо оценивать обе стороны предполагаемой границы.

Эта работа является частью исследования Multiverse Computing, направленного на то, чтобы сделать поведение моделей контролируемым и измеримым на уровне, который важен для реальных развёртываний, а не на уровне широких тематических категорий. Тот же конвейер генерации можно применять к другим темам за пределами политики, а в статье приводится полный набор абляционных экспериментов по составу данных, лежащих в основе представленных выше результатов.

Хотите ознакомиться с полными техническими подробностями, включая стратегии исправления охвата, маршрутизацию функции потерь, разделяющую перекрёстную энтропию для вредоносных данных и сохранение безопасных данных с помощью прямой KL-дистилляции, а также полную оценку отложенной границы? Прочитайте полную статью или свяжитесь с нашей командой, чтобы обсудить безопасность ваших собственных моделей с учётом особенностей развёртывания.

Модели, упомянутые в этой статье 2

Статьи, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 2

Статьи, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости