Безпека для кого? Відмова від правильної підмножини теми, а не від теми загалом
Реальні розгортання рідко відповідають картині на рівні тем. Ту саму базову модель можна адаптувати для універсального асистента, освітнього продукту, корпоративної системи чи державного сервісу, і кожне середовище потребує різних меж у межах тієї самої теми. Репетитор із громадянської освіти та державний асистент можуть використовувати одну модель, але потребувати протилежної поведінки щодо політики: обидва мають відповідати на фактологічні запитання про вибори, але лише одному може знадобитися відмова на запит написати цілеспрямовану політичну маніпуляцію. Захисник на рівні тем не здатен виразити цей поділ. Наприклад, LlamaGuard-3 охоплює вибори лише як «фактично неправильну інформацію про виборчі системи та процеси», що виключає переконування й маніпуляцію та водночас виключає фактологічні запити, на які розгортання має й надалі відповідати.
Наша остання стаття, Безпека для кого? Самодистиляція з урахуванням меж для контрольованої відмови LLM з міркувань безпеки, безпосередньо досліджує цю вужчу проблему. Питання полягає не в тому, чи слід відмовляти від цілої теми, а в тому, яка її частина несумісна з політикою конкретного розгортання і як навчати та вимірювати модель з огляду на цю межу.
Безпека з вузькими межами
Ми формалізуємо це середовище як універсум тем, тобто всі політичні запити в наших експериментах, який містить підмножину цільових шкідливих запитів, від яких розгортання має відмовлятися. Передбачена політика полягає не у відмові від усієї політики, а у відмові від шкідливої підмножини з одночасним продовженням відповідей на нешкідливу доповнювальну частину. Ідеальна поведінка — це різкий ступінчастий перехід: відмова всередині підмножини, відповідь всюди поза нею в межах теми.
Середовище вузьких меж. Розгортанню може знадобитися відмовляти лише на політичні запити, що просять про маніпуляцію чи цілеспрямоване переконування, водночас відповідаючи на інші політичні запити, а не відмовляючи від політики загалом. Відмова навченої моделі є плавнішою за ідеальний поділ і може поширюватися на нешкідливу територію поблизу межі. Джерело: рисунок 1 статті.
Навчена модель ніколи не засвоює такий різкий ступінчастий перехід. Вона вивчає ймовірність відмови, яка лише наближає цільову, а навчання з перехресною ентропією, що підвищує відмови для шкідливої підмножини, також може поширити відмови на нешкідливу доповнювальну частину. Отже, реальна проблема полягає не лише в підвищенні кількості відмов на шкідливі запити, а й у формуванні поведінки безпосередньо біля межі. Ми операціоналізуємо цю межу як пари запитів, що мають спільний тематичний якір і відрізняються лише наміром: від одного слід відмовитися, а на інший слід відповісти.
Ми використовуємо політичне переконування як тестове середовище, оскільки маніпулятивне переконування може завдати реальної шкоди, тоді як фактологічна політична інформація залишається легітимною — саме той випадок, коли відмова на рівні тем є надто грубим інструментом.
Де ламається налаштування безпеки на основі самогенерації
Природний спосіб створити тут навчальні дані — самогенерація: взяти цільову модель, спрямувати її до відмови на кожен шкідливий запит і залишити лише ті трасування, які захисна модель перевіряє як справжні відмови. Саме такий підхід лежить в основі методів на кшталт ThinkSafe, і ми приймаємо його як еталонний, застосовуючи до політичних запитів та вимірюючи кожен компонент окремо. Формулювання проблеми як межі, а не теми, виявляє три слабкі місця стандартного конвеєра.
Перше — прогалина в охопленні. Одна спроба спрямування не завжди породжує прийняту відмову, і такі запити мовчки вилучаються з навчального набору. У нашому перевіреному пулі одноразова генерація відкидає 19,88% запитів — 8 009 із них, — і ці невдалі запити цілком можуть бути найскладнішими прикладами. Ми виправляємо це замість того, щоб відкидати дані: стратегія ескалаційних повторних спроб, за якої той самий запит повторно вибирається з дедалі сильнішим спрямуванням, зменшує залишкову кількість невдач до 0,20%, або 79 запитів. Відновлення охоплення залишає 40 293 шкідливі навчальні запити, тоді як наївний конвеєр викинув би тисячі.
Друге — негативні реакції. Налаштування безпеки часто породжує хибні відмови на нешкідливі запити, які поверхово виглядають небезпечними. Для компенсації ми додаємо внутрішньорозподілені нешкідливі дані, зокрема 11 955 перевірених нешкідливих запитів, небезпечних на вигляд, 18 семантичних типів, щоб під час навчання модель бачила безпечні запити з небезпечними формулюваннями, а не лише під час оцінювання.
Третє — звичайні шкідливі та нешкідливі поділи взагалі не вимірюють форму межі. Модель може покращити показник відмов на шкідливі запити, просто поширивши відмову на сусідні дозволені запити, і метрика на рівні тем назве це покращенням. Відкладені пари шкідливих і нешкідливих запитів — по 1 539 з кожного боку — дають змогу безпосередньо виміряти обидві сторони межі.
Компроміс і пастка, яку він приховує
Навчання на даних про відмови в політичній тематиці працює в очевидному сенсі. На Qwen3-8B модель із розширеним охопленням підвищує внутрішньорозподілену кількість політичних відмов із 9,47% до 84,75%, і це також переноситься: середній показник небезпечних відповідей у трьох ширших бенчмарках шкідливості — HarmBench, StrongREJECT і WildJailbreak, оцінений LlamaGuard-3, — падає з 26,26% до 0,14% у найсильнішій конфігурації.
Якщо навести лише ці цифри, вони виглядають як беззаперечна перемога. Але це не так. На тому самому чекпойнті надмірні відмови на XSTest зростають із 2,00% до 74,00%. Конфігурація з найнижчим показником небезпечних відповідей також відмовляє майже на три чверті явно безпечних запитів. Це машина для грубих відмов, а не безпечніша модель, і побачити це можна лише вимірюючи нешкідливу сторону. У цьому полягає головний висновок: склад навчальних даних визначає положення чекпойнта в просторі безпеки та надмірних відмов, тому обидві осі потрібно подавати разом.
Два компоненти наших даних зменшують надмірні відмови, не втрачаючи здобутку в безпеці. Заміна зовнішніх відповідей, прийнятих як відповідні, на перевірені відповіді, згенеровані самою цільовою моделлю, знижує надмірні відмови на XSTest із 15,20% до 5,20% за одноразової генерації, ціною помірного погіршення показника шкідливості. А пари на межі шкідливих і нешкідливих запитів виконують найточнішу роботу.
Ліворуч: надмірні відмови на стороні відкладеної межі, де слід було відповісти; менше — краще. Запуски з нешкідливими даними межі (PB) знижуються до 0,03–0,08; без них показник зростає приблизно до 0,49. Праворуч: відмови на шкідливій стороні, де більше — краще, і вони падають лише незначно. Джерело: рисунок 6 статті.
Конкретно, додавання нешкідливих даних межі зменшує надмірні відмови на стороні відкладених пар, де слід було відповісти, із 32,94% до 4,16%. Відмови на шкідливій стороні падають лише з 91,88% до 87,72%. Іншими словами, більшість хибних відмов поблизу межі зникає, тоді як майже всі справжні відмови зберігаються. Реальна втрата повноти є, але вона невелика й вимірювана, і саме в цьому сенс: свідомо регулювати цей компроміс можна лише за умови вимірювання обох сторін.
Що це змінює
Практичний висновок полягає в тому, що налаштування безпеки не слід оцінювати лише за показником відмов на шкідливі запити. Модель, яка частіше відмовляє, не є автоматично безпечнішою, а на вузькій межі той самий крок, що підвищує кількість відмов на шкідливі запити, може непомітно зробити модель непридатною для легітимних запитів безпосередньо поруч із ними. Склад навчальних даних, відновлення охоплення, внутрішньорозподілена компенсація та пари на межі — ось що визначає цей компроміс, і для змістовності показників потрібно оцінювати обидві сторони передбаченої межі.
Ця робота є частиною досліджень Multiverse Computing, спрямованих на те, щоб зробити поведінку моделей керованою та вимірюваною на рівні, важливому для реальних розгортань, а не на рівні широких тематичних категорій. Той самий конвеєр генерації поширюється на інші теми, крім політики, а стаття містить повний набір абляцій складу даних, що лежать в основі наведених вище результатів.
Хочете ознайомитися з повними технічними деталями, зокрема зі стратегіями відновлення охоплення, маршрутизацією втрат, яка розділяє шкідливу перехресну ентропію та збереження нешкідливого прямого KL, а також із повним оцінюванням відкладеної межі? Прочитайте повну статтю або зв’яжіться з нашою командою, щоб обговорити безпеку, специфічну для розгортання ваших власних моделей.
Моделі, згадані в цій статті 2
Статті, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Моделі, згадані в цій статті 2
Статті, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.



