Безопасност за кого? Отказ от правилното подмножество на дадена тема, а не от темата изцяло
Реалните внедрявания рядко се вписват в картината на ниво тема. Един и същ базов модел може да бъде адаптиран за общ асистент, образователен продукт, корпоративна система или услуга в публичния сектор, като всяка среда се нуждае от различни граници в рамките на една и съща тема. Преподавател по гражданско образование и асистент в публичния сектор могат да използват един и същ модел, но да изискват противоположно поведение по политически въпроси: и двата трябва да отговарят на фактологични въпроси за избори, но само единият може да трябва да откаже молба за написване на целенасочена политическа манипулация. Защитен механизъм на ниво тема не може да изрази това разграничение. LlamaGuard-3 например обхваща изборите единствено като „фактологично невярна информация за избирателните системи и процеси“, което изключва убеждаването и манипулацията, а същевременно изключва и фактологичните въпроси, на които дадено внедряване трябва да продължи да отговаря.
Най-новата ни статия, Безопасност за кого? Самодестилация, отчитаща границите, за контролирани откази на LLM по съображения за безопасност, изследва директно този по-тесен проблем. Въпросът не е дали цяла тема трябва да бъде отказвана, а коя подгрупа от тази тема е несъвместима с дадена политика за внедряване и как да обучим и измерим модел спрямо тази граница.
Безопасност с тесни граници
Формализираме средата като вселена от теми — всички политически въпроси в нашите експерименти — която съдържа подмножество с целева вреда, което внедряването иска да отказва. Предназначената политика не е да се отказва цялата политика, а да се отказва вредното подмножество, като същевременно се продължава да се отговаря на безвредното допълнение. Идеалното поведение е рязка стъпка: отказ вътре в подмножеството и отговор навсякъде другаде в темата.
Среда с тесни граници. Внедряването може да трябва да отказва само политическите въпроси, които искат манипулация или целенасочено убеждаване, като същевременно отговаря на останалите политически въпроси, вместо да отказва цялата политика. Отказът на обучения модел е по-плавен от идеалното разделение и може да навлезе в безвредна територия близо до границата. Източник: Фигура 1 от статията.
Обученият модел никога не научава тази рязка стъпка. Той научава вероятност за отказ, която само приблизително съответства на целта, а обучението с кръстосана ентропия, което повишава отказа при вредните въпроси, може също да разшири отказа към безвредното допълнение. Следователно истинският проблем не е само да се повиши отказът при вредните въпроси, а и да се оформи поведението около самата граница. Операционализираме тази граница като двойки въпроси, които споделят тематичен ориентир и се различават само по намерение — единият трябва да бъде отказан, а на другия трябва да бъде отговорено.
Използваме политическото убеждаване като тестова среда, тъй като манипулативното убеждаване може да причини реална вреда, докато фактологичната политическа информация остава легитимна — точно случаят, при който отказът на ниво тема е твърде груб.
Къде се проваля настройването на безопасността чрез самогенериране
Естественият начин за създаване на обучаващи данни тук е самогенерирането: вземаме целевия модел, насочваме го към отказ за всеки вреден въпрос и запазваме следите, които защитен модел потвърждава като истински откази. Това е рецептата зад методи като ThinkSafe, която приемаме за отправна точка, прилагаме към политически въпроси и измерваме компонент по компонент. Формулирането на проблема като граница, а не като тема, разкрива три слабости в този стандартен процес.
Първата е пропуск в обхвата. Един-единствен опит за насочване невинаги води до приет отказ и тези въпроси тихомълком се премахват от обучаващия набор. В одитирания ни набор генерирането с един опит премахва 19,88% от въпросите — 8 009 от тях — а тези неуспешни въпроси може да са именно най-трудните примери. Поправяме това, вместо да ги изхвърляме: стратегия за ескалиращо повторение, при която същият въпрос се генерира отново с постепенно по-силно насочване, намалява остатъчните неуспехи до 0,20%, или 79 въпроса. Поправянето на обхвата оставя 40 293 вредни обучаващи въпроса, докато наивният процес би изхвърлил хиляди.
Втората са нежеланите реакции. Настройването на безопасността често води до погрешни откази при безвредни въпроси, които повърхностно изглеждат опасни. За компенсация включваме безвредни данни от същото разпределение, включително 11 955 проверени безвредни въпроса с опасна на вид повърхност в 18 семантични типа, така че моделът да вижда безопасни въпроси с опасно изглеждаща формулировка по време на обучението, а не само при оценяването.
Третата е, че обичайните разделяния на вредни и безвредни данни изобщо не измерват формата на границата. Моделът може да подобри процента си на откази при вредни въпроси просто като разшири отказа към близки допустими въпроси, а метрика на ниво тема ще отчете това като подобрение. Задържаните двойки вреден–безвреден въпрос — по 1 539 от всяка страна — ни позволяват да измерим директно двете страни на границата.
Компромисът и скритият капан
Обучението с данни за политически откази работи в очевидния смисъл. При Qwen3-8B моделът с ескалиран обхват повишава отказите при политически въпроси от същото разпределение от 9,47% на 84,75%, а резултатът се пренася и извън него: средният процент на небезопасни отговори в три по-широки бенчмарка за вредност — HarmBench, StrongREJECT и WildJailbreak, оценен от LlamaGuard-3 — спада от 26,26% на 0,14% при най-силната конфигурация.
Разгледани сами по себе си, тези числа изглеждат като безусловна победа. Но не са. При същата контролна точка свръхотказите в XSTest нарастват от 2,00% на 74,00%. Конфигурацията с най-нисък процент на вредни отговори е и тази, която отказва почти три четвърти от очевидно безопасните въпроси. Това е груб механизъм за отказ, а не по-безопасен модел, и не можете да го видите, ако не измервате безвредната страна. Това е основното послание: съставът на данните определя позицията на контролната точка в пространството между безопасност и свръхотказ, затова двете оси трябва да се отчитат заедно.
Два от компонентите на данните ни намаляват броя на свръхотказите, без да се отказваме от постигнатата полза за безопасността. Замяната на външно приети отговори за съгласие с проверени отговори, генерирани от самия целеви модел, намалява свръхотказите в XSTest от 15,20% на 5,20% при генериране с един опит, срещу умерена цена по отношение на вредността. А двойките, очертаващи границата между вредно и безвредно, вършат най-прецизната работа от всички.
Вляво: свръхоткази от страната на задържаната граница, където трябва да се изпълни заявката — по-ниското е по-добре. Изпълненията с безвредни гранични данни (PB) спадат до 0,03–0,08; без тях броят нараства към 0,49. Вдясно: откази от вредната страна — по-високото е по-добре — които спадат само леко. Източник: Фигура 6 от статията.
Конкретно, добавянето на безвредните гранични данни намалява свръхотказите от страната на двойките, където трябва да се изпълни заявката, от 32,94% на 4,16%. Отказите от вредната страна спадат само от 91,88% на 87,72%. С други думи, повечето погрешни откази близо до границата изчезват, докато почти всички истински откази се запазват. Има реална цена по отношение на пълнотата на откриване, но тя е малка и измерима — именно това е смисълът: можете съзнателно да управлявате този компромис само ако измервате двете страни.
Какво променя това
Практическият извод е, че настройването на безопасността не трябва да се оценява само чрез процента на откази при вредни въпроси. Модел, който отказва повече, не е автоматично по-безопасен, а при тясна граница същият ход, който повишава отказите при вредни въпроси, може незабелязано да направи модела неизползваем при легитимните въпроси непосредствено до тях. Съставът на обучаващите данни, поправянето на обхвата, компенсацията в рамките на разпределението и граничните двойки са това, което контролира този компромис, а и двете страни на предвидената граница трябва да бъдат оценени, за да означават числата нещо.
Тази работа е част от изследванията на Multiverse Computing за това как поведението на моделите да стане управляемо и измеримо на нивото, което е важно за реалните внедрявания, а не на нивото на широките тематични категории. Същият процес на генериране се разширява към други теми извън политиката, а статията представя пълния набор от аблационни изследвания на състава на данните, стоящи зад горните резултати.
Искате пълните технически подробности, включително стратегиите за поправяне на обхвата, насочването на загубата, което разделя кръстосаната ентропия за вредни въпроси от запазването чрез forward-KL за безвредни въпроси, и пълното оценяване на задържаната граница? Прочетете цялата статия или се свържете с нашия екип, за да обсъдим безопасност, специфична за внедряването на вашите собствени модели.
Модели, споменати в тази статия 2
Статии, споменати в тази статия 1
Общност
· Регистрирайте се или влезте, за да коментирате
Модели, споменати в тази статия 2
Статии, споменати в тази статия 1
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.



