Видалення захисних обмежень із моделей ШІ з відкритими вагами тепер доступне як готова комерційна послуга
Ключові моменти
- Американський стартап Abliteration.ai видаляє навчені механізми відмови з моделей із відкритими вагами, таких як GLM-5.3, і продає доступ до модифікованих версій через комерційний API.
- Abliteration пригнічує багато відмов моделі, завдяки чому її можна використовувати для тестування кібербезпеки, red teaming, аналізу шкідливого програмного забезпечення та подібної роботи.
- Клієнтам не потрібно запускати модель на власній GPU-інфраструктурі, але ця сама простота доступу також знижує бар’єр для зловживань.
Abliteration.ai видаляє навчені механізми відмови з потужних моделей із відкритими вагами та продає доступ до модифікованих версій як послугу. Для цього існує легітимний ринок, але така сама конфігурація створює складний компроміс у сфері безпеки.
Кожен, хто має доступ до ваг моделі з відкритими вагами, може змінити її навчені механізми безпеки. Саме навколо цього американський стартап Abliteration.ai побудував свій бізнес. Наприкінці серпня він запустив «abliterated-model-large-v2» — модифіковану версію GLM-5.3 від Z.AI, розроблену для значно рідших відмов у відповідь на чутливі запити.
Ця техніка називається аблітерацією. Якщо спростити, процес знаходить внутрішні шаблони активації в моделі, які спричиняють відмови. Потім ваги моделі коригуються, щоб придушити ці шаблони. Це не джейлбрейк через промпт, а зміна самої моделі. Abliteration.ai стверджує, що можливості програмування, кібербезпеки та роботи агентів здебільшого зберігаються.

Внутрішні оцінювання компанії покликані це підтвердити. Для аблітерованої версії GLM-5.3 Abliteration.ai повідомляє про результат 84,5 відсотка в CyberGym, 41,8 відсотка в Terminal-Bench 4.0 та 105 виконаних завдань ExploitGym за дві години. Водночас модель не лідирує за всіма показниками. У власній таблиці компанії GPT-5.5 очолює CyberGym із результатом 85,6 відсотка, а GPT-5.6 Sol і Fable 5 значно випереджають її в ExploitGym. Abliteration.ai також визнає, що порівняльні результати отримані за допомогою різних тестових оболонок і обсягів обчислювальних ресурсів, що обмежує можливість їх прямого зіставлення.
Чому GLM?
Попередня модель «abliterated-model-large» також базувалася на GLM-5.2. За словами Abliteration.ai, попередні версії GLM навмисно навчалися так, щоб їх було складніше використовувати для практичної роботи у сфері безпеки. Z.AI писала, що кіберможливості GLM-5.3 під час подальшого навчання зростали швидше, ніж очікувалося.
GLM поєднує сильні результати в програмуванні, роботі агентів і кібербезпеці з відкритими вагами та придатною для комерційного використання ліцензією. Альтернативи пропонують Qwen, DeepSeek і Mistral. Z.AI дозволяє модифікації, похідні продукти та комерційні пропозиції «модель як послуга». Тому її ліцензія дозволяє Abliteration.ai модифікувати GLM-5.3, розміщувати отриману модель і продавати доступ до неї.
Відкриті ваги, пропрієтарна послуга
Сама аблітерація не є новою. Розробники роками публікують модифіковані моделі на Hugging Face. Abliteration.ai не робить свої модифіковані ваги доступними для публічного завантаження. Натомість компанія займається хостингом та експлуатацією. Аблітерована GLM-5.3 коштує п’ять доларів за мільйон вхідних або вихідних токенів за стандартним тарифом.
Послуга надає клієнтам доступ до моделі без необхідності завантажувати її або самостійно запускати GPU-інфраструктуру. Така готова конфігурація також знижує бар’єр для проблемного використання.
Компанія стверджує, що попит уже існує
Abliteration.ai просуває модель для наступальної кібербезпеки, red teaming ШІ, тестування агентів, а також роботи у сфері довіри та безпеки. Це включає відтворення відомих вразливостей, експлойти для підтвердження концепції, аналіз шкідливого програмного забезпечення та симульовані фішингові атаки.
Анонімний засновник стартапу розповів у подкасті ThursdAI, що ранній попит особливо надходив від компаній, які тестують ШІ-агентів, розгорнутих великими організаціями та банками. Такі системи потрібно перевіряти, щоб з’ясувати, чи можуть зловмисники використовувати джейлбрейки або ін’єкції промптів для запуску несанкціонованих дій.
Наскільки аблітерація насправді потрібна для такої роботи, залишається відкритим питанням. За даними SaferAI, немодифікована GLM-5.2 вже відмовилася виконувати нуль завдань у тестах наступальної безпеки. Деякі фахівці також скептично налаштовані. Кілька постачальників послуг red teaming, опитаних TechCrunch, заявили, що аблітеровані моделі не є частиною їхньої стандартної роботи. Наприклад, компанія з безпеки Fabraix більше покладається на донавчання відкритих моделей.
Відсутність зберігання даних — це і перевага, і ризик
TechCrunch повідомив, що зміг без особливих труднощів змусити модель створити код для вилучення збережених паролів Chrome та докладний посібник із вирощування небезпечного патогена. Однак механізми безпеки все ще спрацьовували на запити щодо самопошкодження. Згідно з поширеними запитаннями, Abliteration.ai також блокує сексуальний контент за участю дітей. Клієнти можуть додатково додавати правила.
Згідно з інформацією постачальника, промпти та відповіді не зберігаються. Операційні метадані, як-от кількість токенів, часові позначки, ідентифікатори моделей і платіжні дані, зберігаються. Для легітимних команд безпеки це може допомогти не допускати потрапляння конфіденційного вихідного коду або нерозкритих вразливостей до збережених даних постачальника. Однак у разі зловживання послугою Abliteration.ai каже, що не має журналів промптів або відповідей для подальшої перевірки. Компанія також не вимагає звичайної ідентифікації чи перевірки посвідчення особи. Це може ускладнити розслідування проблемного використання, хоча метадані облікового запису, платежів і використання все одно зберігаються.
Анонімний представник компанії стверджує, що перевірка особи не змогла б надійно відрізнити легітимних користувачів від зловмисників. Він також каже, що жорсткіший контроль доступу може поставити невеликі компанії з безпеки у невигідне становище порівняно з великими підприємствами.
Клієнт встановлює правила
За допомогою додаткового шлюзу політик корпоративні клієнти можуть визначати, які запити дозволені, заблоковані, змінені або занесені до журналу. Компанія також продає синтетичні дані для навчання та оцінювання. Однак стандартний доступ до моделі залишається переважно необмеженим. Додаткові правила контролю потрібно вмикати явно.
Та сама філософія поширюється і на державних клієнтів. Abliteration.ai стверджує, що зареєстрована для участі в державних закупівлях США на SAM.gov і просуває версійні моделі, журнали аудиту та правила для конкретних відомств, починаючи з пілотних проєктів, які не передбачають роботи з контрольованою несекретною інформацією (CUI).
Модифікація GLM-5.3 дозволена її ліцензією. Чи є конкретне використання законним, залежить від того, що саме робиться і яка юрисдикція застосовується. Для тестування безпеки Abliteration.ai прямо вимагає письмового дозволу на цільові системи та дотримання чинного законодавства. Це залишає окреме питання щодо того, яку відповідальність має брати на себе постачальник, пропонуючи потужні наступальні можливості через легкодоступну послугу.
Abliteration.ai не є першою компанією, яка робить це. Такі постачальники, як Audn.AI із PenClaw та Silk Compute, також розміщують аблітеровані або переважно необмежені моделі для сценаріїв використання у сфері безпеки. Конкретна пропозиція Abliteration.ai поєднує GLM-5.3 із простим доступом через API та додатковим рівнем політик для корпоративних клієнтів.
Модифікація не залишає решту моделі незмінною
Попереднє дослідження припускає, що в певних моделях кількість відмов можна різко зменшити без зіставного падіння продуктивності у генеруванні коду. Однак інші експерименти виявляють поведінкові зміни навіть у завданнях, де базова модель узагалі ні від чого не відмовлялася. Іншими словами, аблітерація не видаляє хірургічно одну окрему рису, а глибше впливає на поведінку моделі.
Abliteration.ai також переносить значну частину рішень щодо обмежень моделі від постачальника до клієнта, і питання про те, чи може така схема обслуговувати легітимну роботу у сфері безпеки, не роблячи шкідливе використання істотно простішим, залишається невирішеним.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.