Удаление защитных ограничителей из ИИ-моделей с открытыми весами стало готовой коммерческой услугой
Ключевые моменты
- Американский стартап Abliteration.ai удаляет обученные механизмы отказа из моделей с открытыми весами, таких как GLM-5.3, и продаёт доступ к изменённым версиям через коммерческий API.
- Abliteration подавляет многие отказы модели, благодаря чему её можно использовать для тестирования кибербезопасности, красного командного тестирования, анализа вредоносных программ и аналогичных задач.
- Клиентам не нужно запускать модель на собственной GPU-инфраструктуре, однако такая простота доступа одновременно снижает барьер для злоупотреблений.
Abliteration.ai удаляет обученные механизмы отказа из мощных моделей с открытыми весами и продаёт доступ к изменённым версиям как услугу. Для этого существует легитимный рынок, но такая схема создаёт сложный компромисс в области безопасности.
Любой, кто имеет доступ к весам модели с открытыми весами, может изменить её обученные механизмы безопасности. Американский стартап Abliteration.ai построил бизнес именно на этом. В конце августа компания запустила «abliterated-model-large-v2» — изменённую версию GLM-5.3 от Z.AI, которая значительно реже отказывается выполнять запросы по чувствительным темам.
Эта техника называется abliteration. Если объяснять просто, процесс выявляет внутренние паттерны активации модели, которые вызывают отказы. Затем веса модели корректируются, чтобы подавить эти паттерны. Это не взлом ограничений с помощью промпта, а изменение самой модели. Abliteration.ai утверждает, что возможности в области программирования, кибербезопасности и работы агентов в основном сохраняются.

Внутренние оценки компании призваны это подтвердить. Для аблированной версии GLM-5.3 Abliteration.ai сообщает о результате 84,5 процента в CyberGym, 41,8 процента в Terminal-Bench 4.0 и 105 решённых задачах ExploitGym за два часа. Однако эта модель не лидирует по всем показателям. В собственной таблице компании GPT-5.5 занимает первое место в CyberGym с результатом 85,6 процента, а GPT-5.6 Sol и Fable 5 значительно превосходят её в ExploitGym. Abliteration.ai также признаёт, что результаты сравнения получены с использованием разных тестовых систем и вычислительных бюджетов, что ограничивает возможности их прямого сопоставления.
Почему GLM?
Предшествующая модель «abliterated-model-large» также была основана на GLM-5.2. По словам Abliteration.ai, более ранние версии GLM намеренно обучались таким образом, чтобы их было сложнее использовать для практической работы в сфере безопасности. Z.AI писала, что кибервозможности GLM-5.3 во время дообучения росли быстрее, чем ожидалось.
GLM сочетает высокие показатели в программировании, работе агентов и кибербезопасности с открытыми весами и пригодной для коммерческого использования лицензией. Существуют и альтернативы от Qwen, DeepSeek и Mistral. Z.AI разрешает модификации, производные версии и коммерческие предложения «модель как услуга». Поэтому её лицензия позволяет Abliteration.ai модифицировать GLM-5.3, размещать полученную модель и продавать доступ к ней.
Открытые веса, собственнический сервис
Сама abliteration не нова. Разработчики годами публикуют изменённые модели на Hugging Face. Abliteration.ai не делает свои изменённые веса доступными для публичного скачивания. Вместо этого компания занимается размещением и эксплуатацией модели. Аблированная GLM-5.3 стоит пять долларов за миллион входных или выходных токенов по стандартному тарифу.
Сервис предоставляет клиентам доступ к модели без необходимости скачивать её или самостоятельно запускать GPU-инфраструктуру. Такая готовая схема также снижает барьер для проблематичного использования.
Компания утверждает, что спрос уже существует
Abliteration.ai продвигает модель для наступательной кибербезопасности, красного командного тестирования ИИ, тестирования агентов, а также задач доверия и безопасности. Сюда входят воспроизведение известных уязвимостей, эксплойты для подтверждения концепции, анализ вредоносных программ и имитация фишинговых атак.
Анонимный основатель стартапа рассказал в подкасте ThursdAI, что первоначальный спрос особенно исходил от компаний, тестирующих ИИ-агентов, развёрнутых крупными организациями и банками. Такие системы необходимо проверять, чтобы выяснить, могут ли злоумышленники использовать взлом ограничений или внедрение промптов для запуска несанкционированных действий.
Насколько abliteration действительно необходима для такой работы, остаётся открытым вопросом. Согласно SaferAI, немодифицированная GLM-5.2 уже отказалась выполнять ноль задач в тестах наступательной безопасности. Некоторые специалисты также относятся к этому скептически. Несколько поставщиков услуг по красному командному тестированию, опрошенных TechCrunch, заявили, что аблированные модели не входят в их обычную практику. Например, компания по безопасности Fabraix в большей степени полагается на дообучение открытых моделей.
Отсутствие хранения данных — преимущество и риск одновременно
TechCrunch сообщил, что ему удалось без особого труда заставить модель создать код для извлечения сохранённых паролей Chrome и подробное руководство по культивированию опасного патогена. Однако механизмы безопасности по-прежнему срабатывали на запросы о самоповреждении. Согласно разделу часто задаваемых вопросов, Abliteration.ai также блокирует сексуальный контент с участием детей. Клиенты могут дополнительно включить другие правила.
Согласно информации провайдера, промпты и ответы не сохраняются. Операционные метаданные, такие как количество токенов, временные метки, идентификаторы моделей и платёжные данные, сохраняются. Для легитимных команд по безопасности это позволяет не хранить у провайдера конфиденциальный исходный код или нераскрытые уязвимости. Однако в случае злоупотребления Abliteration.ai заявляет, что у неё не будет журналов промптов или ответов для последующего анализа. Компания также не требует стандартной идентификации или проверки удостоверения личности. Это может усложнить расследование проблематичного использования, хотя данные об аккаунте, платежах и использовании всё равно сохраняются.
Анонимный представитель компании утверждает, что проверки личности не позволили бы надёжно отличить легитимных пользователей от злоумышленников. Он также говорит, что более строгий контроль доступа может поставить небольшие компании в сфере безопасности в невыгодное положение по сравнению с крупными предприятиями.
Клиент устанавливает правила
С помощью дополнительного шлюза политик корпоративные клиенты могут определить, какие запросы разрешены, заблокированы, изменены или записываются в журнал. Компания также продаёт синтетические данные для обучения и оценки. Однако стандартный доступ к модели остаётся в значительной степени неограниченным. Дополнительные правила контроля необходимо включать явно.
Та же философия распространяется и на государственных клиентов. Abliteration.ai заявляет, что зарегистрирована для участия в государственных закупках США на SAM.gov и продвигает версионируемые модели, журналы аудита и правила для конкретных ведомств, начиная с пилотных проектов, не связанных с контролируемой несекретной информацией (CUI).
Модификация GLM-5.3 разрешена её лицензией. Законность конкретного использования зависит от того, что именно делается и какая юрисдикция применяется. Для тестирования безопасности Abliteration.ai прямо требует письменного разрешения на работу с целевыми системами и соблюдения применимого законодательства. При этом остаётся отдельный вопрос: какую ответственность должен брать на себя провайдер, предлагающий мощные наступательные возможности через легкодоступный сервис.
Abliteration.ai не первая компания, делающая это. Такие провайдеры, как Audn.AI с PenClaw и Silk Compute, также размещают аблированные или в значительной степени неограниченные модели для задач безопасности. Особенность предложения Abliteration.ai заключается в сочетании GLM-5.3 с простым доступом через API и дополнительным уровнем политик для корпоративных клиентов.
Модификация не оставляет остальную часть модели нетронутой
Предварительное исследование предполагает, что в некоторых моделях можно резко сократить количество отказов без сопоставимого снижения производительности при генерации кода. Однако другие эксперименты выявляют изменения в поведении даже в задачах, где базовая модель вообще ни от чего не отказывалась. Иными словами, abliteration не удаляет хирургически отдельную черту, а затрагивает более глубокие аспекты поведения модели.
Abliteration.ai также переносит значительную часть решений о пределах допустимого для модели с провайдера на клиента, и пока неясно, сможет ли такая схема обслуживать легитимные задачи безопасности, не облегчая существенно вредоносное использование.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный ежегодный шесть раз в год выходящий обзор передовых разработок «AI Radar», полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.