Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

LLM могут писать как люди, но защитные ограничения после дообучения делают их текст распознаваемым

LLM могли бы писать как люди, но защитные механизмы после обучения делают их тексты распознаваемыми
Маттиас Бастиан
20 авг. 2026 г.

Теоретически LLM могли бы писать столь же разнообразно, как люди, но этого не происходит. Постобучение и защитные механизмы безопасности делают их тексты распознаваемыми, утверждает Брэдли Эми, технический директор компании Pangram, занимающейся детектированием текстов ИИ, в публикации в блоге. Такие системы, как ChatGPT, Claude или Gemini, усваивают правила поведения, чтобы избегать опасных ответов или подвергать цензуре определённые политические высказывания. Это резко сужает диапазон их выразительных средств — эффект, называемый «коллапсом модальности».

При «коллапсе модальности» языковая модель сосредотачивается на одном предпочтительном способе выражения (оранжевая кривая), вместо того чтобы охватывать всё разнообразие человеческого языка (синяя кривая). При «охвате модальностей» модель распределяет вероятность более равномерно между различными формулировками. | Изображение: Pangram
При «коллапсе модальности» языковая модель зацикливается на одной предпочтительной формулировке (оранжевая кривая), вместо того чтобы охватывать весь диапазон человеческого языка (синяя кривая). При «охвате модальностей» модель распределяет вероятность более равномерно между различными формулировками. | Изображение: Pangram

По словам Эми, так называемые базовые модели — исходные модели до постобучения — пишут более разнообразно, поэтому детектор Pangram их не отмечает. То же самое относится к узкоспециализированным моделям, дообученным исключительно на текстах Хемингуэя или определённых сабреддитов, а также к неудачным результатам вроде бессвязного текста. Однако это относится только к текстам ИИ без водяных знаков. Водяные знаки, вероятно, будут работать всегда, даже при разнообразии базовой модели.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.

Источник: Pangram

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости