LLM могут писать как люди, но защитные ограничения после дообучения делают их текст распознаваемым
Теоретически LLM могли бы писать столь же разнообразно, как люди, но этого не происходит. Постобучение и защитные механизмы безопасности делают их тексты распознаваемыми, утверждает Брэдли Эми, технический директор компании Pangram, занимающейся детектированием текстов ИИ, в публикации в блоге. Такие системы, как ChatGPT, Claude или Gemini, усваивают правила поведения, чтобы избегать опасных ответов или подвергать цензуре определённые политические высказывания. Это резко сужает диапазон их выразительных средств — эффект, называемый «коллапсом модальности».

По словам Эми, так называемые базовые модели — исходные модели до постобучения — пишут более разнообразно, поэтому детектор Pangram их не отмечает. То же самое относится к узкоспециализированным моделям, дообученным исключительно на текстах Хемингуэя или определённых сабреддитов, а также к неудачным результатам вроде бессвязного текста. Однако это относится только к текстам ИИ без водяных знаков. Водяные знаки, вероятно, будут работать всегда, даже при разнообразии базовой модели.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.