Теоретически LLM могли бы писать столь же разнообразно, как люди, но этого не происходит. Постобучение и защитные механизмы безопасности делают их тексты распознаваемыми, утверждает Брэдли Эми, технический директор компании Pangram, занимающейся детектированием текстов ИИ, в публикации в блоге. Такие системы, как ChatGPT, Claude или Gemini, усваивают правила поведения, чтобы избегать опасных ответов или подвергать цензуре определённые политические высказывания. Это резко сужает диапазон их выразительных средств — эффект, называемый «коллапсом модальности».
При «коллапсе модальности» языковая модель зацикливается на одной предпочтительной формулировке (оранжевая кривая), вместо того чтобы охватывать весь диапазон человеческого языка (синяя кривая). При «охвате модальностей» модель распределяет вероятность более равномерно между различными формулировками. | Изображение: Pangram
По словам Эми, так называемые базовые модели — исходные модели до постобучения — пишут более разнообразно, поэтому детектор Pangram их не отмечает. То же самое относится к узкоспециализированным моделям, дообученным исключительно на текстах Хемингуэя или определённых сабреддитов, а также к неудачным результатам вроде бессвязного текста. Однако это относится только к текстам ИИ без водяных знаков. Водяные знаки, вероятно, будут работать всегда, даже при разнообразии базовой модели.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.