LLM можуть писати як люди, але захисні обмеження після донавчання роблять їхній текст упізнаваним
Теоретично LLM могли б писати так само різноманітно, як люди, але вони цього не роблять. Посттренування та захисні механізми безпеки роблять їхній текст розпізнаваним, стверджує Бредлі Емі, технічний директор детектора ШІ-текстів Pangram, у дописі в блозі. Системи на кшталт ChatGPT, Claude або Gemini засвоюють правила поведінки, щоб уникати небезпечних результатів або цензурувати певні політичні висловлювання. Це різко звужує діапазон їхньої виразності — ефект, який називають «колапсом режимів».

Так звані базові моделі — необроблені моделі до посттренування — пишуть різноманітніше, тому детектор Pangram їх не позначає, каже Емі. Те саме стосується вузькоспеціалізованих донавчених моделей, навчених лише на текстах Гемінґвея або певних субреддітів, а також несправних результатів на кшталт незв’язного тексту. Однак це стосується лише текстів ШІ без водяних знаків. Водяні знаки, ймовірно, працюватимуть завжди, навіть за різноманітності базової моделі.
Новини ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.