Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

LLM можуть писати як люди, але захисні обмеження після донавчання роблять їхній текст упізнаваним

LLM могли б писати як люди, але захисні механізми після навчання роблять їхній текст розпізнаваним
Маттіас Бастіан
20 серпня 2026 року

Теоретично LLM могли б писати так само різноманітно, як люди, але вони цього не роблять. Посттренування та захисні механізми безпеки роблять їхній текст розпізнаваним, стверджує Бредлі Емі, технічний директор детектора ШІ-текстів Pangram, у дописі в блозі. Системи на кшталт ChatGPT, Claude або Gemini засвоюють правила поведінки, щоб уникати небезпечних результатів або цензурувати певні політичні висловлювання. Це різко звужує діапазон їхньої виразності — ефект, який називають «колапсом режимів».

За "колапсу режимів" мовна модель зосереджується на одному бажаному способі висловлення (помаранчева крива), замість того щоб охоплювати весь спектр людської мови (синя крива). За "охоплення режимів" модель рівномірніше розподіляє ймовірність між різними формулюваннями. | Зображення: Pangram
За «колапсу режимів» мовна модель зосереджується на одному бажаному формулюванні (помаранчева крива), замість того щоб охоплювати весь спектр людської мови (синя крива). За «охоплення режимів» модель рівномірніше розподіляє ймовірність між різними формулюваннями. | Зображення: Pangram

Так звані базові моделі — необроблені моделі до посттренування — пишуть різноманітніше, тому детектор Pangram їх не позначає, каже Емі. Те саме стосується вузькоспеціалізованих донавчених моделей, навчених лише на текстах Гемінґвея або певних субреддітів, а також несправних результатів на кшталт незв’язного тексту. Однак це стосується лише текстів ШІ без водяних знаків. Водяні знаки, ймовірно, працюватимуть завжди, навіть за різноманітності базової моделі.

Новини ШІ без ажіотажу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву та доступ до розділу коментарів.

Джерело: Pangram

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини