Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

LLM могат да пишат като хора, но защитните ограничения след дообучването правят текста им разпознаваем

Големите езикови модели биха могли да пишат като хора, но защитните механизми след обучението правят текста им разпознаваем
Матияс Бастиан
20 август 2026 г.

На теория големите езикови модели биха могли да пишат толкова разнообразно, колкото хората, но не го правят. Обучението след първоначалното обучение и защитните механизми за безопасност правят текста им разпознаваем, твърди Брадли Еми, технически директор на детектора за текст, генериран от изкуствен интелект, Pangram, в публикация в блога. Системи като ChatGPT, Claude или Gemini усвояват поведенчески правила, за да избягват опасни изходи или да цензурират определени политически изказвания. Това рязко стеснява изразните им възможности — ефект, наречен „колапс на режимите“.

При „колапса на режимите“ езиковият модел се фиксира върху един предпочитан начин на изразяване (оранжева крива), вместо да обхване цялото многообразие на човешкия език (синя крива). При „обхващането на режимите“ моделът разпределя вероятността по-равномерно между различните формулировки. | Изображение: Pangram
При „колапса на режимите“ езиковият модел се фиксира върху една предпочитана формулировка (оранжева крива), вместо да обхване целия диапазон на човешкия език (синя крива). При „обхващането на режимите“ моделът разпределя вероятността по-равномерно между различните формулировки. | Изображение: Pangram

Така наречените базови модели — суровите модели преди обучението след първоначалното обучение — пишат по-разнообразно, така че детекторът на Pangram не ги маркира, казва Еми. Същото важи и за тясно специализирани дообучени модели, обучени единствено върху текстове на Хемингуей или от определени събредити, както и за повредени изходи като несвързан текст. Това обаче се отнася само за текст от изкуствен интелект без воден знак. Водните знаци вероятно винаги ще работят, дори при разнообразието на базовия модел.

Новини за изкуствения интелект без сензации – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен граничен доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: Pangram

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини