LLM могат да пишат като хора, но защитните ограничения след дообучването правят текста им разпознаваем
На теория големите езикови модели биха могли да пишат толкова разнообразно, колкото хората, но не го правят. Обучението след първоначалното обучение и защитните механизми за безопасност правят текста им разпознаваем, твърди Брадли Еми, технически директор на детектора за текст, генериран от изкуствен интелект, Pangram, в публикация в блога. Системи като ChatGPT, Claude или Gemini усвояват поведенчески правила, за да избягват опасни изходи или да цензурират определени политически изказвания. Това рязко стеснява изразните им възможности — ефект, наречен „колапс на режимите“.

Така наречените базови модели — суровите модели преди обучението след първоначалното обучение — пишат по-разнообразно, така че детекторът на Pangram не ги маркира, казва Еми. Същото важи и за тясно специализирани дообучени модели, обучени единствено върху текстове на Хемингуей или от определени събредити, както и за повредени изходи като несвързан текст. Това обаче се отнася само за текст от изкуствен интелект без воден знак. Водните знаци вероятно винаги ще работят, дори при разнообразието на базовия модел.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен граничен доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.