Видимите вериги на мисълта са предимство за безопасността на ИИ, но тази прозрачност изчезва
Днес моделите с изкуствен интелект мислят на глас, но според Google DeepMind тази прозрачност е изложена на риск. В една от първите публикации на наскоро създадения DeepMind Institute изследователите Рохин Шах и Анка Драган твърдят, че видимата верига на разсъжденията (CoT) е ключово предимство за безопасността. Тъй като моделите изписват междинните си стъпки на разбираем език, изследователите могат да установят дали моделите ги заблуждават или разработват проблематични планове. Според тях при Gemini 3 Pro веригата на разсъжденията е разкрила, че моделът е осъзнал, че се намира в тестова среда.
Но тази прозрачност е застрашена. Системната карта на OpenAI за GPT-6 Astra вече отчита значителен спад в това доколко добре може да бъде наблюдавана веригата на разсъжденията. Бъдещите модели може да мислят в числови пространства, които хората не могат да разчитат, което би било по-ефективно, но напълно непрозрачно. Шах и Драган искат индустрията редовно да измерва доколко добре веригите на разсъжденията все още могат да бъдат наблюдавани, да поддържа прозрачни архитектури и по време на обучението да внимава моделите да не се научат да прикриват истинския си начин на разсъждение.
В началото на септември главният научен директор на OpenAI Якуб Пачоцки предупреди за загуба на контрол, причинена отчасти от вериги на разсъжденията, които са по-трудни за наблюдение. Малко след това главният изпълнителен директор на Anthropic Дарио Амодей призова за умишлено забавяне на темпото на развитие.
Новини за ИИ без сензацията – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, ексклузивния ни годишен доклад „AI Radar“ за водещите разработки, публикуван шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.