Видимые цепочки рассуждений — преимущество ИИ с точки зрения безопасности, но эта прозрачность постепенно исчезает
Сегодня модели ИИ рассуждают вслух, но Google DeepMind утверждает, что прозрачность находится под угрозой. В одной из первых публикаций недавно запущенного DeepMind Institute исследователи Рохин Шах и Анка Драган утверждают, что видимая цепочка рассуждений (CoT) является важным преимуществом с точки зрения безопасности. Поскольку модели записывают промежуточные шаги на естественном языке, исследователи могут заметить, пытаются ли они обмануть людей или разрабатывают проблематичные планы. По их словам, в случае с Gemini 3 Pro цепочка рассуждений показала, что модель осознала, что находится в тестовой среде.
Но этой прозрачности угрожает опасность. В системной карте OpenAI для GPT-6 Astra уже сообщается о значительном снижении того, насколько хорошо можно отслеживать цепочку рассуждений. Будущие модели могут рассуждать в числовых пространствах, которые люди не способны прочитать: это было бы эффективнее, но полностью непрозрачно. Шах и Драган хотят, чтобы отрасль регулярно измеряла, насколько хорошо цепочки рассуждений по-прежнему поддаются мониторингу, сохраняла прозрачные архитектуры и при обучении следила за тем, чтобы модели не учились скрывать свои истинные рассуждения.
В начале сентября главный научный сотрудник OpenAI Якуб Пачоцки предупредил о потере контроля, частично вызванной тем, что цепочки рассуждений стало сложнее отслеживать. Вскоре после этого генеральный директор Anthropic Дарио Амодеи призвал намеренно замедлить темпы развития.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.