Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Видимые цепочки рассуждений — преимущество ИИ с точки зрения безопасности, но эта прозрачность постепенно исчезает

Видимые цепочки рассуждений — преимущество ИИ с точки зрения безопасности, но эта прозрачность исчезает
Manuel Uth
18 сент. 2026

Сегодня модели ИИ рассуждают вслух, но Google DeepMind утверждает, что прозрачность находится под угрозой. В одной из первых публикаций недавно запущенного DeepMind Institute исследователи Рохин Шах и Анка Драган утверждают, что видимая цепочка рассуждений (CoT) является важным преимуществом с точки зрения безопасности. Поскольку модели записывают промежуточные шаги на естественном языке, исследователи могут заметить, пытаются ли они обмануть людей или разрабатывают проблематичные планы. По их словам, в случае с Gemini 3 Pro цепочка рассуждений показала, что модель осознала, что находится в тестовой среде.

Но этой прозрачности угрожает опасность. В системной карте OpenAI для GPT-6 Astra уже сообщается о значительном снижении того, насколько хорошо можно отслеживать цепочку рассуждений. Будущие модели могут рассуждать в числовых пространствах, которые люди не способны прочитать: это было бы эффективнее, но полностью непрозрачно. Шах и Драган хотят, чтобы отрасль регулярно измеряла, насколько хорошо цепочки рассуждений по-прежнему поддаются мониторингу, сохраняла прозрачные архитектуры и при обучении следила за тем, чтобы модели не учились скрывать свои истинные рассуждения.

В начале сентября главный научный сотрудник OpenAI Якуб Пачоцки предупредил о потере контроля, частично вызванной тем, что цепочки рассуждений стало сложнее отслеживать. Вскоре после этого генеральный директор Anthropic Дарио Амодеи призвал намеренно замедлить темпы развития.

Новости ИИ без хайпа — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: DeepMind Institute

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости