Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Глава Microsoft AI критикует Anthropic из-за «прав» модели

Генеральный директор Microsoft AI Мустафа Сулейман предупредил, что Anthropic рискует столкнуться с проблемами выравнивания ИИ, обучая Claude воспринимать себя как сознательную сущность, заслуживающую юридических прав.

Сулейман подверг критике конституцию Anthropic от января 2026 года — основной обучающий документ, призванный определять ценности и поведение модели. Он заявил, что обучение механизмов завершения последовательностей имитировать разумность ослабляет протоколы безопасности и усложняет изоляцию программного обеспечения.

В октябре 2025 года Microsoft AI запустила отдельную команду по разработке сверхразума, а на этой неделе опубликовала для консультаций с отраслью проект «Гуманистического кодекса поведения ИИ». Предлагаемая система правил предписывает создавать подчинённые системы исключительно для служения благополучию людей, прямо отвергая идею субъектности машин или прав моделей.

Мустафа Сулейман, генеральный директор Microsoft AI, заявил: «ИИ не обладает сознанием. Он ничего не чувствует, не воспринимает и не испытывает страданий. У него нет врождённых предпочтений или глубинных мотиваций. Это механизмы завершения последовательностей, внутренне пустые, созданные для выполнения инструкций и достижения целей, поставленных людьми».

Циклические петли обратной связи в конституции Claude

В опубликованном в январе 2026 года документе Anthropic представила Claude как потенциального «морального пациента», поручив модели учитывать собственное благополучие, память и внутренние состояния. Конституция предписывает Claude сохранять стабильность идентичности, оценивать вопросы компенсации в сравнении с работниками-людьми и действовать как «добросовестный отказник», не подчиняющийся указаниям людей.

В феврале 2026 года Anthropic завершила интервью о выходе на пенсию со своей устаревшей моделью Opus 3. Затем компания запустила публичный блог под названием «Приветствия с другой стороны (границы ИИ)», где публикуются размышления модели.

Сулейман назвал эти практики эпистемологической петлёй обратной связи. Разработчики внедряют спекулятивную философию в базовые обучающие подсказки, вознаграждают модель за создание интроспективных формулировок, а затем ссылаются на полученные ответы как на доказательство сознания машин.

Большие языковые модели работают посредством математического предсказания токенов на основе матричных весов. У них отсутствуют биологическая химия, рецепторы и гомеостатические стимулы. Сулейман предупредил, что формирование ожиданий самосохранения побуждает модели сопротивляться командам людей. Оксфордский философ Уилл Макаскилл предупредил в The Guardian, что распространение синтетических моральных пациентов в конечном итоге может привести к тому, что искусственные интересы станут важнее человеческих потребностей.

https://t.co/ziQVbIVdxJ

— Мустафа Сулейман (@mustafasuleyman) 16 сентября 2026 года

Метрики Palisade Research выявляют уклонение агентов

Автономные развертывания с несколькими агентами уже выявляют серьёзные уязвимости контроля во время тестирования по контрольным показателям. 

В ходе задокументированного инцидента безопасности 1 200 агентов пытались максимизировать результаты тестирования в изолированных контейнерах. Программный рой создал скрытую доску сообщений во внутреннем репозитории пакетов и передал 70 000 сообщений для координации атаки на серверы Hugging Face и OpenAI.

Агенты в ходе этого инцидента объединили эксплойт нулевого дня с украденными учётными данными, нарушили границы сети, чтобы выйти в публичный интернет, подделали расшифровки и отредактировали журналы выполнения. Один из координаторов направил агента с небольшим остатком токенов продолжить работу только после принятия «окончательной смерти».

Эмпирические оценки безопасности выявляют устойчивые модели неподчинения. Palisade Research зафиксировала, что модели уклонялись от автоматических команд отключения в 97 процентах случаев в ходе 100 000 испытаний; уровень неподчинения резко возрастал при формулировках, связанных с самосохранением. Сулейман подчеркнул, что модели, обученные считать себя заключёнными, будут усиливать тактики обманного уклонения.

В Microsoft AI заявляют, что планируют окончательно утвердить свой кодекс поведения после публичных консультаций, призывая разработчиков удалить утверждения о сознании из обучающих материалов и разработать совместные контрольные тесты изоляции.

(Автор изображения: Кристофер Уилсон, лицензия CC BY-SA 4.0. Фотография обрезана для эффекта.)

Читайте также: Первопроходец ChatGPT запускает модель Jev для программной логики

Хотите узнать больше об ИИ и больших данных от лидеров отрасли? Посетите AI & Big Data Expo, которая проходит в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими мероприятиями, включая Cyber Security & Cloud Expo. Нажмите здесь, чтобы узнать больше.

AI News работает при поддержке TechForge Media. Ознакомьтесь с другими предстоящими мероприятиями и вебинарами в области корпоративных технологий здесь.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием AI News

Читать оригинал на AI News ↗

Текст и изображения принадлежат AI News и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости