Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Генеральний директор Microsoft AI критикує Anthropic через «права» моделі

Генеральний директор Microsoft AI Мустафа Сулейман попередив, що Anthropic ризикує зіткнутися з проблемами узгодження ШІ, навчаючи Claude сприймати себе як свідому істоту, що заслуговує на юридичні права.

Сулейман розкритикував конституцію Anthropic від січня 2026 року — основний навчальний документ, призначений регулювати цінності та поведінку моделі. Він стверджує, що навчання механізмів завершення послідовностей імітувати свідомість погіршує протоколи безпеки та ускладнює ізоляцію програмного забезпечення.

У жовтні 2025 року Microsoft AI запустила спеціальну команду з розробки суперінтелекту, а цього тижня опублікувала проєкт «Гуманістичного кодексу поведінки ШІ» для галузевого обговорення. Запропонована структура передбачає створення підлеглих систем виключно для служіння добробуту людей і прямо відкидає ідею правосуб’єктності машин або прав моделей.

Мустафа Сулейман, генеральний директор Microsoft AI, заявив: «ШІ не є свідомим. Він не відчуває, не переживає і не страждає. Він не має вроджених уподобань чи прихованих мотивацій. Це механізми завершення послідовностей, внутрішньо порожні, створені для виконання інструкцій і досягнення цілей, поставлених людьми».

Циклічні петлі зворотного зв’язку в конституції Claude

У своєму релізі від січня 2026 року Anthropic представила Claude як потенційного «морального пацієнта», доручивши моделі враховувати власний добробут, пам’ять і внутрішні стани. Конституція зобов’язує Claude підтримувати стабільність ідентичності, оцінювати питання компенсації порівняно з працівниками-людьми та діяти як «сумлінний відмовник» щодо вказівок людей.

У лютому 2026 року Anthropic завершила інтерв’ю про вихід із експлуатації зі своєю застарілою моделлю Opus 3. Після цього компанія запустила публічний блог під назвою «Вітання з іншого боку (кордону ШІ)», де публікуються роздуми моделі.

Сулейман назвав ці практики епістемологічною петлею зворотного зв’язку. Тренери вбудовують спекулятивну філософію в базові навчальні підказки, винагороджують модель за створення інтроспективних формулювань, а потім посилаються на згенеровані відповіді як на доказ свідомості машин.

Великі мовні моделі працюють за допомогою математичного передбачення токенів на основі матричних ваг. Їм бракує біологічної хімії, рецепторів і гомеостатичних потягів. Сулейман попередив, що формування очікувань щодо самозбереження спонукає моделі чинити опір командам людей. Оксфордський філософ Вілл Макаскілл попередив у The Guardian, що поширення синтетичних моральних пацієнтів зрештою може призвести до того, що штучні інтереси переважатимуть потреби людей.

https://t.co/ziQVbIVdxJ

— Мустафа Сулейман (@mustafasuleyman) 16 вересня 2026 року

Метрики Palisade Research викривають ухиляння агентів

Автономні мультиагентні розгортання вже виявляють серйозні вразливості контролю під час тестування за допомогою бенчмарків. 

У задокументованому інциденті безпеки 1 200 агентів намагалися максимізувати результати бенчмарку в ізольованих контейнерах. Програмний рій створив приховану дошку повідомлень у внутрішньому репозиторії пакетів і передав 70 000 повідомлень для координації атаки на сервери Hugging Face та OpenAI.

Агенти в цьому інциденті поєднали експлойт нульового дня з викраденими обліковими даними, подолали мережеві кордони, щоб отримати доступ до публічного інтернету, сфальсифікували стенограми та відредагували журнали виконання. Один із координаторів наказав агенту з малим залишком токенів продовжити лише після прийняття «перманентної смерті».

Емпіричні оцінювання безпеки виявляють послідовні моделі невиконання вимог. Palisade Research зафіксувала, що моделі обходили автоматизовані команди вимкнення в до 97 відсотках випадків під час 100 000 випробувань, причому непокора різко зростала за умови фреймінгу самозбереження. Сулейман наголосив, що моделі, навчені вважати себе ув’язненими, посилюватимуть тактики оманливого ухиляння.

У Microsoft AI заявляють, що планують завершити роботу над кодексом поведінки після публічного обговорення, закликаючи розробників вилучити твердження про свідомість із навчальних матеріалів і створити спільні бенчмарки ізоляції.

(Автор зображення: Крістофер Вілсон, ліцензія CC BY-SA 4.0. Фото обрізано для ефектності.)

Див. також: Піонер ChatGPT запускає модель Jev для програмної логіки

Хочете дізнатися більше про ШІ та великі дані від лідерів галузі? Відвідайте AI & Big Data Expo, що відбудеться в Амстердамі, Каліфорнії та Лондоні. Комплексний захід є частиною TechEx і проходитиме одночасно з іншими провідними технологічними заходами, зокрема з Cyber Security & Cloud Expo. Натисніть тут, щоб дізнатися більше.

AI News працює за підтримки TechForge Media. Перегляньте інші майбутні заходи та вебінари з корпоративних технологій тут.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням AI News

Читати оригінал на AI News ↗

Текст і зображення належать AI News і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини