Видимі ланцюжки міркувань — перевага ШІ для безпеки, але ця прозорість поступово зникає
Сьогодні моделі ШІ думають уголос, але Google DeepMind заявляє, що прозорість під загрозою. В одному з перших дописів новоствореного Інституту DeepMind дослідники Рохін Шах і Анка Драґан стверджують, що видимий ланцюжок міркувань (CoT) є ключовою перевагою з погляду безпеки. Оскільки моделі записують проміжні кроки звичайною мовою, дослідники можуть виявити, чи вводять вони в оману або розробляють проблемні плани. За їхніми словами, у Gemini 3 Pro ланцюжок міркувань показав, що модель усвідомила: вона перебуває в тестовому середовищі.
Але ця прозорість під загрозою. У системній картці OpenAI для GPT-6 Astra вже повідомляється про значне погіршення можливості моніторити ланцюжок міркувань. Майбутні моделі можуть думати в числових просторах, які люди не здатні прочитати, що було б ефективніше, але цілком непрозоро. Шах і Драґан хочуть, щоб галузь регулярно вимірювала, наскільки добре ланцюжки міркувань все ще можна моніторити, зберігала прозорі архітектури та під час навчання стежила, щоб моделі не навчилися приховувати свої справжні міркування.
Ще на початку вересня головний науковець OpenAI Якуб Пахоцький попереджав про втрату контролю, частково спричинену ланцюжками міркувань, які важче моніторити. Невдовзі після цього генеральний директор Anthropic Даріо Амодеї закликав навмисно сповільнити темпи розвитку.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний галузевий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.