Новая техника рассуждений OpenAI тревожит экспертов по безопасности ИИ
Новая модель OpenAI Astra будет использовать метод рассуждения, называемый «рекуррентной глубиной», который позволяет ей работать за пределами последовательного мышления, характерного для большинства моделей рассуждения, сообщило во вторник издание The Information. Этот метод, также называемый «непрозрачной рекурсией», вероятно, усложнит мониторинг цепочки рассуждений модели — и это встревожило экспертов по безопасности ИИ.
Хотя, как сообщается, использование этого метода в Astra ограничено, его появление всё же вызвало серьёзные опасения среди экспертов по безопасности ИИ.
«Я чрезвычайно обеспокоен сообщениями о том, что Astra использует непрозрачную рекурсию», — написал в публикации после появления новости генеральный директор Redwood Бак Шлегерис. «Я не знаю, насколько Astra хуже поддаётся мониторингу CoT по сравнению с предыдущими моделями. Но если OpenAI продолжит развивать этот метод, у компании появится возможность значительно увеличить рекурсию и полностью уничтожить возможность мониторинга CoT».
Давний сторонник безопасности ИИ Зви Моушовиц также высказался, написав, что для предотвращения «гонки на выживание» между ИИ-лабораториями могут потребоваться законы.
«Этот метод играет с огнём, подвергая риску табу, которое OpenAI и Anthropic боролись за установление и которое мы усердно поддерживаем: насколько это возможно, сохранять достоверность и возможность мониторинга цепочки рассуждений, — написал Моушовиц. — Более интенсивное использование подобных методов, вероятно, ухудшит возможность мониторинга».
В обычных обстоятельствах цепочка рассуждений модели, способной к рассуждению, отражает последовательные шаги, которые модель предпринимает при попытке решить задачу. Хотя это представление несовершенно, оно всё же служит ценным инструментом для мониторинга некорректного поведения или рассогласования. В случае недавней активности автономных агентов OpenAI записи цепочки рассуждений стали важным инструментом, позволившим понять, почему агенты вели себя именно так.
При непрозрачной рекурсии модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. В результате остаётся меньше понятных следов, что фактически позволяет обойти традиционную запись цепочки рассуждений.
Важно, что использование этого метода в Astra, по-видимому, ограничено. Ожидается, что цепочка рассуждений модели по-прежнему будет понятной, а компания отвергла любые предположения о том, что она перейдёт на «нейролез». OpenAI уже объявила о планах создать масштабные системы мониторинга цепочки рассуждений в рамках своих перспективных планов по безопасности.
В публикации на X главный научный сотрудник OpenAI Якуб Пачоцкий подчеркнул приверженность лаборатории понятным цепочкам рассуждений. «OpenAI работает над сохранением и использованием мониторинга цепочки рассуждений с момента появления наших первых моделей рассуждения, — написал Пачоцкий. — Это ключевая цель нашей текущей исследовательской программы.
Все модели ИИ в некоторой степени используют непрозрачные рассуждения, и немногие исследователи считают журналы цепочек рассуждений прямым отображением рассуждений модели. Тем не менее эти оговорки не снимают опасений, что непрозрачная рекурсия может затруднить мониторинг рассуждений ИИ, особенно по мере расширения её использования в различных моделях. В последующем материале, опубликованном утром в среду, The Information сообщило, что Anthropic и Google DeepMind уже обсуждали этот метод.
В публикации, посвящённой этой новости, главный научный сотрудник Redwood Research Райан Гринблатт заявил, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем традиционные рассуждения с использованием цепочки мыслей, фактически убирая все рассуждения из видимых каналов.
«Больше всего меня беспокоит, что естественное развитие событий отсюда может привести к масштабированию непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в латентном пространстве, — написал Гринблатт. — Надеюсь, ещё не слишком поздно избежать наиболее опасных архитектур и что OpenAI остановится на этом».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.