Исследователь Anthropic только что позволил нам заглянуть в самосовершенствующийся ИИ
Обучение моделей ИИ с помощью других моделей ИИ стало очень популярной целью для неолабораторий — и теперь исследователь из программы стипендиатов Anthropic впервые показал, как это может выглядеть на практике.
В пятницу Anthropic опубликовала новую статью под названием «Автоматизированные исследователи могут надёжно устранять сбои согласования», в которой подробно описывается, как системы ИИ могут надёжно повышать эффективность модели по набору тестов на согласование. Получив 10 тестов для конкретных несогласованных моделей поведения, автоматизированные системы смогли улучшить результаты по каждому из них, не снижая общую производительность.
Система, разработанная под руководством стипендиата Anthropic Чэнь Юэ-Ханя, во многом воспроизводит традиционный исследовательский подход. Каждая автоматизированная система изучает доступную литературу, предлагает метод и обучает модель с его помощью в течение 30 минут, постепенно повышая результаты теста за несколько итераций. Эффективные методы сохраняются, а неэффективные отбрасываются, что позволяет системе работать быстро и в больших масштабах.
«В целом эти результаты служат предварительным свидетельством того, что автоматизированное постобучение для согласования может стать практически применимым в ближайшем будущем», — говорится в статье.
Статья представляет собой шаг к рекурсивному самоулучшению, которое многие считают следующим значительным этапом развития ИИ. Если модели смогут самостоятельно совершенствовать обучение согласованию, вполне вероятно, что они смогут шире улучшать и методы обучения — и тогда исследователи ИИ из числа людей вскоре могут стать ненужными.
Авторы статьи не избегают этой идеи и прямо сравнивают Automated Alignment Researcher (AAR) с его человеческим аналогом. «Лучший метод AAR превосходит предложения опытных людей в среднем уже через шесть часов», — говорится в статье. «Направления исследований, заданные людьми, не приводят к более высокой эффективности».
Приводится даже сравнение стоимости — на случай, если кого-то это ещё не убедило. «Час работы AAR обходится примерно в 4 доллара за API-инференс, тогда как мы платим нашим исследователям-людям 150 долларов в час».
Справедливости ради, в статье также отмечаются несколько ограничений такого подхода. Автоматизированная система работает лишь в той мере, в какой тесты отражают реальные цели согласования, и даже в этом случае предстоит проделать значительную работу по созданию и поддержанию этих тестов — не говоря уже о поддержании и расширении библиотеки, на основе которой работают автоматизированные исследователи.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.