Дослідник Anthropic щойно дозволив нам зазирнути в самовдосконалюваний ШІ
Навчання моделей ШІ за допомогою інших моделей ШІ стало дуже популярною метою для неолабораторій — і тепер дослідник із програми стипендіатів Anthropic дав нам змогу побачити, як це може виглядати на практиці.
У п’ятницю Anthropic опублікувала нову статтю під назвою «Автоматизовані дослідники можуть надійно пом’якшувати проблеми узгодження», у якій детально описано, як системи ШІ можуть надійно підвищувати продуктивність моделі за набором тестів на узгодження. Коли автоматизованим системам надали 10 тестів для конкретних неузгоджених видів поведінки, вони змогли покращити результати за кожним із них, не погіршуючи загальну продуктивність.
Система, розроблена під керівництвом стипендіата Anthropic Чень Юеханя, значною мірою відтворює традиційний підхід до досліджень. Кожна автоматизована система шукає доступну літературу, пропонує метод і навчає модель за допомогою цього методу протягом 30 хвилин, поступово підвищуючи результат за тестом упродовж кількох ітерацій. Ефективні методи зберігаються, а неефективні відкидаються, завдяки чому система може працювати швидко й у великих масштабах.
«Загалом ці результати є першими доказами того, що автоматизоване постнавчання для узгодження може стати практичним у найближчій перспективі», — йдеться у статті.
Стаття є кроком на шляху до рекурсивного самовдосконалення, яке багато хто вважає наступним значним етапом розвитку ШІ. Якщо моделі можуть покращувати власне навчання узгодженню, цілком імовірно, що вони зможуть ширше вдосконалювати методи навчання — і тоді дослідники ШІ-люди незабаром можуть стати непотрібними.
У статті не уникають цієї ідеї, прямо порівнюючи Automated Alignment Researcher (AAR) з її людським еквівалентом. «Найкращий метод AAR у середньому перевершує те, що пропонують досвідчені люди, уже протягом шести годин», — йдеться у статті. «Напрями досліджень, запропоновані людьми, не приводять до кращих результатів».
Є навіть порівняння вартості — на випадок, якщо когось це не переконало. «AAR коштує приблизно 4 долари за годину API-інференсу, тоді як ми платимо нашим людям-дослідникам 150 доларів за годину».
Заради справедливості, у статті також зазначено кілька обмежень цього підходу. Автоматизована система працює лише тією мірою, якою тести відображають реальні цілі узгодження, і навіть у такому разі ще належить виконати значний обсяг роботи для створення й підтримання цих тестів — не кажучи вже про підтримання та розширення літератури, на основі якої працюють автоматизовані дослідники.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.