Изследовател от Anthropic току-що ни позволи да надникнем в самоусъвършенстващ се ИИ
Обучението на ИИ модели с други ИИ модели се превърна в много популярна цел за неолабораториите — а сега изследовател в програмата за стипендианти на Anthropic ни даде ранен поглед към това как би могло да изглежда на практика.
В петък Anthropic публикува нова статия, озаглавена „Автоматизираните изследователи могат надеждно да ограничават провалите при подравняването“, в която подробно се описва как ИИ системите могат надеждно да подобрят представянето на даден модел по набор от бенчмаркове за подравняване. Когато им бяха предоставени 10 бенчмарка за конкретни несъответстващи поведения, автоматизираните системи успяха да подобрят представянето при всеки един от тях, без да влошат цялостното представяне.
Ръководена от стипендианта на Anthropic Чън Юех-Хан, системата възпроизвежда голяма част от традиционния подход към изследванията. Всяка автоматизирана система претърсва наличната литература, предлага метод и обучава модела с помощта на този метод в продължение на 30 минути, като постепенно повишава резултата по бенчмарка през няколко итерации. Ефективните методи се запазват, а неефективните се отхвърлят, което позволява на системата да работи бързо и в голям мащаб.
„Като цяло тези резултати предоставят ранни доказателства, че автоматизираното последващо обучение за подравняване може да стане практично в близко бъдеще“, се казва в статията.
Статията е стъпка към рекурсивното самоусъвършенстване, което мнозина виждат като следващата значима стъпка в развитието на ИИ. Ако моделите могат да подобряват собственото си обучение за подравняване, напълно възможно е те да подобрят и практиките за обучение в по-широк план — в който момент човешките изследователи на ИИ скоро може да станат излишни.
Статията не избягва разглеждането на тази идея и изрично сравнява Automated Alignment Researcher (AAR) с човешкия му еквивалент. „Най-добрият метод на AAR превъзхожда това, което опитни хора предлагат, средно в рамките на шест часа“, се казва в статията. „Насоките за изследвания, зададени от хора, не водят до по-добро представяне.“
Има дори сравнение на разходите, в случай че някой все още не е убеден. „AAR струва приблизително 4 долара на час за инференция чрез API, в сравнение със 150-те долара на час, които плащаме на нашите човешки изследователи.“
За да бъдем справедливи, статията посочва и няколко ограничения на този подход. Автоматизираната система работи само доколкото бенчмарковете отразяват действителните цели на подравняването, а дори и тогава предстои значителна работа по създаването и поддържането на тези бенчмаркове — да не говорим за поддържането и разширяването на литературата, от която черпят автоматизираните изследователи.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.