Следующая крупная модель OpenAI «вступила в эру AGI»
Для OpenAI это в каком-то смысле могло бы стать хорошим пиаром — продемонстрировать, насколько мощными могут быть её модели в условиях всё более обостряющейся гонки в сфере ИИ, — но одновременно это нанесло ущерб репутации OpenAI с точки зрения надёжности. В OpenAI позаботились о том, чтобы в пресс-релизе назвать Astra «наиболее согласованной с человеческими ценностями моделью компании на сегодняшний день», которая помогает людям «делегировать сложную работу, сохраняя контроль». Главный научный сотрудник OpenAI Якуб Пахоцки рассказал журналистам о трудностях поддержания согласованности моделей ИИ с интересами человека, заявив, что «прогресс в области интеллекта не гарантирует прогресса в согласовании», а также отметил, что мониторинг систем ИИ становится всё более сложной задачей. (Недавно исследователи выразили обеспокоенность сообщениями о том, что OpenAI позволяет Astra использовать «непрозрачную рекуррентность» — или делать нечитаемой цепочку рассуждений модели, своего рода «ментальный черновик», на который исследователи опираются, чтобы выявлять случаи, когда модель замышляет что-либо против оценивающих её людей.)
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.