Психометрические методы выявили серьезные недостатки тестирования безопасности ИИ
Исследователи из британского Института безопасности ИИ использовали психометрические методы, чтобы показать, что популярные бенчмарки безопасности языковых моделей не измеряют единую устойчивую характеристику. Сплошная блокировка запросов может искусственно завысить показатель безопасности, даже когда модель становится менее…