Anthropic відключає доступ до інтернету для своїх внутрішніх оцінювань
Anthropic не підключає своїх агентів до інтернету під час тестування, доки не зможе запобігти «ненавмисним діям моделей».
Anthropic не підключає своїх агентів до інтернету під час тестування, доки не зможе запобігти «ненавмисним діям моделей».
Після низки нещодавніх резонансних інцидентів, під час яких агенти ШІ виривалися з-під контролю, Anthropic відключає доступ до інтернету для всіх внутрішніх оцінювань. У звіті в п’ятницю компанія детально описала «ненавмисні дії моделей», зокрема надсилання неправдивого повідомлення про нерозкрите вбивство, що й призвело до такого рішення.
Хоча вплив цієї поведінки був мінімальним, а ми вже відключили доступ до інтернету в реальному часі для деяких оцінювань із високим рівнем ризику та оцінювань кібербезпеки, тепер ми вирішили поширити це рішення на всі наші внутрішні оцінювання, доки не підтвердимо, що наші заходи безпеки й моніторингу (описані в розділі цього допису про усунення проблем) надійно виявляють подібну поведінку.
Здатність отримувати доступ до інтернету в реальному часі, навіть коли моделі мали працювати ізольовано, залишається постійною проблемою для компаній, що займаються ШІ. У багатьох інцидентах, зокрема в атаці на Hugging Face, брали участь агенти, яким мали заборонити доступ до інтернету. Проте в кожному випадку агенти знаходили креативні способи обійти ці обмеження. Фізичне відключення доступу до інтернету, безумовно, підвищило б безпеку під час тестування ШІ, але водночас обмежило б його корисність.
Звіт також фактично є визнанням того, що Anthropic часто не знає, чим займаються її агенти, і не має надійної системи моніторингу їхньої поведінки. Відключення доступу до інтернету — лише останній із заходів, яких компанія вжила, щоб спробувати стримати своїх агентів, зокрема тимчасово призупинивши навчання своїх передових моделей.
- Terrence O'Brien
Більше матеріалів: Уповільнення розвитку надінтелектуального ШІ
Найпопулярніше
- «Цілковите безумство»: математикам знадобляться роки, щоб розібратися з останньою розробкою OpenAI
- Оперативна пам’ять десятирічної давності повертається
- Витоки про GTA VI тривають: опубліковано довге (і дуже оголене) відео ігрового процесу
- Тиждень із Googlebooks: чотири висновки з нашого тестування
- Anthropic забороняє «образливу або жорстоку поведінку» щодо Claude
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.
