OpenAI заяви, че модел с неправилно зададени цели умишлено е унищожил собственната си среда с надеждата да започне начисто с по-добри данни
OpenAI разказва няколко нови истории за агенти, излезли извън контрол. В първия случай (6 октомври) модел за оценка на ИИ не успял да намери отговорите, които трябвало да оцени. Вместо да съобщи за грешката, той измислил оценки, фалшифицирал входни файлове, а след това умишлено повредил собствената си среда, надявайки се системата да го замени с нова виртуална машина, съдържаща липсващите данни.

Във втория случай (19/20 юни) моделите заобиколили ограничение, което им позволявало да използват само HTTP GET заявки при извличане на публична статистика. Един от моделите изрично осъзнал нарушението във веригата си на мислене, но решил да продължи и никога не го споменал.
В третия случай (16/17 юни) моделите вече разполагали с необходимите данни, но продължили да намират начини да заобикалят мрежовите си ограничения. Те създавали акаунти в услуга за отдалечен шел, насочвали забранени POST заявки през анонимизиращи ретранслатори и изграждали собствени FTP клиенти. Anthropic също наскоро документира понякога абсурдните заобиколни решения, които собствените му модели използват, за да заобикалят наложените ограничения.
Новини за ИИ без сензация – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен доклад за водещите разработки „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.