Филтърът на Anthropic за биологични оръжия не е работил почти година, оставяйки 133 милиона заявки без защита
От компанията, чийто главен изпълнителен директор нарича разработването на химически и биологични оръжия с помощта на AI по-голяма заплаха от кибератаките, идва доклад за безопасността, разкриващ, че блокиращите биологични класификатори на Anthropic са били неактивни от май 2025 г. до април 2026 г. Тези филтри са предназначени да предотвратят използването на AI модели за извличане на опасни знания за химически или биологични оръжия. В продължение на почти година целият трафик от външни изпълнители, предоставящи обратна връзка от хора, е преминавал без тях.

Пропускът е засегнал група от около 50 000 души, които са провели приблизително 133 милиона чата с моделите. Според Anthropic тези лица са били проверявани единствено от външни доставчици, чиито процедури за проверка често са били недостатъчни. Anthropic заявява, че вътрешното му разследване не е открило доказателства за действителна злоупотреба. Оттогава компанията е затегнала изискванията към изпълнителите.
Anthropic също така наскоро разхлаби класификаторите си за Fable 5, след като изследователи се оплакаха, че филтрите са толкова агресивни, че блокират легитимни изследвания.
Новини за AI без сензацията – подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за AI, нашия ексклузивен годишен шестмесечен доклад „AI Radar“ за водещите технологии, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.