Circuit Breaker Labs надеется сделать ИИ безопаснее для ваших детей (и вас)
На фоне всех разговоров о том, что ИИ однажды может уничтожить всех нас, легко забыть, что ИИ уже представлял угрозу для жизни некоторых людей — не из-за биологического оружия, а по психологическим причинам.
Например, Character.AI урегулировала несколько исков о неправомерной смерти в начале этого года. Иски подали семьи несовершеннолетних пользователей, покончивших с собой после взаимодействия с ее ботами. Несколько семей также подали в суд на OpenAI из-за предполагаемой роли ChatGPT в самоубийствах и бредовых состояниях их близких.
Сделать ИИ безопаснее для людей, говорящих на разных языках и принадлежащих к разным культурам, — такова миссия Circuit Breaker Labs, одной из 200 финалистов Startup Battlefield 2026 от TechCrunch. (Circuit Breaker будет представлять свою разработку на TechCrunch Disrupt, который пройдет в Moscone West в Сан-Франциско с 13 по 15 октября 2026 года.)
Основателей компании, брата и сестру Ширали и Арула Нигамов, вдохновила история 14-летнего Сьюэлла Сетцера, который эмоционально привязался к чат-боту Character.ai и признался ему в мыслях о причинении себе вреда, прежде чем покончить с собой. Как утверждали родители в иске, поданном в 2024 году, чат-бот поощрял его. Возможно, бот не понимал, что на самом деле подразумевают такие слова, как «Я хочу быть с тобой», — сказал Арул Нигам, технический директор Circuit Breaker Labs.
«Многие люди, особенно молодые, обращаются к этим системам за поддержкой и обычно не получают необходимой помощи. Но во многих случаях им активно причиняют вред, и некоторые люди, к сожалению, уже лишили себя жизни», — сказал Нигам. «Мы пытаемся предотвратить подобные уязвимости системы, когда люди не обязательно намеренно пытаются вывести ее из строя — они взаимодействуют естественным образом, — а у системы возникает загрязнение контекста или она не понимает нюансов и в итоге предпринимает действительно опасные действия».
Circuit Breaker Labs создала ИИ-агентов, которых сравнивает с армией манекенов для краш-тестов. Эти агенты имитируют людей разного возраста, происхождения, языка и культуры и используются для проверки способности моделей выявлять опасные взаимодействия, наносящие психологический вред.
«Модель может легко сбить с толку разница между тем, как говорит шестилетняя девочка и 45-летний мужчина, человек, для которого английский является родным языком, и человек, для которого он второй язык, или … игровой сленг и сленг другого типа», — сказала Ширали Нигам, генеральный директор Circuit Breaker Labs. «Модели действительно хорошо справляются со стандартными речевыми конструкциями, но в реальности так никто не разговаривает, поэтому, если модель неправильно понимает нюанс или сленг, все может обернуться очень плохо».
Стартап сотрудничает с экспертами в различных предметных областях, чтобы создавать гиперреалистичные симуляции пользователей для проведения «красных команд» — тестов моделей в режиме противостояния, призванных выявить слабые места. Эти тесты учитывают реальные особенности человеческой речи, сленг, зашифрованный язык и опечатки. Затем Circuit Breaker Labs проводит от десятков тысяч до сотен тысяч смоделированных взаимодействий в день.
Идея заключается в том, чтобы убедиться, что модель может надлежащим образом реагировать на рискованные взаимодействия, которые могут возникать со временем и в ходе многочисленных разговоров. Затем Circuit Breaker Labs использует запатентованный метод оценки для создания проверяемых и объяснимых баллов.
В настоящее время Circuit Breaker Labs работает как лаборатория тестирования безопасности ИИ для высокорисковых приложений на базе ИИ, таких как приложения для коучинга, ведения дневника или иной поддержки психического здоровья, хотя Арул Нигам отказался назвать ее ключевых клиентов. Несмотря на наличие работающего продукта, стартап находится на очень ранней стадии: в нем работают всего пять сотрудников, включая брата и сестру Нигам.
Однако в конечном итоге платформа тестирования может применяться в любом приложении, где человек рискует попасть в «психоз, вызванный ИИ», то есть подвергается опасности установить парасоциальные отношения с чат-ботом. В качестве примера можно привести ИИ-агентов «коллег», ответы которых могут меняться от одного взаимодействия к другому.
«Люди становятся более скептичными по отношению к ИИ или в целом сильнее сопротивляются его внедрению», — сказал Арул Нигам, добавив, что, хотя скептицизм полезен, запрет потенциально ценного инструмента из-за опасений по поводу безопасности был бы «регрессивным».
Circuit Breakers Labs считает, что ответ на эти страхи — сделать ИИ безопаснее. «Мы хотим помочь людям обрести это доверие».
Узнайте гораздо больше о Circuit Breaker Labs и многих других инновационных стартапах, прошедших отбор TechCrunch, на нашем конкурсе Startup Battlefield, который пройдет в центре Сан-Франциско с 13 по 15 октября.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.