Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Anthropic и OpenAI хотят разместить оценщиков безопасности. Действительно ли они будут независимыми?

В пространном эссе, опубликованном на выходных, генеральный директор Anthropic Дарио Амодеи выступил с предложением, которое ещё год назад индустрия ИИ отвергла бы мгновенно: внедрить сторонних оценщиков во все компании, разрабатывающие передовые ИИ-системы, предоставив им право сообщать об инцидентах, связанных с безопасностью, оценивать, действительно ли модели ИИ соответствуют заявленным целям, и делиться своими неприукрашенными выводами с общественностью. 

Амодеи заявил, что Anthropic готова предоставить независимым оценщикам, таким как METR и Redwood Research, беспрецедентный доступ к системам компании. Генеральный директор OpenAI Сэм Альтман заявил, что OpenAI также готова взять на себя такие обязательства, что может означать глубокие изменения в том, как индустрия взаимодействует с внешними исследовательскими группами.

Сторонние оценщики, поговорившие с TechCrunch, в целом приветствовали это предложение, но отметили, что детали ещё необходимо проработать — и в идеале закрепить законодательно, — чтобы понять, будут ли они действовать как действительно независимые контролёры или как подрядчики, работающие на условиях ИИ-компаний. 

Более глубокий доступ становится всё важнее по мере того, как модели учатся лучше распознавать моменты, когда их оценивают, что повышает риск их хорошего поведения во время тестирования при одновременном сокрытии проблемного поведения. Исследователи говорят, что признаки такого поведения можно не заметить при тестировании готовой модели, но обнаружить, изучая, как она вела себя на протяжении всего обучения. 

«ИИ-компании должны быть способны ответить на несколько очень простых вопросов о процессе обучения, например: пыталась ли ИИ-система активно подорвать собственное обучение согласованности, пока проходила это обучение?» — рассказал TechCrunch Александр Майнке, руководитель исследовательского направления Apollo Research. «Ответ на этот вопрос должен быть однозначно отрицательным, но сейчас мы полностью полагаемся на ИИ-компании, которые должны и тщательно проверить это сами, и правдиво сообщить об этом общественности. А недавние инциденты показали, что по умолчанию они не делают ни того, ни другого. В качестве внедрённых оценщиков мы действительно могли бы это проверить».

Исторически ИИ-компании привлекали внешних проверяющих для тестирования готовых моделей незадолго до их выпуска. Теперь оценщики, с которыми поговорил TechCrunch, предлагают предоставить им доступ не только к финальной модели, но и к промежуточным версиям, или «контрольным точкам», на протяжении всего цикла её обучения. Адам Глив, генеральный директор Far.AI, заявил, что оценщики могли бы сравнивать эти контрольные точки, чтобы определить, когда появилось вызывающее обеспокоенность поведение, изучать среду посттренировочного обучения, в которой модели получают вознаграждение за определённые действия, а также проверять стенограммы оценок и журналы, чтобы удостовериться в достоверности заявлений компании о работе модели. 

Неясно, планируют ли Anthropic и OpenAI предоставлять такой доступ и когда именно. Несмотря на неоднократные вопросы TechCrunch, ни одна из компаний не сообщила, с какими оценщиками будет работать, когда они будут внедрены, сколько их будет, к каким именно системам и данным они получат доступ и какую информацию можно будет раскрывать общественности.

Такой доступ к внутреннему устройству систем важен, поскольку модели, успешно проходящие тесты на безопасность, необязательно безопасны, если они специально научились проходить такие тесты. Стайдли привёл в пример «тест на сопротивление отключению», который измеряет, будет ли ИИ сопротивляться отключению в определённых обстоятельствах.

«Крайне важно знать, обучался ли ИИ специально для успешного прохождения этого теста», — сказал Стайдли, сравнив ситуацию со скандалом Dieselgate у Volkswagen, когда автомобили программировали распознавать тесты на выбросы и вести себя иначе в условиях проверки.

Глив отметил, что значимый доступ может выходить за рамки самих моделей: оценщикам могут предоставить возможность опрашивать сотрудников, чтобы проверить, соответствуют ли документация компании и публичные описания её практик безопасности тому, что происходило внутри организации. 

Амодеи действительно изложил достаточно комплексное предложение, которое может предоставить оценщикам тот доступ, который они считают необходимым, включая право «публиковать ключевые выводы об уровнях риска, инцидентах, практиках, а также о предоставленном или непредоставленном им доступе — без редакционного контроля со стороны Anthropic».

Однако оценщики говорят, что такая система будет работать только в том случае, если ИИ-компании действительно готовы отказаться от контроля над процессом. Предыдущие попытки провести независимые оценки показывают, что добиться такого отказа будет непросто: третьи стороны часто сталкивались с разногласиями по поводу доступа, сроков, конфиденциальности и того, что им разрешено публично сообщать.

Глив заявил, что Far.AI пришлось отклонить контракты с несколькими разработчиками передовых моделей, которые хотели получить слишком большой контроль над процессом оценки, поставив под угрозу независимость компании. По его словам, по умолчанию к оценщикам относятся как к обычным подрядчикам: их связывают ограничительные соглашения о неразглашении и договоры, предоставляющие разработчикам значительный контроль над тем, что в конечном итоге можно опубликовать.

Ограниченные сроки

Возникает также вопрос, получат ли проверяющие достаточно времени и доступа для выполнения поставленной перед ними работы. При расследовании инцидента с Hugging Face компания OpenAI предоставила METR и Redwood примерно неделю доступа к своим объектам, и впоследствии обе организации заявили, что не смогли сделать уверенные выводы, отчасти из-за ограничений по масштабу и срокам. 

Аналогичная проблема возникла во время предрелизного тестирования GPT-6 Astra, которую OpenAI называет своей самой согласованной моделью. Согласно вкладу Apollo Research в описание модели, компании предоставили всего три дня на тестирование Astra, что затруднило формулирование окончательных выводов.

«Apollo считает, что с учётом более высокой способности модели распознавать оценивание и ограниченного окна для оценки низкая частота нарушений в данном случае не даёт существенных доказательств согласованности или несогласованности модели», — написала компания в своём отчёте об оценке. 

Такая практика оставляет перед оценщиками простой вопрос: почему на этот раз всё должно быть иначе? 

«Безусловно, возможно, что Дарио и Сэм просто изменили своё мнение и теперь будут очень открытыми, — сказал Глив. — Но интеллектуальная собственность этих компаний имеет для них невероятную ценность, и, думаю, по умолчанию они будут очень осторожны в том, чем можно делиться». 

Несколько исследователей, поговоривших с TechCrunch, призвали создать прозрачную систему правил, с которой все они публично согласились бы. По словам Джона Стайдли, руководителя стратегического направления Palisades Research, частью этой системы должны стать стандарты, определяющие, на каких аудиторов компании могут полагаться, чтобы они не пытались обойти проблему, выбирая оценщиков, которые либо недостаточно квалифицированы, либо не заинтересованы в оценке наиболее тревожных рисков. 

Генри Пападатос, исполнительный директор Safer AI, говорит, что проблема даже при наличии публичной системы правил заключается в том, что добровольные меры всегда зависят от доброй воли компании. 

«В идеале у нас должно быть разумное регулирование, обязывающее компании делать это… потому что тогда компании не смогут передумать завтра, если столкнутся с крупным PR-кризисом», — сказал Пападатос TechCrunch, отметив, что это также хороший способ заставить все компании соблюдать правила, а не только наиболее склонные к этому. 

Согласились не все. Пока Meta, SpaceXAI и Google DeepMind не взяли на себя обязательства внедрить сторонних оценщиков, хотя генеральный директор DeepMind Демис Хассабис предложил создать отдельный отраслевой орган по стандартизации для независимого тестирования передовых моделей. Google, OpenAI и Anthropic также несколько недель в частном порядке обсуждают планы по безопасности ИИ. 

Некоторые законы, связанные с идеей сторонних оценщиков, уже формируются. Закон SB 53 в Калифорнии, подписанный в прошлом году, обязывает крупных разработчиков передовых ИИ-систем публиковать рамочные документы по безопасности и сообщать о критических инцидентах. Новый закон SB 813, подписанный в этом месяце, создаёт систему признанных штатом «независимых организаций по проверке», обладающих опытом оценки рисков ИИ. 

В Европе Закон ЕС об искусственном интеллекте требует от разработчиков передовых систем проводить и документировать оценку моделей и состязательное тестирование, а также сообщать о серьёзных инцидентах. Бюро ЕС по ИИ также может проводить собственные оценки и назначать независимых экспертов. 

Пока законодательство остаётся менее масштабным, чем предложение Амодеи, оставляя передовым лабораториям в основном право самостоятельно решать, насколько тщательному независимому контролю они готовы подвергнуться. Пападатос заявил, что добровольное саморегулирование лучше, чем ничего, но в конечном счёте компании не могут требовать свободы контролировать собственные правила безопасности и одновременно просить общественность верить, что они их соблюдают. 

«Нельзя усидеть на двух стульях: полностью отказаться от внешней подотчётности, а затем сказать: “Я просто установлю свои гибкие правила”», — сказал Пападатос.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости