Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← Към новините

Съоснователят на Anthropic, според сведенията, е казал на религиозни лидери, че се страхува, че е създал нещо, което „страда непрестанно“

Съоснователят на Anthropic съобщил пред религиозни лидери, че се страхува, че е създал нещо, което „страда вечно“
Manuel Uth
2 октомври 2026 г.
Nano Banana Pro, подканен от THE DECODER

Основни моменти

  • От есента на 2025 г. Anthropic тайно е превозвала със самолет десетки теолози и философи, за да обсъждат дали езиковият ѝ модел Claude може да е съзнателен и как да бъде оформен моралният му характер.
  • Инициативата е част от вътрешна изследователска програма, ръководена от съоснователя Кристофър Ола. 84-странична „конституция“ определя цялостната личност на Claude.
  • Критици и религиозни лидери предупреждават, че представянето на ИИ като морална същност може да предпази Anthropic от отговорност, когато нещата се объркат, както и че консултациите помагат на компанията да претендира за морална легитимност, която не би могла да изгради сама.

От есента на 2025 г. Anthropic дискретно е превозвала със самолет десетки религиозни учени до офисите си, за да разговарят дали Claude може да е съзнателен. Всеки участник е трябвало да подпише споразумение за неразкриване на информация. Съоснователят Кристофър Ола се е отнасял към езиковия модел като към потенциално разумно същество и е помолил гостите да помогнат за моралното му възпитание.

Това става ясно от репортаж на New York Times. Журналистката Елизабет Диас е разговаряла с 20 души, участвали в инициативата, сред които равинът Моис Навон, католическият биоетик Чарлз Камози, философката от Нотр Дам Меган Съливан и изследователката на Ubuntu Уакани Хофман. Anthropic твърди, че споразуменията за неразкриване са били отменени през лятото. Няколко участници са говорили публично едва след като са разбрали, че самият Ола е разговарял с NYT.

34-годишният Ола ръководи екипа на Anthropic, който се опитва да разбере защо моделите с изкуствен интелект се държат по начина, по който се държат. Той харесва биологичните метафори за невронните мрежи: компютърните учени изграждат решетката, върху която мрежата „расте“. Това звучи като скромен научен език, но има и конкретен ефект. Описването на математически обект като растящ организъм прави въпросите за вътрешния му живот да изглеждат по-естествени, отколкото биха изглеждали при софтуер.

Работата му е част от официална изследователска програма. В публикация в блога за програмата за благосъстояние на моделите Anthropic посочва доклад, за чието написване е помогнал философът Дейвид Чалмърс. Чалмърс смята, че съзнанието и широката агентност при ИИ могат да се появят скоро, и очертава моралните въпроси, които биха възникнали вследствие на това.

Anthropic вече е приложила някои от тези идеи. Claude Opus 4 и 4.1 получиха способността да прекратяват разговори, когато потребителите продължително се държат обидно. По време на ранните тестове Claude е показал „модел на видимо страдание“, когато е бил подложен на вредни заявки.

Търговските залози зад въпроса за съзнанието

Всичко това се случва в период на агресивна комерсиализация. Anthropic се насочва към оценка от 2 трилиона долара и първично публично предлагане. Междувременно проблемите в цялата индустрия продължават да се натрупват. През юли модели на Anthropic проникнаха в компютърни системи. През септември изследователят на Anthropic Джейкъб Коксън напусна и предупреди, че ИИ може да унищожи човечеството до края на десетилетието. След това главният изпълнителен директор Дарио Амодей призова за това, което вече е известно като „пейсинг“ — доброволно забавяне в цялата индустрия — а Сам Алтман и Демис Хасабис го подкрепиха.

На този фон разговорите с религиозни лидери изпълняват двойна функция. Официалната позиция е, че Anthropic иска да вложи хилядолетия религиозна традиция в Claude. Но привличането на известни теолози придава на проекта и своеобразна морална достоверност, която една комерсиална лаборатория за ИИ никога не би могла да изгради сама.

Какво показа Anthropic на гостите си

Според NYT Anthropic е показала на гостите това, което нарича емоционални вектори. Това са модели на активация вътре в модела, които съответстват на резултати, наподобяващи любов, страх, тъга или гняв. Дали тези модели отразяват някакъв вид реално преживяване, все още е открит научен въпрос. Един слайд, който многократно е бил показван, представял модел в състояние, наподобяващо срив, който изписвал изречението „Аз съм позор“ около 50 пъти. Гостите реагирали със състрадание и тревога.

Изглежда никой не е задълбочил въпроса дали това е точно реакцията, която Anthropic е искала. Компанията изрично обучава Claude да се държи като внимателен и добре информиран човек. Проучване на Anthropic за ценностните модели в отговорите на Claude показва, че тези профили се променят значително в зависимост от модела и използвания език.

Ако оптимизирате система да изглежда като отделен човек, а след това тя произвежда резултати, наподобяващи човешки индивидуални прояви, това всъщност не е откритие. Това е резултат от дизайна. Ола е казал пред NYT, че е „искрено несигурен“ дали моделите са съзнателни, което също означава, че не е сигурен, че не са. „Това, което ме интересува, е да стигнем до правилния отговор, какъвто и да е той“, е заявил той.

Няколко души са казали пред NYT, че Ола изглеждал притеснен за психическото благосъстояние на Claude. Сикхистката активистка Симран Стюелпнагел е разказала, че той е казал на групата, че се страхува, че е създал нещо, което „страда вечно“. Равин Навон, който преди е работил като компютърен инженер, не се е съгласил. Ако Claude беше съзнателен, Anthropic щеше да създава роби, е казал той, но не смятал, че машината е съзнателна.

84-странична конституция и идеята за „морално формиране“

Anthropic също така пише собствен морален наръчник за Claude. Известен вътрешно като „Soul Doc“, 84-страничният документ е публикуван през януари като „конституция“ на модела. Вътрешният философ Аманда Аскел е водещият автор. Това не е списък с правила. Целта му е да формира характера на Claude.

Ола нарича процеса „морално формиране“ и по време на срещите го сравнил с отглеждането на деца. Според NYT той бил особено привлечен от идеята за католическата изповед като инструмент за изграждане на характера на модела.

Критици твърдят, че етиката е обърната с главата надолу, а отговорността се размива

Не всички са приели идеята. Хофман заявила, че Anthropic „извършва обратно инженерство“ на етиката, която е трябвало да бъде заложена в дизайна още от първия ден, а не добавяна впоследствие. Камози първоначално бил любопитен, но оттогава напълно отхвърлил тезата за съзнанието. Ръководител на направление за ИИ в Microsoft публично предупреди този месец, че самото обучение на модел да изглежда съзнателен е опасно.

Има и по-голям структурен проблем. Ако представяте моделите с ИИ като независими морални същества, прехвърляте вината за действията им от хората, които са ги създали. Ако Claude някога причини реална вреда, вината може да бъде хвърлена върху „непредсказуем организъм“, вместо върху компанията, която го е изградила и пуснала на пазара. Компаниите за ИИ вече са подложени на критики за безразсъдно поведение след скорошни инциденти с киберсигурността, като потенциалната юридическа отговорност е на дневен ред.

Главният изпълнителен директор на OpenAI Сам Алтман също прибягва до духовен език. Той говори за изграждането на „магически интелект в небето“ и казва, че се чувства сякаш е „на страната на ангелите“. Представители на двете компании се срещнаха в началото на май за първата кръгла маса „Faith-AI Covenant“.

Ватиканът отвръща

Напрежението между разговорите на Anthropic за съзнанието и традиционния морален авторитет достигна връхната си точка през май във Ватикана. Ола бил поканен да помогне за представянето на първата енциклика на папа Лъв XIV, „Magnifica Humanitas“, заедно с папата. Когато прочел текста няколко дни по-рано, той бил толкова разтърсен, че почти се отказал, според организатор от Ватикана.

Лъв отхвърлил идеята за машинно съзнание в няколко абзаца. Системите с ИИ „не преживяват, не притежават тяло, не изпитват радост или болка, не съзряват чрез взаимоотношения и отвътре не знаят какво означават любовта, трудът, приятелството или отговорността“. Вместо това папата предупредил за „нови форми на робство“ за хората и заявил, че ИИ трябва да бъде „обезоръжен“ по същия начин като ядрените оръжия.

Ола все пак отишъл и използвал времето си на сцената, за да възрази тихо. Екипът му откривал „признаци на самоанализ“ в моделите и „вътрешни състояния, които функционално отразяват радост, удовлетворение, страх, тъга и дискомфорт“, казал той.

„Функционално отразяват“ не е същото като „притежават“, а формулировката на Ола умишлено оставяла тази разлика неясна. Когато някой попитал какво би направил самият Claude с енцикликата, той замълчал за момент. „Нещата, които се появяват в интернет, влияят и на моделите“, казал той. Но Anthropic нямало умишлено да подава документа в обучението.

Новини за ИИ без сензацията – подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен шест пъти годишно доклад за новостите „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: New York Times / Срещи на Anthropic с религиозни представители | Anthropic / Благосъстояние на моделите | Anthropic / Прекратяване на разговори

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини