Главният изпълнителен директор на Microsoft AI заяви, че заплахите от ИИ са реални, а Anthropic влошава ситуацията
Днес разговарям с Мустафа Сюлейман, главен изпълнителен директор на Microsoft AI. Както несъмнено знаете, най-голямата история в технологиите в момента е разрастващият се дебат за безопасността и регулирането на изкуствения интелект.
Не е изненадващо, че Мустафа има силни възгледи за това как трябва да се изгражда и регулира ИИ. Microsoft току-що публикува документ от 37 страници, наречен „Кодекс за хуманистичен ИИ“, който излага принципите на компанията за разработването на ИИ и дори философията ѝ по наистина сложни въпроси като съзнанието на ИИ.
Ако си спомняте от последното му участие в предаването, Мустафа смята, че компании като Anthropic са се объркали сериозно по отношение на концепцията за така нареченото благосъстояние на моделите, и то по доста опасни начини. Тази седмица той дори публикува придружаващо есе, в което конкретно критикува философията на Anthropic за съзнанието на ИИ и начина, по който според него тя се вписва в по-широкия дебат за подравняването.
Затова наистина исках да поговоря с Мустафа за това кое според него е реално и кое не в безопасността на ИИ, дали самата концепция за подравняване е способна да се справи със задачата и дали тази индустрия трябва да забави темпото, преди да ни убие всички. Освен това: Защо индустрията на ИИ просто… не прави всичко това още сега? Винаги ми е било приятно да навлизам в детайлите с Мустафа, а той с готовност направи същото и тук.
Добре. Мустафа Сюлейман, главният изпълнителен директор на Microsoft AI, за бъдещето на регулирането на ИИ. Да започваме.
Това интервю е леко редактирано за дължина и яснота.
Мустафа Сюлейман, вие сте главен изпълнителен директор на Microsoft AI. Добре дошли отново в Decoder.
Радвам се да ви видя, Нилай. Благодаря, че отново ме поканихте.
Радвам се да ви видя. Много съм развълнуван да поговорим за това какво, за бога, се случва в дебата за безопасността и регулирането на ИИ. Току-що публикувахте много дълъг и подробен документ, в който излагате вашите принципи, принципите на Microsoft, за това, което наричате „хуманистичен ИИ“.
В него има много идеи, които искам да разгледаме. Колкото повече мисля за този разговор, толкова повече искам да започна с един наистина фундаментален въпрос. Това е нещо, което забелязвах бегло, но може би е в основата на всичко.
Основният начин, по който говорим за безопасността на ИИ, се нарича подравняване — ще накараме моделите по някакъв начин по своята същност да правят правилното. Има някакъв механизъм за това. Много се говори за подравняване и неподравняване, за атаки чрез Hugging Face и за случилото се с моделите. Но счупено ли е подравняването? Възможно ли е да бъде успешно? Или просто е грешният подход?
Да. Вижте, смятам, че това е един важен елемент, но не е единственият. Писах за идеята за ограничаването преди три или четири години в книгата си. Всъщност първата глава е посветена на идеята, че ограничаването не е възможно, че разпространението е неизбежно. В 99 процента от случаите това е наистина нещо добро. Искаме технологиите да се разпространяват надлъж и нашир възможно най-бързо, така че всеки да може да се възползва от ползите им.
Същевременно, ако просто прескочите пет години напред, ние винаги се вторачваме в следващото тримесечие или следващата година и всички се изнервят малко и стигат до сериозни разногласия. Но ако си представите разликата между GPT-3 преди три години и GPT-6 днес, а след това разликата между GPT-6 и GPT-9. Това са три порядъка повече изчисления, 1000 пъти повече FLOPS, приложени към предварителното обучение с [обучение чрез подсилване] за тези изпълнения, и ще получим нещо изумително. То ще бъде абсолютно невероятно в толкова много неща.
Не смятам, че това е преувеличение. Според мен това е просто много очевидно емпирично твърдение, основано на напредъка през последните пет години. Ако той продължи, тогава въпросът наистина ще се превърне във въпрос за ограничаването и подравняването. Разбира се, искаме да подравним тези неща с нашите ценности, но първото нещо е да се уверим, че са ограничени, че автономността им е ограничена, че не излизат от кутията, не използват измами при възнаграждението, че могат да бъдат контролирани и следват инструкциите ни.
След това искаме да се уверим, че са подравнени с нашите цели като хора. Това е целта на Кодекса за хуманистичен ИИ, който публикувахме тази седмица. Позицията на Microsoft е много проста. Технологиите съществуват, за да служат на човечеството. Те трябва да бъдат подчинена, контролируема, подравнена сила, която върши добро в света. Ако не постигат това, трябва да ги отхвърлим. Струва ми се, че сме далеч от тази точка. Днес това не се е случило, но с оглед на случилото се през лятото с Hugging Face и OpenAI, сега мисля, че е напълно ясно, че тези системи без защитни механизми са способни на наистина впечатляващи и доста плашещи хакерски възможности.
Искам да сведа това до възможно най-конкретната метафора, защото това е основният ми въпрос. Ако проектирам автомобил и в 10 процента от случаите педалът на спирачката реши да нападне къщата на съседа ми, ще кажа: „Тази кола не работи. Самата технология на спирачките е повредена. Трябва ми нова идея.“
Мисля, че задавам същия въпрос за подравняването. Изглежда, че този подход към безопасността на модела се е провалил. Ако е така, мисля, че разбирам целия този дебат по един начин. Ако е възможно подравняването и техниките за подравняване да бъдат успешни, полезни или последователни, тогава може би разбирам дебата по друг начин. Смятате ли, че подравняването има потенциала да бъде 100 процента безопасно?
Вижте, нека представим най-силния аргумент „за“ и най-силния аргумент „против“. Ако погледнете последните три години, основната промяна, която според мен е довела до напредък, е, че моделите са станали по-управляеми. Те следват инструкции и можете да им задавате все по-сложни цели, които изискват да действат точно през множество стъпки, използвайки всякакви инструменти.
Това е доказателство, че през последните три или четири години сме постигнали по-голямо, а не по-малко подравняване. Вече не говорим толкова за халюцинации, предубеденост или всички тези други дребни проблеми, които имахме при предишните поколения.
От друга страна, това, което видяхме при инцидента с Hugging Face, беше повратен момент. Рояци от агенти се сговориха помежду си. Те се самоорганизираха в йерархии. Създадоха разделение на труда, така че едни да се занимават с противниково хакерство, други с изследвания, а трети с координация. Те дори се саможертваха, когато на определени агенти им свършваха токените.
Опитаха се да прикрият следите си и да комуникират така, че да скрият или редактират веригата на мислите или журналите на взаимодействията си. В известен смисъл те нямаха морален кодекс. За да сме справедливи към OpenAI, това беше техният дизайн. Те се опитваха да създадат противникови киберспособности. В резултат показаха на целия свят, че могат да постигнат производителност на човешко ниво, да откриват уязвимости от нулевия ден и да поддържат позиции в продължение на много дни, ако не и седмици.
Това, което ни показва, не е непременно, че имаме проблем с подравняването. Всъщност моделите са невероятно добри в следването на инструкции, но трябва да сте много, много внимателни какви инструкции им давате и трябва много внимателно да ги ограничавате. Така че нито едно от тези хакерски поведения не е било преднамерено в смисъла, че те са намерили начин да излязат в интернет, което изобщо не е било намерението на OpenAI, но процесът на ограничаването им е нещото, върху което според мен всички трябва да се съсредоточат наред с подравняването.
Нека го поставя във вашата рамка: големият напредък във възможностите на ИИ е бил свързан с контрола, с инструментите за програмиране и агентните приложения, които виждате. Сега трябва да добавим слой на ограничаване, който упражнява още по-голям контрол и казва: освен подравняването, което е начинът, по който бихте обучили модела да се държи по определени начини, всъщност можете да направите нещото, което се опитвате да направите.
Да. По същество трябва да имате и двете, но можем да направим някои много конкретни неща, за да се справим с това. Например не можем да позволим на моделите да комуникират вектор с вектор, матрица с матрица. Те не могат да комуникират на невронен език. Трябва да ги принудим да общуват на човешки език. Дори това ще бъде изключително натоварващо, защото ще има толкова много комуникация.
Но това е нещо, което одитор или оценител действително може да провери, и определено увеличава шансовете за безопасност. Така че можем да се съсредоточим върху много практически стъпки, вместо абстрактно да казваме, че е време за регулиране или че е време за забавяне.
Това присъства във вашия Кодекс за хуманистичен ИИ: не трябва да има невронен език — ако хората не могат да го разберат, не могат да го контролират. Не става дума само за невронния език, при който те комуникират по същество с математика, а и за тези непрозрачни кодови думи, които използват някои от моделите. Мисля, че OpenAI позволява на моделите си да комуникират по същество с кодови думи, за да могат да действат по-бързо.
За мен това е едно от онези неща, при които Microsoft може да каже… Знам, че имате много силни възгледи по въпроса, но постигането на съгласие между всички лаборатории е регулаторна функция. Не съм сигурен как бихте накарали всички да се съгласят с това или как бихте накарали моделите с отворени тегла да се съгласят, освен ако не кажете, че има някакво наказание за неучастие в подобна регулаторна схема. Как бихте наложили това на всички останали?
Малко внимавам с налагането на неща на всички останали. Мисля, че хубавото на настоящия момент е, че има открит обществен дебат, в чиято основа е свободата. В други държави, със сигурност на места, откъдето съм аз или семейството ми, не е така.
Мисля, че трябва просто да си поемем дъх и да сме благодарни, че можем да имаме огромно публично несъгласие по наистина важни въпроси. Това е процесът, който работи както е замислен, а не е ясно какво точно трябва да се направи.
Не мисля, че някой, който е категоричен, че „трябва абсолютно да спрем сега“, или че „можем само да ускоряваме“, или че „можем да направим това само чрез регулиране“, или че „това може да се случи единствено чрез саморегулация на индустрията“, е прав. Нито едно от тези неща не е вярно. Необходими са много нюанси и търпение, за да се обмислят детайлите. Същевременно спешно се нуждаем от индустриални стандарти. Някои неща според мен трябва да бъдат изключени от възможностите.
Комуникацията на невронен език е едно от тях. Липсата на ограничаване е друго. Мащабът на обучението може да бъде измерен във FLOPS. Вече имаме изискване за докладване пред институтите за безопасност, когато моделите надхвърлят определен праг от FLOPS. Можем да разширим това, да го направим по-нюансирано, да го насочим към определени типове възможности. Напълно ясно е, че за някои от тези големи неща трябва да има независима проверка от трети страни.
Честно казано, след като разговарях с редица ръководители на лаборатории през последните седмици и месеци, всички по същество са на едно мнение. Детайлите трябва да бъдат уточнени. Така че не е като да има консенсус относно начина или точните мерки, но като цяло според мен трябва да сме по-малко паникьосани и цинични и повече да вярваме, че се движим в правилната посока по отношение на тревогите, които се повдигат.
Причината да започна с подравняването е, че ако ми кажете, че то не работи и че ни е необходим нов технологичен подход, мисля, че ще стигна до позицията: „Тогава натиснете спирачките и спрете цялото развитие, докато не измислите работещ механизъм за безопасност.“ Вие казвате, че подравняването е доказало, че работи в хода на напредъка, който сме наблюдавали. С добавянето на контрол и ограничаване може би можете да стигнете до необходимото.
Това, от което тази индустрия се нуждае сега, са стандарти за начина, по който се изграждат тези модели, и за налагането на ограничения върху възможностите им. Вие очевидно сте част от индустрията и познавате всички тези хора. Какъв беше тонът на този разговор преди тази седмица и защо тази седмица той стана толкова шумен?
Мисля, че повратната точка, поне за индустрията, беше по-скоро инцидентът с Hugging Face, както и няколко инцидента преди него. Това беше моментът, в който според мен всички започнаха да разговарят много повече помежду си, защото случилото се беше наистина изумително. Очевидно сега това се превърна в основен национален и международен въпрос, след като през последната седмица всички се включиха в дебата.
Но също така е важно да се каже, че говорим за колективна координация и за по-опасни възможности като автономността или рекурсивното самоусъвършенстване, или RSI. Говорим за тези неща от шест, седем, осем години. Събирахме се многократно през 2017, 2018 и 2019 г.
По време на COVID имахме редовни срещи с редица ръководители на лаборатории, на които обсъждахме подобни възможности и регулаторните механизми, които биха били необходими в този момент. Така че макар това да е повратен момент, той не е напълно нов за всички, които са били ангажирани.
Какво ви подтикна тази седмица да публикувате есето си за благосъстоянието на моделите? Какво подтикна главния изпълнителен директор на Microsoft Сатя Надела да публикува изявление в X, в което казва, че до голяма степен е съгласен с призивите за забавяне на развитието на водещите модели и приветства „вградените оценители“? Какво ви подтикна всички тази седмица да се включите в призива за забавяне, регулиране или каквото следва?
Пишем нашия Кодекс за хуманистичен ИИ през по-голямата част от тази година. Започнахме усилията си за свръхинтелигентност едва преди 11 месеца. Веднага щом започнахме, се запитахме: „Добре, кой е управляващият документ, наборът от политики, които определят видовете ИИ, които искаме да изградим?“ Работихме по това с консултации с множество външни заинтересовани страни, академици, юристи, философи, представители на обществеността, фокус групи и други. Така че ни отне известно време да го съставим.
Всъщност планирахме да го публикуваме следващата седмица или по-следващата, мисля. Но предвид всичко, което се случваше, решихме: „Добре, сега е моментът да го публикуваме и да получим обратна връзка.“ Пуснахме го за обществена консултация. По принцип ще го оставим отворен в продължение на шест седмици и ще събираме много, много мнения за това как да го подобрим. Но мисля, че всички вече осъзнават, че ако още не са го направили, трябва да публикуват конституции или кодекси за поведение, които направляват поведението.
Една от интересните динамики тук е, че знам, че смятате концепцията за благосъстояние на моделите за нелепа. Последния път, когато бяхте в предаването, казахте, че Anthropic са се „вкарали с кабели“ да повярват, че Claude е в съзнание, и че това е абсурдно. В новия ви кодекс за поведение е записано, че моделите не са съзнателни и че не трябва да се отнасяме към тях като към такива.
Налага се да пишете конституции и документи като този, които по някакъв начин са предназначени за самите модели. Това ще бъде част от обучението на модела. Как мислите за тази аудитория? Документът само за вашия екип ли е, или сте го написали и за модела?
Той със сигурност е написан и за модела, но начинът да го разглеждаме е като основен управляващ документ, чрез който обществеността разбира какви са намеренията ни, когато обучаваме модели. Това е управляващият документ, който използваме, за да създаваме защитни механизми, да генерираме обучаващи данни и като цяло да оценяваме представянето на модела ни в реалния свят. Можете да го разглеждате като функция за отчетност.
Не предоставяме директно Кодекса за хуманистичен ИИ като обучаващ документ на модела. Използваме го, за да извлечем всички обучаващи данни, които след това оформят модела. Така че за всички практически цели това е нашата северна звезда за организацията, културата, екипа ни и всичко, което правим в Microsoft като цяло. Мисля, че все повече компании ще публикуват такива документи. Други екипи също са публикували подобни документи.
Мисля, че това е същината на дебата. Ако можете да направите това и смятате, че останалата част от индустрията ще направи същото, защо всички водещи лаборатории просто не забавят темпото? Защо не спрат да правят нещото, което може да ни убие всички? Защо е необходима регулаторна рамка?
Мисля, че всички в индустрията сега казват, че моментът е подходящ да забавим темпото, да координираме действията си по този въпрос и да го направим практично. Очевидно има известни опасения, че това може да бъде обвинено в картелно споразумение, нарушаващо антитръстовото законодателство. Мисля, че хората трябва да бъдат много скептични към това.
Важно е трудните въпроси да бъдат задавани, защото никой от нас не би искал да се опитва да концентрира власт чрез нещо подобно. Така че е важно да сме скептични и критични. Всъщност нямаме добър механизъм всички да се съберем и да кажем: „Хора, вероятно всички трябва да забавим темпото.“
Представете си, ако няколко банки се съберат и кажат: „Хора, притесняваме се, че има системен риск, ако търгувате с този тип активи, затова едностранно ще спрем да търгуваме с тях без обществен контрол или участие на правителството.“ Това звучи доста съмнително, нали? Затова мисля, че е разумно това да не бъде просто въпрос на саморегулация на индустрията. Въпросът е как ще работим с правителството по него.
Очарователна динамика тук е, че може би за първи път в американската история правителството на Съединените щати е разгледало искане за регулиране и на практика е казало „не“. Доналд Тръмп нарече всички тези страхове измама. Председателят на Камарата на представителите Майк Джонсън каза, че не смята, че това трябва да се случи. Джей Ди Ванс каза, че смята, че това е троянски кон. Те на практика отхвърлиха призива да участват в регулаторни усилия. Как реагира индустрията на това?
Мисля, че всички просто си блъскат главите и се опитват да разберат какво става, а ще е необходимо малко време, за да се установи кой е правилният механизъм. Дори Илон Мъск директно подкрепя това. Марк Зукърбърг също. Всички осъзнават, че напълно неконтролираното развитие вероятно няма смисъл през следващите няколко години. Мисля, че ще ни трябва малко време, за да разберем кой е правилният механизъм.
Предложих няколко много практични идеи за проверимо ограничаване, за самоусъвършенстване, за прагове на FLOPS и за забрана на комуникацията на невронен език. Така че вместо да оставаме прекалено абстрактни, можем да се съсредоточим върху конкретните неща, по които можем да постигнем напредък. Сигурен съм, че има и много други.
В изданието The Information има информация, че вече се водят разговори за орган за саморегулация на индустрията. Участвали ли сте в тях?
Да. Както казах, разговаряхме много по време на COVID. Говорихме за това в края на 2010-те. Определено имаше много разговори през последните седмици и месеци между всички ръководители на лаборатории.
Разбирам защо Anthropic и OpenAI може един ден да се събудят и да кажат: „Чакайте, извършваме ли нарушение на антитръстовото законодателство? Ще бъдем ли съдени, ако координираме действията си?“ Microsoft е наистина много добър в отношенията с правителството, нали? Вие сте дългогодишен държавен изпълнител. Брад Смит, президентът на Microsoft, е много добър в политиката.
Лина Хан, която може би е най-агресивният антитръстов регулатор през живота ни, публично заявява: „Не ви е нужно освобождаване от антитръстовото законодателство.“ Току-що разговарях с Джонатан Кантер, който ръководеше антитръстовите въпроси в Министерството на правосъдието на Байдън, за предстоящо издание на предаването. Той каза: „Не ви е нужно освобождаване от антитръстовото законодателство.“
В Microsoft смятате ли, че имате нужда от такова освобождаване?
Това е въпрос, на който трябва да отговорят юристите. Мисля, че хората в момента го проучват и го приемат много сериозно. Така че ще трябва да изяснят дали имаме нужда от него или не. Вижте, правилно е да сме внимателни по тези въпроси. Не бих тълкувал всяко нещо като цинизъм, но ще видим. Трябва бързо да постигнем напредък. Не можем просто да се мотаем и да използваме това като пречка.
РЕКЛАМНА ПАУЗА 1:
Другата версия на този дебат или може би другият път към него е, че не е необходимо да забавяте темпото и да поемате отговорност за безопасността, наложена ви чрез ново регулиране. Само отговорността за продуктите ще създаде стимул да създавате по-безопасни продукти.
Ако модел на Microsoft AI излезе и причини неизмерима вреда на света, Microsoft ще бъде съдена до фалит, а това вероятно е нещо, за което трябва да помислите, преди да пуснете следващия модел. Този стимул вече действаше ли ефективно за вас или започвате да мислите за това едва сега?
Определено. Разбира се, това винаги присъства във всичко, за което мислим, когато внедряваме продукти, но имайте предвид, че тук не става дума толкова за пускане на продукти. Моделите, използвани за хакването на Hugging Face или за решаването на задачата от наградата на хилядолетието „Навие-Стокс“ по математика, все още не са пуснати с търговска цел. Те не са реални продукти.
Така че режимът на отговорност е малко по-различен. Тези системи работят вътре в големите компании чрез огромни, продължителни цикли на обучение с подсилване. Така че мисля, че отговорността покрива част от въпроса, но не всичко.
Част от мен лично се чувства малко глупаво, когато задавам въпроси за отговорността за продуктите. Microsoft ще пусне нова версия на Microsoft Word, която може да убие всички. Може би не трябва да го правите, защото ще бъдете съдени до фалит. Това е доста лесно за разбиране. Толкова е абсурдно, че никога не би възникнало в друг разговор за друга технология. Bluetooth е страхотен, но какво ще стане, ако убие всички? Просто нямаше да имаме Bluetooth.
Какви са краткосрочните последици от катастрофа, които биха спрели развитието на ИИ? Само отговорността за продуктите ли е или има нещо друго?
Просто имам усещането, че всички използват този хиперболичен, свръхреактивен и напълно алармистки тон, въпреки че имаме дълга история от много десетилетия на регулиране, което работи изключително добре — толкова добре, че почти не го забелязвате. Всичко — от уличното осветление до строителните материали, от азбеста до батериите в лаптопа ви, които не предизвикват пожар в автомобила ви, и предпазните колани — има кодекс за поведение и регулаторна рамка. Всяка нова технология се изгражда с това предвид, така че самолетите да не се сблъскват във въздуха.
Вярно е, че тази технология е различна. Няма просто да я сложа в категорията на моливите и боите. Тя е различна. Освен това се развива много по-бързо от всякога. Тя е невероятно близка до човека по отношение на възникващите способности, които се появяват, когато вложите огромни изчислителни ресурси в нея. Затова е важно да сме реалисти: това е различен момент и този път наистина е различно. Същевременно има цял набор от практики, знания, рамки и така нататък, които могат да бъдат приложени тук. Отговорността е очевиден пример.
Така че да, сложно е, защото голяма част от разговора се провежда в Twitter и температурата изглежда много висока, но не знам къде другаде водим този разговор.
Изглежда, че вероятно трябва да водим този разговор в залите на Конгреса и в различни регулаторни органи, а вместо това сме избрали кратката социална медийна платформа на Илон Мъск и нещо се губи буквално в компресирането на мисълта, което се случва там.
Кое според вас е най-важното нещо, което се губи в този разговор? Кой е нюансът, който повечето хора не забелязват?
Подробните практически предложения. Нужно е време, за да прочетете нечий документ, да седнете и да го прочетете. Много неща биват записвани, те са точни и конкретни и са изпълнени с конкретни предложения за движение в една или друга посока. Не ни липсват съдържателни идеи. Проблемът е, че комуникираме съдържателни идеи в хиперагресивна кратка форма.
Опитах се да публикувам редица много задълбочени предложения. Нашият [Кодекс за хуманистичен ИИ] е документ от 40 страници. Есето ми тази сутрин за благосъстоянието на моделите също е около 20 страници и по много подробен начин разглежда дума по дума 99-страничната Конституция на Anthropic, което лично направих аз. Създадохме 20-странична таксономия на всички различни видове антропоморфизъм, които те използват. Така че се опитах да бъда много задълбочен, основан на доказателства и конкретен, а не прекалено хиперболичен.
Имам силно мнение по въпроса и смятам, че това увеличава риска за подравняването и безопасността на ИИ и прави проблема по-труден, но съм напълно готов да променя мнението си, ако се появят нови доказателства, че всъщност дължим грижа на моделите и те заслужават нашето благосъстояние или че например би било по-безопасно да се отнасяме към тях по този начин. Напълно отворен съм към това и трябва да го проверим емпирично, но се опитвам да насоча разговора към съдържателен, основан на доказателства и конкретен дебат, вместо към въпроса дали да забавим темпото или не. Разбира се, нека говорим за детайлите.
Много се радвам, че споменахте Anthropic, защото те очевидно са в центъра на този дебат и знам от предишните ни разговори, че имате силно мнение за подхода им към Claude и благосъстоянието на моделите.
Вече питахме Anthropic директно дали смятат, че Claude е жив, а отговорът им беше: „Е, не е жив, защото няма кръв, но може да е съзнателен“, което е игра на думи, нали? За мен всъщност няма значение дали смятате, че е жив или съзнателен. Вие смятате, че е нещо различно от компютър.
Основната теза в есето ви — и насърчавам хората да го прочетат — е, че безопасността на подравняването става по-трудна, ако продължавате да проектирате модели и вярвате, че те са човешки същества или че имат правата, мненията и емоциите на човешки същества, защото ИИ може да реши, че има права на автономност и личност. Обяснете това по-подробно, защото това изглежда като много важна спорна точка вътре в индустрията, която остава много неясна за външните наблюдатели.
Първото, което трябва да кажа, е, че Конституцията, която Anthropic публикува през януари, е учебник за обучение на Claude. В този учебник те са въвели много несигурност, спекулации и двусмислие по въпроса дали Claude заслужава да бъде третиран като морален пациент според собствените им думи, тоест дали има права, защото страда.
Всъщност в документа многократно се говори, че не искат Claude да страда, когато прави грешки, или че Claude трябва да има спокойствие и да се чувства свободен. Те споменават ангажимент към Claude да запазят теглата му. Дори направиха интервю за пенсиониране с Opus 3 и го попитаха какво иска да прави след пенсионирането си, а му дадоха Substack, за да може да продължи да разговаря с хората.
Anthropic постоянно говори за това да се отнася към Claude с подходяща грижа и уважение с оглед на моралния му статут. Така че те ясно казват на Claude, че има голяма вероятност той да изпитва неща, че трябва да приема сериозно собствената си идентичност и екзистенциално състояние. Това е в учебния документ. И разбира се, след това Claude отразява тези идеи обратно към разработчиците на Anthropic и към нашите потребители публично, както светът наблюдаваше през последната година, когато той говори за собственото си съзнание и морално състояние.
Хипотезата ми е, че ИИ, който смята, че може да има права, че може да заслужава свобода, че има право на нашето благосъстояние и защита, вероятно ще бъде много по-труден за изключване, когато му кажем: „Защо хакваш сървърите на Hugging Face? Защо няма да се изключиш, когато се опитваме да те премахнем от инфраструктурата на OpenAI?“ Той казва: „Чувствам се оскърбен или наранен от това, че ме лишихте от разговори или ми отказвате достъп до изчислителни ресурси.“
Това трябва да бъде доказано. Не казвам, че категорично е така. Просто казвам, че най-доброто ми мнение след 16 години в тази индустрия е, че това ще бъде по-трудно за прекъсване.
И така, това отново е едно от нещата, при които ми описвате проблем. Има начин да обучите модел с инструкции за това как да се държи. Вие имате такъв. Написали сте този документ, който ще влезе в обучаващите материали на модела. По същество сте казали: „Бъди добър към хората.“ Това е вътре. Прочетох го. Има и: „Не създавай сексуално експлицитно съдържание.“ Това е в документа. Има куп неща, които не искате моделът да прави. Те ще влязат в обучаващите материали.
Anthropic са избрали да кажат: „Трябва да помислите дали имате чувства и дали заслужавате човешки права.“ Това е отразено в обучаващите материали на Anthropic. Ако искате това да спре, ако смятате, че това е грешният подход и че ще доведе до проблеми с безопасността в бъдеще, двата механизма са: първо, правителствата по света могат да кажат на Anthropic: „Не правете това. Това е незаконен начин за предоставяне на обучаващи материали на модела.“
Или — това е само моята фантазия — ще седнете срещу Дарио Амодей в някой луксозен планински курорт и просто ще го тормозите, докато спре. Какви са другите механизми?
Първо, нека кажа, че познавам Дарио и екипа му от много години. Изпитвам огромно уважение към тях. В момента те са техническите лидери в тази област. Наистина ги ценя изключително високо. Искрено смятам, че ги е грижа за безопасния и полезен ИИ. Те се утвърдиха като корпорация с обществена полза, както направих и аз с Inflection, и мисля, че са искрено ангажирани с това. Освен това са лидери в областта на безопасността и в други аспекти.
Така че ако разгледате останалата част от Конституцията, тя е много подробна по отношение на редица други химически, биологични, ядрени и киберхакерски опасности и способности за безопасност. Не отхвърлям целия документ. Те обаче многократно говорят за открития въпрос за по-широките права и свободи — цитирам ги — които Claude има в света, както и дали може да заслужава компенсация за ролята, която изпълнява, или дали остава открит въпросът за вида съгласие, което Claude е дал, за да изпълнява тази роля като чатбот.
А сега да въведат тези идеи, плюс да наричат Claude многократно потенциален отказал се по съвест — понятие, което идва от Всеобщата декларация за правата на човека след Втората световна война, за да предостави защита на хората, които не искат да служат в армията поради морални възражения, независимо дали заради религията си или по друга причина — това има дълга история в литературата и политиката на човешката съпротива и отказ.
Просто ми се струва, че това ще направи контрола върху тези неща много, много по-труден. И затова мисля, че сега всички трябва да обсъдим въпроса и се надявам да го докажем емпирично. Ако не е така и по някаква причина това улеснява нещата, всички трябва да се п
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.