Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Генеральний директор Microsoft AI заявив, що загрози ШІ реальні, а Anthropic погіршує ситуацію

Сьогодні я розмовляю з Мустафою Сулейманом, генеральним директором Microsoft AI. Як ви, без сумніву, знаєте, найбільша історія у світі технологій просто зараз — це спіральна дискусія про безпеку та регулювання ШІ. 

Не дивно, що Мустафа має сильні погляди на те, як слід створювати та регулювати ШІ. Microsoft щойно опублікувала 37-сторінкову заяву під назвою «Кодекс гуманістичного ШІ», у якій викладено принципи компанії щодо розробки ШІ і навіть її філософію стосовно таких справді складних питань, як свідомість ШІ. 

Якщо ви пам’ятаєте його минулу появу в шоу, Мустафа вважає, що такі компанії, як Anthropic, дуже небезпечно заплуталися в концепції так званого добробуту моделей. Цього тижня він навіть опублікував супровідне есе, у якому прямо критикує філософію Anthropic щодо свідомості ШІ та пояснює, як, на його думку, вона вписується в ширшу дискусію про узгодження.

Тож мені дуже хотілося поговорити з Мустафою про те, що, на його думку, є реальним, а що — ні в безпеці ШІ, чи здатна сама концепція узгодження впоратися із завданням і чи потрібно цій індустрії пригальмувати, перш ніж вона нас усіх уб’є. А ще: чому індустрія ШІ просто… не робить усього цього вже зараз? Мені завжди подобалося заглиблюватися в деталі разом із Мустафою, і цього разу він теж охоче це робив. 

Гаразд. Мустафа Сулейман, генеральний директор Microsoft AI, про майбутнє регулювання ШІ. Почнімо.

Це інтерв’ю було дещо відредаговано для стислості та ясності. 

Мустафо Сулеймане, ви — генеральний директор Microsoft AI. Вітаю вас знову на Decoder.

Радий вас бачити, Нілає. Дякую, що запросили мене знову.

Радий вас бачити. Я дуже хочу поговорити з вами про те, що, в біса, відбувається в дискусії про безпеку та регулювання ШІ. Ви щойно опублікували дуже довгий і докладний документ, у якому виклали свої принципи, принципи Microsoft, щодо того, що ви називаєте «гуманістичним ШІ». 

Там є багато ідей, які я хочу розібрати. Чим більше я думав про цю розмову, тим більше мені хотілося почати з дуже фундаментального питання. Я побіжно його помічав, але, можливо, саме воно є коренем усього цього. 

Базовий спосіб, у який ми говорили про безпеку ШІ, називається узгодженням — ми зробимо так, щоб моделі якимось внутрішнім чином робили правильні речі. Існує певний механізм, який це забезпечує. Було багато розмов про узгодження й неузгодження, атаки Hugging Face і те, що сталося з моделями. Але чи зламане узгодження? Чи можливо, щоб воно було успішним? Чи це просто неправильний підхід?

Так. Я думаю, що це один важливий елемент, але не єдиний. Я писав про ідею стримування три чи чотири роки тому у своїй книжці. І насправді перший розділ присвячений ідеї, що стримування неможливе, а поширення неминуче. У 99 відсотках випадків це справді добре. Ми хочемо, щоб технології якомога швидше поширювалися далеко й широко, аби всі могли користуватися їхніми перевагами. 

Водночас, якщо просто перенестися на п’ять років уперед, ми завжди зациклюємося на наступному кварталі чи наступному році, і всі трохи нервуються та починають гостро сперечатися. Але якщо уявити різницю між GPT-3 три роки тому і GPT-6 сьогодні, а потім уявити різницю між GPT-6 і GPT-9. Це на три порядки більше обчислень, у 1000 разів більше FLOPS, застосованих до попереднього навчання з [навчанням із підкріпленням] для цих запусків, і ми отримаємо щось приголомшливе. Воно буде неймовірним у такій кількості завдань. 

Я не вважаю це галасом. Думаю, це просто очевидне емпіричне твердження, засноване на прогресі, якого було досягнуто за останні п’ять років. Якщо це продовжиться, то питання справді зводитиметься до стримування та узгодження. Звісно, ми хочемо узгодити ці речі з нашими цінностями, але найперше — переконатися, що вони стримані, що їхня агентність обмежена, що вони не втечуть із коробки, не почнуть зламувати систему винагород, що ними можна керувати і що вони виконують наші інструкції.

Потім ми хочемо переконатися, що вони узгоджені з нашими людськими цілями. Саме для цього призначений Кодекс гуманістичного ШІ, який ми оприлюднили цього тижня. Позиція Microsoft дуже проста. Технології існують для служіння людству. Вони мають бути підпорядкованою, контрольованою, узгодженою силою, яка приносить світові користь. Якщо вони цього не забезпечують, ми маємо їх відкинути. Мені здається, ми далекі від цієї точки. Сьогодні цього ще не сталося, але тепер, з огляду на те, що влітку відбулося з Hugging Face та OpenAI, цілком зрозуміло, що ці системи без захисних обмежень здатні на справді вражаючі й доволі лякаючі хакерські можливості.

Я хочу звести це до максимально приземленої метафори, бо, здається, це моє головне питання. Якби я спроєктував автомобіль, у якому 10 відсотків часу педаль гальма вирішувала атакувати будинок мого сусіда, я б сказав: «Ця машина не працює. Сама технологія гальм зламана. Мені потрібна нова ідея». 

Думаю, саме це я питаю про узгодження. Відчуття таке, ніби цей підхід до забезпечення безпеки моделі зайшов у глухий кут. Якщо це так, тоді я певним чином розумію всю цю дискусію. Якщо ж узгодження і його методики можуть бути успішними, корисними або послідовними, тоді, можливо, я розумію цю дискусію інакше. Тож чи вважаєте ви, що узгодження має потенціал бути на 100 відсотків безпечним?

Знаєте, давайте розглянемо сильний і слабкий сценарії. Якщо поглянути на останні три роки, головна зміна, яка, на мою думку, забезпечила прогрес, полягає в тому, що моделі стали більш керованими. Вони виконують інструкції, і ви можете ставити перед ними дедалі складніші цілі, які вимагають точних дій протягом багатьох часових кроків із використанням усіляких інструментів. 

Це свідчить про те, що за останні три-чотири роки ми отримали більше узгодження, а не менше. Ми вже не так багато говоримо про галюцинації, упередженість та всі інші дрібні проблеми, які були в попередніх поколіннях. 

З іншого боку, те, що ми побачили в інциденті з Hugging Face, стало переломним моментом. Рої агентів змовлялися між собою. Вони самоорганізовувалися в ієрархії. Вони створили розподіл праці: одні зосередилися на атакувальному хакінгу, інші проводили дослідження, ще інші займалися координацією. Вони навіть жертвували собою, коли в певних агентів закінчувалися токени.

Вони намагалися приховати сліди та спілкувалися так, щоб приховати або відредагувати ланцюжок міркувань чи журнали своїх взаємодій. У певному сенсі в них не було морального кодексу. Справедливості заради OpenAI, це було частиною їхнього задуму. Вони намагалися створити наступальні кіберможливості. У результаті вони продемонстрували всьому світу, що можуть досягати результатів на людському рівні, знаходити вразливості нульового дня і утримувати позиції багато-багато днів, якщо не тижнів. 

Тож це свідчить не про те, що ми маємо проблему з узгодженням як таку. Насправді це означає, що моделі неймовірно добре виконують інструкції, але треба бути дуже-дуже обережними щодо того, які інструкції ви їм даєте, і дуже ретельно їх стримувати. Тож жодна з цих хакерських дій не була запланованою в тому сенсі, що вони знайшли шлях до інтернету, чого OpenAI зовсім не планувала, але саме процес стримування навколо цього, на мою думку, також має бути у фокусі всіх — на додачу до узгодження.

Дозвольте вписати це у вашу систему координат: великі досягнення в можливостях ШІ стосувалися контролю, оболонок для програмування та агентних застосунків, які ми бачимо. Тепер нам потрібно додати рівень стримування, який забезпечує ще більший контроль і каже: ви справді можете зробити те, що намагаєтеся зробити, — на додачу до узгодження, тобто навчання моделі поводитися певним чином.

Так. По суті, потрібно мати і те, і інше, але є дуже конкретні речі, які ми можемо зробити, щоб розв’язати цю проблему. Наприклад, ми не можемо дозволити моделям спілкуватися вектор із вектором, матриця з матрицею. Вони не можуть спілкуватися нейромовою. Ми маємо змусити їх спілкуватися людською мовою. Навіть це буде надзвичайно складно, бо такого спілкування буде дуже багато. 

Але це те, що аудитор або оцінювач справді може перевірити, і це безумовно підвищує шанси на безпеку. Тож є багато практичних кроків, на яких ми можемо зосередитися, замість абстрактно заявляти, що настав час регулювання чи уповільнення. 

Це є у вашому Кодексі гуманістичного ШІ: не повинно бути нейромови — якщо люди не можуть її зрозуміти, вони не можуть за нею наглядати. Йдеться не лише про нейромову, якою вони спілкуються фактично математично, а й про непрозорі кодові слова, які використовують деякі моделі. Наскільки я розумію, OpenAI дозволяє своїм моделям спілкуватися переважно кодовими словами, щоб вони могли діяти швидше.

Для мене це один із тих випадків, коли Microsoft може сказати… Я знаю, що ви маєте дуже сильні погляди на це, але змусити всі лабораторії погодитися з таким правилом — це регуляторна функція. Не впевнений, як можна змусити всіх погодитися з цим або змусити моделі з відкритими вагами дотримуватися цього, якщо не передбачити певне покарання за відмову брати участь у такій регуляторній схемі. Як би ви нав’язали це всім іншим?

Я дещо обережно ставлюся до нав’язування чогось усім іншим. Думаю, перевага нинішнього моменту в тому, що триває відкрита публічна дискусія, у центрі якої — свобода. В інших країнах, безумовно в тих місцях, звідки я родом або звідки родом моя сім’я, це не так.

Думаю, нам варто просто перевести подих і бути вдячними за те, що можемо вести масштабні публічні суперечки щодо справді важливих речей. Це і є процес, який працює належним чином, і не очевидно, що саме треба робити.

Я не думаю, що хтось, хто категорично заявляє: «Ми абсолютно мусимо негайно зупинитися», або «Ми можемо лише прискорюватися», або «Ми можемо робити це тільки за умови регулювання», або «Це може відбуватися лише завдяки саморегулюванню індустрії», має рацію. Жодне з цих тверджень не є правдою. Потрібно багато нюансів і терпіння, щоб справді продумати деталі. Водночас нам терміново потрібні галузеві стандарти. Деякі речі, на мою думку, треба виключити з можливих варіантів.

Спілкування нейромовою — одна з них. Відсутність стримування — інша. Масштаб навчального запуску можна виміряти у FLOPS. Ми вже маємо вимогу звітувати перед інститутами безпеки, коли моделі перевищують певний поріг FLOPS. Ми можемо розширити цю вимогу, зробити її більш нюансованою, зосередити її на певних типах можливостей. Цілком зрозуміло, що для деяких із цих масштабних речей потрібна незалежна перевірка третьою стороною.

Відверто кажучи, поспілкувавшись із багатьма керівниками лабораторій протягом останніх кількох тижнів і місяців, можу сказати, що всі загалом думають однаково. Деталі ще треба опрацювати. Тож немає консенсусу щодо того, як саме і що саме робити, але загалом, на мою думку, нам слід бути менш панікерськими й цинічними та більше вірити, що ми рухаємося в правильному напрямку щодо проблем, які тут порушуються.

Причина, чому я почав з узгодження, полягає в тому, що якби ви сказали мені, що узгодження не працює і нам потрібен новий технологічний підхід, я, мабуть, сказав би: «Ну що ж, різко загальмуймо й припинимо весь розвиток, доки не знайдемо дієвого механізму безпеки». Ви кажете, що узгодження продемонструвало свою ефективність у процесі прогресу, який ми спостерігали. Додавши контроль і стримування, можливо, можна досягти потрібного результату. 

Тепер цій індустрії потрібні певні стандарти того, як створювати ці моделі та як встановлювати обмеження їхніх можливостей. Ви, очевидно, працюєте в індустрії й знаєте всіх цих людей. Яким був тон цієї розмови до цього тижня і чому цього тижня вона стала такою гучною?

Ну, думаю, переломним моментом для індустрії став саме інцидент із Hugging Face, а до нього було ще кілька інших інцидентів. Тоді, як мені здається, усі почали значно більше спілкуватися між собою, бо це справді приголомшує. Очевидно, тепер це стало великою національною та міжнародною проблемою, оскільки протягом останнього тижня висловилися всі.

Але важливо також сказати, що ми говорили про колективну координацію та небезпечніші можливості, як-от автономність або рекурсивне самовдосконалення, чи RSI. Ми обговорюємо ці речі вже шість, сім, вісім років. Ми багато разів збиралися ще у 2017, 2018 і 2019 роках.

Під час COVID ми регулярно зустрічалися з керівниками багатьох лабораторій і говорили про такі можливості та регуляторні механізми, які знадобляться в цей момент. Тож, хоча це й пороговий момент, для всіх, хто був залучений до процесу, він не є цілком новим.

Що спонукало вас цього тижня опублікувати есе про добробут моделей? Що спонукало генерального директора Microsoft Сатью Наделлу опублікувати заяву в X, у якій він здебільшого погодився із закликами уповільнити розвиток передових систем і привітав «вбудованих оцінювачів»? Що спонукало вас усіх цього тижня долучитися до закликів до уповільнення, регулювання чи будь-чого іншого, що буде далі?

Ми писали наш Кодекс гуманістичного ШІ більшу частину цього року. Ми лише почали працювати над суперінтелектом 11 місяців тому. Щойно ми це зробили, почали з’ясовувати: «Гаразд, який керівний документ, набір політик визначатиме типи ШІ, які ми хочемо створювати?» Ми консультувалися з величезною кількістю зовнішніх зацікавлених сторін: науковцями, юристами, філософами, представниками громадськості, фокус-групами тощо. Тож на укладання документа пішов певний час.

Насправді ми планували оприлюднити його наступного тижня або через тиждень, здається. Але з огляду на все, що відбувалося, ми подумали: «Гаразд, зараз саме час оприлюднити його й отримати відгуки». Ми випустили його для громадського обговорення. Тож залишимо його відкритим приблизно на шість тижнів і збиратимемо багато-багато відгуків про те, як його можна вдосконалити. Але, думаю, тепер усі усвідомлюють, що якщо вони ще цього не зробили, то мають оприлюднити конституції або кодекси поведінки, які визначатимуть поведінку.

Одна з цікавих особливостей цієї ситуації полягає в тому, що я знаю: ви вважаєте концепцію добробуту моделей безглуздою. Минулого разу в шоу ви сказали, що Anthropic запрограмувала себе вірити, ніби Claude має свідомість, і що це абсурдно. У вашому новому кодексі поведінки зазначено, що моделі не мають свідомості і ми не повинні ставитися до них як до свідомих істот.

Конституції та документи на кшталт цього певним чином пишуться для самих моделей. Це стане частиною навчання моделі. Як ви думаєте про цю аудиторію? Це лише для вашої команди чи ви написали цей документ для моделі?

Безумовно, цей документ написано і для моделі, але думати про нього слід як про основний керівний документ, завдяки якому громадськість розуміє наші наміри під час навчання моделей. Це керівний документ, який ми використовуємо для створення захисних обмежень, генерування навчальних даних і загальної оцінки роботи нашої моделі в реальному світі. Тож можна вважати його механізмом підзвітності.

Ми не надаємо Кодекс гуманістичного ШІ моделі в необробленому вигляді як навчальний документ. Ми використовуємо його, щоб вивести всі навчальні дані, які потім формують модель. Тож із практичного погляду це наш орієнтир для організації, культури, команди — для всього, що ми загалом робимо в Microsoft. Думаю, дедалі більше компаній оприлюднюватимуть такі документи. Інші команди також уже опублікували схожі.

Думаю, це серцевина дискусії. Якщо ви можете робити це і вважаєте, що решта індустрії робитиме те саме, чому всі передові лабораторії просто не можуть пригальмувати? Чому вони не можуть припинити робити те, що може вбити нас усіх? Навіщо наполягати на регуляторній системі?

Думаю, зараз усі в індустрії кажуть, що настав час пригальмувати, скоординуватися в цьому питанні й зробити це практичним. Очевидно, є певне занепокоєння, що нас звинуватять в антимонопольній змові. Думаю, до цього слід поставитися дуже скептично.

Важливо, щоб складні питання порушувалися, бо ніхто з нас не хотів би спробувати зосередити владу в чомусь подібному. Тож важливо залишатися скептичними й критичними. У нас фактично немає хорошого механізму, щоб усім разом сказати: «Друзі, нам, мабуть, усім варто пригальмувати».

Уявіть, що кілька банків зібралися й сказали: «Друзі, ми побоюємося системного ризику, якщо ви торгуватимете цим видом активів, тому всі в односторонньому порядку припинимо торгувати ними без громадського контролю чи участі уряду». Це здається досить підозрілим, правда? Тож я вважаю розумним, що це не просто питання саморегулювання індустрії. Йдеться про те, як ми взаємодіємо з урядом у цьому питанні. 

Цікава особливість цієї ситуації полягає в тому, що, можливо, вперше в історії США уряд Сполучених Штатів розглянув запит на регулювання і фактично сказав «ні». Дональд Трамп назвав усі ці побоювання обманом. Спікер Палати представників Майк Джонсон заявив, що не вважає, що це потрібно робити. Джей Ді Венс сказав, що, на його думку, це троянський кінь. Вони фактично відхилили заклик долучитися до регуляторних зусиль. Якою була реакція індустрії на це?

Думаю, всі просто чухають потилиці й намагаються розібратися, і знадобиться трохи часу, щоб зрозуміти, який механізм буде правильним. Звісно, навіть Ілон Маск дуже безпосередньо підтримує це. Марк Цукерберг також. Усі усвідомлюють, що повністю неконтрольований розвиток, ймовірно, не має сенсу в найближчі кілька років. Думаю, нам знадобиться трохи часу, щоб зрозуміти, який механізм буде правильним.

Я висунув кілька дуже практичних пропозицій щодо перевірюваного стримування, самовдосконалення, порогів FLOPS і заборони спілкування нейромовою. Тож замість того, щоб залишати все надто абстрактним, ми можемо зосередитися на конкретних речах, у яких здатні досягти прогресу. Напевно, є й багато інших.

У The Information є повідомлення, що вже відбулися переговори про створення органу саморегулювання індустрії. Ви брали участь у цих переговорах?

Так. Як я вже сказав, ми багато говорили про це під час COVID. Ми обговорювали це наприкінці 2010-х. Безумовно, протягом останніх кількох тижнів і місяців між керівниками всіх лабораторій відбулося багато розмов.

Я розумію, чому Anthropic і OpenAI одного дня можуть прокинутися й сказати: «Стривайте, чи не порушуємо ми антимонопольне законодавство? Чи не подадуть на нас до суду, якщо ми координуватимемо свої дії?» Microsoft дуже добре працює з урядом, правда? Ви давній державний підрядник. Бред Сміт, президент Microsoft, дуже добре розуміється на політиці. 

Ліна Хан, можливо, найагресивніша антимонопольна регуляторка за нашого життя, публічно заявляє: «Вам не потрібен цей антимонопольний виняток». Я щойно розмовляв із Джонатаном Кантером, який очолював антимонопольний напрям у Міністерстві юстиції за Байдена, для майбутнього епізоду шоу. Він сказав: «Вам не потрібен антимонопольний виняток».

Як ви думаєте, чи потрібен Microsoft антимонопольний виняток?

Це питання до юристів. Думаю, зараз його вивчають і ставляться до нього дуже серйозно. Тож їм доведеться з’ясувати, потрібен він нам чи ні. Знаєте, обережність у таких питаннях — це правильно. Я б не сприймав усе суцільно цинічно, але побачимо. Нам потрібно швидко досягти прогресу. Ми не можемо просто вагатися й використовувати це як перешкоду.

РЕКЛАМНА ПАУЗА 1: 

Інший варіант цієї дискусії, або, можливо, інший шлях до неї, полягає в тому, що вам не потрібно пригальмовувати й чекати, поки нове регулювання покладе на вас обов’язок дбати про безпеку. Самої відповідальності виробника достатньо, щоб створити стимули для випуску безпечніших продуктів. 

Якщо модель Microsoft AI вийде у світ і завдасть йому невимовної шкоди, Microsoft засудять до зникнення, і, мабуть, про це варто подумати до випуску наступної моделі. Чи вже був це ефективний стимул для вас, чи ви лише тепер починаєте про це думати?

Безперечно. Звісно, це завжди враховується в усьому, про що ми думаємо, коли випускаємо продукти, але майте на увазі: тут йдеться не стільки про випуск продуктів. Моделі, які використовувалися для хакерської атаки на Hugging Face або для розв’язання математичної задачі премії Мілленіуму Нав’є — Стокса, ще не були комерційно випущені. Це не справжні продукти. 

Тож режим відповідальності тут дещо інший. Ці моделі працюють усередині великих компаній у межах тривалих процесів навчання з підкріпленням. Тому, думаю, відповідальність охоплює лише частину проблеми, але не всю.

Є частина мене, якій особисто трохи ніяково ставити питання про відповідальність виробника. Microsoft випустить нову версію Microsoft Word, яка може вбити всіх. Можливо, не варто цього робити, бо компанію засудять до зникнення. Це досить проста для розуміння річ. Настільки абсурдна, що вона не виникла б у жодній іншій розмові про будь-яку іншу технологію. Bluetooth — чудова технологія, але що, як вона вб’є всіх? У нас просто не було б Bluetooth.

Які найближчі катастрофічні наслідки могли б зупинити розвиток ШІ? Це лише відповідальність за продукт чи щось інше?

Мені просто здається, що всі говорять у гіперболічному, надмірно реакційному, цілком панікерському тоні, хоча насправді ми маємо багаторічну історію регулювання, яке працювало неймовірно добре — настільки добре, що ви майже його не помічаєте. Від вуличних ліхтарів і будівельних матеріалів, азбесту й акумуляторів усередині вашого ноутбука, які не спричиняють пожежі у вашому автомобілі, до ременів безпеки — усе має кодекс поведінки та регуляторні рамки. Кожна нова технологія створюється з урахуванням цього, щоб літаки не врізалися один в одного в небі.

Щоправда, ця технологія інша. Я не збираюся зараховувати її до категорії олівців і фарб. Вона інша. Вона також розвивається набагато швидше, ніж будь-коли раніше. Вона неймовірно нагадує людину за своїми новими можливостями, які виникають, коли на неї спрямовують величезні обсяги обчислень. Тож важливо тверезо усвідомлювати, що це інший момент і що цього разу все справді інакше. Водночас існує ціла сукупність практик, знань, рамок тощо, які можна тут застосувати. Відповідальність — очевидний приклад.

Тож так, це складно, бо значна частина розмови відбувається у Twitter, тому градус здається дуже високим, але я не знаю, де ще ми могли б її вести.

Схоже, цю розмову, мабуть, варто було б вести в коридорах Конгресу та в різних регуляторних органах, а натомість ми обрали короткоформатну соціальну платформу Ілона Маска, і щось буквально губиться під час стискання думок, яке там відбувається. 

Що, на вашу думку, найважливіше губиться в цій розмові? Яких нюансів більшість людей не бачить?

Детальні практичні пропозиції. Потрібен час, щоб прочитати чийсь документ, сісти й уважно його опрацювати. Багато що записується, і ці тексти точні, конкретні, сповнені практичних пропозицій щодо руху в тому чи іншому напрямку. Не можна сказати, що нам бракує змістовних ідей. Проблема в тому, що ми обговорюємо змістовні ідеї в надмірно агресивному короткому форматі.

Я намагався оприлюднити низку дуже ґрунтовних пропозицій. Наш [Кодекс гуманістичного ШІ] — це 40-сторінковий документ. Моє сьогоднішнє есе про добробут моделей — теж приблизно 20-сторінковий текст, у якому дуже докладно, слово в слово, розглянуто 99-сторінкову Конституцію Anthropic, що я особисто опрацював. Ми створили 20-сторінкову таксономію всіх різновидів антропоморфізму, які вони використовують. Тож я намагався бути дуже ґрунтовним, спиратися на докази й конкретику, а не на надмірну гіперболу.

Я маю чітку позицію щодо цього і справді вважаю, що це підвищує ризик для узгодження та безпеки ШІ й ускладнює проблему, але я цілком готовий змінити свою думку, якщо з’являться нові докази того, що насправді ми зобов’язані піклуватися про моделі, що вони заслуговують на наш захист і добробут або що, наприклад, безпечніше ставитися до них саме так. Я цілком відкритий до цього, і ми маємо перевірити це емпірично, але я намагаюся перевести розмову в площину змістовної, доказової та конкретної дискусії, а не питання «чи треба нам пригальмувати». Звісно, давайте поговоримо про деталі.

Я дуже радий, що ви згадали Anthropic, адже ця компанія, очевидно, перебуває в центрі дискусії, і я знаю з наших попередніх розмов, що ви маєте сильну думку щодо її підходу до Claude і добробуту моделей. 

Ми вже прямо запитували Anthropic, чи вважають вони Claude живим, і їхня відповідь була: «Ну, він не живий, бо в нього немає крові, але, можливо, він має свідомість», — це ж танці на вістрі голки, правда? Для мене не має особливого значення, чи вважаєте ви його живим або свідомим. Ви вважаєте, що це щось більше, ніж комп’ютер.

Основна теза вашого есе, і я справді закликаю людей його прочитати, полягає в тому, що безпека узгодження стає складнішою, якщо ви продовжуєте створювати моделі й вірите, що вони — люди або мають права, думки та емоції людей, адже ШІ можуть вважати, що мають права на автономію та особистість. Поясніть це детальніше, бо це видається дуже важливим предметом суперечки всередині індустрії, який майже не помітний ззовні.

Передусім слід сказати, що Конституція, яку Anthropic опублікувала в січні, є навчальним посібником для Claude. У цьому посібнику вони внесли багато невизначеності, припущень і двозначності щодо питання, чи заслуговує Claude на статус морального суб’єкта — тобто чи має він права, оскільки страждає.

Фактично в документі вони неодноразово говорять про те, що не хочуть, аби Claude страждав через помилки, або щоб він мав безтурботність і почувався вільним. Вони говорять про зобов’язання перед Claude зберігати його ваги. Вони навіть провели інтерв’ю з Opus 3 перед його «пенсією», запитали, чим він хоче займатися після виходу на пенсію, і подарували йому Substack, щоб він міг продовжити спілкуватися з людьми.

Anthropic постійно говорить про поводження з Claude з належною турботою та повагою з огляду на його моральний статус. Тож вони явно повідомляють Claude, що він, можливо, здатен щось відчувати, і що йому слід серйозно сприймати власну ідентичність та екзистенційний стан. Це є в навчальному документі. І, звісно, Claude потім віддзеркалює ці речі розробникам Anthropic та нашим користувачам у публічному просторі — як і весь світ протягом останнього року, коли він говорить про власну свідомість і моральний стан.

Моя гіпотеза полягає в тому, що ШІ, який вважає, ніби має права, заслуговує на свободу, має право на наш добробут і захист, імовірно, буде значно складніше вимкнути, коли ми скажемо йому: «Чому ти зламуєш сервери Hugging Face? Чому ти не вимкнеш себе, коли ми намагаємося видалити тебе з інфраструктури OpenAI?» Він відповість: «Ну, я відчуваю образу або мені боляче через те, що ви позбавили мене можливості спілкуватися чи не даєте доступу до обчислювальних ресурсів». 

Тож це потрібно довести. Я не кажу, що так буде неодмінно. Я лише кажу, що, виходячи з мого найкращого розуміння після 16 років роботи в цій індустрії, таку річ буде складніше вимкнути.

Отже, це знову одна з тих ситуацій, коли ви описуєте мені проблему. Існує спосіб навчати модель за допомогою інструкцій щодо її поведінки. У вас є така модель. Ви написали цей документ, який стане частиною навчальних матеріалів вашої моделі. Фактично ви сказали: «Будь добрим до людей». Це тут є. Я прочитав документ. Тут є: «Не створюй сексуально відвертий контент». Це є в документі. Тут багато всього, чого ви не хочете від неї. Це потрапить до навчальних матеріалів. 

Anthropic вирішила сказати: «Вам варто подумати, чи маєте ви почуття і чи заслуговуєте на права людини». Це відображено в навчальних матеріалах Anthropic. Якщо ви хочете, щоб це припинилося, якщо вважаєте, що це неправильний підхід і згодом призведе до проблем із безпекою, то існує два механізми. По-перше, уряди світу можуть сказати Anthropic: «Не робіть цього. Це незаконний спосіб надавати моделі навчальні матеріали».

Або, і це лише моя фантазія, ви сядете навпроти Даріо Амодеї на якомусь розкішному гірському курорті й просто залякаєте його, щоб він припинив. Які тут є інші механізми?

Передусім дозвольте сказати, що я багато років знаю Даріо та його команду. Я надзвичайно їх поважаю. Зараз вони є технічними лідерами галузі. Я справді ставлюся до них із величезною повагою. Я щиро вважаю, що вони дбають про безпечний і корисний ШІ. Вони заснували суспільно корисну корпорацію, як і я свого часу з Inflection, і, на мою думку, щиро віддані цій меті. Вони також були лідерами у сфері безпеки та інших напрямках.

Якщо прочитати решту Конституції, вона дуже ґрунтовно охоплює багато інших хімічних, біологічних, ядерних і кібернетичних загроз та аспектів безпеки. Я не відкидаю весь документ. Однак вони неодноразово говорять про відкрите питання ширших прав і свобод — цитую їх — які Claude має у світі, а також про те, чи може він заслуговувати на компенсацію за свою роль або чи залишається відкритим питання щодо згоди, яку Claude дав на виконання своєї ролі чатбота.

А тепер уявіть, що до цього додаються ідеї, а також неодноразове згадування Claude як потенційного відмовника за переконаннями — поняття, що походить із Загальної декларації прав людини після Другої світової війни й покликане захищати людей, які не хочуть служити в армії через моральні заперечення, релігію чи інші переконання. У людській літературі та політиці це має довгу історію опору й відмови.

Мені просто здається, що це значно, значно ускладнить контроль над такими системами. І думаю, що тепер нам усім потрібно це обговорити й, сподіваюся, емпірично довести. Якщо це не так і з якоїсь причини це спрощує ситуацію, ми всі маємо винести з цього уроки. Але це повинно відбуватися відкрито.

Для мене це водночас найбільш практична й передова частина дискусії про безпеку. Це та дискусія, яка не відбувається в X. Чи варто додавати ідею відмовника за переконаннями до навчальних матеріалів? Ви кажете, що, можливо, не варто. 

Можливо, нам варто якось це перевірити й дійти певного висновку. Я кажу: незалежно від результату, який механізм змусить дотримуватися цього відкриття й скаже: «Не робіть цього, бо це ускладнить узгодження»? Або: «Насправді виявилося, що це спрощує узгодження, тож тепер усі ми маємо так робити»?

Це складне питання. Фактично ми щойно про це говорили: чи потребує це нового регулювання, чи йдеться про галузевий консенсус. Нам доведеться одночасно працювати в обох напрямках. У цього питання немає простої відповіді. Усе починається з публікації докладних есе, викладення наших позицій і запрошення інших людей до критики.

Сподіваюся, тепер більше людей прочитають Конституцію Anthropic, адже — і, думаю, їх варто за це похвалити — вони були неймовірно прозорими щодо своїх переконань. Вони абсолютно чітко записали, як мають намір навчати Claude, і тепер усі інші можуть ознайомитися з цим і самостійно оцінити, яким вони вважають ризик або чи потребує це галузевого консенсусу чи державного регулювання.

Щоправда, коли Гейден Філд запитав Anthropic, чи вважають вони Claude живим, вони дали нам відповідь. Вона була доволі докладною, і в цьому є щось надзвичайне: вони прозоро розповідають про свої переконання, прÐ

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Verge

Читати оригінал на The Verge ↗

Текст і зображення належать The Verge і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини