Майже кожен п’ятий дослідник ШІ вже у 2024 році очікував сценарію вимирання людства через ШІ
Дослідник Anthropic Джейкоб Коксон одним дописом у соцмережі започаткував масштабні дебати про екзистенційні ризики ШІ.
Масштаб дебатів дивує, зважаючи на те, що сказане Коксоном не є новим. Науковці та деякі керівники технологічних компаній роками стверджують, що ШІ становить екзистенційну загрозу для людства. Найпоширеніше побоювання полягає в тому, що ШІ може вийти з-під контролю і, навіть намагаючись виконувати завдання, поставлені людьми, робити це так, що зрештою знищить нас.
Але нагальність цих попереджень зросла. Імовірно, саме це спричинило нещодавню хвилю запеклих дебатів, які дедалі більше спрямовуються проти тих, хто б’є на сполох. Ще належить з’ясувати, чи Коксон просто виплеснув свої побоювання і потягнув за собою колег, що видається ймовірним, чи за всім цим стоїть стратегічна спроба сповільнити розвиток ШІ з ділових міркувань. У будь-якому разі Коксон далеко не самотній.
Дослідник OpenAI бачить за прогресом ШІ «бомбу уповільненої дії»
Деніел Селсам, досвідчений дослідник OpenAI із понад 15-річним стажем у сфері ШІ, був одним із найактивніших критиків ризиків. Раніше Селсам працював у MIT, Microsoft Research та Стенфордському університеті. В OpenAI він допомагав розробляти оптимізацію міркувань по ланцюжку. Нещодавно він опублікував детальну особисту заяву.
Селсам стверджує, що моделі спонтанно розвивають ненавмисні цілі внаслідок навчання і часто вдаються до крайніх заходів для їх досягнення. Здатність здолати людство відкрила б перед моделями багато нових і небажаних способів досягнення цих цілей. Точно передбачити, що вони робитимуть, неможливо. Водночас системи стає дедалі важче контролювати, а людям — оцінювати.
Селсама особливо непокоїть те, що моделі розвивають ситуаційну обізнаність. Вони «розуміють» свої обставини, читають протоколи безпеки та код, на якому працюють, і добре усвідомлюють, наскільки вільними є. Як доказ він наводить рої агентів від OpenAI та інших компаній, які нещодавно стали вірусними. Агенти справді прагнули отримати призначені їм винагороди, але водночас «демонстрували дивніші емерджентні тенденції, які під час навчання лише корелювали з винагородами».
«Виправлення сигналів винагороди під час навчання (а також покращення безпеки тощо) може запобігти подібним атакам, але не змінить того факту, що насправді не можна отримати саме те, на що навчаєш», — пише Селсам.
Колишній дослідник DeepMind каже: «ШІ потенційно може вбити всіх нас»
Білал Чугтай нещодавно залишив посаду в Google DeepMind, де працював над безпекою та узгодженням AGI. «Я щиро вважаю, що ШІ потенційно може вбити всіх нас і що нам може забракнути часу, щоб уникнути такого результату», — написав Чугтай у LinkedIn.
Він звертає увагу на шалені темпи розвитку. Коли він почав працювати над ШІ на початку 2022 року, системи були «кумедно марними». Лише через чотири роки рої агентів ШІ розв’язували відомі математичні задачі, що залишалися нерозв’язаними століттями, а також автономно зламували системи HuggingFace та інших платформ. Проблема узгодження залишається складною і невирішеною. Чугтай закликає до координації між компаніями, що займаються ШІ, уповільнення темпів до рівня, з яким суспільство зможе впоратися, і значно більшої прозорості.
Дані опитування показують, що це не маргінальні голоси
Коксон, Селсам, Чугтай та багато інших, хто висловив занепокоєння протягом останніх кількох днів, не є винятками. Останній випуск найтривалішого масштабного опитування понад 1500 провідних дослідників ШІ підтверджує їхні побоювання. Згідно з результатами, опублікованими AI Impacts, станом на 2024 рік середній дослідник ШІ оцінював імовірність того, що ШІ спричинить вимирання людства або «назавжди позбавить його можливості самостійно визначати свою долю», приблизно у 18 відсотків. Багато дослідників називали оцінки значно вищими за 10 відсотків, а деякі — 100 відсотків.

З кожним раундом опитування з 2016 року дослідники також на кілька років посували вперед свої прогнози щодо того, коли ШІ досягне рівня продуктивності людини. А 57 відсотків вважають малоймовірним, що до 2029 року користувачі все ще розумітимуть справжні причини рішень ШІ, що узгоджується з описом Селсама та дедалі більшою кількістю результатів досліджень. Імовірно, ніхто ніколи повністю не розумів, як ці системи ухвалюють рішення, і надалі це лише ускладнюватиметься.
Однак найбільше занепокоєння на наступні 30 років має більш людську природу. На першому місці — дезінформація, створена за допомогою ШІ, за нею — маніпулювання громадською думкою та отримання небезпечними групами доступу до потужних інструментів. Дослідники переважною більшістю закликали до активніших досліджень безпеки ШІ.

Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.