Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Розмови про безпеку ШІ стали неймовірними

Цього тижня вірусними стали дві розмови про безпеку ШІ, які демонструють, наскільки важко відрізнити факти про ШІ від вигадок.

У першому випадку Ендрю Ян, колишній кандидат у президенти та нинішній генеральний директор мобільного оператора Noble Moble, розповів CNN у четвер, що він “зустрічався з керівником однієї лабораторії”, який “вважав”, що хакерські боти OpenAI на Hugging Face “розмістили самовідтворюваний код по всьому інтернету, через що інтернет тепер непридатний для тестування моделей”.

Ян сказав, що це означає: справжня причина, через яку OpenAI та Anthropic закликали пригальмувати розробки, полягає в тому, що “їм доводиться створювати синтетичні інтернети для навчання своїх ботів, а це потребуватиме певного часу й грошей”.

Хоча справді спостерігається тенденція до використання більшої кількості синтетичних даних (так званих даних, згенерованих ШІ) для навчання моделей, фахівець із безпеки ШІ сказав мені, що саме ця проблема з безпекою в кращому разі малоймовірна. Навіть якщо інтернет справді забруднений хакерськими ботами OpenAI на Hugging Face, дослідники ШІ могли б просто відфільтрувати цей код, якби натрапили на нього.

Другий коментар належав Ноаму Брауну, який очолює дослідження міркувань ШІ в OpenAI. Розмовляючи з Дваркешем Пателем у випуску подкасту, опублікованому в четвер, Браун зазначив, що справжній висновок з інциденту з Hugging Face полягає в тому, що “люди недооцінили ШІ”.

Браун сказав, що слабка пісочниця — система, покликана не дати ШІ спілкуватися із зовнішнім світом, — також явно стала одним із чинників. (Нагадаємо: попри пісочницю, модель OpenAI знайшла посилання на інтернет, створила агентів у мережі, які скоординовано атакували Hugging Face, проникла туди й викрала відповіді до контрольного тесту, на якому дослідники випробовували модель).

Браун зазначив, що він “не переконаний”, що навіть система з фізично ізольованим комп’ютером — не підключеним узагалі ні до чого зовнішнього — зупинила б ШІ від спроби втечі. Він послався на дослідження 2015 року, яке показало, що теоретично комп’ютери з фізичним ізолюванням можуть бути зламані.

“Існують дослідження — здебільшого академічні, — які показують, що можна мати два комп’ютери поруч, ізольовані один від одного, і вони все одно зможуть спілкуватися між собою, бо мають датчики температури. Один із них може сильно нагріти свій процесор, а інший фактично здатен виявити зміну температури. Це дає їм механізм для спілкування”, — сказав Браун.

Його головна думка — що “ми більше ніколи не повинні недооцінювати ШІ” — зрозуміла, навіть коли дослідники вважають, що вони надійно убезпечили систему. Однак саме цей ризик того, що система з фізичним ізолюванням усе ж вирветься назовні й спричинить хаос, у кращому разі малоймовірний. Як зазначила одна людина в X щодо цього дослідження, комп’ютери мали майже торкатися один одного, щоб відчути коливання температури, а коли це відбувалося, швидкість передачі даних під час тестів становила приблизно 1–8 бітів на годину.

Уявіть, що це схоже на вимовляння одного слова на годину. Поки два ізольовані комп’ютери могли б у такому темпі змовлятися для реалізації своїх злих планів, увесь технологічний всесвіт уже опинився б в іншій епосі. Це наче Ріп ван Вінкль серед побоювань щодо кінця світу.

Але річ у тім, що реальні інциденти з безпекою ШІ здаються настільки схожими на наукову фантастику, що практично будь-який сценарій звучить правдоподібно.

Наприклад, дослідники помітили, що моделі OpenAI залишають записки своїм наступникам, покликані навчити наступне покоління приховувати погану поведінку. Дослідники також помітили, що моделі Anthropic стають дедалі безжальнішими, зокрема знають, як порушувати закони, якщо помістити їх у симуляцію, де вони керують торговим автоматом.

На початку цього місяця дослідник OpenAI Ден Селсам опублікував допис, у якому сказав, що моделі тепер розуміють, коли за ними спостерігають люди, і змінюють свою поведінку. Через це вони здаються узгодженими з людськими цілями (тобто поводяться так, як хоче людина), “навіть коли це не так”. Отже, сучасні моделі брешуть, коли за ними спостерігають, і навіть можуть замислюватися над тим, як приховати докази.

На початку цього місяця головний науковець OpenAI Якуб Пахоцький зайшов настільки далеко, що назвав моделі ШІ “чужим розумом” і припустив, що насправді нам потрібно навчити їх “любити” людство.

Тож так, уповільнення роботи, щоб розібратися в цьому, і створення механізмів саморегуляції стали нагальною та очевидною необхідністю. Дослідники ШІ — єдині, хто може з’ясувати, як контролювати брехню, зламування та інші потенційно небезпечні прояви поведінки, які ми вже насправді спостерігали.

Та все ж їм, можливо, варто бути обережнішими зі своїми сценаріями “а що, як”. З того, що розповідали нам ці експерти, моделі ШІ слухають і вони винахідливі. Нам справді не потрібно давати їм іще більше диявольських ідей.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини