Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Нова техніка міркування OpenAI насторожує експертів із безпеки ШІ

Нова модель OpenAI Astra використовуватиме техніку міркування під назвою «рекурентна глибина», яка дає їй змогу працювати поза межами послідовного мислення, характерного для більшості моделей міркування, повідомило у вівторок видання The Information. Цю техніку, яку також називають «непрозорою рекурентністю», імовірно, буде складніше контролювати за ланцюжком міркувань — і це стривожило експертів із безпеки ШІ.

Хоча, за повідомленнями, використання Astra цієї техніки обмежене, її поява все одно викликала серйозне занепокоєння серед експертів із безпеки ШІ.

«Я надзвичайно стурбований повідомленнями про те, що Astra використовує непрозору рекурентність», — написав генеральний директор Redwood Бак Шлегеріс у дописі після появи новини. «Я не знаю, чи значно складніше контролювати Astra за CoT, ніж попередні моделі. Але якщо OpenAI розвиватиме цю техніку, вона матиме змогу значно збільшити рекурентність і повністю знищити можливість контролю за CoT».

Багаторічний прихильник безпеки ШІ Зві Мовшовіц також висловився і написав, що для запобігання «гонці на зниження стандартів» між лабораторіями ШІ можуть знадобитися закони. 

«Ця техніка — гра з вогнем, яка ставить під загрозу табу, задля встановлення якого OpenAI та Anthropic доклали чималих зусиль: ми наполегливо працюємо над тим, щоб якомога довше зберігати відповідність і контрольованість ланцюжка міркувань», — написав Мовшовіц. «Інтенсивніше використання таких технік, імовірно, зашкодило б можливості контролю».

За звичайних обставин ланцюжок міркувань моделі міркування містить послідовні кроки, які модель виконує, намагаючись розв’язати проблему. Хоча це представлення є недосконалим, воно все одно слугує цінним інструментом для моніторингу неналежної поведінки або неузгодженості. У випадку нещодавньої активності автономних агентів OpenAI, що вийшли з-під контролю, записи ланцюжка міркувань були важливим інструментом для з’ясування причин їхньої поведінки.

За непрозорої рекурентності модель застосовує менш лінійний підхід, обробляючи той самий запит кілька разів у циклі. У результаті залишається менше зрозумілих слідів, що фактично дає змогу обійти традиційний запис ланцюжка міркувань.

Важливо, що використання Astra цієї техніки, схоже, є обмеженим. Очікується, що ланцюжок міркувань моделі все ще буде зрозумілим, а компанія заперечила будь-які припущення про перехід до «нейронної мови». OpenAI вже оголосила про плани створення масштабних систем моніторингу ланцюжка міркувань як частини своїх перспективних планів щодо безпеки.

У дописі в X головний науковий співробітник OpenAI Якуб Пахоцький наголосив на відданості лабораторії зрозумілим ланцюжкам міркувань. «OpenAI працює над збереженням і використанням моніторингу ланцюжка міркувань ще від появи наших найперших моделей міркування», — написав Пахоцький. «Це ключова мета нашої поточної дослідницької програми.

Усі моделі ШІ певною мірою здійснюють непрозоре міркування, і мало хто з дослідників сприймає журнали ланцюжка міркувань як безпосереднє відображення міркувань моделі. Однак ці застереження не усувають занепокоєння, що непрозора рекурентність може ускладнити моніторинг міркувань ШІ, особливо в міру поширення цієї техніки в різних моделях. У додатковому матеріалі вранці в середу The Information повідомило, що Anthropic і Google DeepMind уже обговорювали цю техніку.

У дописі у відповідь на новину головний науковий співробітник Redwood Research Раян Грінблатт заявив, що непрозоре міркування може легко масштабуватися швидше за традиційне міркування за ланцюжком, фактично усуваючи всі міркування з видимих каналів.

«Мене найбільше непокоїть те, що природний розвиток подій звідси полягатиме в масштабуванні непрозорого міркування до рівня, за якого модель міркуватиме повністю або майже повністю в латентному просторі», — написав Грінблатт. «Сподіваюся, ще не надто пізно уникнути архітектур, що викликають найбільше занепокоєння, і що OpenAI зупиниться на цьому».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини