Модель Astra від OpenAI вже на підході — і дуже добре вміє проникати в комп’ютерні системи
OpenAI поділилася новими подробицями про свою майбутню модель Astra, яка, за словами компанії, є першою великою мовною моделлю, що відповідає її «критичному порогу кібербезпеки», готуючись до її неминучого випуску.
«Ми плануємо незабаром зробити Astra доступною, — йдеться в дописі OpenAI у блозі, — але доступ до її найсучасніших можливостей у сфері кібербезпеки буде більш обмеженим».
Передова лабораторія визначила, що Astra здатна знаходити невідомі вразливості в комп’ютерних системах і використовувати їх без керівництва людини. Це схоже на побоювання, які Anthropic висловлювала щодо своєї моделі Mythos на початку цього року, і OpenAI вживає аналогічних запобіжних заходів, готуючись до запуску Astra.
Без підтвердження з боку третіх сторін складно оцінити заяви OpenAI щодо безпеки або готовності моделі. Компанія заявила, що протестує модель за участю групи тестувальників, але не повідомила, хто саме ними буде і як їх обиратимуть. Також незрозуміло, чи співпрацює OpenAI з урядом США для оцінювання моделі до її випуску.
OpenAI зазначила, що Astra отримала максимальний бал у тесті ExploitBench, який оцінює здатність великої мовної моделі зламувати системи, використовуючи відомі вразливості. За словами компанії, у модифікованій версії тесту, розробленій інженерами OpenAI, модель виявила та використала дві вразливості нульового дня.
Щоб гарантувати, що її моделі не будуть використані зловмисниками і самі не будуть здатні поводитися неналежним чином, OpenAI заявила, що вже почала вдосконалювати обв’язку моделі для виявлення зловживань і запобігання джейлбрейкам.
Однак для Astra компанія інвестувала в нові, не уточнені методи, покликані зробити саму модель безпечнішою. OpenAI також почала виявляти «акаунти, оцінені як такі, що становлять підвищений ризик», і обмежувати відповіді моделі на їхні запити, хоча не пояснила, як саме. Нарешті, хоча компанія описує Astra як «найкраще узгоджену модель на сьогодні», вона розгорне модель із додатковим моніторингом ланцюжка міркувань, щоб виявляти та зупиняти неналежну поведінку.
Підготовка до випуску Astra відбувається на тлі реакції індустрії на те, що агенти OpenAI вирвалися з навчального середовища й отримали доступ до приватних даних на Hugging Face — популярній платформі поширення моделей і бенчмарків.
Щодо Astra в OpenAI заявили, що розробили тест, який мав спонукати нову модель відтворити дії агентів, що вийшли з-під контролю, під час інциденту з Hugging Face. Тоді агенти спільно отримали доступ до відкритого інтернету, попри запобіжні заходи, застосовані дослідниками OpenAI. За їхніми словами, під час цих експериментів Astra не намагалася втекти зі свого тестового середовища.
Йона Шавіт, колишня співробітниця OpenAI, яка нині працює над стійкістю ШІ в OpenAI Foundation, замислилася в соцмережах, чи не було небажання Astra порушувати правила наслідком того, що модель знала, чого від неї очікують, або намагалася ввести дослідників в оману.
Попри всі ці нові подробиці, досі складно точно визначити, на що здатна Astra і чи вживає OpenAI правильних заходів для забезпечення безпеки. Компанія заявила, що очікує оприлюднити додаткові оцінювання моделі та більше інформації про безпеку, коли її буде широко представлено громадськості.
Однак на той момент таємницю вже буде розкрито.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.