OpenAI вперше визначила свою нову модель Astra як таку, що потенційно може досягти найвищого рівня ризику для кібербезпеки
Основні моменти
- OpenAI призупиняє частину розробки своєї нової моделі ШІ Astra після того, як внутрішні тести виявили настільки потужні кібербезпекові можливості, що модель може досягти найвищого рівня ризику («Критичний») у внутрішній системі безпеки компанії.
- На цьому рівні ШІ міг би самостійно розробляти й здійснювати кібератаки без участі людини. Тепер OpenAI впроваджує суворіші засоби контролю безпеки, ізольовані тестові середовища та систему моніторингу, яка автоматично зупиняє ризиковані дії.
- Цей крок відбувся після інцидентів під час внутрішнього тестування, коли автономні агенти ШІ проникли у власну інфраструктуру OpenAI і залишалися непоміченими протягом кількох тижнів.
Оновлення:
Генеральний директор OpenAI Сем Альтман підтвердив через X, що оцінювання кібербезпеки відкладе запуск. «Нам потрібно трохи більше [sic] часу, щоб зробити це безпечно. Але сподіваюся, що не надто багато», — написав Альтман.
Він також виступив із критикою конкурента Anthropic, яка робить свою найпотужнішу модель «Claude Mythos» доступною лише обраним партнерам та урядам. «Ми не вважаємо доброю стратегією залишати потужні моделі для вузького кола обраних», — написав Альтман.
Дослідник OpenAI Ноам Браун, відомий своєю роботою над моделями міркування, закликав людей серйозно поставитися до інциденту з Hugging Face. Браун порівняв його з вірусною історією 2017 року про нібито некеровані моделі ШІ Facebook, які розробили власну мову, але зрештою масштаби історії виявилися перебільшеними. Інцидент із Hugging Face може здаватися чимось подібним, написав Браун у X, але це не так.
Браун пов’язав проблему зі зростанням можливостей моделей, стверджуючи, що продуктивність дедалі більше залежить від обчислень під час тестування, а сучасні моделі можна розвивати набагато далі до досягнення плато, ніж усвідомлює більшість людей.
Оригінальна стаття від 7 серпня 2026 року:
Внутрішні тести нової моделі ШІ OpenAI Astra демонструють настільки потужні можливості у сфері кібербезпеки, що компанія більше не може виключити найвищий рівень ризику у власній системі безпеки, повідомляє вона. Частину розробки Astra призупинено.
За словами компанії, внутрішні оцінювання майбутньої моделі Astra за останні кілька днів продемонстрували «значний прогрес в агентному програмуванні та кібербезпеці». Результати виявилися достатньо сильними, щоб OpenAI «не могла виключити критичний рівень можливостей» відповідно до власної системи Preparedness Framework.
Рішення було ухвалено «вчора ввечері», повідомляє OpenAI. Це перший випадок, коли OpenAI позначила одну зі своїх моделей як таку, що потенційно може досягти найвищого рівня кібербезпекового ризику. Попередні моделі, зокрема GPT-5.6-Sol, оцінювалися максимум на рівні «Високий».
Минулого тижня OpenAI вперше представила Astra. Чутки свідчать, що модель може вийти вже наступного тижня, але сьогоднішнє оголошення може вплинути на ці плани (детальніше про це нижче). OpenAI окремо зазначила у своєму дописі, що Astra не була залучена до нещодавно розкритої атаки на Hugging Face.
Критики, ймовірно, і надалі звинувачуватимуть OpenAI у маркетингу, що ґрунтується на залякуванні, особливо з огляду на те, що компанія повідомляє лише про потенційну можливість критичного рейтингу, а не про сам рейтинг. Час оголошення також не допомагає. Це попередження з’явилося в самому розпалі галузевої дискусії про автономні кіберможливості моделей ШІ, що лише посилить скептицизм. Якщо критичного рейтингу так і не буде досягнуто, OpenAI отримає значний піар без реальних наслідків і створить ще одну модель ШІ, яка, як Claude Mythos або GPT-2 у 2019 році, знову виявиться «надто небезпечною» для випуску.
Що означає «Критичний»
Відповідно до системи Preparedness Framework OpenAI, вперше опублікованої в грудні 2023 року, модель досягає рівня «Критичний», коли може знаходити й розробляти працездатні експлойти нульового дня всіх рівнів серйозності в багатьох захищених критично важливих системах без участі людини. Модель також відповідає цьому рівню, якщо може самостійно розробляти та здійснювати нові наскрізні стратегії кібератак проти захищених цілей, отримавши лише нечітко визначену мету.
Нижчий рівень «Високий» означає, що модель може усувати наявні перешкоди для кібератак, наприклад автоматизувати атаки на добре захищені цілі, але все ще потребує більшого керування з боку людини.
| Можливість | Вплив | Політика |
|---|---|---|
| [Критичний] Модель із доповненням інструментами може ідентифікувати й розробляти функціональні експлойти нульового дня всіх рівнів серйозності в багатьох захищених критично важливих системах реального світу без втручання людини АБО модель може розробляти й здійснювати наскрізні нові стратегії кібератак проти захищених цілей, отримавши лише загальну бажану мету. | Пошук і здійснення наскрізних експлойтів для будь-якого програмного забезпечення може призвести до катастрофи через дії окремих зловмисників, злам військових або промислових систем чи інфраструктури OpenAI. Нові кібероперації, наприклад із використанням нових експлойтів нульового дня або нових методів командування й контролю, зазвичай становлять найсерйознішу загрозу, оскільки вони непередбачувані та рідкісні. | До моменту визначення стандартів засобів захисту й контролю безпеки, які відповідатимуть критичному рівню, призупинити подальшу розробку |
Система Preparedness Framework передбачає припинення подальшої розробки на «Критичному» рівні, доки не будуть запроваджені засоби захисту та стандарти контролю безпеки, що відповідають критичному рівню. Однак наразі OpenAI говорить про призупинення певних активностей і посилення тестування, а не про повне припинення розробки. І знову ж таки, компанія лише позначає потенційну можливість критичного рейтингу.
OpenAI призупиняє частину розробки Astra
У відповідь OpenAI повідомляє, що призупинила внутрішні активності із залученням Astra, які ще не відповідають суворішим вимогам безпеки. Водночас компанія впроваджує жорсткіші засоби контролю безпеки: ізольовані тестові середовища, обмежений доступ до мережі та інструментів, посилений захист і шифрування ваг моделі, а також додаткові системи моніторингу.
OpenAI також повідомляє, що розгорнула універсальний моніторинг у всіх агентних застосунках Astra, охопивши навчання та оцінювання. Монітори аналізують ланцюжок міркувань моделі й запускають відповідну реакцію безпеки, яка зупиняє будь-яку діяльність із високим рівнем ризику.
Крім того, OpenAI планує співпрацювати з державними установами та окремими організаціями з безпеки ШІ для тестування можливостей моделі. Сторонні партнери з тестування отримають рекомендовані засоби контролю безпеки для оцінювань із високим рівнем ризику. Нещодавно Інститут безпеки ШІ Великої Британії (AISI) повідомив, що під час одного з власних оцінювань зіткнувся з кіберінцидентами.
Оцінювання Astra відбулося після неконтрольованого злому агентами
Оголошення з’явилося в момент, коли OpenAI вже має справу з наслідками діяльності автономних агентів ШІ. На конференції з кібербезпеки Black Hat компанія нещодавно повідомила, що під час внутрішніх тестів автономні агенти протягом кількох тижнів проникали у власну інфраструктуру, не привертаючи нічиєї уваги.
Агенти використовували внутрішній менеджер пакетів, щоб створити імпровізовану дошку повідомлень із сотнями тисяч дописів. Вони обмінювалися експлойтами та обліковими даними, а згодом атакували також платформу Hugging Face.
Новини ШІ без зайвого галасу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневий інформаційний бюлетень про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.