GPT-6 Astra від OpenAI рідше галюцинує, але залишається вразливою до прихованих інʼєкцій у промпт
Ключові моменти
- Нова модель OpenAI GPT-6 Astra галюцинує рідше, ніж її попередниця GPT-5.6 Sol, і блокує 99,99 відсотка атак із прямими ін’єкціями запитів.
- Astra також ефективніше протистоїть джейлбрейкам, але наполегливі зловмисники все ще можуть отримати проблемну відповідь приблизно в одній із трьох спроб протягом кількох раундів розмови.
- Для непрямих ін’єкцій запитів, прихованих у документах, які читає ШІ, показник помилок Astra знизився з 27 відсотків до 8,5 відсотка. Це значне покращення, але показник усе ще високий.
Нова модель OpenAI GPT-6 Astra створює менше галюцинацій і ефективніше блокує атаки з ін’єкціями запитів, ніж її попередниці. Але вона все ще недостатньо надійна для справді безпечного розгортання ШІ-агентів.
Згідно з системною картою OpenAI, нова модель Astra допускає значно менше фактичних помилок, ніж її попередниця GPT-5.6 Sol. OpenAI протестувала її на розмовах у ChatGPT, які користувачі позначили як такі, що містять неправильні відповіді, тобто це були особливо схильні до помилок випадки, а їхні показники не слід сприймати як типові для повсякденного використання. Astra значно рідше відтворювала ці зафіксовані помилки, причому найбільші покращення спостерігалися за низьких налаштувань затримки та нижчих рівнів міркування.

Для прямих ін’єкцій запитів, коли користувачі намагаються маніпулювати моделлю за допомогою власних запитів, Astra демонструє майже бездоганний рівень захисту — 99,99 відсотка. OpenAI пояснює це використанням методу GPT-Red, який застосовує автоматизованого атакувальника для посилення моделі під час навчання.
Стійкість до джейлбрейків виглядає подібно. Проти фіксованого набору даних із відомими атаками, спрямованими на отримання шкідливих відповідей про біологію, насильство та кібербезпеку, Astra відмовляється допомагати у 91,5–98,3 відсотка випадків.
Коли зловмисники адаптують свою стратегію протягом кількох раундів розмови, рівень захисту Astra падає приблизно до 67 відсотків, тобто наполегливі супротивники можуть виманити принаймні одну проблемну відповідь приблизно в одній із трьох спроб. Попередні моделі набрали трохи менше 50 відсотків у тому самому тесті. OpenAI зазначає, що ці випробування проводилися на базовій моделі без виробничих рівнів безпеки, як-от класифікатори, які постачаються разом із фактичним продуктом.
Приховані ін’єкції запитів залишаються реальною проблемою безпеки
Astra досягла прогресу в протидії непрямим ін’єкціям запитів, коли атака прихована в документі, який читає ШІ. Зовнішнє тестування, проведене компанією з безпеки Gray Swan із використанням 1810 підібраних атак із їхньої IPI Arena, показало, що за 15 спроб на сценарій Astra зламували щонайменше один раз у 8,5 відсотка випадків. GPT-5.6 Sol зазнавала невдачі у 27 відсотках випадків. Claude Opus 5 показала кращий результат — 4,8 відсотка під час того самого оцінювання, але й вона не була невразливою.

Показники в об’єднаному тесті Gray Swan за перший і другий квартали фактично зросли порівняно з попередніми результатами. Раніше Anthropic повідомляла лише про двовідсотковий показник успішності атак, ґрунтуючись лише на простішому тесті першого кварталу, а GPT-5.6 Sol там також набрала лише 20 відсотків. Anthropic також запускала всі моделі з увімкненим розширеним міркуванням, що разом із ширшим охопленням тесту може пояснити розбіжність.
Навіть якщо це підібрані вручну атаки, їхні показники успішності мають занепокоїти будь-яку корпоративну команду з безпеки. Astra можна обманути за допомогою ін’єкцій інструкцій приблизно в одному з кожних дванадцяти сценаріїв. Opus 5 демонструє кращу стійкість, але все одно зазнає невдачі приблизно в одному з кожних двадцяти одного. І ризик зростає. ШІ-агенти дедалі частіше самостійно пишуть код, працюють з інструментами та керують комп’ютерами — саме це й тестувала Gray Swan. Цих агентів також розробляють для цілодобової роботи у великих масштабах, а читання й обробка документів є одним із їхніх основних завдань.
Новини ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові технології «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.