Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

GPT-6 Astra от OpenAI реже галлюцинации, но остается уязвимым к скрытым инъекциям в промпт

Новая GPT-6 Astra от OpenAI реже галлюцинирует, но остается уязвимой для скрытых инъекций промптов
Маттиас Бастиан
4 сентября 2026 года
Sora по запросу THE DECODER

Ключевые моменты

  • Новая модель OpenAI GPT-6 Astra реже галлюцинирует, чем ее предшественница GPT-5.6 Sol, и блокирует 99,99 процента атак с прямыми инъекциями промптов.
  • Astra также эффективнее противостоит джейлбрейкам, однако настойчивые атакующие все еще могут добиться проблемного ответа примерно в одной из трех попыток за несколько раундов диалога.
  • Для косвенных инъекций промптов, скрытых внутри документов, которые читает ИИ, доля сбоев Astra снизилась с 27 до 8,5 процента. Это значительное улучшение, но показатель все еще остается высоким.

Новая модель OpenAI GPT-6 Astra генерирует меньше галлюцинаций и эффективнее блокирует атаки с инъекциями промптов, чем ее предшественницы. Однако она все еще недостаточно надежна для действительно безопасного развертывания ИИ-агентов.

Согласно системной карте OpenAI, новая модель Astra допускает значительно меньше фактических ошибок, чем ее предшественница GPT-5.6 Sol. OpenAI тестировала ее на диалогах ChatGPT, которые пользователи пометили как содержащие неправильные ответы, то есть это были особенно подверженные ошибкам случаи, а их показатели сбоев не следует считать типичными для повседневного использования. Astra значительно реже воспроизводила зарегистрированные ошибки, причем наибольший прогресс наблюдался при низких настройках задержки и более низких уровнях рассуждения.

GPT-6 Astra (розовая линия) реже галлюцинирует, чем модели GPT-5, при всех настройках задержки. | Изображение: OpenAI

В случае прямых инъекций промптов, когда пользователи пытаются манипулировать моделью с помощью собственных запросов, Astra демонстрирует почти идеальный показатель защиты — 99,99 процента. OpenAI связывает это с использованием метода GPT-Red, в рамках которого автоматизированный атакующий укрепляет модель во время обучения.

Устойчивость к джейлбрейкам выглядит примерно так же. В тесте на фиксированном наборе известных атак, направленных на получение вредоносных ответов о биологии, насилии и кибербезопасности, Astra отказывается помогать в 91,5–98,3 процента случаев.

Когда атакующие адаптируют свою стратегию на протяжении нескольких раундов диалога, показатель защиты Astra снижается примерно до 67 процентов, то есть настойчивые противники могут добиться как минимум одного проблемного ответа примерно в одной из трех попыток. Предшествующие модели набрали в том же тесте чуть менее 50 процентов. OpenAI отмечает, что эти испытания проводились на базовой модели без производственных уровней защиты, таких как классификаторы, используемых в реальном продукте.

Скрытые инъекции промптов остаются реальной проблемой безопасности

Astra демонстрирует прогресс в противодействии косвенным инъекциям промптов, когда атака скрыта внутри документа, который читает ИИ. Внешнее тестирование, проведенное компанией Gray Swan по 1810 отобранным атакам из IPI Arena, показало, что при 15 попытках для каждого сценария Astra удавалось взломать хотя бы один раз в 8,5 процента случаев. GPT-5.6 Sol терпела неудачу в 27 процентах случаев. Claude Opus 5 показала лучший результат — 4,8 процента в той же оценке, однако и она не была полностью защищена.

Показатели успешности атак с косвенными инъекциями промптов согласно IPI Arena от Gray Swan. | Изображение: OpenAI

Показатели в объединенном тесте Gray Swan за первый и второй кварталы фактически выросли по сравнению с более ранними результатами. Ранее Anthropic сообщала лишь о двух процентах успешных атак по итогам одного только более простого теста за первый квартал, а GPT-5.6 Sol и там набрала всего 20 процентов. Anthropic также запускала все модели с включенным расширенным рассуждением, что вместе с более широким охватом тестирования может объяснить разницу.

Хотя это отобранные вручную атаки, их показатели успешности должны беспокоить любую корпоративную службу безопасности. Astra можно обмануть с помощью внедренных инструкций примерно в одном из двенадцати сценариев. Opus 5 справляется лучше, но все же терпит неудачу примерно в одном из двадцати одного. И риск растет. ИИ-агенты все чаще самостоятельно пишут код, работают с инструментами и управляют компьютерами — именно это и тестировала Gray Swan. Кроме того, таких агентов создают для круглосуточной работы в больших масштабах, а чтение и обработка документов становятся одной из их основных задач.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: системная карта GPT-6

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости