Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

GPT-6 Astra на OpenAI халюцинира по-рядко, но остава уязвим към скрити инжекции в промпта

Моделът GPT-6 Astra на OpenAI халюцинира по-малко, но остава уязвим към скрити инжекции на подсказки
Матиас Бастиан
4 септември 2026 г.
Sora, подканена от THE DECODER

Основни моменти

  • Новият модел GPT-6 Astra на OpenAI халюцинира по-малко от предшественика си GPT-5.6 Sol и блокира 99,99 процента от директните атаки чрез инжектиране на подсказки.
  • Astra устоява и по-ефективно на опитите за заобикаляне на ограниченията, но упоритите нападатели все пак могат да получат проблемен отговор приблизително при един от всеки три опита в рамките на няколко рунда на разговор.
  • При непреки инжекции на подсказки, скрити в документи, които изкуственият интелект прочита, процентът на грешките на Astra е спаднал от 27 процента на 8,5 процента. Това е голямо подобрение, но процентът все още е висок.

Новият модел на OpenAI, GPT-6 Astra, генерира по-малко халюцинации и блокира атаките чрез инжектиране на подсказки по-ефективно от предшествениците си. Но все още не е достатъчно надежден за наистина сигурно внедряване на автономни агенти с изкуствен интелект.

Според новия модел Astra той допуска значително по-малко фактически грешки от предшественика си GPT-5.6 Sol, сочи системната карта на OpenAI. OpenAI го е тествала в разговори в ChatGPT, които потребителите са маркирали заради грешни отговори, тоест това са били особено податливи на грешки случаи, чиито проценти на неуспех не бива да се приемат като типични за ежедневната употреба. Astra е възпроизвеждала тези докладвани грешки много по-рядко, като най-големите подобрения са се проявили при настройки с ниска латентност и по-ниски нива на разсъждение.

GPT-6 Astra (в розово) халюцинира по-малко от моделите GPT-5 при всички настройки на латентността. | Изображение: OpenAI

При директни инжекции на подсказки, при които потребителите се опитват да манипулират модела чрез собствените си подсказки, Astra постига почти идеален процент на защита от 99,99 процента. OpenAI отдава това на своя метод GPT-Red, който използва автоматизиран нападател, за да подсили модела по време на обучението.

Устойчивостта на опити за заобикаляне на ограниченията изглежда сходна. Срещу фиксиран набор от известни атаки, целящи да извлекат вредни отговори за биологията, насилието и киберсигурността, Astra отказва да помогне в 91,5 до 98,3 процента от случаите.

Когато нападателите адаптират стратегията си в рамките на няколко рунда на разговор, процентът на защита на Astra спада до около 67 процента, което означава, че упоритите противници могат да изкопчат поне един проблемен отговор приблизително при един от всеки три опита. Моделите предшественици са постигнали малко под 50 процента на същия тест. OpenAI отбелязва, че тези тестове са проведени с базовия модел без защитните слоеве от производствената среда, като класификатори, които се доставят с действителния продукт.

Скритите инжекции на подсказки остават реален проблем за сигурността

Astra бележи напредък при непреките инжекции на подсказки, при които атака е скрита в документ, който изкуственият интелект прочита. Външно тестване от компанията за сигурност Gray Swan, използващо 1810 подбрани атаки от тяхната IPI Arena, установи, че при 15 опита за всеки сценарий Astra е била пробита поне веднъж в 8,5 процента от случаите. GPT-5.6 Sol се е провалил в 27 процента от случаите. Claude Opus 5 се е представил по-добре — с 4,8 процента при същата оценка, но и той не е бил неуязвим.

Процент на успеваемост на атаките при непреки инжекции на подсказки според IPI Arena на Gray Swan. | Изображение: OpenAI

Всъщност резултатите от комбинирания тест на Gray Swan за първото и второто тримесечие са се повишили спрямо по-ранните резултати. Anthropic по-рано е съобщила за едва два процента успеваемост на атаките, въз основа само на по-лесния тест за първото тримесечие, а GPT-5.6 Sol също е постигнал едва 20 процента там. Anthropic е провела тестовете с включено разширено разсъждение за всички модели, което заедно с по-широкия обхват на теста може да обясни разликата.

Въпреки че това са подбрани, внимателно селектирани атаки, процентите на успеваемост би трябвало да тревожат всеки екип за корпоративна сигурност. Astra може да бъде подведена чрез инжектирани инструкции приблизително в един от всеки дванадесет сценария. Opus 5 се справя по-добре, но все пак се проваля приблизително в един от всеки двадесет и един случая. А рискът нараства. Агентите с изкуствен интелект все по-често пишат код, използват инструменти и управляват компютри самостоятелно — именно това е тествала Gray Swan. Тези агенти също така се създават за непрекъсната работа в голям мащаб, като четенето и обработката на документи е една от основните им задачи.

Новини за изкуствения интелект без сензация – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за новостите в сектора „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Системна карта на GPT-6

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини