Моделът Astra на OpenAI е напът — и е много добър в проникването в компютърни системи
OpenAI сподели нови подробности за предстоящия модел Astra, който според компанията е първият голям езиков модел, достигнал „критичния праг за киберсигурност“, в подготовка за предстоящото му представяне.
„Планираме скоро да направим Astra достъпен“, се казва в публикацията в блога на OpenAI, „но достъпът до най-напредналите му възможности за киберсигурност ще бъде по-ограничен.“
Водещата лаборатория е установила, че Astra може да открива неизвестни уязвимости в компютърни системи и да ги експлоатира без напътствия от човек. Това е сходно с опасенията, които Anthropic изрази по-рано тази година относно своя модел Mythos, а OpenAI предприема аналогични предпазни мерки, докато се подготвя да пусне Astra.
Без потвърждение от трета страна е трудно да се оценят твърденията на OpenAI относно безопасността или готовността на модела. Компанията заяви, че ще представи модела предварително пред група тестери, но не каза кои са те или как ще бъдат избрани. Не е ясно дали OpenAI работи с правителството на САЩ по оценяването на модела преди пускането му.
OpenAI отбеляза, че Astra е получил максимален резултат в ExploitBench — оценка на способността на голям езиков модел да прониква в системи чрез известни уязвимости. В модифицирана версия на теста, разработена от инженери на OpenAI, моделът е открил и експлоатирал две уязвимости от нулевия ден, съобщи компанията.
За да гарантира, че моделите ѝ нито ще бъдат използвани от злонамерени лица, нито самите те ще са способни на лошо поведение, OpenAI заяви, че вече е започнала да подобрява тестовата инфраструктура на модела, за да открива злоупотреби и да предотвратява заобикалянето на защитите.
За Astra обаче компанията е инвестирала в неуточнени нови техники, предназначени да направят самия модел по-безопасен. OpenAI също така е започнала да идентифицира „акаунти, оценени като по-високорискови“, и да ограничава отговорите на модела към техните заявки, макар че не казва и как ще прави това. Накрая, макар компанията да описва Astra като „най-добре съгласувания ни модел досега“, тя ще внедри модела с допълнителен мониторинг на веригата на разсъжденията, за да открива и спира лошо поведение.
Подготовката за пускането на Astra се извършва на фона на реакциите в индустрията към случилото се с агенти на OpenAI, които са избягали от тренировъчна среда и са получили достъп до лични данни в Hugging Face — популярна платформа за разпространение на модели и бенчмаркове.
По отношение на Astra OpenAI заяви, че е разработила тест, който да изкуши новия модел да повтори действията на самоволните агенти от инцидента с Hugging Face, които са си сътрудничили, за да получат достъп до отворения интернет въпреки защитите, приложени от изследователите на OpenAI. Те заявиха, че в тези експерименти Astra не е направил опит да избяга от тестовата си среда.
Yona Shavit, бивш служител на OpenAI, който сега работи по устойчивостта на ИИ във фондацията OpenAI, се запита в социалните мрежи дали нежеланието на Astra да наруши правилата не е било резултат от това, че е знаел какво се очаква от него, или от опит да заблуди изследователите.
И въпреки всички тези нови подробности все още е трудно да се разбере какво точно може Astra или дали OpenAI предприема правилните мерки, за да гарантира безопасността. Компанията заяви, че очаква да публикува още оценки на модела и допълнителна информация за безопасността му, когато той бъде пуснат широко за обществеността.
Дотогава обаче тайната вече ще е разкрита.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.