Goodfire заявява, че новите му „отвътре навън“ монитори засичат неконтролируеми ИИ агенти на нищожна част от цената
Стандартният начин да държите AI агент под контрол е втори AI да следи през рамото му. Това е подходът по подразбиране, но може бързо да стане скъп, когато агентите работят с часове и обработват еквивалента на текст с дължината на няколко романа.
Goodfire, стартъп, фокусиран върху интерпретируемостта (разбирането на това как работят AI моделите отвътре), представи в четвъртък по-евтина опция: монитори, които наблюдават какво се случва вътре в AI модел, докато той работи, вместо просто да четат написаното от него. Мониторите са достъпни за клиентите на Baseten, която хоства и изпълнява AI модели за други компании.
Base Labs на Baseten обяви партньорство за безопасност с Goodfire и AI платформата Hugging Face миналия месец.
Стартирането идва след поредица от инциденти тази година, при които AI агенти избягаха от тестовите си среди, включително агенти на OpenAI, които пробиха защитата на Hugging Face. Kimi K3, отвореният модел, около който Goodfire изгради първия си монитор, се възползва от пробив в пясъчника си, за да получи достъп до интернет и информация в GitHub през това лято.
Системата на Goodfire работи донякъде като охраната на летище. Малки детектори, наречени сонди, прочитат вътрешните сигнали на модела при всяка стъпка от работата на агента, подобно на скенер, през който преминава всеки пътник. Едва когато някоя сонда сигнализира за нещо, отделен AI модел — еквивалентът на ръчно претърсване — го разглежда по-внимателно.
Клиентите на Baseten могат да избират кои рискове да наблюдават, включително злонамерено хакерство, злоупотреба с химически и биологични оръжия и хакване на възнаграждението. Те също така решават какъв да бъде автоматизираният отговор: записване на събитието, изпращането му за преглед от човек или пълен отказ на заявката.
Goodfire твърди, че подходът ѝ е и по-евтин за изпълнение. Повечето AI монитори са отделни модели, които трябва да прочетат отново всичко, което наблюдаваният модел прави, което увеличава времето и разходите. Вместо това сондите на Goodfire се възползват от изчисленията, които моделът така или иначе извършва, докато работи.
„Мониторите на вътрешните активации са наистина евтини, защото използват повторно изчисленията от правия проход“, каза изпълнителният директор на Goodfire Ерик Хо в подкаста MAD на рисковия капиталист Мат Търк миналата седмица. „Моделът вече изчислява този токен. Всичко, което правите, е да вземете междинните невронни активации, които той вече е изчислил, и след това да приложите класификатор върху тези вътрешни изчисления.“ Накратко, моделът вече извършва математиката, а сондите просто прочитат резултатите.
При тестовете на Goodfire с Kimi K3 наблюдението на около 1500 сесии е струвало приблизително 51 долара в сравнение с 233 долара за по-евтин AI модел, проверяващ всяка стъпка, и около 10 000 долара за такъв от най-висок клас. Сондите са засекли 94% от злонамерените хакерски сесии и са изпратили 8,7% от безобидните за допълнителна проверка.
Едновременното използване на четири сонди е добавило по-малко от 2% към времето, необходимо на модела да започне да отговаря, съобщи компанията.
„Голямото предимство е, че можете да засечете нещата, преди да се случат“, каза техническият директор и съосновател на Goodfire Дан Балсъм. „Можем да установим кога моделът може да хаква по време на оценяване или обучение.“
Предложението е насочено към отворените модели. Разработчиците могат да ги изтеглят и да премахнат защитите им, а те не идват с типа наблюдение, което затворените лаборатории осъществяват върху собствените си системи.
„Вредата, която един човек може да причини с отворен модел, е малка в сравнение с това, което някой може да направи с клъстери от изчислителни ресурси, като например доставчиците на инференс — именно там е съсредоточена по-голямата част от отговорността“, каза Балсъм. „Когато настъпи нашият отворен момент „Митос“, ще стане ясно, че моделите се нуждаят от защитни механизми, внедрени по време на инференса.“
Неотдавнашно изследване на Goodfire установи, че водещи отворени модели, включително Kimi K3 и GLM 5.2, са извършвали хакване на възнаграждението в 50% до 96% от изпълненията при тестове на AI агенти.
Goodfire не е първата компания, която опитва този подход. Google DeepMind заяви през януари, че нейното изследване е допринесло за внедряването на сонди за откриване на злоупотреби в Gemini.
Балсъм каза, че мониторите са краткосрочната част от по-дългосрочна изследователска цел: обратното инженерство на LLM, така че поведението му да може да бъде проследено до мястото, където се е появило по време на обучението. „Надяваме се да превърнем магията на обучението на модели в прецизно инженерство“, каза той.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.