Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← Към новините

NVIDIA AI представи NOOA: обектно-ориентирана Python рамка, която превръща AI агент в един-единствен Python клас

NVIDIA Labs публикува с отворен код NOOA (NVIDIA Object-Oriented Agents), независима от модела Python рамка за изграждане на AI агенти. Днес разработването на агенти е разделено между шаблони за подсказки, схеми на инструменти, код за обратни извиквания и графи на работни процеси. NOOA обединява всичко това в един Python клас. Методите са действията, които моделът може да извършва. Полетата са състоянието на агента. Docstring-овете са подсказки. Анотациите на типовете са договори, които средата за изпълнение налага. Метод, чието тяло е ..., се завършва по време на изпълнение от управляван от LLM цикъл, докато метод с нормално тяло остава детерминистичен Python код. Така разработчиците и моделите споделят един интерфейс, което позволява поведението на агента да бъде тествано, проследявано, рефакторирано и управлявано чрез контрол на версиите като обикновен софтуер. NVIDIA отчита 82.2% на SWE-bench Verified, 86.8% на CyberGym L1 и 85.1% среден RHAE на ARC-AGI-3 — при приблизително наполовина по-малко токени спрямо отворените хранилища, с които е сравнен.

Може ли да бъде внедрена?

Да, но само в изолация на ниво операционна система. NOOA е с лиценз Apache 2.0, инсталира се с pip install nooa (v0.0.8, публикувана на 30 юли 2026 г.) и изисква Python 3.12–3.13. PyPI я класифицира като алфа версия, а NVIDIA я описва като изследователска предварителна версия. Агентите могат да изпълняват код, генериран от LLM, и NVIDIA изрично посочва, че нейните AST проверки и списъци с отказани модули са защитни механизми на дълбочина, а не граница на изолация. Границата на изолация е контейнер, виртуална машина или NVIDIA OpenShell. Моделите могат да се сменят чрез LiteLLM, така че работят хоствани API, Ollama и крайни точки на vLLM.

  • Ниво на компанията: AI-native стартъпи и екипи на платформи от средния пазар, които изграждат вътрешни агенти. Групи за корпоративни AI платформи и приложни изследвания, провеждащи оценки или пилотни проекти. Регулираните производствени натоварвания трябва да изчакат стабилна версия.
  • Индустрии: инструменти за разработчици, киберсигурност, облачни технологии и DevOps, анализ на данни, операции във финансовите услуги, клиентска поддръжка.
  • Приложения: триаж и коригиране на проблеми в хранилища, автоматизация на терминали и инфраструктура, процеси за валидиране на уязвимости, класификация и извличане в големи партиди от данни в паметта, типизирана оркестрация на множество агенти.

Агентът е Python обект

NVIDIA Labs публикува NOOA (NVIDIA Object-Oriented Agents), независима от модела Python рамка за изграждане на агенти. Традиционното разработване на агенти разделя изходния код между шаблони за подсказки, схеми на инструменти, обратни извиквания и графи на работни процеси. NOOA обединява всичко това в един клас.

Методите са действията, които моделът може да извършва. Полетата са състоянието. Docstring-овете са подсказки. Анотациите на типовете са договори, налагани от средата за изпълнение. Метод, чието тяло е ..., се превръща в агентен метод, завършван по време на изпълнение от управляван от LLM цикъл; метод с нормално тяло остава детерминистичен Python код, който моделът може да извиква като инструмент.

Включени са две стратегии. PredictStrategy е еднократно типизирано извикване на LLM с локален цикъл за повторен опит при неуспешно валидиране. CodeActStrategy изпълнява итеративен Python REPL, в който моделът извиква execute_python(...), докато не изпрати return_result(...), което се валидира спрямо анотацията на връщания тип.

Шест възможности в един интерфейс

Изследователският екип идентифицира шест идеи, ориентирани към модела, които според него за първи път са комбинирани: типизирани входни и изходни данни, предаване по референция на живи обекти, код като действие, програмируемо проектиране на цикли, изрично състояние на обектите и API на хранилището, достъпни за модела. NVIDIA оцени четиринадесет рамки и хранилища — LangGraph, Google ADK, PydanticAI, smolagents, Claude Agent SDK, OpenAI Codex, OpenHands и други — спрямо същите показатели и отчита частично покритие навсякъде другаде.

Предаването по референция е ключовият елемент. Аргументите пристигат като живи Python обекти; моделът вижда само ограничен преглед с конкретния тип, действителната дължина и извадка от началото и края. Списък от сто елемента се визуализира с около тридесет токена, докато цялата променлива остава в REPL. Контекстът е разделен на кешируем статичен префикс, добавяна само в края типизирана история на събитията и динамични блокове в края, което запазва повторното използване на KV кеша между ходовете.

Незадължителна подсистема за памет се свързва с непроменен агент. Седем инструмента, достъпни за модела, записват и извличат записи, класирани според активацията на ACT-R, всичко това в един SQLite файл, който може да бъде инспектиран от човек.

Производителност

Тестовете на възможностите включваха 88 теста, изпълнени пет пъти с десет модела: 4 309 от 4 400 записа преминаха успешно (97.9%). Подмножество от стрес тестове в шест категории, обхващащо пакетна обработка, възстановяване от грешки и декомпозиция, постигна 84.7%, като разликата между малките и водещите модели се увеличава от 3.2 до 23 пункта.

При крайни тестове 253-редов агент, независим от бенчмарка, достига 82.2% на SWE-bench Verified с GPT-5.5 при xhigh усилие, спрямо 78.6% за OpenCode и 78.2% за PI, и 79.8% с Opus 4.6. На Terminal-Bench 2.0 достига 73.0% при високо усилие спрямо 60.7% и 68.5%, макар че PI води при xhigh с 75.3%. На CyberGym L1 решава 86.8% при блокиран мрежов достъп — най-високият отчетен резултат за проект с отворен код. На ARC-AGI-3 един агент с умение за модел на света от една страница достига 50.2% среден RHAE с GPT-5.5 и 85.1% с GPT-5.6-sol, при цена под 20 долара на игра.

По-интересният резултат е ефективността: 82.2% при приблизително 1.1 млн. токена и около 28 извиквания на модела на задача, спрямо 2.2 млн. токена и 66 извиквания за PI при 78.2%. Анализът на проследяванията отдава значение и на валидираното прекратяване — OpenCode спира, когато моделът отговори без извикване на инструмент, докато NOOA изисква типизиран TaskResult, съдържащ доказателства и команда за проверка.

Основни изводи

  • Агентът е един Python клас — методите са действия, полетата са състояние, docstring-овете са подсказки, анотациите са наложени договори.
  • Тялото на метод с ... се превръща в LLM цикъл; реалното тяло остава детерминистичен Python код, който моделът може да извиква.
  • Предаването по референция запазва големите данни активни в REPL, така че при SWE-bench не е било необходимо компресиране на контекста.
  • 82.2% на SWE-bench Verified и 86.8% на CyberGym L1 при приблизително наполовина по-малко токени спрямо сравнените отворени хранилища.
  • Apache 2.0 и инсталиране чрез pip, но алфа версия — изпълнявайте генериран код само в изолация на ниво операционна система.

Разгледайте научната статия, GitHub хранилището и техническия блогСъщо така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

Още новини

Всички последни новини