Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Nvidia току-що показа, че истинският герой вече е тестовата рамка, а не AI моделът

Nvidia публикува в петък ново интересно изследване, което предполага, че именно обвивката, а не толкова базовият модел, е далеч по-важна, когато от изкуствения интелект се изисква да изпълнява задачи с дълъг хоризонт.

Накратко: само чрез използването на персонализирана обвивка, настроена да обработва добре паметта и включваща компонент тип „надзорник“, подобен на шеф, изследователите са постигнали 100% резултат с Claude Opus 5 на интерактивния бенчмарк за разсъждение ARC-AGI-3. (Това е бенчмарк, който особено много е подразнил конкурентната водеща лаборатория OpenAI.) Без обвивката Opus 5 е постигнал 30% — най-добрият резултат сред всички тествани модели.

Изследването на Nvidia е още един показател, че макар изборът на модел да има значение, тъй като той играе ролята на мозък на агента, той е по-малка част от агентната система, отколкото много потребители на изкуствен интелект осъзнават, особено при задачи с дълъг хоризонт. Обвивката е това, което превръща модела в агент: тя управлява паметта, контекста и обратната връзка.

„Като цяло светът възприема агента почти като API на модела“, казва пред TechCrunch Адел Ел Халак, вицепрезидент по продуктите в звеното за изкуствен интелект на Nvidia (на снимката по-горе). Но всъщност агентът е нещо повече от това. „Това е моделът. Това е инфраструктурата около модела, която наричаме обвивка, тоест наборът от инструменти, които той използва. Това е средата за изпълнение и свързаните с нея умения и библиотеки, до които му предоставяме достъп.“

Задачите с дълъг хоризонт са тези, които изискват свързването на множество решения, понякога в продължение на дни, за да се създаде завършен резултат. Това е различно от случаите, в които изкуственият интелект просто изстрелва отговор на дадена подкана. Да се намери начин изкуственият интелект да изпълнява задачи с дълъг хоризонт, без да се разсейва и да се отклонява в света на фантазиите, е един от свещените граали на изследванията в областта на агентите.

Например: Microsoft публикува през април изследване, в което тества 19 LLM модела със задачи с дълъг хоризонт, свързани с редактиране на документи, и установява, че всички модели, включително водещите, са изпълнили документите с грешки. (Ако хората вършеха работа по този начин, щяха незабавно да бъдат уволнени.)

Модели, които самостоятелно свързват решенията си, също са били засичани да изтриват файловете на потребителите си, дори цели бази данни или да прибягват до престъпно поведение, за да постигнат целите си — от сговор до хакерски атаки.

Изборът на изследователите от Nvidia да използват този интерактивен бенчмарк за разсъждение е особено значим, почти забавен. Това е бенчмарк, състоящ се от множество 2D игри без инструкции. Моделът трябва да разбере как да играе и да печели. Резултат от 100% означава, че моделът може да побеждава в игрите също като хората.

OpenAI беше толкова разтърсена от плачевните резултати на моделите си (под 10%) на ARC-AGI-3, че проведе собствено изследване миналия месец. Подобно на Nvidia, OpenAI установи, че само чрез промяна на две настройки на обвивката резултатите на моделите ѝ са се утроили.

Но нито един от моделите не се доближи до резултат от 100%, какъвто постигнаха изследователите на Nvidia. Те показаха, че обвивките се нуждаят от компонент „надзорник“, който да насочва агента в правилната посока, ако той се затрудни.

„По-интересната част беше въвеждането на надзорен агент в допълнение към основния агент, който върши работата“, каза Ел Халак. Той „почти действа като изпълнителен директор, който подтиква агента, когато той се отклони от посоката или започне да проучва път, който може да го отведе в задънена улица, или да проучи отново път, по който вече е минавал.“

Макар концепцията за надзорен агент да не е напълно нова, днес повечето потребители на агенти разчитат само на един слой в своята обвивка, като Claude Code, Codex, Hermes и други. Изследователите на Nvidia са създали собствена усъвършенствана обвивка, наречена Agentic Variation Operators (AVO).

Важно е да се отбележи, че това не е нов продукт на Nvidia. Вместо това Nvidia създава множество отворени отделни компоненти и части от технологии за изграждане на обвивки под марката Nemo. Част от тези технологии са комерсиални, а много от тях са свободно достъпни.

Все пак резултатите на Nvidia допълват нарастващите доказателства, че изборът на модел далеч не е единственият фактор за ефективността на агентите. През юли например Databricks публикува впечатляващо изследване, което показва, че обвивката, а не моделът, оказва драматично влияние върху разходите за изкуствен интелект.

„Можете да изберете един и същ модел, но различни обвивки, и разходите ви ще бъдат значително по-високи, ако използвате неправилната обвивка“, каза пред TechCrunch изпълнителният директор на Databricks Али Годси. „Затова си мислите: о, този модел е скъп. Този модел е евтин. Но чакайте, коя обвивка използвате? Само тя може да удвои разходите ви.“

По-голямата теза на Nvidia е, че отворените обвивки, подобно на отворените модели, дават на потребителите много повече контрол, отколкото те осъзнават.

„Вярваме и демонстрираме заедно с екосистемата как отворените обвивки ви позволяват да настройвате много повече параметри, за да повишите точността“, каза Ел Халак. „Това е свързано със забавянето на обучението на моделите от страна на OpenAI“, в резултат на създаването на пробиви в сигурността от моделите.

„Вярваме, че е необходимо да разполагаме с отворен агентен стек — в който имате контрол върху обвивката, инфраструктурата и средата за изпълнение — за да развиваме екосистемата напред по сигурен начин“, добави той.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини