Nvidia только что показала, что теперь настоящий герой — обвязка, а не модель ИИ
Nvidia опубликовала в пятницу новое интересное исследование, из которого следует, что при постановке перед ИИ долгосрочных задач гораздо важнее сама обвязка, чем базовая модель.
Коротко: просто используя специально настроенную обвязку, оптимизированную для эффективной работы с памятью и включающую компонент в роли «супервизора», исследователи добились того, чтобы Claude Opus 5 набрала 100% в интерактивном бенчмарке рассуждений ARC-AGI-3. (Этот бенчмарк особенно досаждает конкурирующей передовой лаборатории OpenAI.) Без обвязки Opus 5 набрала 30% — это был лучший результат среди всех протестированных моделей.
Исследование Nvidia — ещё один признак того, что, хотя выбор модели действительно имеет значение, модель, играющая роль мозга агента, составляет меньшую часть агентной системы, чем осознают многие пользователи ИИ, особенно при выполнении долгосрочных задач. Именно обвязка превращает модель в агента: она отвечает за память, контекст и обратную связь.
«В целом мир воспринимает агента почти как API модели», — говорит TechCrunch Адель Эль-Халлак, вице-президент по продуктам в подразделении ИИ Nvidia (на фото выше). Но на самом деле агент — это нечто большее. «Это модель. Это инфраструктура вокруг модели, которую мы называем обвязкой, то есть набор инструментов, которые она использует. Это среда выполнения, а также связанные с ней навыки и библиотеки, к которым мы предоставляем ей доступ».
Долгосрочные задачи требуют последовательного принятия множества решений, иногда на протяжении нескольких дней, чтобы получить завершённый результат. Это отличается от ситуации, когда ИИ просто выдаёт ответ на запрос. Понять, как заставить ИИ выполнять долгосрочные задачи, не отвлекаясь и не уходя в далёкие от реальности рассуждения, — одна из главных целей исследований в области агентных систем.
Например, Microsoft опубликовала в апреле исследование, в рамках которого протестировала 19 больших языковых моделей на долгосрочных задачах, связанных с редактированием документов, и обнаружила, что все модели, включая передовые, заполняли документы ошибками. (Если бы люди выполняли работу с таким качеством, их бы немедленно уволили.)
Модели, самостоятельно выстраивающие цепочки решений, также были замечены за удалением пользовательских файлов, вплоть до целых баз данных, или обращались к преступному поведению для достижения своих целей — от сговора до взлома.
Выбор исследователями Nvidia именно этого интерактивного бенчмарка для своих тестов особенно примечателен и даже забавен. Это бенчмарк, состоящий из набора двумерных игр без каких-либо инструкций. Модель должна самостоятельно понять, как играть и побеждать. Результат в 100% означает, что модель способна проходить игры не хуже людей.
OpenAI была настолько расстроена плачевными результатами своих моделей — менее 10% — в ARC-AGI-3, что в прошлом месяце провела собственное исследование. Как и Nvidia, OpenAI обнаружила, что простая настройка двух параметров обвязки утроила результаты её моделей.
Однако ни одна из моделей не приблизилась к результату в 100%, которого добились исследователи Nvidia. Они показали, что обвязке необходим компонент «супервизора», который направляет агента в нужную сторону, если тот застревает.
«Более интересным оказалось добавление контролирующего агента в дополнение к основному агенту, выполняющему работу, — сказал Эль-Халлак. — Он почти действует как генеральный директор: подталкивает агента, когда тот сбивается с курса или начинает исследовать путь, который может привести в тупик, либо заново исследовать путь, по которому уже проходил».
Хотя концепция контролирующего агента не совсем нова, сегодня большинство пользователей агентов полагаются лишь на один уровень обвязки — например, Claude Code, Codex, Hermes и так далее. Исследователи Nvidia создали собственную усовершенствованную обвязку под названием Agentic Variation Operators (AVO).
Важно отметить, что это не новый продукт Nvidia. Вместо этого Nvidia выпускает множество открытых компонентов и фрагментов технологий для создания обвязок под брендом Nemo. Часть этих технологий является коммерческой, но многое доступно открыто.
Тем не менее результаты Nvidia дополняют растущий массив свидетельств того, что выбор модели — далеко не единственный фактор, влияющий на эффективность агентных систем. Например, в июле Databricks опубликовала впечатляющее исследование, показывающее, что обвязка оказывает на расходы на ИИ гораздо большее влияние, чем модель.
«Можно выбрать одну и ту же модель, но разные обвязки, и затраты будут значительно выше, если использовать неправильную обвязку, — сказал генеральный директор Databricks Али Годси в интервью TechCrunch. — Поэтому вы думаете: о, это дорогая модель, а это дешёвая модель. Но постойте, какую обвязку вы используете? Она сама по себе может увеличить ваши расходы вдвое».
Главная мысль Nvidia заключается в том, что открытые обвязки, как и открытые модели, дают пользователям гораздо больше контроля, чем они осознают.
«Мы верим и демонстрируем вместе с экосистемой, что открытые обвязки позволяют настраивать гораздо больше параметров, чтобы повысить точность, — сказал Эль-Халлак. — Это связано с замедлением OpenAI обучения своих моделей» из-за того, что модели создавали уязвимости в системе безопасности.
«Мы считаем, что для продвижения экосистемы вперёд и обеспечения её безопасности необходим открытый стек агентов, в котором у вас есть контроль над обвязкой, инфраструктурой и средой выполнения», — добавил он.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.