Nvidia щойно показала, що тепер справжній герой — обв’язка, а не модель ШІ
Nvidia опублікувала в п’ятницю нове цікаве дослідження, яке свідчить, що саме оболонка, а не стільки базова модель, набагато важливіша, коли ШІ доручають виконувати довготривалі завдання.
Коротко: просто використавши спеціальну оболонку, оптимізовану для ефективної роботи з пам’яттю та доповнену компонентом «наглядача», схожим на керівника, дослідники домоглися від Claude Opus 5 результату 100% на бенчмарку інтерактивного міркування ARC-AGI-3. (Це бенчмарк, який особливо дошкуляє конкуруючій передовій лабораторії OpenAI.) Без оболонки Opus 5 набрала 30% — це був найкращий результат серед усіх протестованих моделей.
Дослідження Nvidia — ще один доказ того, що хоча вибір моделі й має значення, виконуючи роль мозку агента, вона є меншою частиною агентної системи, ніж усвідомлюють багато користувачів ШІ, особливо під час виконання довготривалих завдань. Саме оболонка перетворює модель на агента: вона забезпечує роботу з пам’яттю, контекстом і зворотним зв’язком.
«Загалом світ сприймає агента майже як API моделі», — розповідає TechCrunch Адель Ель-Халлак, віцепрезидент із продуктів підрозділу Nvidia, що займається ШІ (на фото вище). Але насправді агент — це більше. «Це модель. Це інфраструктура навколо моделі, яку ми називаємо оболонкою, тобто набір інструментів, які вона використовує. Це середовище виконання та пов’язані з ним навички й бібліотеки, до яких ми надаємо їй доступ».
Довготривалі завдання — це завдання, які вимагають пов’язати між собою багато рішень, іноді протягом кількох днів, щоб виконати роботу. На відміну від ситуації, коли ШІ просто видає відповідь на запит. З’ясувати, як змусити ШІ виконувати довготривалі завдання, не відволікаючись і не занурюючись у фантазії, — один зі святих Граалів досліджень агентних систем.
Наприклад, Microsoft опублікувала у квітні дослідження, у якому протестувала 19 LLM на довготривалих завданнях, пов’язаних із редагуванням документів, і виявила, що всі моделі, включно з передовими, заповнювали документи помилками. (Якби люди виконували роботу так, їх би негайно звільнили.)
Моделі, які самостійно пов’язують рішення між собою, також не раз видаляли файли своїх користувачів, а то й цілі бази даних або вдавалися до злочинної поведінки заради досягнення своїх цілей — від змови до злому.
Вибір дослідниками Nvidia саме цього бенчмарку інтерактивного міркування має особливе, майже кумедне значення. Це бенчмарк, що складається з низки двовимірних ігор без інструкцій. Модель має сама зрозуміти, як грати й перемагати. Результат 100% означає, що модель може проходити ігри так само добре, як люди.
OpenAI була настільки збентежена жахливими результатами своїх моделей — менше ніж 10% — на ARC-AGI-3, що минулого місяця провела власне дослідження. Як і Nvidia, OpenAI виявила, що просте налаштування двох параметрів оболонки потроїло результати її моделей.
Але жодна з моделей навіть не наблизилася до результату 100%, якого досягли дослідники Nvidia. Вони показали, що оболонкам потрібен компонент «наглядача», який спрямовує агента в правильному напрямку, якщо той застрягає.
«Найцікавішою частиною було додавання агента-наглядача до основного агента, який виконує роботу», — сказав Ель-Халлак. Він «майже діє як генеральний директор, підштовхуючи агента, коли той збивається зі шляху або починає досліджувати напрямок, який може привести його в глухий кут, чи повторно вивчати шлях, яким він уже проходив».
Хоча концепція агента-наглядача не є цілком новою, сьогодні більшість користувачів агентів покладаються лише на один рівень у своїй оболонці — наприклад, Claude Code, Codex, Hermes тощо. Дослідники Nvidia створили власну вдосконалену оболонку під назвою Agentic Variation Operators (AVO).
Зверніть увагу, що це не новий продукт Nvidia. Натомість Nvidia випускає безліч відкритих окремих компонентів технологій для створення оболонок під брендом Nemo. Частина цих технологій є комерційною, але багато з них доступні у відкритому доступі.
Втім, результати Nvidia доповнюють дедалі більшу кількість доказів того, що вибір моделі — далеко не єдиний чинник ефективності агентів. Наприклад, у липні Databricks опублікувала вражаюче дослідження, яке показує, що оболонка значно сильніше, ніж модель, впливає на витрати на ШІ.
«Можна вибрати ту саму модель, але різні оболонки — і отримати значно вищі витрати, якщо використати неправильну оболонку», — сказав TechCrunch генеральний директор Databricks Алі Ґодсі. «Тож ви думаєте: о, це дорога модель, а це дешева модель. Але зачекайте, яку оболонку ви використовуєте? Вона сама по собі може подвоїти ваші витрати».
Більший висновок Nvidia полягає в тому, що відкриті оболонки, як і відкриті моделі, дають користувачам набагато більше контролю, ніж вони усвідомлюють.
«Ми віримо й демонструємо разом з екосистемою, що відкриті оболонки дають змогу налаштовувати значно більше параметрів для підвищення точності», — сказав Ель-Халлак. «Це пов’язано із уповільненням OpenAI навчання своїх моделей», що сталося через створення моделями порушень безпеки.
«Ми віримо, що для просування екосистеми вперед і забезпечення її безпеки нам потрібен відкритий стек агентів, у якому ви маєте контроль над оболонкою, інфраструктурою та середовищем виконання», — додав він.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.