Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

NVIDIA представляет SoL-Pi: циклы автоматизированных исследований сокращают трафик токенов кодирующих агентов до 49%

Агенты для программирования теперь работают часами, а не минутами. Каждое редактирование, запуск теста и чтение журнала возвращаются в контекст модели. Команда исследователей из NVIDIA, NTU и MIT выпустила SoL-Pi — набор из 4 механизмов повышения эффективности для агента программирования с открытым исходным кодом Pi. ИИ обнаружил эти механизмы, запуская циклы автоматического исследования на уровне оболочки. В оценивании EdgeBench на 51 задаче SoL-Pi сокращает зафиксированный трафик токенов на 44,7–49,0% по сравнению с Pi, а затраты на API — примерно на 33%. При этом его показатели остаются близкими к Pi на обеих моделях — GPT-5.6 Sol и Opus 5.

Готов ли он к развертыванию? Да. SoL-Pi доступен на GitHub в репозитории NVlabs как расширение под лицензией MIT, работающее с неизменённым релизом Pi. Он протестирован с Pi 0.85.1 и Node.js 22.19 или более новой версией.

Почему выбрана оболочка

Большинство работ по повышению эффективности снижает стоимость токена за счёт более быстрых ядер, квантования или более дешёвых моделей. SoL-Pi вместо этого уменьшает количество токенов, расходуемых на задачу. Оболочка — это уровень, который отвечает за вызовы инструментов, контекст, наблюдения и делегирование.

Ручная настройка оболочки занимает много времени, а её компоненты взаимосвязаны: исправление в одном месте может увеличить затраты на последующих этапах. Meta-Harness и аналогичные системы автоматизируют эту работу. Однако недавнее исследование показало, что эволюционировавшие оболочки могут переобучаться на поисковых задачах и давать лишь незначительные улучшения на неизвестных задачах.

Как работает поиск

Исследовательский ИИ наблюдает за трассировками выполнения отдельного агента, работающего на базовой версии Pi. Затем он предлагает изменения оболочки и тестирует их. Поиск охватывал:

  • 152 предложенных направления в 6 категориях: контекст, прогресс, инструменты, делегирование, промпт и политика, а также улучшение и оценивание
  • 535 исполняемых сред: 495, созданных на основе пар issue и pull request на GitHub, и 40 синтетических задач с исполняемыми верификаторами
  • Более 3 000 запусков и свыше 60 000 взаимодействий агента со средой

Каждый поиск представляет собой одноразовый изолированный цикл. Он следует циклу автоматического исследования, дополненному этапом реализации Ralph Loop и независимым проверяющим.

Правила принятия фиксируются до начала поиска, и оптимизатор не может их изменять. Каждая метрика возможностей должна оставаться в пределах заранее объявленного допуска. Кандидат также должен улучшать как минимум 1 метрику эффективности. EdgeBench остаётся отложенным набором. Из его 51 публичной задачи 11 используются для одностороннего принятия зафиксированных кандидатов, а 40 — для итогового оценивания. Результаты на отложенных задачах никогда не возвращаются обратно в поиск.

4 сохранившихся механизма

  1. Action Fusion: Базовая версия Pi часто редактирует файл, а затем выполняет отдельную команду для его тестирования, сборки или запуска. Action Fusion объединяет оба действия в 1 запрос к инструменту и возвращает оба результата в 1 наблюдении. Это устраняет один раунд взаимодействия с моделью.
  2. Online Context Compact: Этапы плана отслеживаются через update_plan. Когда этап завершается, оболочка оценивает, сколько запросов осталось. Затем она сравнивает прогнозируемую экономию входных данных с дополнительными затратами на перезапись кэша промпта. Она запускает встроенное в Pi сжатие, когда это условие выполняется или когда контекст приближается к пределу окна.
  3. ObservationPack: Результаты работы инструментов размером более 10 КиБ архивируются локально и полностью отправляются в следующих 2 запросах к провайдеру. Начиная с 3-го запроса модель видит стабильный идентификатор, исходный размер и короткую выборку первых и последних строк. Точные страницы по-прежнему доступны через этот идентификатор.
  4. Evidence-Preserving Reducer: Журналы сборки и тестов размером не менее 4 КиБ передаются более дешёвой модели GPT-5.6 Luna с параметром high, которая составляет компактную квитанцию. Детерминированный верификатор проверяет схему квитанции, хеш источника, статус выхода, точные цитаты и размер. Оболочка возвращается к исходному журналу в 3 случаях: если проверка не пройдена, если есть подозрение на наличие учётных данных или если квитанция не стала меньше.

Результаты на EdgeBench

БэкендОболочкаТокены (B)Стоимость APIСредний балл
GPT-5.6 SolCodex3.05$1,78734.7
GPT-5.6 SolPi2.15$1,33944.8
GPT-5.6 SolSoL-Pi [Efficiency]1.10$89442.0
GPT-5.6 SolSoL-Pi [Performance]2.02$1,27147.2
Opus 5Claude Code2.00$2,53543.7
Opus 5Pi2.37$1,74144.8
Opus 5SoL-Pi [Efficiency]1.31$1,15842.2
Opus 5SoL-Pi [Performance]2.10$1,60550.5

Весь стек был создан на GPT-5.6 Sol и перенесён на Opus 5 без дальнейшего поиска. На Opus 5 он сохраняет 94,3% показателя Pi, сокращая трафик токенов на 44,7%, а затраты на API — на 33,5%. На GPT-5.6 Sol он сохраняет 93,7% показателя Pi при сокращении количества токенов на 49,0% и стоимости на 33,2%.

Вариант Performance использует лучший отдельный механизм для каждого бэкенда: ObservationPack на GPT-5.6 Sol и Action Fusion на Opus 5. Он повышает показатели на 5,3% и 12,8% соответственно по сравнению с Pi.

На GPT-5.6 Sol полный стек увеличивает трафик записи в кэш с 0,0141 B до 0,0316 B токенов. Общая стоимость при этом снижается с $1,339 до $894. Согласно оценке статьи, почасовая экономия по сравнению с нативными оболочками Codex и Claude Code составляет от $8,75 до $13,50, а по сравнению с Pi — от $4,36 до $5,71.

За пределами EdgeBench

  • Terminal-Bench 4 (63 задачи только для CPU): SoL-Pi решает 15 задач против 18 у Codex и Pi. Общая стоимость снижается на 26,3% по сравнению с Pi ($211.12 против $286.45).
  • IMO 2026, проверка в Lean 4: SoL-Pi проходит 3 из 6 задач, как и Pi, при самой низкой стоимости в расчёте на решённую задачу ($20.90). Codex проходит 5 задач.
  • Рой агентов: Координатор Codex с 20 рабочими SoL-Pi достигает 1 127 циклов при стоимости $60.11. С 20 рабочими Pi он достигает 1 366 циклов при стоимости $82.12. Один агент Codex по-прежнему является самым дешёвым вариантом: $39.20 и 1 333 цикла.

Исследовательская команда называет перенос между моделями предварительным результатом. На Opus 5 механизмы срабатывают реже, возможно, потому что поиск использовал только траектории GPT-5.6 Sol.

Основные выводы

  • SoL-Pi сокращает трафик токенов EdgeBench на 44,7–49,0% по сравнению с Pi.
  • Стоимость API снижается примерно на 33%, при этом сохраняется около 94% среднего показателя Pi.
  • 4 механизма прошли поиск по 152 направлениям и 535 средам.
  • SoL-Pi — расширение Pi на GitHub с лицензией MIT, подключаемое по желанию.

Ознакомьтесь с статьёй, репозиторием на GitHub и техническим блогом. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости