NVIDIA представляет SoL-Pi: циклы автоматизированных исследований сокращают трафик токенов кодирующих агентов до 49%
Агенты для программирования теперь работают часами, а не минутами. Каждое редактирование, запуск теста и чтение журнала возвращаются в контекст модели. Команда исследователей из NVIDIA, NTU и MIT выпустила SoL-Pi — набор из 4 механизмов повышения эффективности для агента программирования с открытым исходным кодом Pi. ИИ обнаружил эти механизмы, запуская циклы автоматического исследования на уровне оболочки. В оценивании EdgeBench на 51 задаче SoL-Pi сокращает зафиксированный трафик токенов на 44,7–49,0% по сравнению с Pi, а затраты на API — примерно на 33%. При этом его показатели остаются близкими к Pi на обеих моделях — GPT-5.6 Sol и Opus 5.
Готов ли он к развертыванию? Да. SoL-Pi доступен на GitHub в репозитории NVlabs как расширение под лицензией MIT, работающее с неизменённым релизом Pi. Он протестирован с Pi 0.85.1 и Node.js 22.19 или более новой версией.
Почему выбрана оболочка
Большинство работ по повышению эффективности снижает стоимость токена за счёт более быстрых ядер, квантования или более дешёвых моделей. SoL-Pi вместо этого уменьшает количество токенов, расходуемых на задачу. Оболочка — это уровень, который отвечает за вызовы инструментов, контекст, наблюдения и делегирование.
Ручная настройка оболочки занимает много времени, а её компоненты взаимосвязаны: исправление в одном месте может увеличить затраты на последующих этапах. Meta-Harness и аналогичные системы автоматизируют эту работу. Однако недавнее исследование показало, что эволюционировавшие оболочки могут переобучаться на поисковых задачах и давать лишь незначительные улучшения на неизвестных задачах.
Как работает поиск
Исследовательский ИИ наблюдает за трассировками выполнения отдельного агента, работающего на базовой версии Pi. Затем он предлагает изменения оболочки и тестирует их. Поиск охватывал:
- 152 предложенных направления в 6 категориях: контекст, прогресс, инструменты, делегирование, промпт и политика, а также улучшение и оценивание
- 535 исполняемых сред: 495, созданных на основе пар issue и pull request на GitHub, и 40 синтетических задач с исполняемыми верификаторами
- Более 3 000 запусков и свыше 60 000 взаимодействий агента со средой
Каждый поиск представляет собой одноразовый изолированный цикл. Он следует циклу автоматического исследования, дополненному этапом реализации Ralph Loop и независимым проверяющим.
Правила принятия фиксируются до начала поиска, и оптимизатор не может их изменять. Каждая метрика возможностей должна оставаться в пределах заранее объявленного допуска. Кандидат также должен улучшать как минимум 1 метрику эффективности. EdgeBench остаётся отложенным набором. Из его 51 публичной задачи 11 используются для одностороннего принятия зафиксированных кандидатов, а 40 — для итогового оценивания. Результаты на отложенных задачах никогда не возвращаются обратно в поиск.
4 сохранившихся механизма
- Action Fusion: Базовая версия Pi часто редактирует файл, а затем выполняет отдельную команду для его тестирования, сборки или запуска. Action Fusion объединяет оба действия в 1 запрос к инструменту и возвращает оба результата в 1 наблюдении. Это устраняет один раунд взаимодействия с моделью.
- Online Context Compact: Этапы плана отслеживаются через
update_plan. Когда этап завершается, оболочка оценивает, сколько запросов осталось. Затем она сравнивает прогнозируемую экономию входных данных с дополнительными затратами на перезапись кэша промпта. Она запускает встроенное в Pi сжатие, когда это условие выполняется или когда контекст приближается к пределу окна. - ObservationPack: Результаты работы инструментов размером более 10 КиБ архивируются локально и полностью отправляются в следующих 2 запросах к провайдеру. Начиная с 3-го запроса модель видит стабильный идентификатор, исходный размер и короткую выборку первых и последних строк. Точные страницы по-прежнему доступны через этот идентификатор.
- Evidence-Preserving Reducer: Журналы сборки и тестов размером не менее 4 КиБ передаются более дешёвой модели GPT-5.6 Luna с параметром
high, которая составляет компактную квитанцию. Детерминированный верификатор проверяет схему квитанции, хеш источника, статус выхода, точные цитаты и размер. Оболочка возвращается к исходному журналу в 3 случаях: если проверка не пройдена, если есть подозрение на наличие учётных данных или если квитанция не стала меньше.
Результаты на EdgeBench
| Бэкенд | Оболочка | Токены (B) | Стоимость API | Средний балл |
|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 |
| GPT-5.6 Sol | Pi | 2.15 | $1,339 | 44.8 |
| GPT-5.6 Sol | SoL-Pi [Efficiency] | 1.10 | $894 | 42.0 |
| GPT-5.6 Sol | SoL-Pi [Performance] | 2.02 | $1,271 | 47.2 |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 |
| Opus 5 | Pi | 2.37 | $1,741 | 44.8 |
| Opus 5 | SoL-Pi [Efficiency] | 1.31 | $1,158 | 42.2 |
| Opus 5 | SoL-Pi [Performance] | 2.10 | $1,605 | 50.5 |
Весь стек был создан на GPT-5.6 Sol и перенесён на Opus 5 без дальнейшего поиска. На Opus 5 он сохраняет 94,3% показателя Pi, сокращая трафик токенов на 44,7%, а затраты на API — на 33,5%. На GPT-5.6 Sol он сохраняет 93,7% показателя Pi при сокращении количества токенов на 49,0% и стоимости на 33,2%.
Вариант Performance использует лучший отдельный механизм для каждого бэкенда: ObservationPack на GPT-5.6 Sol и Action Fusion на Opus 5. Он повышает показатели на 5,3% и 12,8% соответственно по сравнению с Pi.
На GPT-5.6 Sol полный стек увеличивает трафик записи в кэш с 0,0141 B до 0,0316 B токенов. Общая стоимость при этом снижается с $1,339 до $894. Согласно оценке статьи, почасовая экономия по сравнению с нативными оболочками Codex и Claude Code составляет от $8,75 до $13,50, а по сравнению с Pi — от $4,36 до $5,71.
За пределами EdgeBench
- Terminal-Bench 4 (63 задачи только для CPU): SoL-Pi решает 15 задач против 18 у Codex и Pi. Общая стоимость снижается на 26,3% по сравнению с Pi ($211.12 против $286.45).
- IMO 2026, проверка в Lean 4: SoL-Pi проходит 3 из 6 задач, как и Pi, при самой низкой стоимости в расчёте на решённую задачу ($20.90). Codex проходит 5 задач.
- Рой агентов: Координатор Codex с 20 рабочими SoL-Pi достигает 1 127 циклов при стоимости $60.11. С 20 рабочими Pi он достигает 1 366 циклов при стоимости $82.12. Один агент Codex по-прежнему является самым дешёвым вариантом: $39.20 и 1 333 цикла.
Исследовательская команда называет перенос между моделями предварительным результатом. На Opus 5 механизмы срабатывают реже, возможно, потому что поиск использовал только траектории GPT-5.6 Sol.
Основные выводы
- SoL-Pi сокращает трафик токенов EdgeBench на 44,7–49,0% по сравнению с Pi.
- Стоимость API снижается примерно на 33%, при этом сохраняется около 94% среднего показателя Pi.
- 4 механизма прошли поиск по 152 направлениям и 535 средам.
- SoL-Pi — расширение Pi на GitHub с лицензией MIT, подключаемое по желанию.
Ознакомьтесь с статьёй, репозиторием на GitHub и техническим блогом. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.