NVIDIA представя SoL-Pi: цикли за автоматизирани изследвания намаляват токенния трафик на кодиращите агенти с до 49%
Агентите за кодиране вече работят с часове, а не с минути. Всяка редакция, изпълнение на тест и прочетен лог се връщат в контекста на модела. Екип от изследователи от NVIDIA, NTU и MIT представи SoL-Pi — набор от 4 механизма за ефективност за агента за кодиране с отворен код Pi. AI система откри тези механизми, като изпълняваше цикли на автоматизирано изследване на ниво harness. При оценката EdgeBench с 51 задачи SoL-Pi намалява записания токен трафик с 44,7% до 49,0% спрямо Pi и намалява разходите за API с приблизително 33%. Резултатите му остават близки до тези на Pi както при GPT-5.6 Sol, така и при Opus 5.
Може ли да бъде внедрен? Да. SoL-Pi се предоставя в GitHub под NVlabs като разширение с лиценз MIT, което работи с немодифицирана версия на Pi. Тестван е с Pi 0.85.1 и Node.js 22.19 или по-нова версия.
Защо фокусът е върху harness слоя
Повечето дейности за повишаване на ефективността намаляват цената на токен чрез по-бързи ядра, квантизация или по-евтини модели. Вместо това SoL-Pi намалява броя токени, които задачата използва. Harness слоят обработва извикванията на инструменти, контекста, наблюденията и делегирането.
Ръчното настройване на harness е бавно, а компонентите му са взаимосвързани: поправка на едно място може да прехвърли разходите към по-късни стъпки. Meta-Harness и сходни системи автоматизират тази работа. Въпреки това скорошно проучване установи, че еволюиралите harness системи могат да се преобучат спрямо задачите за търсене и да постигнат само маргинални подобрения при невиждани досега задачи.
Как работи търсенето
Изследователски AI наблюдава следите от изпълнението на отделен агент, работещ с базовия Pi. След това предлага промени в harness и ги тества. Търсенето обхвана:
- 152 предложени направления в 6 семейства: контекст, прогрес, инструменти, делегиране, подсказване и политики, както и подобрение и оценяване
- 535 изпълними среди: 495, изградени от двойки GitHub issue-pull request, и 40 синтетични задачи с изпълними верификатори
- Над 3000 изпълнения и повече от 60 000 взаимодействия между агенти и среди
Всяко търсене представлява изолиран цикъл за еднократна употреба. То следва цикъла на autoresearch, разширен с имплементационна стъпка Ralph Loop и независим рецензент.
Правилата за приемане се фиксират преди началото на търсенето и оптимизаторът не може да ги променя. Всеки показател за функционалност трябва да остане в рамките на предварително обявен толеранс. Кандидатът трябва също да подобри поне 1 показател за ефективност. EdgeBench остава отделен от търсенето. От публичните му 51 задачи 11 се използват за еднопосочно приемане на фиксирани кандидати, а 40 — за финалната оценка. Резултатите от отделените задачи никога не се връщат обратно в търсенето.
4-те механизма, които оцеляха
- Action Fusion: Базовият Pi често редактира файл и след това издава отделна команда, за да го тества, изгради или изпълни. Action Fusion обединява двете действия в 1 заявка към инструмента и връща двата резултата в 1 наблюдение. Това премахва едно обиколно взаимодействие с модела.
- Online Context Compact: Стъпките от плана се проследяват чрез
update_plan. Когато дадена стъпка приключи, harness изчислява колко заявки остават. След това сравнява прогнозните спестявания от входа с допълнителната цена за пренаписване на кеша на подсказката. Той извиква вграденото в Pi компресиране, когато това условие е изпълнено или когато контекстът наближи лимита на прозореца. - ObservationPack: Изходите от инструменти над 10 KiB се архивират локално и се изпращат в пълен вид при следващите 2 заявки към доставчика. От 3-тата заявка нататък моделът вижда стабилен идентификатор, първоначалния размер и кратък откъс от началните и крайните редове. Точните страници остават достъпни чрез идентификатора.
- Evidence-Preserving Reducer: Логовете от компилация и тестове с размер поне 4 KiB се изпращат към по-евтин модел — GPT-5.6 Luna с
high— който създава кратък отчет. Детерминистичен верификатор проверява схемата на отчета, хеша на източника, статуса на изхода, точните цитати и размера. Harness се връща към оригиналния лог в 3 случая: проверката е неуспешна, има подозрение за идентификационни данни или отчетът не е по-малък.
Резултати от EdgeBench
| Бекенд | Harness | Токени (B) | Разходи за API | Среден резултат |
|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 |
| GPT-5.6 Sol | Pi | 2.15 | $1,339 | 44.8 |
| GPT-5.6 Sol | SoL-Pi [Efficiency] | 1.10 | $894 | 42.0 |
| GPT-5.6 Sol | SoL-Pi [Performance] | 2.02 | $1,271 | 47.2 |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 |
| Opus 5 | Pi | 2.37 | $1,741 | 44.8 |
| Opus 5 | SoL-Pi [Efficiency] | 1.31 | $1,158 | 42.2 |
| Opus 5 | SoL-Pi [Performance] | 2.10 | $1,605 | 50.5 |
Пълният стек е изграден върху GPT-5.6 Sol и е прехвърлен към Opus 5 без допълнително търсене. При Opus 5 той запазва 94,3% от резултата на Pi, като намалява токен трафика с 44,7% и разходите за API с 33,5%. При GPT-5.6 Sol той запазва 93,7% от резултата на Pi с 49,0% по-малко токени и 33,2% по-ниски разходи.
Вариантът Performance използва най-добрия единичен механизъм за всеки бекенд: ObservationPack при GPT-5.6 Sol и Action Fusion при Opus 5. Той повишава резултатите съответно с 5,3% и 12,8% над тези на Pi.
При GPT-5.6 Sol пълният стек увеличава трафика за запис в кеша от 0,0141 B на 0,0316 B токена. Общите разходи въпреки това спадат от $1,339 на $894. Според изчисленията в статията почасовите спестявания са от $8.75 до $13.50 спрямо вградените harness системи на Codex и Claude Code и от $4.36 до $5.71 спрямо Pi.
Отвъд EdgeBench
- Terminal-Bench 4 (63 задачи, използващи само CPU): SoL-Pi решава 15 задачи спрямо 18 за Codex и Pi. Намалява общите разходи с 26,3% спрямо Pi ($211.12 спрямо $286.45).
- IMO 2026, проверено с Lean 4: SoL-Pi преминава 3 от 6 задачи, колкото и Pi, при най-ниска цена за премината задача ($20.90). Codex преминава 5.
- Рояк от агенти: Координатор Codex с 20 работници SoL-Pi достига 1127 цикъла при $60.11. С 20 работници Pi достига 1366 цикъла при $82.12. Един-единствен агент Codex все още е най-евтината опция при $39.20 и достига 1333 цикъла.
Изследователският екип определя прехвърлянето между моделите като предварително. Механизмите се задействат по-рядко при Opus 5, вероятно защото търсенето е използвало само траектории от GPT-5.6 Sol.
Основни изводи
- SoL-Pi намалява токен трафика в EdgeBench с 44,7% до 49,0% спрямо Pi.
- Разходите за API спадат с около 33%, като се запазват около 94% от средния резултат на Pi.
- 4-те механизма оцеляха при търсене сред 152 направления и 535 среди.
- SoL-Pi е разширение на Pi за GitHub с лиценз MIT, което се активира по избор.
Разгледайте статията, GitHub хранилището и техническия блог. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.