Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

NVIDIA представя SoL-Pi: цикли за автоматизирани изследвания намаляват токенния трафик на кодиращите агенти с до 49%

Агентите за кодиране вече работят с часове, а не с минути. Всяка редакция, изпълнение на тест и прочетен лог се връщат в контекста на модела. Екип от изследователи от NVIDIA, NTU и MIT представи SoL-Pi — набор от 4 механизма за ефективност за агента за кодиране с отворен код Pi. AI система откри тези механизми, като изпълняваше цикли на автоматизирано изследване на ниво harness. При оценката EdgeBench с 51 задачи SoL-Pi намалява записания токен трафик с 44,7% до 49,0% спрямо Pi и намалява разходите за API с приблизително 33%. Резултатите му остават близки до тези на Pi както при GPT-5.6 Sol, така и при Opus 5.

Може ли да бъде внедрен? Да. SoL-Pi се предоставя в GitHub под NVlabs като разширение с лиценз MIT, което работи с немодифицирана версия на Pi. Тестван е с Pi 0.85.1 и Node.js 22.19 или по-нова версия.

Защо фокусът е върху harness слоя

Повечето дейности за повишаване на ефективността намаляват цената на токен чрез по-бързи ядра, квантизация или по-евтини модели. Вместо това SoL-Pi намалява броя токени, които задачата използва. Harness слоят обработва извикванията на инструменти, контекста, наблюденията и делегирането.

Ръчното настройване на harness е бавно, а компонентите му са взаимосвързани: поправка на едно място може да прехвърли разходите към по-късни стъпки. Meta-Harness и сходни системи автоматизират тази работа. Въпреки това скорошно проучване установи, че еволюиралите harness системи могат да се преобучат спрямо задачите за търсене и да постигнат само маргинални подобрения при невиждани досега задачи.

Как работи търсенето

Изследователски AI наблюдава следите от изпълнението на отделен агент, работещ с базовия Pi. След това предлага промени в harness и ги тества. Търсенето обхвана:

  • 152 предложени направления в 6 семейства: контекст, прогрес, инструменти, делегиране, подсказване и политики, както и подобрение и оценяване
  • 535 изпълними среди: 495, изградени от двойки GitHub issue-pull request, и 40 синтетични задачи с изпълними верификатори
  • Над 3000 изпълнения и повече от 60 000 взаимодействия между агенти и среди

Всяко търсене представлява изолиран цикъл за еднократна употреба. То следва цикъла на autoresearch, разширен с имплементационна стъпка Ralph Loop и независим рецензент.

Правилата за приемане се фиксират преди началото на търсенето и оптимизаторът не може да ги променя. Всеки показател за функционалност трябва да остане в рамките на предварително обявен толеранс. Кандидатът трябва също да подобри поне 1 показател за ефективност. EdgeBench остава отделен от търсенето. От публичните му 51 задачи 11 се използват за еднопосочно приемане на фиксирани кандидати, а 40 — за финалната оценка. Резултатите от отделените задачи никога не се връщат обратно в търсенето.

4-те механизма, които оцеляха

  1. Action Fusion: Базовият Pi често редактира файл и след това издава отделна команда, за да го тества, изгради или изпълни. Action Fusion обединява двете действия в 1 заявка към инструмента и връща двата резултата в 1 наблюдение. Това премахва едно обиколно взаимодействие с модела.
  2. Online Context Compact: Стъпките от плана се проследяват чрез update_plan. Когато дадена стъпка приключи, harness изчислява колко заявки остават. След това сравнява прогнозните спестявания от входа с допълнителната цена за пренаписване на кеша на подсказката. Той извиква вграденото в Pi компресиране, когато това условие е изпълнено или когато контекстът наближи лимита на прозореца.
  3. ObservationPack: Изходите от инструменти над 10 KiB се архивират локално и се изпращат в пълен вид при следващите 2 заявки към доставчика. От 3-тата заявка нататък моделът вижда стабилен идентификатор, първоначалния размер и кратък откъс от началните и крайните редове. Точните страници остават достъпни чрез идентификатора.
  4. Evidence-Preserving Reducer: Логовете от компилация и тестове с размер поне 4 KiB се изпращат към по-евтин модел — GPT-5.6 Luna с high — който създава кратък отчет. Детерминистичен верификатор проверява схемата на отчета, хеша на източника, статуса на изхода, точните цитати и размера. Harness се връща към оригиналния лог в 3 случая: проверката е неуспешна, има подозрение за идентификационни данни или отчетът не е по-малък.

Резултати от EdgeBench

БекендHarnessТокени (B)Разходи за APIСреден резултат
GPT-5.6 SolCodex3.05$1,78734.7
GPT-5.6 SolPi2.15$1,33944.8
GPT-5.6 SolSoL-Pi [Efficiency]1.10$89442.0
GPT-5.6 SolSoL-Pi [Performance]2.02$1,27147.2
Opus 5Claude Code2.00$2,53543.7
Opus 5Pi2.37$1,74144.8
Opus 5SoL-Pi [Efficiency]1.31$1,15842.2
Opus 5SoL-Pi [Performance]2.10$1,60550.5

Пълният стек е изграден върху GPT-5.6 Sol и е прехвърлен към Opus 5 без допълнително търсене. При Opus 5 той запазва 94,3% от резултата на Pi, като намалява токен трафика с 44,7% и разходите за API с 33,5%. При GPT-5.6 Sol той запазва 93,7% от резултата на Pi с 49,0% по-малко токени и 33,2% по-ниски разходи.

Вариантът Performance използва най-добрия единичен механизъм за всеки бекенд: ObservationPack при GPT-5.6 Sol и Action Fusion при Opus 5. Той повишава резултатите съответно с 5,3% и 12,8% над тези на Pi.

При GPT-5.6 Sol пълният стек увеличава трафика за запис в кеша от 0,0141 B на 0,0316 B токена. Общите разходи въпреки това спадат от $1,339 на $894. Според изчисленията в статията почасовите спестявания са от $8.75 до $13.50 спрямо вградените harness системи на Codex и Claude Code и от $4.36 до $5.71 спрямо Pi.

Отвъд EdgeBench

  • Terminal-Bench 4 (63 задачи, използващи само CPU): SoL-Pi решава 15 задачи спрямо 18 за Codex и Pi. Намалява общите разходи с 26,3% спрямо Pi ($211.12 спрямо $286.45).
  • IMO 2026, проверено с Lean 4: SoL-Pi преминава 3 от 6 задачи, колкото и Pi, при най-ниска цена за премината задача ($20.90). Codex преминава 5.
  • Рояк от агенти: Координатор Codex с 20 работници SoL-Pi достига 1127 цикъла при $60.11. С 20 работници Pi достига 1366 цикъла при $82.12. Един-единствен агент Codex все още е най-евтината опция при $39.20 и достига 1333 цикъла.

Изследователският екип определя прехвърлянето между моделите като предварително. Механизмите се задействат по-рядко при Opus 5, вероятно защото търсенето е използвало само траектории от GPT-5.6 Sol.

Основни изводи

  • SoL-Pi намалява токен трафика в EdgeBench с 44,7% до 49,0% спрямо Pi.
  • Разходите за API спадат с около 33%, като се запазват около 94% от средния резултат на Pi.
  • 4-те механизма оцеляха при търсене сред 152 направления и 535 среди.
  • SoL-Pi е разширение на Pi за GitHub с лиценз MIT, което се активира по избор.

Разгледайте статията, GitHub хранилището и техническия блог. Всички заслуги са за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини