NVIDIA представляє SoL-Pi: цикли автоматизованих досліджень скорочують трафік токенів кодерів до 49%
Агенти для кодування тепер працюють годинами, а не хвилинами. Кожне редагування, запуск тесту та читання журналу повертаються до контексту моделі. Команда дослідників з NVIDIA, NTU та MIT випустила SoL-Pi — набір із 4 механізмів ефективності для агента кодування з відкритим кодом Pi. ШІ знайшов ці механізми, запускаючи цикли автоматизованого дослідження на рівні обв’язки. Під час оцінювання на 51 завданні EdgeBench SoL-Pi скорочує зафіксований потік токенів на 44,7–49,0% порівняно з Pi, а витрати на API — приблизно на 33%. Його результати залишаються близькими до Pi як на GPT-5.6 Sol, так і на Opus 5.
Чи можна його розгортати? Так. SoL-Pi доступний на GitHub під обліковим записом NVlabs як розширення з ліцензією MIT, що працює з незміненим випуском Pi. Його протестовано з Pi 0.85.1 і Node.js 22.19 або новішої версії.
Чому саме обв’язка
Більшість робіт з підвищення ефективності знижують вартість одного токена завдяки швидшим ядрам, квантуванню або дешевшим моделям. SoL-Pi натомість зменшує кількість токенів, які споживає завдання. Обв’язка — це рівень, що обробляє виклики інструментів, контекст, спостереження та делегування.
Налаштовувати обв’язку вручну повільно, а її компоненти взаємопов’язані: виправлення в одному місці може перенести витрати на наступні кроки. Meta-Harness та подібні системи автоматизують цю роботу. Однак нещодавнє дослідження виявило, що еволюціоновані обв’язки можуть перенавчатися на пошукових завданнях і давати лише незначний приріст на невідомих завданнях.
Як працює пошук
Дослідницький ШІ спостерігає за трасуваннями виконання окремого агента, що працює на базовому Pi. Потім він пропонує зміни обв’язки та тестує їх. Пошук охоплював:
- 152 запропоновані напрямки у 6 категоріях: контекст, прогрес, інструменти, делегування, підказки та політика, а також покращення й оцінювання
- 535 середовищ виконання: 495 побудованих на основі пар issue–pull request із GitHub і 40 синтетичних завдань із виконуваними верифікаторами
- Понад 3 000 запусків і понад 60 000 взаємодій агент–середовище
Кожен пошук є одноразовим ізольованим циклом. Він дотримується циклу autoresearch, розширеного кроком реалізації Ralph Loop та незалежним рецензентом.
Правила прийняття фіксуються до початку пошуку, і оптимізатор не може їх змінювати. Кожен показник функціональності має залишатися в межах заздалегідь оголошеного допуску. Кандидат також має покращити щонайменше 1 показник ефективності. EdgeBench залишається відкладеним набором даних. Із 51 публічного завдання 11 використовуються для одностороннього прийняття зафіксованих кандидатів, а 40 — для фінального оцінювання. Результати на відкладених завданнях ніколи не повертаються до пошуку.
4 механізми, що пройшли відбір
- Об’єднання дій: базовий Pi часто редагує файл, а потім видає окрему команду для його тестування, збирання або запуску. Об’єднання дій поєднує обидві операції в 1 запит до інструмента та повертає обидва результати в 1 спостереженні. Це усуває один раунд взаємодії з моделлю.
- Онлайнове компактне представлення контексту: кроки плану відстежуються через
update_plan. Коли крок завершується, обв’язка оцінює, скільки запитів залишилося. Потім вона порівнює прогнозовану економію на вхідних даних із додатковою вартістю перезапису кешу підказки. Вона викликає вбудоване ущільнення Pi, коли ця умова виконується або коли контекст наближається до обмеження вікна. - ObservationPack: результати роботи інструментів розміром понад 10 КіБ архівуються локально та надсилаються повністю для наступних 2 запитів до провайдера. Починаючи з 3-го запиту модель бачить стабільний ідентифікатор, початковий розмір і короткий фрагмент перших та останніх рядків. Точні сторінки залишаються доступними через ідентифікатор.
- Редуктор зі збереженням доказів: журнали збирання та тестування розміром щонайменше 4 КіБ передаються дешевшій моделі GPT-5.6 Luna з параметром
high, яка створює компактний звіт. Детермінований верифікатор перевіряє схему звіту, хеш джерела, статус завершення, точні цитати та розмір. Обв’язка повертається до оригінального журналу у 3 випадках: якщо перевірка не пройдена, є підозра на облікові дані або звіт не є меншим.
Результати на EdgeBench
| Бекенд | Обв’язка | Токени (млрд) | Вартість API | Середній бал |
|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 |
| GPT-5.6 Sol | Pi | 2.15 | $1,339 | 44.8 |
| GPT-5.6 Sol | SoL-Pi [Ефективність] | 1.10 | $894 | 42.0 |
| GPT-5.6 Sol | SoL-Pi [Продуктивність] | 2.02 | $1,271 | 47.2 |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 |
| Opus 5 | Pi | 2.37 | $1,741 | 44.8 |
| Opus 5 | SoL-Pi [Ефективність] | 1.31 | $1,158 | 42.2 |
| Opus 5 | SoL-Pi [Продуктивність] | 2.10 | $1,605 | 50.5 |
Увесь стек було створено на GPT-5.6 Sol і перенесено на Opus 5 без подальшого пошуку. На Opus 5 він зберігає 94,3% результату Pi, одночасно скорочуючи потік токенів на 44,7% і витрати на API на 33,5%. На GPT-5.6 Sol він зберігає 93,7% результату Pi, використовуючи на 49,0% менше токенів і забезпечуючи на 33,2% нижчу вартість.
Варіант «Продуктивність» використовує найкращий окремий механізм для кожного бекенду: ObservationPack на GPT-5.6 Sol і об’єднання дій на Opus 5. Він підвищує результати на 5,3% і 12,8% порівняно з Pi.
На GPT-5.6 Sol повний стек збільшує потік запису в кеш із 0,0141 млрд до 0,0316 млрд токенів. Загальна вартість усе одно знижується — з $1,339 до $894. У статті оцінюється погодинна економія від $8.75 до $13.50 порівняно з нативними обв’язками Codex і Claude Code та від $4.36 до $5.71 порівняно з Pi.
Поза межами EdgeBench
- Terminal-Bench 4 (63 завдання лише для CPU): SoL-Pi розв’язує 15 завдань проти 18 у Codex і Pi. Він знижує загальну вартість на 26,3% порівняно з Pi ($211.12 проти $286.45).
- IMO 2026, перевірка в Lean 4: SoL-Pi проходить 3 із 6 задач, зрівнюючись із Pi, за найнижчої вартості за одну пройдену задачу ($20.90). Codex проходить 5.
- Рій агентів: Координатор Codex із 20 працівниками SoL-Pi досягає 1 127 циклів за $60.11. Із 20 працівниками Pi він досягає 1 366 циклів за $82.12. Один агент Codex усе ще є найдешевшим варіантом — $39.20 за 1 333 цикли.
Дослідницька команда називає перенесення між моделями попереднім. На Opus 5 механізми спрацьовують рідше, можливо, тому що під час пошуку використовувалися лише траєкторії GPT-5.6 Sol.
Основні висновки
- SoL-Pi скорочує потік токенів EdgeBench на 44,7–49,0% порівняно з Pi.
- Вартість API знижується приблизно на 33%, водночас зберігається близько 94% середнього результату Pi.
- 4 механізми пройшли пошук серед 152 напрямків і 535 середовищ.
- SoL-Pi — це розширення Pi на GitHub із ліцензією MIT, яке можна підключати за бажанням.
Ознайомтеся зі статтею, репозиторієм на GitHub і технічним блогом. Уся подяка дослідникам цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150+ тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію на GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.