Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Google Research представила ToolGrad: фреймворк із підходом «спочатку відповідь» досягає показника проходження 99,8% під час генерації даних для використання інструментів

Навчання LLM надійно викликати інструменти потребує наборів даних, які поєднують запити користувачів із правильними ланцюжками використання інструментів. Створення таких даних у масштабі було повільним і дорогим. Команда дослідників із Google, Токійського університету, RIKEN AIP і Університету Тохоку представляє ToolGrad. Дослідницька робота інвертує звичний конвеєр: спочатку створюється перевірений ланцюжок інструментів, а потім формується запит. Моделі Gemma-3, донавчені на 500 зразках отриманих даних, демонструють результати на рівні передових пропрієтарних моделей у Berkeley Function Calling Leaderboard.

Чи придатний він для розгортання? Так. Код поширюється за ліцензією Apache-2.0, набір даних ToolGrad-500 і моделі на 1B, 4B і 12B параметрів доступні на Hugging Face, а також існує пакет PyPI.

Проблема генерації за принципом «спочатку запит»

Попередні конвеєри, такі як ToolBench і ToolACE, дотримуються принципу «спочатку запит». Система формує вибірку API, просить LLM вигадати правдоподібну інструкцію користувача, а потім запускає агента пошуку в глибину (DFS), щоб знайти шлях використання інструментів, який задовольняє цю інструкцію. Пошук не гарантує успіху. Коли він заходить у глухий кут, обчислювальні ресурси, витрачені на дослідження, марнуються, а зразок відкидається. У статті це описується як дистиляція цінних траєкторій зі складного й часто невдалого дослідження агентом, що за своєю суттю є неефективним.

ToolGrad змінює порядок дій на протилежний. Спочатку він створює еталонний ланцюжок використання інструментів шляхом фактичного виконання API, а потім додає до цього ланцюжка відповідний запит користувача. Явний робочий ланцюжок набагато менш неоднозначний, ніж гіпотетичний запит, тому для переходу від ланцюжка до запиту достатньо одного виклику LLM.

Чотири модулі в циклі

Кожна ітерація послідовно запускає чотири модулі:

  • API Proposer звужує вибірку API до кількох кандидатів, які можуть розширити поточний робочий процес.
  • API Executors паралельно запускають цих кандидатів і формують докладні звіти про виконання.
  • API Selector аналізує звіти, обирає виклик із найкращими результатами та додає його до робочого процесу. Його спрямований зворотний зв’язок є текстовим градієнтом.
  • LLM Updater переписує синтетичний запит користувача й відповідь ШІ так, щоб вони відповідали новому набору API.

Повторення циклу дає один зразок: запит користувача, перевірений робочий процес API та фінальну відповідь. Типова конфігурація репозиторію виконує 10 ітерацій над 50 відібраними API для кожного робочого процесу.

Ефективність генерації на ToolBench

Дослідницька команда оцінила генерацію даних на базі даних API ToolBench, яка містить понад 16 000 реальних API, і порівняла ToolGrad із підходом ToolBench «спочатку запит» на основі DFS. Згідно з дослідницькою статтею:

  • Рівень успішного проходження зріс із 63,8% (DFS) до 99,8% (ToolGrad).
  • Кількість еталонних використань інструментів на зразок зросла з 2,1 до 3,4, тобто ланцюжки стали довшими.
  • Кількість кроків використання інструментів на зразок зменшилася з 34,3 до 20,0.
  • Кількість викликів LLM на зразок дещо зменшилася — із 64,5 до 63,9.

Випадок невдачі у 0,2% стався, коли агент не зміг отримати успішну відповідь від 3 відібраних API протягом усіх 10 ітерацій і зберіг порожній зразок.

Інтерактивне пояснення

Результати BFCL із Gemma-3

Дослідники створили ToolGrad-500 — набір даних із 500 зразків, сформований за допомогою Gemini 2.5 Flash-Lite, — і використали його для посттренування Gemma-3 із 1B, 4B і 12B параметрів. Оцінювання проводилося на Berkeley Function Calling Leaderboard, де використовується набір інструментів, відмінний від ToolBench, що робить це тестом поза розподілом із невідомими інструментами. Автори повідомляють про такі результати:

  • Донавчання на ToolGrad-500 підвищило показники використання інструментів за кожного розміру моделі.
  • ToolGrad-12B отримала 83,1 бала, тоді як Gemini 2.5 Pro — 83,2, Claude 4.5 Opus — 82,8, а GPT-5 — 74,4 за вимірюваннями на момент публікації.
  • Студентська модель на 12B параметрів перевершила Gemini 2.5 Flash-Lite — модель-учителя, яка створила її навчальні дані.
  • ToolGrad-12B випередила відкриті спеціалізовані моделі для використання інструментів, зокрема ToolACE і Hammer-2.1-7B.

Скрипти репозиторію для відтворення результатів орієнтовані на BFCL V1 і V2 через налаштований форк, запускають інференс в образі Docker із vLLM і були перевірені на одному NVIDIA A100 40GB.

Ключові висновки

  • ToolGrad перевертає генерацію даних для використання інструментів: спочатку перевіряється ланцюжок, а потім пишеться запит.
  • На ToolBench рівень успішного проходження зростає з 63,8% до 99,8%, а ланцюжки стають довшими за меншої кількості кроків роботи з інструментами.
  • Усього 500 зразків підвищують результат Gemma-3-12B до 83,1 на BFCL — майже до показника Gemini 2.5 Pro на рівні 83,2.
  • Студентська модель перевершує свою модель-учителя Gemini 2.5 Flash-Lite.

Ознайомтеся зі статтею, сторінкою на GitHub та блогом Google Research. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини