AutoSynthData: Генерування навчальних даних для корпоративних агентів
Корпоративним компаніям потрібні агенти, які добре працюють у їхніх власних середовищах. Робота, яку вони доручають цим агентам, визначається системами, якими вони користуються, правилами, яких вони дотримуються, і станом їхніх даних. Модель може мати широкі можливості й водночас зазнавати труднощів у конкретному середовищі: погано виконувати певний робочий процес, неправильно використовувати комбінацію інструментів або не дотримуватися певного обмеження. Саме ці слабкі місця корпоративній компанії потрібно вдосконалювати.
Складність полягає в перетворенні цих слабких місць на навчальні дані. Окрема помилка повідомляє нам щось важливе, але для навчання моделі потрібна велика кількість нових завдань, які перевіряють ту саму здатність у різних ситуаціях. Ці завдання також мають бути можливими для виконання в середовищі, нагадувати роботу, яку справді міг би замовити користувач, і мати надійний спосіб перевірки успішності агента.
У ServiceNow CoreAI ми створили AutoSynthData, щоб перетворювати прогалини в можливостях на навчальні дані. Система використовує помилки цільової моделі та успіхи сильнішої моделі-вчителя, щоб визначити, чого моделі слід навчитися далі, а потім генерує й перевіряє нові завдання, які тренують ці здібності. У міру вдосконалення моделі навчальна програма зміщується до того, що їй досі дається складно. Ми демонструємо цей конвеєр за допомогою EnterpriseOps Gym (Malay та ін., 2026), використовуючи опублікований набір даних. Спочатку ми описуємо середовище, у якому працює агент, і те, що робить завдання корисним для навчання.
Що робить агентне завдання корисним?
Агентне середовище визначає світ, у якому працює агент: стан, який він може спостерігати й змінювати, інструменти та API, які він може викликати, а також переходи стану, спричинені його діями.
Завдання створюється в межах цього середовища. Ми використовуємо таку абстракцію:
завдання = (специфікація системи, запит користувача, верифікатор)
Специфікація системи
Специфікація системи визначає обмеження, у межах яких працює агент, зокрема системні інструкції, політики середовища та, за потреби, ініціалізацію, специфічну для завдання, наприклад початковий стан бази даних або набір інформаційних статей.
Специфікація має бути сумісною з інструментами, станом і підтримуваними діями середовища. Її інструкції мають бути чіткими й не повинні містити довільних обмежень, запроваджених винятково для штучного ускладнення завдання.
Завдання для агента
Запит користувача визначає, чого користувач хоче досягти за допомогою агента, а також будь-які обмеження на рівні користувача. Згенероване завдання має відповідати трьом властивостям.
Здійсненність. У поточному середовищі має існувати принаймні одна траєкторія, яка задовольняє запит користувача й відповідає специфікації системи. Це виключає завдання, що залежать від недоступних інструментів, недоступних знань, неможливих переходів стану або дій, заборонених політикою.
Реалістичність. Запит користувача має нагадувати те, про що користувач міг би правдоподібно попросити в цільовому середовищі. Простір виконуваних дій зазвичай набагато ширший за простір реалістичних робочих процесів.
Складність. Для навчання завдання має виявляти слабке місце поточного агента. Завдання, які вже надійно виконуються, дають мало нового навчального сигналу. Тому корисний регіон — це завдання, які є здійсненними та реалістичними, але ще не виконуються стабільно.
Верифікатор
Верифікатор визначає, чи успішно отримана траєкторія виконує завдання. Він має відповідати трьом властивостям.
Узгодженість. Він має узгоджуватися із запитом користувача, специфікацією системи та станом середовища, специфічним для завдання.
Коректність. Він має відхиляти траєкторії, які не виконують завдання або порушують відповідні обмеження.
Повнота. Він має приймати дійсні рішення, а не кодувати одну конкретну еталонну траєкторію.
Ці властивості безпосередньо важливі під час навчання. Поблажливий верифікатор може винагороджувати неправильну поведінку, тоді як надмірно суворий — карати за дійсні рішення.
Огляд
Маючи середовище й цільову модель, AutoSynthData генерує навчальні завдання, що складаються зі специфікації системи, запиту користувача та верифікатора. Згенеровані завдання прив’язані до середовища й відібрані так, щоб забезпечити корисний навчальний сигнал для поточної моделі.
Спочатку AutoSynthData оцінює цільову модель у середовищі за допомогою діагностичних завдань і виявляє закономірності в завданнях, які їй складно виконувати. Сильніший учитель допомагає визначити, які з цих завдань можна виконати та як виглядає успішна поведінка. AutoSynthData перетворює отримані прогалини в можливостях на нові виконувані завдання, перевіряє кожне завдання в середовищі й використовує прийняті зразки для подальшого навчання. Оцінювання оновленої моделі показує, які прогалини залишилися, і може спрямувати наступний раунд генерування.
Від помилок моделі до навчальної програми
AutoSynthData використовує результати оцінювання в цільовому середовищі, щоб визначити, чого моделі потрібно навчитися далі. У нашому експерименті з EnterpriseOps Gym ми запускаємо на завданнях оцінювання як цільову модель, так і сильнішого вчителя. Ми аналізуємо ці запуски, щоб визначити:
- здатність, яка перевіряється;
- задіяні інструменти та структуру робочого процесу;
- де цільова модель помиляється і як досягає успіху вчитель;
- властивості, яким має відповідати правильний кінцевий стан;
- параметри, які можна змінювати, зберігаючи здатність, що перевіряється.
Ми узагальнюємо ці результати в очищених картках специфікацій можливостей. Завдання оцінювання визначають, чого має навчитися модель, але генератор не отримує їхніх початкових запитів, сутностей, траєкторій або деталей верифікатора. Він отримує картки й використовує їх для створення нових завдань з іншими запитами, станами та шляхами розв’язання.
Генерування та масштабування завдань
Виявлення прогалини в можливостях показує, чого потрібно навчати, але для навчання потрібна велика кількість різноманітних завдань, які це тренують. AutoSynthData використовує картку специфікації для генерування таких завдань.
Припустімо, що цільовій моделі складно виконувати завдання, які потребують такого робочого процесу:
Генератор створює нові завдання, які тренують цей робочий процес, змінюючи сутності, початковий стан середовища, композицію робочого процесу, комбінації інструментів, формулювання та складність. Потім сильніший учитель демонструє успішну траєкторію для кожного завдання. Для контрольованого донавчання (SFT) ці демонстрації навчають цільову модель застосовувати здатність у нових ситуаціях.
AutoSynthData створює набір даних у два етапи: спочатку генерує та перевіряє основні зразки, а потім розширює їх новими варіантами.
Цільовий етап
Цільовий етап створює основний набір навчальних зразків зі специфікацій можливостей. Воркери паралельно генерують незалежні завдання, переходячи до нового цільового завдання після завершення попереднього. Кожен кандидат проходить перевірку, виконання, оцінювання розв’язувачем і виправлення перед прийняттям. У результаті формується пакет перевірених прикладів, побудованих навколо того, чого має навчитися цільова модель.
Розмноження
На етапі розмноження набір даних розширюється шляхом створення нових варіантів прийнятих цільових зразків. Кожен варіант має власний запит користувача, стан середовища, конфігурацію сутностей, еталонну траєкторію та верифікатор і має пройти ті самі перевірки й перевірки виконання. Розмножений зразок не може бути основою для іншого розмноженого зразка. Це прив’язує розширення до перевіреного цільового набору й обмежує відхилення між поколіннями.
Деталі реалізації
Щоб підтримувати обидва етапи, AutoSynthData відокремлює керування генеруванням від виконання, специфічного для середовища. Спільний контролер координує генерування, контроль якості, покриття та створення набору даних, тоді як адаптер відповідає за виконання в середовищі, керування завданнями й станами, відтворення еталонних траєкторій, детерміновану перевірку, виконання розв’язувача та профілювання завдань.
Разом паралельне цільове генерування та розмноження забезпечують шлях до наборів даних масштабу, потрібного для навчання. Їхня корисність залежить від перевірок, які застосовуються до кожного кандидата: завдання має виконуватися, рішення має працювати, а верифікатор має відрізняти успіх від невдачі.
Для високоякісних синтетичних даних потрібно більше, ніж просто генерування
Генерування правдоподібного запиту недостатньо для створення корисних навчальних даних. Завдання може бути неможливим у цільовому середовищі, його еталонне рішення може не спрацювати під час виконання, або його верифікатор може винагороджувати неправильний кінцевий стан. AutoSynthData перевіряє ці властивості, перш ніж прийняти завдання для навчання.
AutoSynthData перевіряє якість на двох рівнях: окремі кандидати мають пройти верифікацію, а пакети мають забезпечувати корисне покриття та різноманітність.
Перевірка та виправлення на рівні зразка
Кожен кандидат має пройти цикл контролю якості, перш ніж потрапити до навчального набору даних. Ми починаємо з оцінювання розв’язувачем, щоб виміряти складність. У конфігурації, використаній тут, ми надаємо перевагу завданням, які цільова модель розв’язує не більш ніж в одній із трьох спроб, а сильніший розв’язувач — щонайменше у двох із трьох спроб. Кандидати також проходять позитивну й негативну перевірку та обмежений процес виправлення.
Позитивна перевірка
Позитивна перевірка ставить запитання: чи розв’язує заплановане рішення згенероване завдання?
Конвеєр виконує еталонну траєкторію в цільовому середовищі та порівнює отриманий стан із верифікатором кандидата. Це виявляє невідповідності між запитом, початковим станом, рішенням і критеріями успіху.
Негативна перевірка
Негативна перевірка ставить запитання: чи не проходять відповідні неправильні результати перевірку?
Наприклад, вона може змінювати частини очікуваного результату й підтверджувати, що такі стани більше не проходять перевірку. Це виявляє слабкі верифікатори, які зараховують успіх без вимоги запланованої поведінки.
Критика та виправлення
Невдалі кандидати перед відхиленням передаються критику. Критик аналізує зразок і його помилку, шукаючи неузгоджений стан, неможливі робочі процеси, неправильну побудову завдання, помилкові еталонні траєкторії, слабку логіку верифікатора або невідповідність запланованій здатності. Висновки критика спрямовують виправлення з фіксованим обмеженням кількості повторних спроб:
кандидат
↓
помилка
↓
критика / діагностика
↓
цільове виправлення
↓
повторне проходження перевірок
↓
прийняти або повторити спробу
Виправлене завдання має знову пройти відповідні перевірки. Діагностика спрямовує виправлення на наявного кандидата, а не вимагає починати генерування спочатку.
Проходження цих перевірок робить зразок придатним для навчання, але окремі дійсні зразки все ще можуть утворити повторюваний або незбалансований набір даних. Тому AutoSynthData також перевіряє генерування на рівні пакета.
Перевірка на рівні пакета
У пакеті можуть бути надмірно представлені кілька простих сімейств завдань, може бракувати певної здатності або може бути відображено надмірні зусилля з генерування, витрачені на малорезультативний шаблон.
Метааналіз перевіряє прийняті й відхилені зразки, а також поведінку генерування в кожному пакеті. Він ставить такі запитання:
- Які сімейства завдань представлені надмірно, а яких вимірів можливостей бракує?
- Чи повторюються постійно ті самі типи прикладів?
- Чи продовжують певні цілі зазнавати невдачі під час генерування?
- Чи з’являються систематичні проблеми в критичних зауваженнях?
- Які вказівки слід змінити для наступного пакета?
Контролер відстежує покриття в прийнятому наборі даних, скорочує генерування в надмірно представлених регіонах і спрямовує більше роботи на прогалини. Коли певний регіон регулярно дає поганих кандидатів, критичні зауваження та метааналіз спрямовують зміни стратегії генерування. Ці коригування балансують корисний навчальний сигнал, якість завдань, покриття, різноманітність і низьку надлишковість у межах доступного бюджету генерування та вимог до розміру набору даних.
Разом ці цикли зворотного зв’язку покращують як окремі завдання, так і набір даних, який вони утворюють: перевірки на рівні зразка спрямовують виправлення кандидатів, а перевірка на рівні пакета — майбутнє генерування.
Розширення межі навчання
Корисний розподіл навчальних даних змінюється в міру вдосконалення моделі. AutoSynthData розглядає генерування синтетичних даних як пошук завдань поблизу межі можливостей цільової моделі: достатньо складних, щоб виявляти слабкі місця, але достатньо здійсненних, щоб учитель міг надавати надійні демонстрації.
Після подальшого навчання ми оцінюємо оновлену модель у тому самому середовищі. Завдання, які вона тепер надійно розв’язує, менш корисні для наступного раунду навчання; стійкі невдачі вказують на здібності, які все ще потребують уваги. Ці результати можуть спрямувати наступний раунд генерування.
Наші експерименти зосереджені на SFT, але той самий механізм може підтримувати навчання з підкріпленням (RL): генерувати завдання, які кидають виклик поточній політиці та забезпечують надійний навчальний сигнал, навчати, а потім зміщувати ціль генерування за допомогою оновленої політики. Ми плануємо перевірити цю рухому межу, калібровану за складністю, за межами SFT.
Експерименти з EnterpriseOps Gym
Ми використовуємо EnterpriseOps Gym, щоб перевірити, чи покращує цей підхід модель на завданнях у станозалежному корпоративному середовищі. Ми генеруємо навчальні завдання в середовищах Hybrid та ITSM Gym, донавчаємо цільову модель на прийнятих зразках і оцінюємо отримані контрольні точки.
Hybrid
Ми протестували конвеєр у домені Hybrid середовища EnterpriseOps Gym, використовуючи Gemma-4-26B-A4B-it як цільову модель і Qwen3.8-27B як учителя.
AutoSynthData згенерувала 2 000 синтетичних навчальних зразків приблизно за 18 годин. Ми донавчили Gemma на цьому наборі даних і оцінили отримані контрольні точки на бенчмарку. Найкращою була контрольна точка на 5-й епосі.
Результати Hybrid
Синтетична контрольна точка SFT підвищує середній Pass@1 на 7,2 відсоткового пункта, тобто на 35% відносно, і збільшує успішність верифікатора з 63,01% до 68,55%. Вона закриває 59% початкового розриву Pass@1 між Gemma та еталонною моделлю.
Навчальні завдання були згенеровані заново на основі специфікацій можливостей; генератор не отримував оригінальних завдань оцінювання. Результат демонструє покращення в EnterpriseOps Gym Hybrid — середовищі, використаному в цьому експерименті.
ITSM
Ми також застосували AutoSynthData до домену ITSM середовища EnterpriseOps Gym, використовуючи Gemma-4-26B-A4B-it як цільову модель і DeepSeek-V4.1-Flash як учителя. AutoSynthData згенерувала 1 994 синтетичні навчальні зразки за 66 годин. Генерування тривало довше, ніж у наступному запуску Hybrid, описаному вище, переважно тому, що в запуску ITSM використовувалася більша модель-учитель і він передував оптимізаціям конвеєра, які підвищили пропускну здатність.
В ITSM синтетичне SFT підвищує середній Pass@1 з 18,77% до 27,18%, демонструючи, що цей підхід також покращує продуктивність у другому домені.
Замкнення циклу
Найкорисніші для навчання завдання залежать як від середовища, так і від моделі, що в ньому працює. AutoSynthData використовує помилки моделі, щоб визначити, що генерувати, перевіряє нові завдання в середовищі й робить ці завдання доступними для подальшого навчання. Наші результати в EnterpriseOps Gym демонструють цінність цього підходу в контрольованих умовах. У міру зміни моделі той самий процес може зосереджуватися на прогалинах, які залишаються.
Моделі, згадані в цій статті 3
Набори даних, згадані в цій статті 1
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Моделі, згадані в цій статті 3
Набори даних, згадані в цій статті 1
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.








