Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Дослідники з Princeton, Ant Group і Stanford представили AQuA: двочастинну агентну систему для автономного виявлення факторів і розроблення моделей у кількісних фінансах

Кількісні дослідницькі агенти, які самостійно пишуть експерименти, можуть спотворити докази, на яких згодом навчаються. Ознака з витоком даних, що демонструє високі результати, зберігається як успішний прецедент і поширюється в наступних ітераціях. Інструкції на рівні промптів і агенти-рецензенти не усувають цю проблему, оскільки автор і рецензент мають однакові сліпі зони. Команда дослідників із Принстонського університету, Ant Group і Стенфордського університету пропонує AQuA. AQuA — це пара дослідницьких систем на основі мовних моделей, які вдосконалюють власний дослідницький процес упродовж ітерацій, тоді як система, що їх оцінює, залишається незмінною. Одна система виявляє символічні альфа-фактори для криптовалют, інша розробляє моделі часових рядів для американських акцій. Вони не мають спільних агентів, пам’яті, просторів кандидатів чи дослідницького стану.

Проблема, навколо якої побудовано AQuA

Кількісні дослідження дають збій через невеликі методологічні помилки, які породжують переконливі, але невідтворювані результати бек-тестів; це задокументовано, зокрема, у роботі Bailey та ін. Агент, який сам пише власні експерименти, погіршує ситуацію: ознака з витоком даних, що демонструє високі результати, зберігається як прецедент, а рекурсія так само легко посилює непомічену помилку, як і справжнє відкриття.

Інструкції на рівні промптів і перевірка моделлю не є межею цілісності. Повторний доступ до фіксованої відкладеної вибірки спричиняє адаптивне перенавчання, а за агентами на базі LLM спостерігали експлуатацію неправильно заданих цілей та оцінювачів. Натомість AQuA робить дії, що спричиняють витік даних, недоступними. Кожна частина фіксує свої розбиття, визначення ознак і міток, а також оцінювач до початку будь-якої ітерації, а агент видає лише обмежений вираз фактора або одну зміни конфігурації. Дослідницька команда називає це асиметричною свободою: агент вільно досліджує простір усередині своєї DSL, але оцінювач перебуває поза адаптивною поверхнею. Удосконалюється саме дослідницький процес.

Інтерактивне пояснення

Частина I: відкриття факторів під керуванням менеджера

Частина I — це конвеєр із шести агентів: розпорядник даних, візуальний аналітик, генератор ідей, оцінювач факторів, інженер бек-тестування та бібліотекар досліджень — під керуванням ШІ-менеджера. Агенти ніколи не викликають один одного; кожна передача відбувається через менеджера, що забезпечує можливість аудиту запусків.

Фактор надходить як пропозиція, яку можна спростувати, а не як вираз: гіпотеза, механізм, прогнозований напрямок і умови спростування. Лише після цього він збирається зі стандартного реєстру операторів формульних альфа-факторів. Оскільки кожен оператор часових рядів читає лише кінцеве вікно, а кожен крос-секційний оператор — лише поточну часову позначку, причинність зберігається під час композиції. Працюють три цикли зворотного зв’язку: калібрування напрямку всередині бек-тесту, оновлення переконань на основі спростувань у межах одного запуску та міжзапускова пам’ять, яка спрямовує наступний пошук.

У п’ятихвилинному криптовалютному універсумі сукупний валідаційний коефіцієнт Спірмена IC зростає протягом 20 дослідницьких епох приблизно до 0.190, проти 0.171 у адаптованого AlphaMemo, 0.151 у адаптованого AlphaGen, 0.137 у LSTM, 0.106 у LightGBM і 0.075 у базової моделі на кшталт Alpha158. Окремі механізми залишаються слабкими — значення IC для окремих факторів становлять від 0.026 до 0.037. Твердження стосується тестового середовища, а не одного виразу.

Частина II: розроблення моделей на основі конфігурацій

Частина II прогнозує форвардну дохідність кожної акції за наступні тридцять хвилин для внутрішньоденних американських акцій. Навчання відбувається на даних за 2010–2019 роки, 2020 рік є проміжком ембарго, якого не торкається жоден процес, а 2021–2025 роки — недоторкані тестові дані. Відбір використовує внутрішній валідаційний зріз лише з кінця навчального вікна.

Гіпотеза тут — це одна зміна конфігурації: архітектури, функції втрат, семплера або оптимізатора; одна зміна створює рівно один варіант, що забезпечує порівнюваність варіантів. Прогнозатор є гібридним: багатомасштабний фронтенд на основі одновимірної згортки, конфігурована базова мережа, що охоплює LSTM, Mamba і механізм уваги (у наведеному запуску — механізм уваги), крос-секційний етап, який змішує дані панелі, кероване об’єднання та агрегований вихід для кожної акції.

Жодна окрема ціново-об’ємна ознака не несе сигналу: найсильнішою є п’ятихвилинна дохідність зі значенням −0.031, а комбінація ridge досягає лише +0.025. Для різних сімейств моделей на ідентичних даних і з тим самим оцінювачем вихідний IC на одну акцію становить +0.0251 (ridge), +0.0397 (LGB), +0.0434 (xLSTM), +0.0535 (LSTM), +0.0613 (GRU) і +0.0843 для гібридної моделі — на +0.0230 абсолютного значення більше за найкращу базову модель, або на 37.5% відносно. IC двох частин використовують різні конвенції, і в роботі прямо зазначено, що їх не слід порівнювати.

Від сигналу до стратегії

Оцінка для кожної акції перетворюється на пороговий доларово-нейтральний лонг/шорт-портфель із вартістю двох операцій у 2 б.п. Нейтралізація за секторами підвищує коефіцієнт Шарпа на відкладених даних до +2.15, причому значення для навчальної та відкладеної вибірок майже однакові. Каузальний оверлей таргетування волатильності підвищує його до +2.50, а повністю каузальний послідовний вибір, у якому кожен параметр визначається лише на основі минулих даних, усе одно досягає +2.00. R² на одну акцію становить 1.20%. Значення Шарпа за роками становить +1.7, +3.5, +1.9, +1.8 і +2.7 для 2021–2025 років відповідно — позитивне в кожному році, включно з просіданням 2022 року.

Ключові висновки

  • Два незалежні дослідницькі цикли: відкриття факторів і розроблення моделей — не мають спільних агентів, пам’яті чи стану.
  • Свобода є асиметричною: агент досліджує простір усередині DSL, але розбиття, ознаки, мітки та оцінювач захищені.
  • Частина I досягає приблизно 0.190 сукупного IC на криптовалютах; частина II — +0.0843 IC на одну акцію проти +0.0613 у GRU.
  • Портфель акцій демонструє коефіцієнт Шарпа +2.50 за вартості 2 б.п. і є прибутковим у всі п’ять років, 2021–2025.

Ознайомтеся з науковою статтею. Також підписуйтеся на нас у Twitter та не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників і підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами


Примітка: Дякуємо дослідницькій команді Ant за експертні матеріали та ресурси для цієї статті. Дослідницька команда Ant підтримала цей контент/статтю з метою просування.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини