Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Исследователи из Princeton, Ant Group и Stanford представляют AQuA: двухчастный агентный фреймворк для автономного поиска факторов и разработки моделей в количественных финансах

Количественные исследовательские агенты, которые самостоятельно пишут эксперименты, могут искажать доказательства, на которых впоследствии обучаются. Признак с утечкой данных, показавший хороший результат, сохраняется как успешный прецедент и распространяется в последующих итерациях. Инструкции на уровне промптов и агенты-рецензенты не устраняют эту проблему, поскольку автор и рецензент имеют одни и те же слепые зоны. Команда исследователей из Принстонского университета, Ant Group и Стэнфордского университета предлагает AQuA. AQuA — это пара исследовательских систем на основе языковых моделей, которые улучшают собственный исследовательский процесс от итерации к итерации, в то время как система, оценивающая их, остается неизменной. Одна система обнаруживает символьные альфа-факторы для криптовалют, другая разрабатывает модели временных рядов для американских акций. Они не используют общих агентов, памяти, пространств кандидатов или исследовательского состояния.

Сценарий сбоя, вокруг которого построена AQuA

Количественные исследования рушатся из-за небольших методологических ошибок, которые приводят к убедительным, но невоспроизводимым бэктестам; это задокументировано в работе Bailey и соавторов. Агент, самостоятельно пишущий эксперименты, усугубляет проблему: признак с утечкой данных, показавший хороший результат, сохраняется как прецедент, а рекурсия с такой же легкостью усиливает необнаруженную ошибку, как и настоящее открытие.

Инструкции на уровне промптов и проверка моделью не являются границей целостности. Многократный доступ к фиксированной отложенной выборке приводит к адаптивному переобучению, а было замечено, что LLM-агенты эксплуатируют неверно заданные цели и оценщики. Вместо этого AQuA делает действия, вызывающие утечку данных, недоступными. Каждая часть системы фиксирует разбиения, определения признаков и меток, а также оценщик до начала любой итерации, а агент выдает только ограниченное выражение фактора или единственное изменение конфигурации. Исследовательская команда называет это асимметричной свободой: агент свободно исследует пространство внутри своего DSL, но оценщик находится за пределами адаптивной поверхности. Улучшается именно исследовательский процесс.

Интерактивное объяснение

Часть I: обнаружение факторов под управлением менеджера

Часть I представляет собой конвейер из шести агентов: хранитель данных, визуальный аналитик, генератор идей, оценщик факторов, инженер по бэктестам и библиотекарь исследований — под управлением ИИ-менеджера. Агенты никогда не вызывают друг друга; каждая передача проходит через менеджера, благодаря чему запуски остаются проверяемыми.

Фактор поступает в систему как проверяемое опровержением предложение, а не как выражение: гипотеза, механизм, предполагаемое направление и условия опровержения. Только после этого он собирается из стандартного реестра операторов формульных альфа-факторов. Поскольку каждый оператор временных рядов считывает данные только из завершающегося окна, а каждый кросс-секционный оператор — только из текущей временной метки, причинность сохраняется при композиции. Работают три цикла обратной связи: калибровка направления внутри бэктеста, обновление убеждений на основе фальсификации внутри одного запуска и межзапусковая память, направляющая следующий поиск.

В пятиминутной криптовалютной вселенной совокупный валидационный Spearman IC растет на протяжении 20 исследовательских эпох примерно до 0.190 против 0.171 у адаптированной версии AlphaMemo, 0.151 у адаптированной версии AlphaGen, 0.137 у LSTM, 0.106 у LightGBM и 0.075 у базовой модели в стиле Alpha158. Отдельные механизмы остаются слабыми — IC отдельных факторов составляет от 0.026 до 0.037. Утверждение касается исследовательского контура, а не одного выражения.

Часть II: разработка моделей на основе конфигураций

Часть II прогнозирует форвардную доходность каждой акции за следующие тридцать минут для внутридневных данных по американским акциям. Обучение проводится на периоде 2010–2019 годов, 2020 год является разрывом-эмбарго, которого ничего не касается, а 2021–2025 годы представляют собой нетронутые тестовые данные. Отбор использует срез внутренней валидации только из конца обучающего окна.

Гипотеза здесь представляет собой одно изменение конфигурации — архитектуры, функции потерь, сэмплера или оптимизатора, — причем одно изменение создает ровно один вариант, что позволяет сопоставлять варианты. Предиктор является гибридным: многомасштабный одномерный сверточный фронтенд, настраиваемый бэкенд, включающий LSTM, Mamba и механизм внимания (в представленном запуске использовался механизм внимания), кросс-секционный этап, смешивающий данные по всей панели, управляемое слияние и агрегированный выход для каждой акции.

Ни один отдельный ценовой или объемный признак не несет в себе сигнал: самым сильным является 5-минутная доходность со значением −0.031, а комбинация ridge достигает лишь +0.025. Для семейств моделей на идентичных данных и с одним и тем же оценщиком исходный IC на одну акцию составляет +0.0251 (ridge), +0.0397 (LGB), +0.0434 (xLSTM), +0.0535 (LSTM), +0.0613 (GRU) и +0.0843 для гибридной модели — на +0.0230 абсолютного значения выше лучшей базовой модели, или на 37.5% относительно. В двух частях используются разные соглашения об IC, и в статье прямо указано, что их не следует сравнивать.

От сигнала к стратегии

Оценка для каждой акции преобразуется в долларово-нейтральный пороговый лонг/шорт-портфель с затратами 2 б.п. на две сделки. Нейтрализация по секторам повышает Sharpe на отложенной выборке до +2.15, причем значения на обучающей и отложенной выборках почти равны. Каузальная надстройка таргетирования волатильности повышает его до +2.50, а полностью каузальный пошаговый процесс, выбирающий каждый параметр исключительно на основе прошлых данных, по-прежнему достигает +2.00. R² на одну акцию составляет 1.20%. Значения Sharpe по годам составляют +1.7, +3.5, +1.9, +1.8 и +2.7 за 2021–2025 годы — положительные в каждом году, включая просадку 2022 года.

Основные выводы

  • Два независимых исследовательских цикла: обнаружение факторов и разработка моделей; они не используют общих агентов, памяти или состояния.
  • Свобода асимметрична: агент исследует пространство внутри DSL, но разбиения, признаки, метки и оценщик запечатаны.
  • Часть I достигает совокупного IC около 0.190 на криптовалютах; часть II достигает IC +0.0843 на одну акцию против +0.0613 у GRU.
  • Доходность портфеля акций соответствует Sharpe +2.50 при затратах 2 б.п. и остается положительной во все пять лет, 2021–2025.

Ознакомьтесь с исследовательской статьей. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами


Примечание: благодарим исследовательскую команду Ant за идейное руководство и ресурсы для этой статьи. Исследовательская команда Ant поддержала продвижение этого материала/статьи.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости