Изследователи от Princeton, Ant Group и Stanford представят AQuA: двукомпонентна агентна рамка за автономно откриване на фактори и разработване на модели в количествените финанси
Количествените изследователски агенти, които сами пишат експериментите си, могат да компрометират доказателствата, от които по-късно се учат. Пропускащ информация признак, който постига добър резултат, се съхранява като успешен прецедент и се разпространява в следващите итерации. Инструкциите на ниво промпт и агентите-рецензенти не отстраняват този проблем, защото авторът и рецензентът споделят едни и същи слепи петна. Екип от изследователи от Принстънския университет, Ant Group и Станфордския университет предлага AQuA. AQuA представлява двойка изследователски системи, управлявани от езикови модели, които подобряват собствения си изследователски процес в последователни итерации, докато оценяващият ги компонент остава замразен. Едната открива символични алфа фактори за криптовалути, а другата разработва модели за времеви редове върху американски акции. Те не споделят агенти, памет, пространства от кандидати или изследователско състояние.
Режимът на отказ, около който е изградена AQuA
Количествените изследвания се провалят заради малки методологични грешки, които водят до убедителни, но невъзпроизводими бек-тестове — явление, документирано от Bailey и съавтори. Агент, който пише собствените си експерименти, влошава проблема: пропускащ информация признак, който постига добър резултат, се съхранява като прецедент, а рекурсията усилва неоткритата грешка също толкова лесно, колкото и истинското откритие.
Инструкциите на ниво промпт и прегледът от модела не представляват граница на интегритета. Многократният достъп до фиксирана контролна извадка води до адаптивно преобучаване, а е наблюдавано, че LLM агентите експлоатират неправилно специфицирани цели и оценяващи системи. Вместо това AQuA прави действията, водещи до изтичане на информация, недостъпни. Всеки компонент фиксира своите разделяния, дефиниции на признаците и етикетите, както и оценяващия, преди началото на която и да е итерация, а агентът извежда само ограничен израз на фактор или единична промяна в конфигурацията. Изследователският екип нарича това асиметрична свобода: агентът изследва свободно в рамките на своя DSL, но оценяващият се намира извън адаптивната повърхност. Подобрява се именно изследователският процес.
Интерактивно обяснение
Част I: откриване на фактори чрез посредничество на мениджър
Част I представлява конвейер от шест агента: Управител на данните, Визуален анализатор, Изследовател на идеи, Оценяващ факторите, Инженер по бек-тестове и Научен библиотекар — координирани от AI мениджър. Агентите никога не се извикват един друг; всяко предаване минава през мениджъра, което запазва одитируемостта на изпълненията.
Факторът постъпва като проверима чрез опровержение хипотеза, а не като израз: хипотеза, механизъм, предсказана посока и условия за опровержение. Едва след това той се съставя от стандартния регистър на операторите за формулни алфи. Тъй като всеки оператор за времеви редове чете само следващ прозорец, а всеки оператор за напречно сечение чете само текущия времеви отрязък, причинността се запазва при композиция. Работят три цикъла за обратна връзка: калибриране на посоката в рамките на бек-тест, актуализиране на убежденията въз основа на опровержения в рамките на едно изпълнение и памет между отделните изпълнения, която насочва следващото търсене.
В петминутна крипто вселена комбинираният Spearman IC при валидирането се покачва през 20 изследователски епохи до приблизително 0.190 в сравнение с 0.171 за адаптираната версия на AlphaMemo, 0.151 за адаптираната версия на AlphaGen, 0.137 за LSTM, 0.106 за LightGBM и 0.075 за базова линия в стил Alpha158. Отделните механизми остават слаби — IC на единичните фактори от 0.026 до 0.037. Твърдението се отнася до експерименталната рамка, а не до един конкретен израз.
Част II: разработване на модели, управлявано от конфигурация
Част II предсказва бъдещата доходност на всяка акция през следващите тридесет минути при вътредневна търговия с американски акции. Обучението се провежда върху периода 2010–2019 г., 2020 г. е междинен период за предотвратяване на изтичане на информация, до който нищо няма достъп, а 2021–2025 г. представлява неприкосновен набор за тестване. Изборът използва срез за вътрешна валидация единствено от края на тренировъчния прозорец.
Тук хипотезата представлява една промяна в конфигурацията — архитектура, функция на загубата, семплер или оптимизатор — а една промяна създава точно един вариант, което запазва сравнимостта между вариантите. Предикторът е хибриден: многомащабен 1-D свърточен преден слой, конфигурируем гръбнак, включващ LSTM, Mamba и внимание (внимание в докладваното изпълнение), етап за напречно сечение, който смесва данните в рамките на панела, контролирано сливане и обобщен изход за всяка акция.
Нито един отделен ценово-обемен признак не носи сигнала: най-силният е 5-минутната доходност с −0.031, а комбинацията чрез ridge достига само +0.025. При еднакви данни и един и същ оценяващ, в различните семейства модели суровият IC на акция е +0.0251 (ridge), +0.0397 (LGB), +0.0434 (xLSTM), +0.0535 (LSTM), +0.0613 (GRU) и +0.0843 за хибрида — с +0.0230 абсолютна разлика спрямо най-добрата базова линия, или 37.5% относително. IC в двете части използват различни конвенции и в статията изрично се посочва, че не трябва да бъдат сравнявани.
От сигнала към стратегията
Оценката за всяка акция се превръща в неутрална по отношение на долара long/short книга с праг и разход от 2 базисни пункта за двете страни на сделката. Неутрализирането по сектори повишава Sharpe на данните, запазени за тестване, до +2.15, като стойностите за обучението и запазените данни са почти равни. Причинно обосновано наслагване за таргетиране на волатилността го повишава до +2.50, а напълно причинно walk-forward изпълнение, което избира всеки параметър единствено от минали данни, все още достига +2.00. R² на акция е 1.20%. Sharpe по години е +1.7, +3.5, +1.9, +1.8 и +2.7 за периода от 2021 до 2025 г. — положителен през всяка година, включително спада през 2022 г.
Основни изводи
- Два независими изследователски цикъла: откриване на фактори и разработване на модели, които не споделят агенти, памет или състояние.
- Свободата е асиметрична: агентът изследва в рамките на DSL, но разделянията, признаците, етикетите и оценяващият са запечатани.
- Част I достига ~0.190 комбиниран IC върху крипто; Част II достига +0.0843 IC на акция спрямо +0.0613 за GRU.
- Книгата с акции поддържа Sharpe от +2.50 при 2 базисни пункта и е положителна през всичките пет години, 2021–2025 г.
Разгледайте статията.Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас
Забележка: Благодарим на изследователския екип на Ant за експертния принос/ресурсите за тази статия. Изследователският екип на Ant подкрепи това съдържание/статия за популяризиране.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.