LLM-MCTS驱动的可解释因子迭代框架研究

  • 来源:东吴证券
  • 发布时间:2026/06/24
  • 浏览次数:45
  • 举报
相关深度报告REPORTS

金工专题报告:深度学习系列之四,从人工写因子到AI写因子,LLM_MCTS驱动的可解释因子迭代框架.pdf

本报告构建了LLM-MCTS可解释因子迭代框架,旨在实现从人工写因子到AI挖因子的范式升级。框架中,MCTS负责在公式或代码搜索树中进行选择、扩展、评测和回传,LLM负责生成金融假说、可执行表达式或Python函数,并解释机制及审查数据合法性。相比一次性让模型写公式,该框架将候选生成、周度RankIC/IR评测、样本内选择、样本外检验和经验库沉淀组织成闭环,覆盖日频Seed改造、低频Seed池批量挖掘和高频分钟行为挖掘。在日频Seed定向改造中,以29个低频价量原始因子为起点,结果显示候选池层面25/29个Seed至少搜索到过样本外优于原始Seed的候选。在低频Seed池批量挖掘中,以12个根...

因子研究范式的演进与瓶颈

传统因子挖掘主要依赖人工构建、深度学习建模及自动公式搜索三种路径。人工构建虽具备较强的经济学解释能力,但高度依赖研究员经验,搜索空间有限且效率较低。深度学习模型虽能处理高维非线性特征,但其“黑箱”特性限制了在实际投研中的广泛应用。自动公式搜索技术如遗传规划虽能扩大搜索范围,但面临计算资源消耗大、表达式复杂且难以解释的挑战。近年来,大语言模型(LLM)展现出较强的金融逻辑推理能力,能够生成具备金融含义的因子假设,但直接利用LLM生成因子缺乏系统性搜索机制和持续反馈闭环,难以解决系统性探索问题。

LLM-MCTS框架的核心逻辑

为解决上述问题,本研究构建了LLM-MCTS(大语言模型结合蒙特卡洛树搜索)可解释因子迭代框架。该框架将因子生成问题建模为公式搜索树,其中MCTS负责在搜索树中进行选择、扩展、评测和回传,管理搜索预算并决定路径切换;LLM则作为扩展器,负责生成金融假说、可执行表达式或Python函数,并对候选因子进行逻辑审查和机制解释。这种分工使得LLM不直接决定最终因子,而是提供带有语义约束的候选动作,MCTS则基于真实数据评测结果(如RankIC、IR、覆盖率、换手率等)计算奖励分数,通过UCT算法平衡利用与探索,避免搜索过早收敛。

日频价量因子的迭代挖掘效果

在日频Seed定向改造实验中,以29个低频价量原始因子为起点进行迭代。结果显示,候选池层面25/29个Seed至少搜索到过样本外优于原始Seed的候选。这表明LLM-MCTS并非仅在原因子附近做机械组合,而是能围绕波动、反转、成交确认等逻辑提出增量结构。在正式选择口径下,29个最终入选因子在样本内全部优于原始Seed,其中19个在样本外仍优于原始Seed,验证了框架在保留原始金融逻辑基础上的改进能力。

批量低频因子挖掘与高频应用

在低频Seed池批量挖掘中,以12个根节点机制为起点进行批量搜索。样本内生成的173个因子优于对应原始Seed,其中143个同时实现样本内和样本外优于原始Seed,占比82.7%。双优候选去重后包含123个公式,且这些候选之间全局绝对相关性整体偏低,说明搜索结果未坍缩为少数同质信号。此外,该框架亦适用于高频分钟因子挖掘,通过给定原始经验因子作为Seed,利用LLM-MCTS搜索框架可得到更高质量的高频因子,如“高量脉冲次数”因子在样本内外均表现突出,验证了框架从日频公式扩展到分钟级交易行为机制的有效性。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至