基于GFlowNet与AlphaEval的分钟频因子挖掘框架解析

  • 来源:国金证券
  • 发布时间:2026/07/10
  • 浏览次数:34
  • 举报
相关深度报告REPORTS

Alpha掘金系列之二十四:基于GFlowNet和AlphaEval的分钟频因子挖掘筛选框架.pdf

本文提出了一种基于GFlowNet和AlphaEval的分钟频因子挖掘筛选框架。首先回顾了GFlowNet原理,指出其通过建模图网络中的“水流”过程,旨在挖掘多元化、低相关性的Alpha因子池,克服了强化学习的模式崩溃和遗传规划的搜索效率低下问题。在日频数据挖掘中,基于原始K线、衍生特征及分钟聚合特征挖掘出大量因子,IC均值中位数较高,且因子相关性低、复杂度可控。针对分钟频数据内存瓶颈,引入MemMap机制和分块并行计算框架,实现了高效计算,并验证了分钟频信号对日频信号的增量价值。在因子筛选阶段,采用AlphaEval框架从多样性、预测能力、秩稳定性等维度进行筛选,通过DPP方法筛选出低冗余因...

GFlowNet在因子挖掘中的核心优势与原理

生成流网络(GFlowNet)作为一种新型生成模型,其核心思想是将对象的生成过程建模为图网络中的“水流”过程。与强化学习不同,GFlowNet并非致力于寻找单一的“最优公式”,而是旨在挖掘“一群优秀的多元化公式”。这一特性高度契合多因子选股模型对低相关性、高多样性Alpha池子的根本诉求。在探索机制上,GFlowNet天生具备极强的多样性保证,能够广泛探索整个公式空间,发现不同流派的高收益因子,从而避免强化学习中常见的模式崩溃问题。相比之下,遗传规划缺乏对整个公式空间规律的理解,往往陷入局部最优,而GFlowNet利用深度学习模型的泛化能力,能够“有脑子地学”,大大提升了在大空间搜索规律的效率。

在数学原理层面,GFlowNet的训练目标是让网络中的流量分布满足守恒定律。具体而言,对于任意中间状态,流入的总流量必须等于流出的总流量;对于终止状态,流入的总流量等于环境赋予的奖励。实际训练中采用更稳定的Trajectory Balance目标。状态表示方面,动作历史序列通过Transformer编码,辅以当前深度、已用算子比例等手工特征。奖励函数综合了IC、多头IR和Barra时序相关性惩罚项,以确保挖掘出的因子不仅预测能力强,且具备低相关性。

日频数据挖掘的多层次特征构建

在日频数据挖掘中,研究基于三组基础特征分别进行挖掘:原始日频K线、日频K线衍生特征以及分钟聚合日频特征。原始日频K线直接基于OHLCV/VWAP组合,挖掘出的因子IC均值中位数较高,且因子长度和复杂度控制在较小水平,具有一定的可解释意义。日频K线衍生特征则是人工结构化后的相对量价特征,虽然IC均值中位数略低,但最大值表现突出。分钟聚合日频特征虽来源于分钟数据,但已预计算成日频特征,其挖掘出的因子在多头年化超额表现上较为稳健。

各因子集的相关性中位数均在15%以下,截面和时序相关性较低,这意味着后续进行因子合成时增益会比较明显。因子复杂度方面,平均表达式长度较短,较长的因子占比不高,表明挖掘出的因子结构简洁,避免了过度拟合的风险。通过引入多头超额奖励与Barra相关性惩罚,有效解决了单纯以因子IC作为挖掘目标时可能出现的多头超额较差及风险因子暴露较高的问题。

分钟频数据快速计算框架与增量价值

分钟频数据的计算面临巨大的内存瓶颈,无法将所有分钟特征全部读入内存。为此,研究引入了MemMap机制,通过操作系统的虚拟内存按需访问数据。普通读取流程涉及磁盘到用户态内存的反序列化,而MemMap机制将数据映射到进程虚拟内存,像numpy数组一样按需访问,实现了少反序列化、按需加载、共享page cache以及适合并行切片等优势。

在计算框架上,一个完整公式被拆分为日内block和日频tree两段。日内block包含分钟算子、mask算子和聚合算子,计算后进入LRU持久化block cache。随着训练后期重复结构增多,计算速度显著提升。并行方式按年份和股票切片进行多进程计算,numba kernel负责单线程计算,loky负责多进程并行。基于分钟频特征挖掘出的因子,虽然平均长度相对较长,可解释性稍弱,但其IC均值中位数和多头年化超额表现良好。

将分钟频因子与日频因子利用LGBM模型进行合成,结果显示分钟信号的引入在一定程度上提高了多空收益的表现。尽管当前分钟频有效因子挖掘数量相对较少,导致RankIC和多头超额提升幅度有限,但分钟数据提供的日内路径信息确实为日频信号带来了增量价值。

AlphaEval多维度因子筛选与策略融合

AlphaEval框架从预测能力、时序稳定性、扰动鲁棒性、金融逻辑性、多样性五个角度对因子进行筛选。在多样性筛选中,利用DPP(行列式点过程)方式最大化所选子集相关矩阵的log-determinant,从而筛选出低冗余、信息空间大的因子集。实验表明,通过DPP筛选出的因子集,利用LGBM模型合成后,多头超额和多空表现最佳。

在其他角度筛选中,PPS预测能力筛选和金融逻辑性筛选在收益端没有带来明显提升,但RRE秩稳定性筛选可有效降低因子换手率,提升策略的稳定性。将筛选后的因子与现有AI模型融合后,在沪深300、中证500和中证1000三个宽基指数上均实现了稳定的正超额收益。其中,沪深300指数增强表现较为亮眼,中证1000指数增强表现尚可,中证500指数增强历史超额收益显著。这一结果表明,结合GFlowNet的多样化挖掘能力与AlphaEval的多维度筛选机制,能够有效构建稳健的多因子选股模型。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至