2025年量化因子掘金系列专题报告:OpenFE驱动下的多因子融合实战

  • 来源:江海证券
  • 发布时间:2025/05/21
  • 浏览次数:1027
  • 举报
相关深度报告REPORTS

量化因子掘金系列专题报告:OpenFE驱动下的多因子融合实战.pdf

量化因子掘金系列专题报告:OpenFE驱动下的多因子融合实战。研究要旨:本研究运用OpenFE自动特征生成算法,搭建因子挖掘工作流。通过最大化夏普合成,获得最终的选股因子,并根据因子值分组构建组合。该框架融合了基本面、量价和191Alphas等三个不同域的特征,经过该框架生成增强型因子、含交互项的因子和最终的合成因子。本文对这些因子进行了回测,分析和应用,并对比分析不同的因子合成方法在此场景下的效果差异。组合效果:在A股选股场景中,OpenFE生成的合成因子组合年化收益率24.8%,年化超额24.5%,夏普1.66,胜率58.6%,周胜率60.8%,盈亏比1.34。且回撤控制优异,最大回撤36...

1 研究概要

1.1 研究背景

传统量化研究依赖人工经验构建因子,流程繁琐且效率低下。尤其在面对高频数据(如 Level2)或复杂财务报表时,人工遍历所有可能的特征组合不可行。因此,我们希望在《江海潮涌,星辰引航:量化因子掘金系列》中提出一些实用性强的因子构建方法。 OpenFE 是一种自动特征生成算法,旨在通过特征增强和两阶段评估框架,高效准确地识别数据中的有用特征。实验表明 OpenFE 在多个基准数据集和 Kaggle 竞赛中优于现有方法,甚至能与人类专家生成的特征相竞争。并且其使用简便,与因子挖掘框架结合度大。因此,我们尝试使用 OpenFE 生成因子,评价其效果。 OpenFE 的价值在于其“Expand-and-Reduce”的框架。在 Expand 阶段,通过枚举法生成海量候选因子,覆盖传统方法难以触及的组合形式。而在Reduce 阶段,采用两阶段筛选(连续二分法+多因子检验),快速剔除冗余特征,保留信息增益显著的因子。此框架将人工经验转化为系统化流程,解决了“特征空间爆炸”与“计算效率低下”的双重难题。

OpenFE 的核心技术创新在于其独特的评估与加速方法。Feature Boosting通过梯度提升思想快速评估特征增量贡献,避免重新训练模型的耗时操作。而 GPU 加速与内存优化,显著提升运算速度。本研究的模型训练是在云计算中实现的。 OpenFE 的引入本质上是数据驱动与算法驱动的结合。在数据维度爆炸、策略同质化加剧的背景下,其通过自动化特征工程打破人工经验上限,同时兼顾可解释性与计算效率。这一技术路径不仅适应当前高频、多源数据的研究需求,也为因子挖掘提供了可复用的方法论框架,成为量化研究从“人工密集型”向“算法密集型”转型的实用工具。

1.2 研究概要

本文应用 OpenFE 框架,结合基本面、量价和 191 Alphas 等三个不同域的因子,经过回测、筛选和因子处理后,作为 OpenFE 输入,生成增强型的因子。然后,通过进一步回测筛选和因子处理,再次输入 OpenFE,生成包含不同域之间交互项的因子。再对这些因子进行回测、筛选、共线性去除和组合测试。最后通过最大化夏普合成,获得最终的选股因子,并根据因子值分组构建组合。

另外,本文对 191 Alphas 因子进行了单因子回测,分析和应用,对基本面因子和量价因子也做了相应的工作,并对比分析了不同的因子合成方法在此场景下的效果差异、不同因子组合的效果。

在 A 股选股场景中,OpenFE 生成的组合年化收益率为 24.8%,年化超额 24.5%,夏普 1.66,胜率 58.6%,周胜率 60.8%,盈亏比 1.34。且回撤控制优异,最大回撤 36.4%小于基准,最大回撤持续约 1 个自然月,验证了其收益与风控的平衡。

这种组合的优势是,过拟合程度低,通过严格筛选和合成因子控制,降低数据中的噪声干扰,鲁棒性好。模块应用更便捷,运行过程更高效。调仓频率为周度,一定程度减少了交易损耗。回撤控制优异,回撤修复较快。

2 因子介绍

2.1 191 Alphas

191 Alphas 是一类量价因子,包含 191 个基于个股日频价量数据的短周期交易型阿尔法因子。这些因子以捕捉市场微观交易特征为核心,通过统计方法挖掘价格与成交量之间的动态关系,为量化策略提供选股依据和超额收益来源。所有因子均基于日频价格与成交量数据构建,适合捕捉市场短期波动规律。 通过交易型阿尔法策略的研究,发现交易型阿尔法收益的空间更大、收益稳定性更强。本研究使用聚宽平台提供的因子数据,这些因子均来自于个股日频率的价格与成交量数据,并且在编写短周期交易型因子时,对缺失部分和不合理部分的因子公式进行了调整。 这些因子并非都适用于 A 股市场,因此分别对每个因子进行单因子回测,并进行初步筛选。其中因子值越大,组别号越大。由于部分 191 Alphas 因子尚未实现,故空缺。

可见部分因子表现较优秀,可进一步应用。注意到部分因子的方向不同,在使用时最好进行调整。除了根据分组回测的净值表现外,还需考虑曲线形态,综合考虑因子的回撤情况、波动性和进攻防守能力。

2.2 典型 Alpha 因子

2.2.1 Alpha 100

Alpha100 因子的核心是计算过去 20 日成交量(VOLUME)的标准差。成交量标准差高时,可能伴随价格波动加剧,反映市场情绪剧烈变化(如利空/利好信息释放、主力资金异动)。低标准差则可能预示市场处于观望期,价格趋势未明(如横盘整理阶段)。 高成交量波动可能暗示流动性枯竭或资金分歧,需警惕价格反转(如高位放量滞涨)。成交量突然放大(标准差骤升)可能捕捉事件冲击(如业绩公告、政策变动)后的短期交易机会。

2.2.2 Alpha 120

分子部分通过 VWAP - CLOSE 反映当日成交均价与收盘价的偏离程度。若 VWAP > CLOSE,表明盘中成交均价高于收盘价,可能隐含盘中买方力量较强但尾盘抛压导致价格回落,形成短期反转信号。若VWAP < CLOSE,则可能暗示尾盘资金流入推动价格上涨,形成动量信号。分母作为标准化参考,消除价格绝对水平的影响,便于将因子值转化为相对比率,增强跨股票可比性。对分子和分母分别进行全市场截面排名,进一步消除市场整体波动的影响,突出个股的相对强弱特征。 最终,筛选出 VWAP 与收盘价偏离程度显著且相对稳定的股票,用于捕捉短期价格修正或量价背离信号。分子较大,可能反映尾盘抛售压力,次日存在价格反弹可能性。此时因子值较大,可能触发买入信号;分子较小,可能暗示尾盘资金抢筹,次日延续上涨趋势,形成动量效应。因此本因子进一步通过 OpenFE 与 alpha042 进行复合。

2.2.3 Alpha 042

该因子同样由两部分组成,通过波动性排序反转与价量相关性的乘积构建复合信号。第一部分,-1 * RANK(STD(HIGH,10))。首先计算过去10日最高价(HIGH)的标准差,衡量价格波动性。波动性越高,表明价格短期波动剧烈。然后,对全市场股票的价格波动性进行截面排序,波动性越大,排名越靠前。最后,对排序结果取反,使得波动性越小的股票排名越靠前。这部分反映对低波动性股票的偏好,用于捕捉稳定型或反转机会。第二部分,CORR(HIGH, VOLUME,10)。计算过去10日最高价(HIGH)与成交量(VOLUME)的时序相关系数,范围[-1,1]。正相关提示价量齐升/齐跌,反映趋势延续(即动量效应)的可能;负相关提示价量背离,提示反转风险。 将波动性排序反转(偏好低波动)与价量相关性结合,综合筛选低波动且价量协同性强的股票,或高波动但价量背离的股票。Alpha 042通过波动性排序与价量相关性的交互作用生成信号。其核心优势在于风险与收益的平衡设计,适合作为多因子模型中的辅助指标。

2.3 基本面及量价因子

基础因子可以和经过 OpenFE 生成的因子进行合成,进一步增强组合表现。但要注意去除共线性,及进行因子组合测试,观察其复合效果。

2.4 因子对比

选择样本内回测净值超过 1.10 的因子入池。其中,alpha191 共有 49 个因子符合标准,量价及基本面因子有 22个因子符合标准。从统计结果上看,alpha 191 因子的净值均值、中位数、标准差都小于量价及基本面因子。但进一步通过统计检验,并不能说明这些因子具有明显的均值、中位值和方差的差异。 其中 Shapiro-Wilk 检验验证两个数据是否来源于正态分布,其0为数据集来自于正态分布。t 检验检测两组数据的均值。严格意义上,t 检验基于数据是正态分布的假设,且两组数据方差相等,其0为两组数据均值相等。

Welch t 检验适用于两组数据方差不等或样本量差异较大的情形,其0与 t 检验一致。Levene 检验是一种方差检验方法,更稳健且不依赖正态性,其0 为两组数据方差相等。Mann-Whitney U 检验适用于数据分布非正态,其0为两组数据中位数相等。 除 S-W 检验的 p 值较小可以拒绝原假设之外,其余检验的 p 值均较大,不能拒绝原假设。即,两类因子的净值分布均为非正态,从统计上看均有右偏倾向,个别因子表现可以非常好。在不依赖正态性的检验中,两类因子的方差和中位数并无显著差异,在较宽泛条件的 t 检验中,两类因子的均值也无显著差异。从总体上,不能说 alpha 191 因子就显著更强。但在不同时域和选股域上可能会存在个体差异。这些因子都有不同的适用场景和频率。

3 OpenFE

OpenFE 是一种自动特征生成算法,旨在通过特征增强和两阶段评估框架,高效准确地识别数据中的有用特征。实验表明 OpenFE在多个基准数据集和 Kaggle 竞赛中优于现有方法,甚至能与人类专家生成的特征相竞争。此外,OpenFE 证明了特征生成在深度学习模型中的价值,能够进一步提升模型性能1 。 OpenFE 采用“扩展-缩减”(Expand-and-Reduce)框架。Expand-and-reduce是自动特征生成领域中流行使用的框架,其基本思想是先通过原始特征创建一个候选特征池,然后消除无效的候选特征。在扩展阶段,通过数学运算符(如加减乘除、log、平方等)和组合规则(如 GroupBy、聚合统计)对原始特征进行一阶或多阶变换,生成大量候选特征。 缩减阶段,通过两阶段筛选(连续二分法 +特征重要性归因)高效剔除冗余特征,保留对模型预测能力提升显著的特征。 特征评估技术采用 Feature Boosting 和两阶段筛选。Feature Boosting是一种有效的评价新特征总量性能的算法,类似梯度提升的思想,通过残差学习快速评估新特征的增量性能。不用像传统方法一样重新训练模型。FeatureBoosting 在基础特征集合的预测结果之上进行增量训练(incremental training)。比如,用已有特征训练初始模型后,仅用新特征拟合残差,避免全量模型重训练,显著节省计算资源。两阶段筛选包括粗筛和精筛,鉴于有效特征一般都是比较稀疏的,采用从粗筛到精筛的剪枝算法。粗筛使用连续二分法(Successive Halving)动态分配计算资源,快速淘汰无效特征,精筛结合特征重要性归因(如 SHAP 值),考虑特征间的交互影响,保留高贡献特征。Tianping Zhang 等人的实证研究表明:在 Kaggle 的2019年IEEE-CIS欺诈侦测和 2016 年法国巴黎银行的索赔管理竞赛中,有数千支数据科学团队参赛。基于 OpenFE 的一个简单基准模型,可以分别打败 99.3%和99.6%的数据科学团队。OpenFE 在 10 个基准数据集上达到了 SOTA,并证明OpenFE在特征生成方面与人类专家能力相当。 OpenFE 提供简洁 API,通过 Python 库可以快速方便地使用。本文的训练过程是在云计算中实现的。

4 回测环境和因子处理

4.1 回测环境设定

本文回测环境设定如下:样本内:2018 年 1 月 1 日至 2021 年 12 月 31 日;样本外:2022 年 1 月 1 日至 2025 年 4 月 28 日。起始金额:1 亿元,买入和卖出佣金比例:0.03%,交易印花税(卖出时征收):0.1%,最低交易佣金:5 元,滑点设置:0.2%,每周一按照开盘价调仓。进行单因子回测时,考虑费率但不考虑滑点,进行多因子及组合回测时,均考虑费率及滑点。

4.2 因子处理

去极值:为减少异常值对模型的干扰,采用标准差法,将 2.5 倍标准差之外的值调整为 2.5 倍标准差的边界值。极端值会显著扭曲均值、方差等统计量,导致统计失真,误判规律,影响合成效果。

5 因子分析

5.1 合成方法

获得包含不同域的多个交互项的因子后,在样本内对比不同合成方法的效果。合成前,因子需要去极值化、标准化和归一化。其中,线性合成指把各因子值简单加总。Max_ICIR 以历史一段时间的因子平均 IC值作为对下一期 IC 值的期望;以历史 IC 值的协方差矩阵对总体进行估计,作为因子下一期的期望波动率,以最大化合成因子的 ICIR 值2。Rolling IC 指滚动计算因子过去 20 天的 Rank IC 值,作为下一期 IC 的期望,根据此值计算因子加权比例。线性斜率合成,指根据因子的净值曲线,进行线性拟合,以回归系数乘以 R-square 为斜率,斜率越大的曲线权重越高,这样同时考虑了动量与稳定性。Xgboost 指使用 xgboost 模型,以隔日收益率为预测目标进行滚动训练,根据当期因子值进行预测。GRU 指使用 GRU 模型,引入 Attention机制,全连接层中以线性函数为合成方式,Tanh 为激活函数,并以排名损失(Rank Loss)为损失测度,进行训练和合成。线性回归,指使用线性模型,以因子值为独立变量,隔日收益率为依赖变量,滚动 30 天进行回归训练,根据当期因子值与回归系数相乘加总合成。

最大化夏普,指根据各因子的回测净值曲线,滚动计算夏普值,根据夏普值的大小作为权重合成。在《量化投资组合管理研究系列之(五)宽基指数的多因子择时模型》中,我们同样发现最大化夏普合成的效果更好。首先,关于 GRU 模型。我们对 GRU 模型进行过多次的调整和优化,但结果依然不佳。在此情景中并不适合使用,其更适用于更直接的描述变量,比如开盘价、收盘价、交易额、大单流入等变量。其次,线性回归模型围绕均值震荡,反映出这些因子的非线性关系,线性模型不能很好描述这些因子的非线性关系。对比 xgboost,采用梯度提升树模型,合成净值表现提升,部分非线性关系得以捕捉。再者,根据 IC 方法合成的净值曲线,波动率比较小,但合成效果逊色于 xgboost,是因为下一期的 IC 期望与历史 IC 值之间的差异变化,导致估计失真;最后,最大化夏普综合考虑了因子的风险调整后收益,如果因子表现较稳健,那么历史夏普的参考意义较大,因此合成效果较好。实际上,如果因子足够纯粹,线性相关性较低,那么简单的线性合成(非线性回归,即简单加总)表现就已经很好。

关于最大化夏普合成中,滚动计算的窗口大小问题。在样本内,测试不同窗口的回测净值大小。其曲线出现先增大后减小的震荡变化趋势。为避免数据挖掘,结合经验判断及回测结果,我们选定窗口大小为 30。

5.2 因子分组回测统计

统计各组表现。其中第一组年化收益率为 20.5%,年化超额为 20.2%,夏普为 1.39,胜率 57.1%,周胜率 58.6%,盈亏比 1.29,超额收益明显,胜率较高。最大回撤为 36.3%低于基准,最大回撤起止约为 1 个自然月。IC 为 0.025,IR 为 0.342,Rank IR 为 0.188。其余各组依次衰减。

6 组合表现

因子合成后,根据因子值进行选股,取其中第一组。其中每组大约有300-400 支个股。其中 2022 年 1 月 1 日至 2025 年4 月 28 日为样本外回测。可见,曲线在样本外的表现优秀,性能延续,最大回撤能快速修复,超额稳定性和持续性较好。

其中加权组合年化收益率为 24.8%,年化超额 24.5%,夏普 1.66,胜率 58.6%,周胜率 60.8%,盈亏比 1.34,最大回撤 36.4%小于基准,最大回撤持续约 1 个自然月,超额最大回撤为 26.4%,超额最大回撤持续约 5 个自然月。加权组合几乎各项均优于等权组合,再次展现因子的有效性。两种组合的最大回撤和超额的最大回撤起止一致,显示系统性风险下的一致修复能力。

7 总结

本研究通过 OpenFE 框架实现了量化因子挖掘的范式重构,构建了融合多维数据源的动态选股体系。实证结果表明:基于三域特征交互生成的复合因子在 A 股市场展现出显著的 alpha 捕捉能力,验证了非线性特征合成在复杂市场环境中的独特优势。 技术层面,研究突破传统人工因子构建过程中的三大局限:一是实现从线性组合到交互式特征生成的跃迁,挖掘出多个具有显著意义的非线性关系;二是建立动态因子筛选机制,特征维度压缩效率较传统方法提升;三是使用GPU 加速计算模块,使大规模特征迭代周期大大压缩。这些创新使策略在保持低过拟合风险的同时,实现对市场变化的精准刻画。市场应用端,该体系展现出三大核心价值:收益维度上,通过波动率协同因子等新型信号源,突破传统量价因子的限制;风控维度上,创新应用移动窗口夏普优化,使策略在诸如 2024 年初等极端行情中仍能获取稳健超额;扩展维度上,模块化架构支持快速移植至可转债、股指期货等多资产领域。后续将验证在不同的选股域上的效果并据此构建指增组合。本研究为量化投资提供了实用的可复用的技术框架及工作流,是特征工程从人工经验驱动向算法进化的重要实践。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至