2025年金融工程深度研究:以空间换时间,多目标基本面选股因子挖掘框架

  • 来源:华泰证券
  • 发布时间:2025/08/13
  • 浏览次数:463
  • 举报
相关深度报告REPORTS

金融工程深度研究:以空间换时间,多目标基本面选股因子挖掘框架.pdf

金融工程深度研究:以空间换时间,多目标基本面选股因子挖掘框架。人工智能95:构建多目标遗传算法,挖掘基本面选股因子经过前期报告对因子计算和评价过程的GPU加速、对因子评价维度的扩充和对种群多样性的提升后,我们团队的因子挖掘框架相较传统的单目标遗传规划已经“脱胎换骨”。本文将其应用于基本面选股因子挖掘,获得了分组单调性较好、|IC|胜率较高、多头组表现亮眼的因子。尤其是在全成分内中证1000指增上,基本面合成因子的扣费后年化超额收益高达32.5%。其令人惊喜的表现说明中证1000成分股的基本面信息依然具有丰富的α。基本面合成因子和“舆情分诊台&rd...

基本面选股因子挖掘框架

前期报告《双目标遗传规划应用于行业轮动》(2024-05-20)中,我们已经使用双目标遗传 规划框架挖掘出一批主要基于量价数据计算的行业轮动因子,并在样本外一年多时间的跟 踪中取得了良好的业绩。在量价因子的挖掘中,我们使用了数十个运算算子,得到了较为 复杂的因子表达式,虽取得了不错的业绩,但也削弱了因子的可解释性。这对于量价因子 来说或许可以接受,但对于基本面因子,可解释性可能是投资者更关注的问题。对此,本 研究放弃了遗传规划中的算子,用参数化的因子表达式取而代之,使得每一个基本面因子 都有明确的经济学含义。另外,由于不再存在树结构的因子表达式,因子挖掘框架从遗传 规划退变为通用的遗传算法,可以不再依赖 gplearn、deap 等包执行。

因子评价指标

前期报告《双目标遗传规划应用于行业轮动》(2024-05-20)的亮点是将遗传规划从传统的 单目标体系升级为双目标体系。双目标的第一维度是|IC|,用来评价因子的分组单调性;双 目标的第二维度是 NDCG@k,用来评价因子多头组表现。这样做使得一部分因子追求分组 单调性,一部分因子追求多头组表现,也有一部分因子追求两者平衡,大幅提升了因子种 群多样性,进而提升了因子种群对抗过拟合的性能。关于 NDCG@k 的计算方法,在前期 报告《行业景气投资的顶层设计和落地方案》(2024-09-14)的 P18 和前期报告《双目标遗 传规划应用于行业轮动》(2024-05-20)的 P12 均有详细介绍,本文不再赘述。本文研究对 象是中证 1800 成分股,后文将分十组测试因子有效性,所以 k 取 180。

除了|IC|和 NDCG@k 之外,本文进一步引入第三维度目标——|IC|胜率,即时序上|IC|为正 的比例,用来评价因子的时序稳定性。这是考虑到一种小概率情景——个别截面上因子预 测准确率异常高,导致|IC|和 NDCG@k 数值都不低,但大多数截面上,该因子几乎不具备 预测能力。于是,双目标因子挖掘体系就变成了三目标因子挖掘体系,因子种群多样性或 将得到进一步提升。

因子挖掘流程

在本研究中,满足规定格式的因子将在千万量级,在个人电脑上定期遍历计算和评价是不 现实的,对此我们用遗传算法来优化因子。多目标遗传算法流程与传统的遗传规划基本一 致,主要差异在于因子评估环节采用多目标评价体系,进而影响子代选择方法。针对多个 评价维度,读者容易想到的方式是加权,即 λ1y1+λ2y2+λ3y3,但 λ1y1+λ2y2+λ3y3 的本质与单 目标无异,仍可能引起因子同质化。对此,我们需要借助前期报告《双目标遗传规划应用 于行业轮动》提及过的 NSGA-II 算法。该算法能在不对 y1、y2、y3 加权的条件下,评价因 子优劣。在该算法助力之下,一轮多目标因子挖掘的效果,相当于执行了若干轮不同(λ1, λ2, λ3)组合、以 λ1y1+λ2y2+λ3y3 为评价指标的单目标因子挖掘的效果,而且时间复杂度相较一 轮单目标因子挖掘并没有增加。

内存、显存管理与因子挖掘速度

前期报告《遗传规划因子挖掘的 GPU 加速》(2024-02-19)通过将因子计算和评价过程放 在 CUDA 上进行,使得因子挖掘速度成倍提升。为了进一步提升因子挖掘速度,我们提前 将指标及其对数形式的滞后项和标准差计算好,单独划一块内存存放。这样在计算 y 和 x 最终形式的时候,我们可以直接基于指标或者其对数形式的当期值、滞后项或者标准差计 算,而不必再重复进行取对数、滞后、计算标准差等操作。例如在计算指标百分比变化的 时候,只需要从内存中加载其当期值和滞后项,额外再做一次取绝对值和一次除法,起到 了“以空间换时间”的作用,使得基本面选股因子挖掘进一步得到加速。 但基本面因子挖掘所需的基础指标数量比量价因子挖掘所需的基础指标数量已经高出一个 数量级,再考虑到单个指标又存在多种变换形式,对于一块常见的 32G 显存以内的 GPU 来说,很难将全体指标的全部变换形式一次性加载完毕。因此,我们只能把全体指标的全 部变换形式暂存于相对“廉价”的内存,再根据因子表达式的参数,将特定指标的特定变 换形式传入相对“昂贵”的显存,因子计算完毕后,再将其传回内存。

数据准备

基本面选股因子挖掘共使用 71 个指标,包括市场表现指标、分析师一致预期指标、三大财 务报表科目。其中,大部分财报指标都有当季值(MRQ)和滚动四个季度之和(TTM)两种呈现 方式。因为 y 是决定因子含义的输入指标,加上本研究的目的是为了得到基本面因子,所 以市场表现指标不能作为 y。此外,考虑到数学和经济学含义,部分指标被禁止以某些形式 呈现。例如,收盘价本身的数值大小在不同股票之间不可比,因而只能以动量即时序变换 的形式出现,作为 x 的目的是为了从基本面指标中剔除已经被市场反映的部分。再如,财 报指标一年只有 4 个数据点,难以估计标准差。

个别指标重点讲解

企业价值

常见的价值因子如 B/P、E/P、S/P 等,通常以净资产、净利润、营业收入等作为分子,以 总市值或者流通市值作为分母。由于分子同时影响企业股东和债权人的利益,而分母仅代 表企业的权益价值,分子分母存在错配问题。对此,前期报告《如何使价值因子更具“价 值”?》(2025-01-07)引入了企业价值作为分母。企业价值等于在总市值的基础上,加上 总负债、少数股东权益、优先股之和,再减去现金及现金等价物。由于总市值是日频,额 外加减的部分是季频,两部分叠加时需要将季频的部分通过前向填充(ffill)升至日频。

融合快报或者预告的财务指标

对于业绩快报、业绩预告的披露,我国证券法、上交所、深交所对不同的 A 股上市企业进 行分类管理。虽然并非所有的 A 股企业强制披露业绩快报、业绩预告,但一旦披露,就意 味着市场可以获得早于正式财报的有关该公司的基本面信息。其中,业绩快报可能包含营 业收入、营业利润、利润总额、归母净利润、不含少数股东权益等科目,业绩预告一般披 露净利润和扣非净利润的预测区间。对于上述提及的指标,可以构建融合快报或者预告的 财务指标。具体来说,若公司披露了业绩快报或者业绩预告,则披露当日用快报或预告中 的数值作为指标的最新值,等到正式财报公布日,再用正式财报中的数值替代快报或预告 中的数值;若公司未披露业绩快报和业绩预告,则仍然使用正式财报中的数值。需要注意 的是,在计算指标的差分、百分比变化、标准化变化等时序变换时,指标的滞后项必须使 用前期正式财报中的数值。

研发前财务指标

企业持续进行研发投入,致力于技术创新和产品升级,是企业提升竞争力、寻求长期发展 的关键途径。对于研发支出,会计处理上有费用化和资本化两种方式。根据会计准则的要 求,费用化一般适用于研究阶段,资本化一般适用于开发阶段。但在实务中,因为研究阶 段和开发阶段的区分通常是定性的、模糊的,且费用化能充当税盾,加上会计准则也有“无 法区分研究阶段和开发阶段的支出,应当将其所发生的研发支出在发生时全部费用化”的 谨慎性规定,所以企业倾向于将可能已经满足资本化条件的研发支出费用化,即使研发活 动在未来大概率能够给企业带来丰厚的回报。这就会导致披露的利润类科目无法公允反映 企业的成长性。对此,我们将研发费用加回利润总额类科目,构建研发前财务指标。需要 注意的是,由于净利润类科目是税后的,而研发费用是税前的,两者无法相加。

一致预期指标重构

Wind 根据滚动 180 个自然日各家预测机构给出的个股财务指标预测值,提供了一致预期指 标,包括 FY1、FY2、FY3 等多种预处理后的版本。FY 的含义为未公布年报预期。 假设最近一期已公布年报对应年份 T,则 FY1、FY2、FY3 预测的对象分别是 T+1 年、T+2 年、T+3 年的年报。在同一个自然年内 T 的指向跟上一个自然年的年报是否发布有关,举 个例子:设 S 股票 2024 年年报的公布日期为 2025-04-10,那么在 2025-04-10(不含)之 前,T 指向 2023 年,FY1、FY2、FY3 预测的对象分别是 2024 年、2025 年、2026 年的 年报;而在 2025-04-10 及之后,T 指向 2024 年,FY1、FY2、FY3 预测的对象分别是 2025 年、2026 年、2027 年的年报。这就导致了 Wind 一致预期指标的不合理之处: 1) Wind 一致预期指标在年报公布日会产生数值跳变、含义突变; 2) 接近年报发布日,虽然去年年报还未公布,但因为去年一季报至三季报已公布、去年四 季度的经营状况通过公开数据或者调研基本已被市场掌握、业绩预告或业绩快报可能已 披露,导致去年年报中未记入股价中的信息较为有限,而 FY1 预测的对象仍然是去年 年报,所以相应地,FY1 对预测股价未来表现的价值也有限。 对此,我们提出了如下改进方案: 1) 首先,以去年年报公布日期为分界点,将 FY1、FY2、FY3 都划分为两段;前半段分别 记作 FY1_a、FY2_a、FY3_a,后半段分别记作 FY1_b、FY2_b、FY3_b; 2) 在上文的例子中,FY2_a 和 FY1_b 预测的对象都是 2025 年,即当前自然年;FY3_a 和 FY2_b 预测的对象都是 2026 年,即下一个自然年。于是,我们将 FY2_a 和 FY1_b 拼接,将 FY3_a 和 FY2_b 拼接,分别记作 NY1 和 NY2,其含义为自然年预期。

训练与回测

我们将在沪深 300、中证 500、中证 1000(后文简称中证 1800)成分股内执行基本面选股 因子挖掘流程。硬件包括型号为 RTX 5070Ti 显存为 16G 的 GPU、32G 物理内存+32G 虚 拟内存、型号为 i7-14700KF 的 CPU,完成一个日期的训练约需 12 个小时。

中证 1800 成分股内合成因子分层测试

在 NDCG@k 的辅助下,最终合成的因子在保证一定程度分组单调性、较高|IC|胜率的基础 上,多头组表现相较其余九组较为亮眼,脱离了空头 α“陷阱”。

中证 1800 成分股内风险暴露分析

根据 BARRA 风险暴露分析,长期来看,合成因子偏好高盈利(BARRA 风险因子体系中的 高盈利主要是指盈利视角的估值较低)、强反转(主要是指前期涨幅较小)、大市值、低换 手的成分股,比较符合价值投资的理念。

全成分内指数增强测试

为了降低成分外股票风格的影响,指数增强测试采用全成分内模式。回测结果显示,沪深 300 指增、中证 500 指增和中证 1000 指增扣费后年化超额收益分别为 10.1%、13.6%和 32.5%。其中,沪深 300 指增在 2024 年几乎没有超额收益,而中证 500 指增和中证 1000 指增超额收益的延续性较好。

小结

经过前期报告《遗传规划因子挖掘的 GPU 加速》(2024-02-19)对因子计算和评价过程的 GPU 加速、前期报告《双目标遗传规划应用于行业轮动》(2024-05-20)对因子评价维度 的扩充和对种群多样性的提升后,我们团队的因子挖掘框架相较传统的单目标遗传规划在 性能方面取得了较大的进步。 本文将其应用于基本面选股因子挖掘,获得了分组单调性较好、|IC|胜率较高、多头组表现 亮眼的因子。尤其是在中证 1000 指增上,合成因子的表现令人惊喜。对于基本面因子和量 价因子的使用频率,业界的共识是沪深 300 指增上基本面因子的使用频率较高而中证 1000 指增上量价因子的使用频率较高。而本文的研究结果和业界共识有所出入。可能正是因为 中证 1000 指增上基本面因子的使用频率较低,且主动投资者对中证 1000 成分股基本面的 挖掘深度也不如沪深 300 成分股,使得中证 1000 成分股的基本面信息依然具有丰富的 α。 最后,前期报告《LLMRouter-GRU:“舆情分诊台”赋能 AI 量价因子》(2025-07-17)也 得到了一个优秀的量价选股因子。在中证 1800 成分股内,本文的基本面合成因子和“舆情 分诊台”量价因子的长期相关性仅为 0.07,具有进一步合成的潜力。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至