基本面选股因子评价指标、挖掘流程与指标讲解

基本面选股因子评价指标、挖掘流程与指标讲解

最佳答案 匿名用户编辑于2025/09/15 16:36

常见的价值因子如 B/P、E/P、S/P 等,通常以净资产、净利润、营业收入等作为分子,以 总市值或者流通市值作为分母。

1.因子评价指标

前期报告《双目标遗传规划应用于行业轮动》(2024-05-20)的亮点是将遗传规划从传统的 单目标体系升级为双目标体系。双目标的第一维度是|IC|,用来评价因子的分组单调性;双 目标的第二维度是 NDCG@k,用来评价因子多头组表现。这样做使得一部分因子追求分组 单调性,一部分因子追求多头组表现,也有一部分因子追求两者平衡,大幅提升了因子种 群多样性,进而提升了因子种群对抗过拟合的性能。关于 NDCG@k 的计算方法,在前期 报告《行业景气投资的顶层设计和落地方案》(2024-09-14)的 P18 和前期报告《双目标遗 传规划应用于行业轮动》(2024-05-20)的 P12 均有详细介绍,本文不再赘述。本文研究对 象是中证 1800 成分股,后文将分十组测试因子有效性,所以 k 取 180。

除了|IC|和 NDCG@k 之外,本文进一步引入第三维度目标——|IC|胜率,即时序上|IC|为正 的比例,用来评价因子的时序稳定性。这是考虑到一种小概率情景——个别截面上因子预 测准确率异常高,导致|IC|和 NDCG@k 数值都不低,但大多数截面上,该因子几乎不具备 预测能力。于是,双目标因子挖掘体系就变成了三目标因子挖掘体系,因子种群多样性或 将得到进一步提升。

2.因子挖掘流程

在本研究中,满足规定格式的因子将在千万量级,在个人电脑上定期遍历计算和评价是不 现实的,对此我们用遗传算法来优化因子。多目标遗传算法流程与传统的遗传规划基本一 致,主要差异在于因子评估环节采用多目标评价体系,进而影响子代选择方法。针对多个 评价维度,读者容易想到的方式是加权,即 λ1y1+λ2y2+λ3y3,但 λ1y1+λ2y2+λ3y3 的本质与单 目标无异,仍可能引起因子同质化。对此,我们需要借助前期报告《双目标遗传规划应用 于行业轮动》提及过的 NSGA-II 算法。该算法能在不对 y1、y2、y3 加权的条件下,评价因 子优劣。在该算法助力之下,一轮多目标因子挖掘的效果,相当于执行了若干轮不同(λ1, λ2, λ3)组合、以 λ1y1+λ2y2+λ3y3 为评价指标的单目标因子挖掘的效果,而且时间复杂度相较一 轮单目标因子挖掘并没有增加。

3.个别指标重点讲解

企业价值

常见的价值因子如 B/P、E/P、S/P 等,通常以净资产、净利润、营业收入等作为分子,以 总市值或者流通市值作为分母。由于分子同时影响企业股东和债权人的利益,而分母仅代 表企业的权益价值,分子分母存在错配问题。对此,前期报告《如何使价值因子更具“价 值”?》(2025-01-07)引入了企业价值作为分母。企业价值等于在总市值的基础上,加上 总负债、少数股东权益、优先股之和,再减去现金及现金等价物。由于总市值是日频,额 外加减的部分是季频,两部分叠加时需要将季频的部分通过前向填充(ffill)升至日频。

融合快报或者预告的财务指标

对于业绩快报、业绩预告的披露,我国证券法、上交所、深交所对不同的 A 股上市企业进 行分类管理。虽然并非所有的 A 股企业强制披露业绩快报、业绩预告,但一旦披露,就意 味着市场可以获得早于正式财报的有关该公司的基本面信息。其中,业绩快报可能包含营 业收入、营业利润、利润总额、归母净利润、不含少数股东权益等科目,业绩预告一般披 露净利润和扣非净利润的预测区间。对于上述提及的指标,可以构建融合快报或者预告的 财务指标。具体来说,若公司披露了业绩快报或者业绩预告,则披露当日用快报或预告中 的数值作为指标的最新值,等到正式财报公布日,再用正式财报中的数值替代快报或预告 中的数值;若公司未披露业绩快报和业绩预告,则仍然使用正式财报中的数值。需要注意 的是,在计算指标的差分、百分比变化、标准化变化等时序变换时,指标的滞后项必须使 用前期正式财报中的数值。

研发前财务指标

企业持续进行研发投入,致力于技术创新和产品升级,是企业提升竞争力、寻求长期发展 的关键途径。对于研发支出,会计处理上有费用化和资本化两种方式。根据会计准则的要 求,费用化一般适用于研究阶段,资本化一般适用于开发阶段。但在实务中,因为研究阶 段和开发阶段的区分通常是定性的、模糊的,且费用化能充当税盾,加上会计准则也有“无 法区分研究阶段和开发阶段的支出,应当将其所发生的研发支出在发生时全部费用化”的 谨慎性规定,所以企业倾向于将可能已经满足资本化条件的研发支出费用化,即使研发活 动在未来大概率能够给企业带来丰厚的回报。这就会导致披露的利润类科目无法公允反映 企业的成长性。对此,我们将研发费用加回利润总额类科目,构建研发前财务指标。需要 注意的是,由于净利润类科目是税后的,而研发费用是税前的,两者无法相加。

一致预期指标重构

Wind 根据滚动 180 个自然日各家预测机构给出的个股财务指标预测值,提供了一致预期指 标,包括 FY1、FY2、FY3 等多种预处理后的版本。FY 的含义为未公布年报预期。 假设最近一期已公布年报对应年份 T,则 FY1、FY2、FY3 预测的对象分别是 T+1 年、T+2 年、T+3 年的年报。在同一个自然年内 T 的指向跟上一个自然年的年报是否发布有关,举 个例子:设 S 股票 2024 年年报的公布日期为 2025-04-10,那么在 2025-04-10(不含)之 前,T 指向 2023 年,FY1、FY2、FY3 预测的对象分别是 2024 年、2025 年、2026 年的 年报;而在 2025-04-10 及之后,T 指向 2024 年,FY1、FY2、FY3 预测的对象分别是 2025 年、2026 年、2027 年的年报。这就导致了 Wind 一致预期指标的不合理之处: 1) Wind 一致预期指标在年报公布日会产生数值跳变、含义突变; 2) 接近年报发布日,虽然去年年报还未公布,但因为去年一季报至三季报已公布、去年四 季度的经营状况通过公开数据或者调研基本已被市场掌握、业绩预告或业绩快报可能已 披露,导致去年年报中未记入股价中的信息较为有限,而 FY1 预测的对象仍然是去年 年报,所以相应地,FY1 对预测股价未来表现的价值也有限。 对此,我们提出了如下改进方案: 1) 首先,以去年年报公布日期为分界点,将 FY1、FY2、FY3 都划分为两段;前半段分别 记作 FY1_a、FY2_a、FY3_a,后半段分别记作 FY1_b、FY2_b、FY3_b; 2) 在上文的例子中,FY2_a 和 FY1_b 预测的对象都是 2025 年,即当前自然年;FY3_a 和 FY2_b 预测的对象都是 2026 年,即下一个自然年。于是,我们将 FY2_a 和 FY1_b 拼接,将 FY3_a 和 FY2_b 拼接,分别记作 NY1 和 NY2,其含义为自然年预期。

参考报告REPORT

金融工程深度研究:以空间换时间,多目标基本面选股因子挖掘框架.pdf

金融工程深度研究:以空间换时间,多目标基本面选股因子挖掘框架。人工智能95:构建多目标遗传算法,挖掘基本面选股因子经过前期报告对因子计算和评价过程的GPU加速、对因子评价维度的扩充和对种群多样性的提升后,我们团队的因子挖掘框架相较传统的单目标遗传规划已经“脱胎换骨”。本文将其应用于基本面选股因子挖掘,获得了分组单调性较好、|IC|胜率较高、多头组表现亮眼的因子。尤其是在全成分内中证1000指增上,基本面合成因子的扣费后年化超额收益高达32.5%。其令人惊喜的表现说明中证1000成分股的基本面信息依然具有丰富的α。基本面合成因子和“舆情分诊台&rd...

我来回答
分享至