2025年量化研究系列报告:临界相变,探寻传统因子中的非线性基因

  • 来源:华安证券
  • 发布时间:2025/06/16
  • 浏览次数:554
  • 举报
相关深度报告REPORTS

量化研究系列报告:临界相变,探寻传统因子中的非线性基因.pdf

量化研究系列报告:临界相变,探寻传统因子中的非线性基因。非线性效应无处不在在当前A股市场的量化实践中,传统线性模型对因子收益关系的刻画存在局限。市值因子的实证研究率先揭示了这一困境——Barra风险模型发现,线性假设会系统性高估中盘股收益并低估大小盘分化,其通过在CNE5/CNE6模型中构建对数市值立方残差项,分离出中盘股独立风险敞口。这类非线性效应在基本面领域同样具有普适性。无论是市场风格指数的长期表现,还是行业市值中性化处理后的因子分组测试,均指向了核心规律:基本面指标的边际效用存在临界点,历史财务数据的线性外推常因商业环境剧变、信息快速定价、财务粉饰行为而失效。非...

1 A 股市场存在非线性基本面效应

1.1 非线性效应无处不在,并非市值因子独有

在 A 股市场中,市值长期以来都是一个关键的系统性风险因子。众多市场现象 表明,小市值股票具有显著的溢价效应。然而,随着实证研究的深入,我们发现线性 模型在刻画市值与收益关系时存在明显局限,其背后实际蕴含着复杂的非线性特征。 Barra 早期模型就已指出,市值因子对中盘股的收益预测存在偏差,线性模型可能高 估中盘股表现,同时低估大盘与小盘股之间的收益分化。为捕捉这种市值与收益的 非线性关系,Barra 在 CNE5 和 CNE6 模型中引入了“非线性市值因子”,通过对数 市值的立方回归提取残差项,从而有效分离出中盘股这一独特且具有显著影响的风 险敞口,成为了风险模型分析框架中不可或缺的一部分。 在观察市场时,我们注意到,非线性效应并非市值因子所独有,在常见的估值类 指标中同样存在。以申万高市盈率、中市盈率和低市盈率指数为例,下图展示了三者 的历史走势和历年涨跌幅情况:在过去的 15 年里,中市盈率指数的长期年化回报高 于高市盈率和低市盈率指数。具体来看,低市盈率指数表现强势的年份主要集中在 2011、2012、2014、2016-2018 以及 2022-2024 年。这些年份市场普遍呈现防御性 特征,低市盈率股票凭借其相对稳定的估值和业绩,吸引了风险偏好较低的投资者。 而中市盈率指数则在 2010、2015、2019-2021 年这些成长型市场环境中表现更佳, 其涨幅甚至超过了高市盈率指数。长期来看,投资者对中等市盈率股票呈现持续偏 好,这可能源于:相较估值透支的高市盈率标的,中等市盈率企业风险溢价更为合 理;相比潜在增长乏力的低市盈率股票,其成长空间更具确定性,进而在不同市场周 期中为投资者提供更为稳健的收益。

当然,市场上多数风格指数编制未剔除行业和市值因素的影响,因此我们观察 到的非线性效应可能是这两类变量干扰所致,而非源于风格本身。为更严谨地检验 基本面因子中是否真实存在非线性效应,我们选取归母净利润 TTM 同比增速和 ROE_TTM 这两个典型因子,在行业和市值中性化处理后展开测试,将全市场股票 按因子值分为 20 组,观察各组超额收益表现:自 2013 年 1 月 1 日至 2025 年 5 月 30 日,两个因子经中性化处理后仍呈现显著的非线性分布特征。归母净利润增速在 因子值较高的第 16-20 组中,超额收益与增速呈负相关;在中段区间 3-16 组中,呈 现正向关系;而在低因子值区间又再度转为负相关。而 ROE_TTM 与涨跌幅之间亦 呈现非单一方向变动关系,其顶点出现在 15 组,当 ROE 高于 15 组,超额收益随 因子值上升而递减,当 ROE 低于 15 组,超额收益随因子值下降而递减。

以上现象仅是财务指标与市场表现之间复杂关联的冰山一角。事实上,多数财务指标与收益率之间均存在形态各异的非线性关系。受制于低频更新与高噪声特征, 此类指标严重削弱了传统基本面因子的预测效力。在分组回测时我们频繁观察到, 因子值最高的一组表现弱于次高组,这种现象直接侵蚀了线性合成因子的稳定性。 另外,在现行线性框架下,大量财务指标难以转化为有效因子,导致财报数据的利用 率低下,财务科目的覆盖度不足,最终制约量化模型对企业基本面信息的全面捕捉 与分析能力。

1.2 应对非线性效应的解决方案

为应对上述现象,业界也对其展开了广泛的研究,大致改进思路总结如下: (1) 算子层面,对传统计算方法进行改进和迭代。例如,用回归、夹角等方 法替代除法,缓解低基数带来的“微利效应”;借助遗传规划进行因子挖 掘等等; (2) 特征方面,聚焦于对现有特征进行扩展和微优化,例如,用企业价值替 代市值,更全面地反映企业的整体规模;加入业绩快报、业绩预告等更 具时效性的信息;引入财务附注数据等以往被忽视的信息; (3) 因子合成环节,采用机器学习模型替代传统线性模型,旨在提取有效特 征间的非线性交互效应。

从实践效果来看,部分方法确实取得了一定成效。然而回归投资逻辑的本质,核 心观点仍遵循传统投资理念——历史盈利能力越强,成长性越突出的股票,未来涨 幅潜力越高。这个观点看似契合大众所熟知的传统投资理念,但从量化建模视角审 视,隐含了将历史财务指标线性外推至未来财务增长的假设,这种假设是否可靠恰 是量化基本面领域的核心争议点。在当今瞬息万变的商业环境中,高增速和高盈利 状态往往难以持续。与此同时,信息高效传播加速市场对公开财务数据的消化效率; 另一方面,大量学术研究也揭示了一个不容忽视的问题,部分企业可能存在财务粉 饰行为,这就导致中间区域数据偏离线性预测轨迹,从而使基于线性假设的模型产 生偏差。 鉴于上述分析,我们认为,财务指标与收益之间的线性关系假设本身缺乏坚实 的理论支撑。在投资实践中,企业历史业绩改善的幅度或许并非越高越好,而将增长 维持在合理区间反而更具可持续性。因此,本文将系统引入非线性回归模型,探索基 本面指标与股价变动间的复杂映射机制,以期构建具备增量解释能力的非线性因子 体系。

2 非线性基本面因子挖掘框架

2.1 基本面非线性效应的经济逻辑

缺乏坚实经济逻辑支撑的基本面因子如同无根之木,其稳定性和可解释性存在 内生局限。尤其在探索因子非线性效应这一领域,理解其背后的经济逻辑是指导模 型构建方向与甄别有效信号的前提。本节旨在梳理这些驱动基本面因子呈现非线性 关系的核心逻辑依据,为后续的定量挖掘流程奠定理论基础。

2.1.1成长持续性困境:越高越好还是过犹不及?

传统多因子模型的线性范式隐含单调性假设——基本面指标的边际改善应与预期收益线性正相关。然而市场实践中,投资者对极端成长值存在非对称预期:超高 速增长的可持续性常引发质疑,甚至触发估值折价。

为验证这一非线性效应,我们基于上市公司年报归母净利润同比增速构建五等 分组,其中,组 5 代表了最高增速组,我们通过跨期转移概率矩阵解析增速动态演 进规律,结果揭示如下现象: 1. 高速增长组存在较大的均值回归压力:处于最高增速组的企业,仅有 23%的概 率在下一年仍维持领先地位,但有 26%的概率滑落至最低增速组,增速反转概 率约次高组的 2 倍,印证“高增长难以持续”的市场认知。 2. 黄金增长区间:处于次高组的企业稳定性更强,下一期维持原分组的概率最高, 且落入最低增速组的概率在所有组别中最低,构成“增速适当”的黄金区域。 3. 底部增长组困境反转:最低增速组企业展现超预期弹性,下一年有 41%的概率 跃升至最高增速组,显著高于其他组向上跃迁的概率,未来可能激发市场对被错 杀标的修正动能,可见基于成长性的低位布局有一定合理性。

综上所述,增速转移矩阵印证了成长因子非线性定价的倒 U 型或三次函数规律, 超常增速伴随均值回归压力,引发现实折价;可持续中高速增长获得市场持续溢价; 极端底部可能蕴含非对称收益机会。

2.1.2财务粉饰行为引起的数据可信度干扰

成长性因子的倒 U 型关系源于对增长持续性的担忧,而盈利类因子呈现的正 U 型关系则映射出另一种非线性机制:监管规则与市场压力催生的报表调节行为。具 体而言,A 股上市规则规定连续两年净利润为负将触发 ST 警示,导致处于盈亏平衡 点 0 值附近的企业存在利润粉饰动机,削弱其基本面信息的可信度。 为验证这一现象,我们在每个年末基于年报净资产收益率将公司分为 4 组:财 务困境组(ROE<-2%),财务压力组(ROE 处于-2%-0%),微利观察组(ROE 处于 0%-2%),以及财务健康组(ROE >2%)。类似的,统计净资产收益率的跨期转移概 率矩阵,结果表明财务状况持续性存在明显的不对称性: 财务健康组持续性强,下一期仍维持原状态概率达 91%,体现高质量盈利的稳 定性;困境组反转效应显著,下一期有 45%的概率持续承压,但跃升至健康组的概 率达 39%。 财务压力和微利观察组剧烈分化,存在财务粉饰风险。我们发现,处于中间两 组的企业次期分布存在明显的两级发散特征。尤其是对于财务压力组的企业,下一 期维持原状态的概率仅 8%,38%改善至财务健康组,约 31%恶化至财务困境组。 由此可见,微利或微亏组企业的极端不稳定性加剧市场对其财务数据的信任危 机。由监管规则驱动的粉饰行为,使得微利企业呈现“财务路径不可预测”的统计 特征,引发投资者要求额外的风险补偿。虽然精准识别财务粉饰行为难度较大,且 其对涨跌幅的传导往往存在迟滞性,但远期潜在的尾部风险不容忽视。这正是部分 盈利因子正 U 型关系的核心成因。当 ROE 逼近零值时,对粉饰风险的担忧往往超 过基本面改善的利好,最终形成 U 型底部的收益洼地。

2.2 非线性基本面数据挖掘流程

在这一节中,我们以利润表、现金流量表、资产负债表中的所有字段作为基础数据,介绍非线性基本面因子的挖掘流程,具体过程如下: 1、字段覆盖度筛选:剔除全市场覆盖率低于 60%的原始字段,确保数据代表性。 2、字段标准化加工:对于每个指标,字段统一加工为单季度、TTM 和累计值。资产负债表:单季度值=本季末累计值-上季末累计值;TTM 值=近 4 季度 单季度值之和;累计值为历史累计; 利润表/现金流量表:单季度值=本季年内累计值-上季年内累计值;TTM 值 =近 4 季度单季度值之和;累计值为年内累计值。 3、基础算子构建:继承经典因子构造逻辑,定义七类基础算子,分别是原始值, 市值比率,净资产比率,总资产比率,同比增长率,环比增长率和超预期幅度,这样 能保证初步构建的基础特征是易于理解的。 4、特征预处理:基于加工后的特征和算子计算基础因子值,并依次进行行业中 位数缺失值填充、5MAD 去极值、Z-score 标准化和行业市值中性化处理。 5、非线性特征转换:以 2010-2019 年的数据为训练集拟合模型参数,并应用于 全样本(具体模型和转换步骤参见后续章节)。通过对新因子与原始因子进行截面回 归,提取残差项作为剥离线性成分后的纯非线性因子。 6、有效性验证:以 2010-2019 年作为因子筛选期,以 2020-2025 年 5 月为测 试验证期。由于因子剔除了线性成分后,普遍收益预测能力会衰减,因此我们以一个 较低的标准来筛选:月度 Rank IC 均值绝对值大于 2%,年化 ICIR 绝对值大于 1.5。

2.3 如何刻画基本面因子中的非线性效应?

2.3.1多项式回归:捕捉简单抛物线型规律

传统线性模型中“指标值越高越好”的隐含假设在现实中存在明显局限。我们发 现基本面因子常呈现抛物线型特征:一方面,当盈利增速突破可持续阈值时,市场 对其持续性的质疑会引发估值折价,形成“中间高、两端低”的倒 U 型关系;另一 方面,在盈亏平衡点附近,因财务粉饰行为导致基本面数据失真,产生“两端高、中 间洼”的正 U 型特征。

以季度资本公积超预期因子为例,其本身虽非典型的二次函数关系因子,但隐含的局部二次结构经多项式回归转换后,预测能力有显著提升,诠释了如何通过非 线性技术将财务噪声转化为可用的信息。下面展示经多项式回归转换前的因子表现。 测试范围为全市场,时间区间为 2013 年 1 月 1 日- 2025 年 5 月 30 日,通过 Rank IC、年化 ICIR、以及分十组年化收益(超额收益比较基准为成分股等权,不考虑交 易费用)来判断因子的有效性,下文中因子的回测部分如无特殊说明,均与上述参 数保持一致。 季度资本公积超预期因子原始 Rank IC 均值仅-0.2%,几乎不具备收益预测能 力。分组测试显示其与收益存在复杂的非线性结构:低值组(第 1-2 组)收益优于 市场基准,中间区域(第 3-5 组)收益位于低谷,中高组(第 6-7 组)收益再度高于 基准,而最高组(第 8-10 组)收益回落。从行为金融视角解析,这种特殊分布源于 市场对资本扩张性质的差异化解读:季度资本公积的超预期幅度实质捕捉了再融资 落地效率与资产注入质量的市场预期差。更谨慎、稳健的资本扩张传递财务稳健信 号,形成避险资产属性;而温和变动由于战略信号传导不足,引发投资者对资金使用 效能与协同价值的评估分歧;积极资本运作存在两种可能,一种是优质资产注入提 振信心,另一种则是可能触发整合风险与股权稀释担忧,最终形成局部弱 U 型+高值 区无序的定价曲线。

2.3.2样条回归:捕捉基本面因子非线性效应的灵活框架

传统多项式回归虽能捕捉简单非线性关系,但其全局函数形式存在形态刚性与 局部敏感度不足的双重局限,难以全面刻画基本面因子与收益率间的复杂交互结构。 事实上,部分基本面因子存在多峰形态。以行业市值中性化后的EP_TTM因子为例, 在全市场范围内根据因子值等分为 20 组,发现收益率呈现典型的三段式关系:在低 估值区,即在因子值最高的 5 组中,EP 提升反而伴随收益下行,反映估值修复动能 衰竭的边际效应;在合理估值带,即在 EP 适中的 3-16 组中展现稳健的正向关联, 说明基本面定价有效;在高估值区,即因子值最小的三组中又呈现负向关系。这种 含双转折点的三次函数形态亟需更灵活的非线性建模工具,此时样条回归便成为自 然选择。

2.3.3“锯齿函数”:融合微观线性与宏观非线性结构

传统线性模型、多项式回归与样条回归均基于“连续渐变”假设,但真实市场中 企业异质性与投资者认知差异常引发因子效应的结构性断层,具体表现为: 1、域内同质化:当企业处于同一细分领域时,相似的供需结构与市场预期促使 因子效应呈现连续线性规律。例如,科创板块内,研发投入直接量化了企业 的技术壁垒强度,导致内部具有较强的可比性。 2、组间异质性:跨经营生态圈的因子效应存在非线性跃变。例如,商业性质的 差异、市场情绪的传导等因素导致高研发组与中低研发组间的因子比较失去 经济学意义。 这种“域内线性规律稳定,跨域逻辑跃变”的典型特征,形似锯齿函数的分段折 线形状。我们可以通过“组间非线性+组内线性化”来实现,与多项式回归的全局弯 曲建模哲学截然不同,后者则强制全域服从单一抛物线形态。而锯齿函数通过分域 线性建模捕捉局部定价效率,再叠加跨域非线性转换捕捉特定拐点,在保障局部稳 定性的同时实现动态适应性,形成更贴近市场真实的多级定价结构。

基于上述分析,我们尝试引入“组间非线性+组内线性化”的锯齿函数,具体实 现步骤如下: (1) 根据 2.3.1 节中的多项式回归模型确定顶点位置及曲线形态方向; (2) 在每个月末将全市场股票按因子值大小等分为 10 组,计算各组因子均 值作为组的重心值; (3) 计算各组重心值与顶点距离的平方,若曲线与因子同向(例如正 U 型+ 正向因子),组得分即为距离平方值;若两者反向,组得分为距离平方值 的相反数; (4) 将个股原始因子值乘以万分之一,与组得分叠加形成个股最终得分,确 保组内保持原始排序。 以季度基本 EPS 同比增长率为例,下图展示非线性转换前的因子表现:Rank IC 均值为 3.0%,Rank ICIR 为 1.90,虽具备正向预测能力但稳定性不足。该因子 作为股东权益回报扩张动能的直接度量指标,理论上应持续正向驱动收益预测,然 而分组测试揭示其存在典型的增速舒适边界效应:具体表现为,以相邻 4 组为跨度构成大组时,大组内部收益率分布高度聚合,而跨大组边界则产生显著收益跃迁,显 示市场对企业盈利增速变化存在阶梯式定价机制。

2.3.4门限回归:捕捉基本面因子中的结构突变与非连续效应

“锯齿函数”虽然通过“组间非线性+组内线性化”框架捕捉结构性突变,但其 对人为分组规则的高度依赖导致了分组边界难以匹配真实经济断点。门限回归则通 过内生门限变量客观识别断点位置,以临界值划分样本区间,每个区间内因子效应 可保持线性形式,在边界处实现参数阶跃式跳变。较锯齿函数的本质差别在于基于 Hansen 法的断点自发现机制,规避节点预设的主观干扰。

2.4 非线性效应是否存在于量价因子中?

前文主要基于三大财务报表构建了非线性基本面因子体系。那么,一个自然的 问题是,量价因子中是否也同样存在非线性效应呢?本节我们将因子库中的日频量 价因子也作为模型的输入,尝试挖掘具有增量解释力的衍生量价因子。

以 10 日非流动性因子为例,其本身是一个非常显著的正向因子,而不同期限的 非流动性因子在不同模型的转换下均能取得显著的表现。其中,经锯齿函数转换后 的 10 日非流动性因子 Rank IC 均值为-4.3%,年化 ICIR 为-3.45,IC 月胜率 85.2%, 表现十分稳定。 从分十组测试结果来看,因子多空年化收益达 17.4%,多头年化超额 11.6%, 信息比为 1.76,分年度表现稳定。 此外,从样本外检验来看,Rank IC 均值-4.1%,年化 ICIR 为-3.17,且多头表 现持续优异,总体仍能保持显著的预测能力。

2.5 非线性复合因子表现

由于单一非线性因子虽具有预测能力,但其逻辑解释复杂度较高,且对原始线 性项正交化后显著性有限。通过多因子信息融合,可提取共性规律并提升稳定性。本 节我们将挖掘得到的一系列非线性基本面因子和量价因子进行线性合成,考察复合 因子的表现。 具体而言,以 0.9 作为因子值相关系数的筛选阈值,优先选取训练集中 ICIR 高 的因子,入选的因子以截面对称正交消除因子间的共线性,并以滚动 12 个月 ICIR 进行加权复合得到非线性基本面因子、非线性量价因子,以及由前两者二次合成的 非线性复合因子。 可以看到,自 2013.1.1-2025.5.30,非线性基本面因子 Rank IC 均值为 6.6%, 年化 ICIR 为 3.88,IC 月胜率为 84.6%,分组严格单调,多头年化超额 10.7%,信 息比 2.74,表现十分出色。此外,因子在样本外的表现仍较为稳定,因子 Rank IC 均值 6.3%,年化 ICIR 为 3.32,每年均能稳定跑赢基准,且相对回撤较小,仅-3.3%。

非线性量价因子 Rank IC 均值为 7.8%,年化 ICIR4.46,IC 月胜率 92.6%,从 分组表现来看,因子空头端区分度更强,多空年化收益 26.3%,多头年化超额 7.1%, 信息比 2.24,多头相对回撤仅-2.9%,表现出色。此外,因子在样本外的表现仍较为 稳定,因子 Rank IC 均值 6.7%,年化 ICIR 为 3.77,每年仍能稳定跑赢基准。

叠加了非线性量价因子后,复合因子的表现获得进一步提升。全样本区间内, Rank IC 均值为 9.4%,年化 ICIR 约 4.53,IC 月胜率达 90.6%。从分组测试结果来 看,因子空头端剔除能力得到明显提升,空头年化超额为-21.1%,且多头端超额表 现提升至 12.7%。 从样本外检验来看,因子 Rank IC 均值 8.5%,多头超额收益仍持续有效。但与 非线性基本面因子相比,量价的非线性成分在样本外一定程度上拖累了非线性基本 面因子的多头表现。

进一步统计了复合因子在 BARRA 风格上的暴露情况:结果表明,由于在非线 性转换的过程中对原始线性项进行正交处理,非线性基本面因子在 Barra 风格上的 暴露较低,相关系数均在 0.2 以下。而由于非线性量价因子更多的由非流动性和反 转动量的衍生因子参与,因此本身剔除波动率和换手率的信息较少,因而与波动率 和换手率因子具有一定的信息重叠性。

3 非线性复合因子在指数增强策略中的应用

为更客观地考察非线性复合因子对多因子模型的贡献,后文将通过更贴近实战 的方式考察因子的有效性,主要结合沪深 300、中证 500、中证 1000 指数增强模型 进行判断。

3.1 沪深 300 增强

对非线性复合因子构建沪深 300 指数增强组合,具体细节如下: 股票池:全市场 A 股,剔除 ST、涨跌停、停牌、上市不满 180 天的股票。回测时间区间:2013 年 1 月 1 日 - 2025 年 5 月 30 日。调仓频率:月末调仓。基准:申万一级行业、市值暴露、个股权重均以沪深 300 指数为基准 。约束上下限:80%成分股约束,个股偏离幅度 1%,行业暴露偏离 2%,市 值暴露偏离 0.2,其余 Barra 风格暴露偏离 0.5 。 成交价格:收盘价。 交易费用及仓位:双边千三,满仓。 调仓策略:以非线性复合因子作为 Alpha 得分,在风险约束的条件下最大 化复合因子暴露,来求解股票的最优权重。

3.2 中证 500 增强

对非线性复合因子构建中证 500 指数增强组合,具体细节如下: 股票池:全市场 A 股,剔除 ST、涨跌停、停牌、上市不满 180 天的股票 。回测时间区间:2013 年 1 月 1 日 - 2025 年 5 月 30 日。 调仓频率:月末调仓 。 基准:申万一级行业、市值暴露、个股权重均以中证 500 指数为基准 。 约束上下限:80%成分股约束,个股偏离幅度 0.8%,行业暴露偏离 2%, 市值暴露偏离 0.2,其余 Barra 风格暴露偏离 0.5。成交价格:收盘价。交易费用及仓位:双边千三,满仓 。调仓策略:以非线性复合因子作为 Alpha 得分,在风险约束的条件下最大 化复合因子暴露,来求解股票的最优权重。

3.3 中证 1000 增强

对非线性复合因子构建中证 1000 指数增强组合,具体细节如下: 股票池:全市场 A 股,剔除 ST、涨跌停、停牌、上市不满 180 天的股票。回测时间区间:2014 年 10 月 31 日 - 2025 年 5 月 30 日 。调仓频率:月末调仓。基准:申万一级行业、市值暴露、个股权重均以中证 1000 指数为基准。约束上下限:80%成分股约束,个股偏离幅度 0.5%,行业暴露偏离 2%, 市值暴露偏离 0.2,其余 Barra 风格暴露偏离 0.5。 成交价格:收盘价 。交易费用及仓位:双边千三,满仓 。 调仓策略:以非线性复合因子作为 Alpha 得分,在风险约束的条件下最大 化复合因子暴露,来求解股票的最优权重。

4 总结

A 股市场历史表明,传统线性模型难以精准刻画因子与收益的复杂关系。以市 值因子为例,Barra 模型发现其对中盘股存在系统性定价偏差——线性假设高估中盘 股表现,低估大盘与小盘股的分化。在 CNE5/CNE6 模型中,通过对数市值立方回 归残差分离中盘股风险敞口,验证了非线性市值因子的必要性。这种非线性现象在 基本面领域也尤为显著:申万市盈率指数 15 年数据显示,中市盈率组合年化收益持 续超越高/低市盈率组合。此类现象揭示核心规律:基本面指标的边际效用存在临界 点,历史财务数据(如盈利增速)的线性外推常因商业环境剧变、信息快速定价、财 务粉饰行为而失效。 本文突破传统线性框架,主要以三大财务报表的字段为特征,辅以因子库中的基本面与量价因子,通过四类模型系统挖掘基本面因子非线性效应:1、多项式回归 :通过中心化处理与残差正交化分离高阶效应;2、样条回归:捕捉局部非线性结构 并平滑过渡;3、锯齿函数:组间非线性+组内线性化;4、门限模型:自动识别关键 状态转折点。通过经上述模型转换后的新因子与原始因子进行截面回归,提取残差 项作为剥离线性成分后的纯非线性因子。

此外,我们发现,量价因子中也同样存在非线性效应,尤其是对于流动性和动量 反转类因子。其中,经锯齿函数转换后的非流动性因子表现尤为出色,因子 Rank IC 均值为-4.3%,年化 ICIR 为-3.45,IC 月胜率 85.2%,多空年化收益达 17.4%,多头 年化超额 11.6%,信息比为 1.76,分年度表现稳定。 由于单一非线性因子虽具有预测能力,但其逻辑解释复杂度较高,且对原始线 性项正交化后统计显著性有限。通过多因子信息融合,可提取共性规律并提升稳定 性。我们进一步将挖掘得到的非线性基本面因子和量价因子进行线性合成。自 2013 年 1 月 1 日-2025 年 5 月 30 日,非线性基本面因子 Rank IC 均值为 6.6%,年化 ICIR 为 3.88,IC 月胜率为 84.6%,分组严格单调,多头年化超额 10.7%,表现十分 出色。叠加了非线性量价因子后,复合因子的表现得到进一步提升,其 Rank IC 均 值为 9.4%,年化 ICIR 约 4.53,IC 月胜率达 90.6%,多头端超额表现提升至 12.7%。 此外,非线性因子在从样本内外表现较为一致,样本外多头超额收益仍持续有效。非 线性复合因子在不同指数域均有不俗的表现,且与 Barra 风格因子和常规选股因子 均保持较低的相关性,具有显著信息增量。 最后,为考察非线性复合因子对多因子模型的实际贡献,我们以沪深 300、中证 500 和中证 1000 增强模型为例,结果表明,沪深 300 增强组合的年化超额收益为 6.5%,信息比 1.64;中证 500 增强组合的年化超额收益为 8.6%,信息比 1.67;中 证 1000 增强组合表现相对优异,年化超额收益为 13.4%,信息比 2.22。样本外增 强策略仍有不错的表现。

 

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至