2024年金融工程专题:涵盖价量与基本面因子的多模型结合神经网络
- 来源:信达证券
- 发布时间:2024/10/31
- 浏览次数:1008
- 举报
金融工程专题:涵盖价量与基本面因子的多模型结合神经网络.pdf
金融工程专题:涵盖价量与基本面因子的多模型结合神经网络。本文是深度学习揭秘系列报告第二篇。本文先以量价因子Alpha158与基本面因子为特征,全连接神经网络为测试对象,从模型的输入端入手,讨论了量价因子与基本面因子对原始收益的预测效果,以及在预测中性化收益率的场景下,不同输入形式与输出处理方式的特点。其次,本文研究通过参数遍历的方式,对比了时序神经网络相对全连接神经网络的优劣,研究了时序神经网络的参数设置规律,以及时序神经网络对量价因子和原始行情数据的拟合及预测效果。以量价因子原始值建模预测中性化收益,在因子IC与组合收益上有损,但模型能学习到市值与行业的波动。在预测中性化收益的场景下,本文对...
一、因子集、预处理与组合构建方式
通常在股票收益预测的场景下,我们通过构建具有一定逻辑的选股因子,可以有效地提取出原始数据中的关 键特征,进行降维处理,从而减少模型训练的复杂度和计算成本。选股因子是基于金融理论和实证研究构建的, 量价因子能够对股票的价格走势和成交变化进行描绘,让模型能够学习不同量价情况下股票的收益分布特征,而 基本面因子,例如 EP、BP 等则反映了公司估值水平,提供了量价维度外的另一个重要的视角。
1.1、量价因子数据集
我们采用 Github 上的开源项目 Qlib 所集成的 Alpha158 量价因子进行模型层面的基础研究,它包含了基于 价格和成交量的多种因子,不算窗口期则有 42 个因子,部分因子考虑了 5/10/20/30/60 的交易日的窗口期,因此 若算窗口期则共有 158 个因子。我们将 Alpha158 因子分为以下 5 类: 日内因子:这些因子仅使用当天的开盘价、收盘价、最高价、最低价以及均价数据,共包含 13 个因子。这 些因子捕捉了市场在单个交易日内的波动和变化特征。 波动因子:波动因子主要衡量股票价格的波动性,共包含 5 个因子。波动性因子可以帮助我们理解股票价格 的变动幅度和频率,从而更好地评估风险和收益。 价因子:价因子是基于股票的价格信息计算得出的,共包含 100 个因子。这些因子涉及多种价格计算方法和 统计指标,能够反映出股票价格的长期和短期趋势。 量因子:量因子基于成交量数据,共包含 30 个因子。成交量是市场交易活动的直接反映,量因子能够提供 关于市场流动性和投资者行为的重要信息。 量价相关性因子:这些因子同时考虑了成交量和价格的关系,共包含 10 个因子。通过分析量价关系,可以 更深入地了解市场的供需动态和价格变动的内在驱动力。
1.2、基本面因子数据集
除了 Alpha158 量价因子外,我们还加入了常规的基本面因子,包含了估值、质量、成长和分析师一致预期 等维度,共计 38 个因子。
1.3、数据预处理与网络参数设置
特征与标签: 特征 X:158 个 Alpha158 因子与 38 个基本面因子,去极值、截面 ZSCORE 标准化、维持原始值或进行市值 行业中性化,分开测试。 标签 Y:个股从下一个交易日的 VWAP 算起,未来 5 个交易日或 20 个交易日的 VWAP 收益率,维持原始 值或进行市值行业中性化后,计算截面排序百分位。若当天股票停牌,则剔除该数据。 数据采样:日频采样,以 2014 年 1 月 2 日为第一次预测点,回看过去 5 个自然年数据作为样本,数据集按 顺序划分,前 90%的交易日作为训练集,后 10%的交易日作为验证集,用于拟合模型,接下来 1 年用该模型 预测每个股票的收益率,每个自然年重训练一次模型。
神经网络参数: Batch:按交易日做 Batch 拆分,每个 Batch 大小为当前截面股票数量。损失函数:预测值与真实值 Pearson 相关性的相反数。 优化器:Adam;学习速率:0.001。 输出层激活函数:Sigmoid。将输出值非线性映射到 0 至 1 范围内,与排序百分位的标签保持一致。 最大 Epoch:100;早停 Epoch:10(验证集 Loss 连续 10 轮没有创新低则停止训练)。 随机种子:42。(固定随机种子数保证模型对比实验路径的一致)
1.4、训练集、验证集与测试集的数据处理
在上一节中,我们将数据拆分为样本内训练集、样本内验证集与样本外测试集,之后我们仍需要根据预测周 期长短,进行数据集之间的进一步隔离处理。 (1) 若预测未来 N 个交易日的均价收益率,则剔除样本内数据集的最后 N+1 个交易日的数据,避免样本内的 标签用到样本外的数据进行计算。 (2) 若预测未来 N 个交易日的均价收益率,则进一步剔除最后(N-1)/2 个交易日的训练集数据与最早(N-1)/2 个交易日的验证集数据,避免训练集未来收益率与验证集未来收益率的计算有用到重复的交易日数据。 (若 N 为偶数,则训练集比验证集多剔除一个交易日的数据)

1.5、全 A 选股组合回测参数与方式
回测区间:2013 年 12 月 31 日至 2024 年 8 月 30 日。 剔除:剔除上市不满 365 个自然日的新股,剔除 ST 股。 组合构建:取因子值前 10%为多头组合,后 10%为空头组合,全 A 等权为基准组合。 交易方式:每 5 个交易日 / 20 个交易日调仓,以下一个交易日的 VWAP 价格成交,交易费率为单边千分之 一。 交易限制:一字涨停不能买入,一字跌停不能卖出,停牌不可交易,多头 / 空头组合中的多余权重分给其余 股票。
1.6、路径依赖与路径合并
日频因子,每一天皆可预测未来 5 日(20 日)的收益率,这意味着我们可以利用这些因子在每个交易日对 未来一段时间内的股票收益率进行预测。然而,如果我们选定某一个特定的起点并每隔 5 日(20 日)进行一次 调仓操作,那么由于起点选择的不同,可能会导致我们得到不同的净值曲线,这种现象被称为路径依赖问题,若 任取一条净值曲线计算收益与风险都会有失公允。 为规避此问题,我们在 2014 年 1 月 30 日将不同调仓起点的净值曲线做截断,并将所有净值曲线归一化处 理,使得它们的初始值相同,然后计算所有净值曲线在每一天的收益率的均值。通过这种方法,我们可以得到一 条综合的净值曲线,代表了在不同起点下调仓策略的平均表现。这样一来,我们能够更准确地评估投资策略的收 益与风险,避免了单一调仓起点带来的路径依赖问题。
二、3 种中性化收益率建模方式对比
在收益预测问题中,预测原始收益率与预测市值行业中性化收益率皆有意义。前者可以帮助我们构建追求绝 对高收益的全 A 选股组合,或者行业轮动策略,后者在市值行业被约束的指增组合中更加适用。 若是用神经网络预测原始收益率,使用方式上比较直观,以去极值标准化后的原始因子值为特征,以转排序 后的原始收益率为标签即可。 但若是用神经网络预测中性化收益率,我们认为则有多种处理方式,例如: 1) 以去极值标准化后的原始因子值为特征,以转排序后的原始收益率为标签,拟合神经网络模型,中性化模型 输出的预测值,作为最终结果。 2) 以去极值标准化后的中性化因子值为特征,以转排序后的中性化收益率为标签,拟合神经网络模型,直接以 模型输出的预测值为最终结果。 3) 以去极值标准化后的中性化因子值为特征,以转排序后的中性化收益率为标签,拟合神经网络模型,中性化 模型输出的预测值,作为最终结果。 这几种建模方式之间有无差别,量价因子与基本面因子是否有不同的适用场景,接下来我们基于 MLP 模型, 分开讨论量价因子和基本面因子在以下 4 种方式下,对样本外未来 5 个交易日收益的预测效果。为了便于描述, 后文用 A、B、C、D 编号指代 4 种不同的方法。
2.1、量价因子:以原始值建模 IC 与收益有损,但组合风险端更佳
对于 158 个量价因子,我们采用 2 层的全连接神经网络(MLP)。隐藏层神经元数量分别为 128 和 64,每层 皆采用 RELU 激活函数,并在激活函数后衔接参数为 0.2 的 Dropout 层,输出层激活函数采用 Sigmoid。网络结 构如下图所示,图中的 input-tensor(5000, 158)代表 5000 个示例股票和 158 个因子。
同时为了避免固定的输入特征对结论产生影响,我们对 Alpha158 因子集进行无放回的随机抽样,随机从 158 个因子中抽取 79 个因子,构造 10 个随机因子集。
统计显示,预测原始收益率的 A 方式与预测中性化收益率的 BCD 方式,RankIC 均值差距不大,说明量价 因子对于原始收益率与中性化收益率皆有较好的预测效果。不过因为大部分量价因子的原始值在市值上有偏,所 以 A 方式的多头组合年化超额收益最高,但波动与回撤也最大,且 ICIR 弱于 BCD 方式。 B 方式与 C 方式相比,两者的目标都是预测中性化后收益率排序,我们发现不论是在 Alpha158 因子集下, 还是在随机抽样因子值下,后者的 RankIC 均值与 ICIR 总是比前者更高。我们推测这可能是因为前者的建模预 测目标是原始收益率排序,而非真正校验所采用的中性化收益率。 进一步比较 B 与 C 方式的多头组合超额收益与风险,发现 B 组合的收益弱于 C 组合,但 B 组合的年化波动 与每年平均最大回撤更优。说明如果将带有市值行业信息的因子值输入模型,神经网络模型也许可以学习到由市 值行业带来的风险,从而在后续的中性化过程中将其更好地剔除。而如果输入的是市值行业中性化后的因子值, 则一开始就失去了市值行业的波动学习能力,导致最后组合的波动与回撤更大。 最后比较 C 与 D 两种方式,发现不论是 IC 还是收益风险,皆没有显著差别,说明若是输入端已经中性化,输出端则没有太大的二次中性化必要。 因为我们主要将中性化因子用于指增组合构建,在组合构建过程中,我们可以通过优化器来控制风险,所以 后文中对量价因子,统一采用“中性化输入,原始值输出”的 C 方式预测中性化收益率。
2.2、基本面因子:中性化处理的必要性
对于基本面因子,我们同样采用非线性的 2 层 MLP 模型进行拟合,由于基本面因子的数量为 38 个,因此我 们将隐藏层神经元数量缩减为 32 和 16。为了避免固定的输入特征对结论产生影响,同样对基本面因子集进行无 放回的随机抽样,随机从 38 个因子中抽取 19 个因子,构造 10 个随机因子集。
对于基本面因子,我们发现在预测中性化收益的场景下,B 方式的各项指标显著弱于 C 与 D。我们推测这是 因为基本面因子通常在行业上有偏,不同的行业基本面因子值可能有中枢上的差距(例如银行业的大部分股票 PB 都小于 1,而计算机行业的股票大部分 PB 都大于 1), 因此若将基本面因子的原始值输入模型,因子值的中枢 差距可能会干扰模型的拟合效果。
另外,相较于量价因子,基本面因子预测原始收益的能力也显著弱于预测中性化收益率的能力,我们认为也 是上述原因引起的。 综上,对于基本面因子,后文也统一采用“中性化输入,原始值输出”的 C 方式预测中性化收益率。

2.3、再谈量价与基本面结合
在 2.1 小节与 2.2 小节中,通过测算我们得出几个结论: (1) 原始量价因子具备较好的原始收益率预测能力。 (2) 原始基本面因子预测原始收益率的能力相对较弱。 (3) 输入中性化处理后的量价或基本面因子,在 RankIC 与收益上,优于输入原始因子之后再中性化。 因此,若是想做量价与基本面因子结合的中性化收益预测,根据结论(3),将两者中性化之后再输入模型进 行合成即可。 但如果想基于量价和基本面因子做原始收益预测,在使用原始量价因子的同时,该采用原始基本面因子还 是中性化后的基本面因子呢?我们认为两种做法皆有一定的道理: 1) 采用原始基本面因子与原始量价因子结合更符合直觉,即便基本面因子值存在不同行业中枢不一致的问题, 但拟合出来样本外也有 6.24%的 RankIC,或可作为原始量价因子的补足。 2) 采用中性化基本面因子与原始量价因子结合,则目的在于尝试用中性化基本面因子对于市值行业内相对收益 的预测能力,与原始量价因子的绝对收益预测能力进行非线性拟合,从而实现加强。 所以,我们以原始 Alpha158 因子集为基准组合,使其分别与原始基本面因子和中性化基本面因子,以《深 度学习揭秘系列之一:基于量价与基本面结合的深度学习选股策略》报告中提出的分支网络形式相结合,从而观 察两者分别对纯量价基准组合的增强效果,网络结构如下。
经过 3 个模型的横向对比,发现加入原始或中性化基本面因子之后的组合相较于纯量价组合,在 RankIC 上 皆有提升,而叠加中性化基本面因子的组合在 IC 与多头超额收益上最佳,RankIC 提升 0.45pct。且叠加中性化基 本面因子的组合相较于纯量价组合的 RankIC 提升在时序上较为稳定,在 2014 年至 2017 年及 2024 年的收益上 有显著增强,2018 年至 2023 年虽然没有显著增强,但也没有较大的波动与回撤,相对净值基本走平,全区间年 化超额收益提升 2.39pct。 因此,在后文预测原始收益的场景中,我们将量价因子保持原始值,与中性化之后的基本面因子进行结合。
三、时序神经网络的应用与参数探秘
在此之前的报告中,我们主要对全连接神经网络 MLP 进行了较深入的研究,但全连接神经网络通常只考虑 截面数据,而无法捕捉时序间的关系与变化。循环神经网络 RNN 相较于 MLP,通过引入隐藏状态这一概念,让 时序信息在其中传递,从而学习时序特征。而门控循环单元网络 GRU 相较于 RNN 进一步引入了更新门与重置 门,解决了梯度消失与梯度爆炸的传统问题。 然而,在量化选股领域,时序神经网络是否全方位优于全连接神经网络?升级迭代过的 GRU 是否又真的优 于 RNN?什么样的因子更适合输入时序神经网络?时序神经网络的隐藏层、隐藏单元数量和特征步长三个参数 之间又有着什么关系,怎么设置比较通用? 本章通过 Grid Search 的方式,在预测未来 5 个交易日中性化收益率的场景下,进行 MLP、RNN、GRU 三 个模型之间的横向对比。
3.1、MLP Vs RNN Vs GRU —— 量价因子
首先,以中性化后的 Alpha158 因子集为特征,中性化后收益率为标签,对 2 层的全连接神经网络 MLP 模型 的隐藏单元数进行遍历,统计在不同参数设置下,MLP 模型的样本外预测效果。
经过参数遍历回测发现,若有 158 个输入特征,则将第一层的隐藏单元数量设置在 64 至 256 之间,第二层 的隐藏单元数量设置在 16 至 64 之间,基本可以取得较理想的样本外预测效果,同时也较为符合传统的经验设置 方式,即设为 2 的次方数,然后根据降维的思路,每一层神经元数量比上一层少。在该参数遍历范围内,RankIC 均值最小值为 11.57%,最大值为 12.22%,两者相差 0.65pct,可见 MLP 对于参数的敏感性也在可接受范围内。
根据量价因子在 RNN 与 GRU 上的测试,发现以下几点: 1) 其他参数保持一致的情况下,2 层的 RNN 大部分预测效果优于 1 层的 RNN,但是模型层数增加带来的提升 反而在 GRU 上不是很明显。 2) 在上述参数遍历范围内,大多数 2 层 RNN 的 RankIC 均值相较于 MLP 的最大值 12.22%有提升,但 GRU 仅 将隐藏单元数设置为 16 时有提升,其他隐藏单元数设置仅和 MLP 的最大值接近甚至略低于。 3) 1 层与 2 层的 GRU 对于隐藏单元设置较为敏感,当隐藏单元数设置为 128 时,RankIC 均值可能衰减至 9% 左右。 4) 更为进阶的 GRU 相较于 RNN 并没有优势相反更差。 5) 特征步长如何设置没有观察到明显的规律,不利于总结经验上的设置方式从而套用到其他因子集上。 因此我们反思是否是因子或者模型使用不当导致的上述问题。回顾输入的特征因子集不难发现,Alpha158 由 13 个单日因子与 145 个窗口期因子构成,其中的窗口期因子分别有 5、10、20、30、60 的窗口期计算方式,若 将窗口期因子输入时序神经网络,可能会造成信息的交叉重叠(例如通过最近 56 个交易日的 5 日窗口期因子可 以近似推导出最新的 60 日窗口期因子),所以我们推测若将 158 个 Alpha158 因子直接输入时序神经网络,起到 增量贡献的可能主要是 13 个单日因子,因此我们尝试对 13 个单日因子进行参数遍历,观察在不同参数下的预测 效果。

如果将单日量价因子输入时序神经网络模型,可以发现参数和样本外预测效果之间的关系,相较于 Alpha158 所有因子全部输入,更符合经验直觉: 1) 在同样的层数、隐藏单元和步长设置下,GRU 优于 RNN。 2) 在预测未来 5 个交易日的问题中,特征步长从 5 到 20,预测效果呈现递增关系。 3) 输入 13 个单日因子的情况下,将 RNN 或者 GRU 的隐藏单元数设置为 8 和 16 效果较好。 最后,我们将单日因子与窗口期因子结合起来,测试如果将 13 个单日因子通过时序神经网络拟合,而 145 个窗口期因子仍然沿用 MLP 拟合,这样的网络结构是否能稳定战胜原始 MLP 模型架构。研究过程中,MLP 网 络参数不变,使用 2 层,隐藏单元数为 128、64,仅遍历时序神经网络的参数部分。
前文中,我们测得单纯使用 MLP 网络的量价合成因子,在[128, 64]参数设置下的 RankIC 均值为 12.09%, 最大 5 日 RankIC 为 12.22%。而我们上述构建的 RNN/GRU+MLP 合成网络,当 RNN/GRU 部分有 2 层时,几乎 在所有遍历的隐藏单元数与特征步长参数下,RankIC 均值皆大于 12.22%,整体结果也优于将 Alpha158 所有因 子输入时序神经网络中。
综上,我们认为: 1) 对于单日量价因子(包括日频化的高频因子),采用时序神经网络学习时序上的关系与变化,对预测效果的 提升确实存在帮助。 2) 如果是涉及到窗口期计算的因子,采用 MLP 神经网络拟合,或许是能够均衡预测效果与算力消耗及显存占 用的较好方式。 3) 对于时序神经网络隐藏单元数的参数设置,如果输入的特征已经证明在统计上有一定的选股能力,那么将隐 藏单元数设置为和因子数较为接近或许是较好的方式。 4) 对于时序神经网络特征步长的参数设置,可以参考线性选股方式下根据预测周期长短来挑选窗口期的方式, 来设置特征步长。
3.1、RNN 与 GRU —— 行情数据 在上一小节中,我们通过遍历各个参数下的时序神经网络模型,论证了时序神经网络对于单日维度的选股因 子有着较好地拟合与预测效果。那么除了选股因子,我们若直接输入股票时序的价格与成交相关数据,让模型从 原始数据中进行时序关系的挖掘,能否取得较好的表现?网络参数的设置上又有什么规律?输入特征与处理方 式如下: ➢ 原始特征:开盘价、收盘价、最低价、最高价、VWAP 均价、成交量、成交额。 ➢ 时序标准化:对于每个原始特征,将所有历史值除以当前值。 截面标准化:对时序标准化后的特征进行截面 ZSCORE 标准化。 在预测绝对收益率的场景下,直接将行情数据经过标准化处理之后输入网络即可。但如果我们希望做中性 化收益率预测,因为对时序行情数据做中性化回归计算量较大,因此在本节的网络中,采用先输入标准化后的原 始特征拟合时序神经网络,再中性化回归网络的输出值,从而实现中性化收益的目的,网络结构图如下,图中 (5000, 20, 7)的 input-tensor 为假定的 5000 个股票,步长为 20 个交易日,7 个特征数据;(5000, 1)的 input-tensor 为标准化后的对数市值;(5000, 30)的 input-tensor 为 30 个中信一级行业哑变量。
将 7 个维度的原始行情数据带入上述网络结构中,预测未来 5 个交易日的中性化收益率,经过参数遍历,可 见和拟合单日量价因子时类似,在学习行情数据时,GRU 模型的预测效果均稳定优于对应参数下的 RNN 模型, 且在 5 至 20 的步长范围内,RankIC 均值呈递增规律。
进一步观察基于行情数据的预测结果后,我们发现较优的隐藏单元数设置范围是 16 和 32。尽管我们的输入 特征总共有 7 个,但其中高开低收均价等 5 个特征的时序变化相关性较高,而成交量和成交额的相关性也较高。 因此,严格来说,我们只有两个区分性维度。然而,较优的隐藏单元设置数量为 16 或 32,远远超过了输入特征 数,这与前述单日量价选股因子最优隐藏单元数近似于输入特征数的结论不同。 我们推测这是因为单日选股因子已经是在统计上有一定预测能力的特征,所以采用一个相对简单的时序神经 网络即可。而原始行情数据中噪音较多,因此需要一个相对较复杂的时序神经网络挖掘行情数据更深处的信息。 我们以 GRU_[2, 32, 20]模型(2 层,32 个隐藏单元,20 的步长)为例,展示原始行情 GRU 中性化因子的收 益预测效果。在 2014 年 1 月至 2024 年 8 月 30 日的区间内,5 日 RankIC 均值为 10.26%,ICIR 为 1.18,5 日调 仓组合的费后年化多头超额收益为 9.32%,多头组合单边年化换手率为 33.93 倍。GRU_[2, 32, 20]模型拟合原始 行情因子与前文同样参数下拟合的 13 个单日量价因子的相关性均值为 0.6,说明 GRU 拟合的原始行情相对单日 量价因子能提供一定的增量信息。

四、低频量价+高频量价+基本面因子+行情的多模型组合
4.1、四分支多模型神经网络
在前面的章节中,我们研究了不同因子集以及各自较为适用的神经网络模型: 窗口期低频量价因子:MLP 全连接神经网络。 单日低频量价因子:GRU 神经网络。 高频因子:日频化的高频因子类似于单日低频量价因子,因此也可以采用 GRU 神经网络。 行情数据:GRU 神经网络,若预测原始收益率则直接输出,若预测中性化收益率,则需要在网络中添加回 归取残差模块。 基本面因子:MLP 全连接神经网络,在预测原始收益与中性化收益的场景下,皆需要将基本面因子预先做 中性化再输入。 在以上研究结论的基础上,我们构建四分支多模型的神经网络,集中学习各个维度的信息,得出最终的预测 收益率。若预测未来 5 个交易日收益率,特征步长设为 20;若预测未来 20 个交易日收益率,特征步长设为 60。
预测未来 5 个交易日的中性化收益率,通过上述模型生成 5 日合成因子,RankIC 均值为 13.55%,构建的多 头组合费后多头超额年化收益为 27.14%,单边年化换手率为 32.38 倍。
20 日合成因子 RankIC 均值为 15.65%,费后多头超额年化收益为 17.18%,单边年化换手率为 9.07 倍。

4.2、预测区间与调仓频率的关系
在之前的收益预测与组合构建过程中,我们的做法都是保持预测区间与调仓频率一致,例如预测未来 5 个交 易日的收益率,则每 5 个交易日调仓一次。预测未来 20 个交易日的收益率,则每 20 个交易日调仓一次。 但如果预测区间较短,则模型标签中可能含有较多的短期噪音,将预测区间拉长能够降低噪音占比,但我们 也担心与短期调仓的目标不符。 本节主要对比在不同建模方式下预测“未来 5 / 10 / 20 个交易日”的中性化收益率(时序神经网络特征步长 分别为[20, 40, 60]),并计算每组生成因子值在不同调仓频率下的表现,即“1 / 5 / 10 / 15 / 20 / 25 / 30 个交易日”。 具体分析指标包括:“日均 RankIC”、“日均多头超额收益”、“费后多头超额年化收益”以及“多头单边年化换手 率”。 根据表 26 至表 29 的结果显示,在各个预测区间下,深度学习合成因子的持续预测效果距调仓时点越远,日 均 RankIC 与日均多头超额收益越小,呈逐渐衰减状态,说明深度学习合成因子的收益主要集中在刚调仓完毕的 前期时间段。且在同一调仓频率下,预测区间越长,多头组合换手率越低。
且在较高的调仓频率下,短区间预测的效果与长区间预测的效果差距相对较大,以 5 日调仓为例,预测 5 日 的日均 RankIC 为 7.26%,预测 20 日的日均 RankIC 为 6.53%,相差 0.63pct。 而在较低的调仓频率下,短区间预测的效果与长区间预测的效果差距相对较小,以 20 日调仓为例,预测 20 日的日均 RankIC 为 4.44%,预测 5 日的日均 RankIC 为 4.32%,相差 0.12pct。 测算各个预测区间下合成因子的相关性,可以看到因子之间相关性适中。以 5 日因子与 20 日因子为例,两 者相关性为 0.69。 两者或许可以相结合作为互补,因此我们将 5 日中性化因子与 20 日中性化因子 ZSCORE 等权结合,构造混 频因子。
混频因子 5 日 RankIC 均值为 13.81%,相较于原 5 日因子提升 0.26pct,费后多头超额年化收益为 29.02%, 提升 1.88pct,单边年化换手率为 27.92 倍。
混频因子 20 日 RankIC 均值为 16.49%,相较于原 20 日因子提升 0.84pct,费后多头超额年化收益为 19.07%, 提升 1.89pct,单边年化换手率为 9.23 倍。
4.3、深度学习行业轮动组合
基于以上研究结论,对于行业轮动组合,首先 ZSCORE 等权合成 5 日原始收益率预测与 20 日原始收益率预 测值,得到对于每个股票的因子得分。在每周的最后一个交易日,以每个股票的打分为 X,行业内权重为 W,做 加权平均,计算 28 个中信一级行业得分(剔除综合、综合金融)。选择得分最高的 6 个行业作为多头组合,得分 最低的 6 个行业作为空头组合,28 个中信一级行业等权作为基准组合。在下周的第一个交易日以开盘价调仓。 2014 年初至 2024 年 10 月 18 日,中信一级行业轮动组合多头年化多头超额收益 11.36%,收益波动比 1.37, 多空年化超额收益 22.71%,收益波动比 1.37,多头组合单边年化换手率 21.35 倍。
4.4、中证 1000 指增组合
中证 1000 指增组合 2015 年至 2024 年 10 月 18 日年化收益为 15.73%,年化信息比为 3.64,单边年化换手率 4.98倍。相对基准指数的年化超额收益为16.21%,收益波动比为3.91,收益回撤比为3.66。今年超额收益为7.11%。
编辑:火腿肠- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 4 房地产行业专题报告:城市更新推动高质量发展.pdf
- 5 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 6 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 7 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 8 投资策略:这一次,是金银的拐点吗?.pdf
- 9 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 10 宏观专题:俄乌冲突最新进展如何?.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年上半年小红书六大热门行业消费趋势洞察
- 2 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 3 2026年7月A股回调归因与底部布局策略分析
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
