基于知识蒸馏的AI选股模型优化与多源因子集成

  • 来源:财通证券
  • 发布时间:2026/05/27
  • 浏览次数:100
  • 举报
相关深度报告REPORTS

金融工程专题报告:基于知识蒸馏的AI选股模型优化.pdf

本文探讨了将知识蒸馏技术应用于量化选股领域的优化方法,旨在解决高频数据低信噪比导致的模型训练难题。研究选取一个在全市场具有稳定且较强选股能力的成熟综合选股模型作为Teacher,用其预测值作为蒸馏标签,引导基于不同数据集训练的Student模型学习成熟模型中的收益预测信息,同时保留各自数据集的差异化增量。在信号验证方面,研究在30分钟K线数据集和日频量价特征数据集上进行了对比实验。结果显示,蒸馏信号因子在多头超额收益和5日IC均值两个维度上均显著优于原始信号。例如,在30分钟K线数据集上,蒸馏信号因子多头超额提升至34.2%,5日IC均值提升至11.7%;在日频量价特征数据集上,蒸馏信号多头超...

引言:知识蒸馏在量化选股中的应用逻辑

量化选股模型的核心目标在于准确预测股票的横截面收益排序,进而构建能够持续跑赢基准指数的投资组合。近年来,深度学习技术在量化领域取得了显著进展,然而,模型训练过程中面临的一个核心挑战在于数据的低信噪比问题——特别是高频数据虽然包含了更为丰富的信息,但噪声同样被放大,导致模型难以有效学习到真实的收益预测规律。

与此同时,在大语言模型(LLM)领域,知识蒸馏(Knowledge Distillation)技术被证明是实现模型压缩与知识迁移的有效手段。知识蒸馏的核心思想是让轻量级的学生模型(Student Model)学习复杂教师模型(Teacher Model)已经学到的知识和表达,从而在保持性能接近的同时大幅降低模型复杂度。这一技术路径为量化选股领域面临的挑战提供了新的解决思路。

研究的核心思路是借用大模型蒸馏的思想,将一个模型(Teacher)学到的东西迁移到另一个模型(Student)上来,对选股模型进行知识蒸馏优化。具体而言,蒸馏标签在计算损失函数时,不使用真实收益率作为标签,而是采用Teacher模型的预测结果作为“蒸馏标签”,为Student模型提供更稳定的学习方向;对于分钟频等低信噪比数据集,引入成熟Teacher模型的预测结果可以提供更平滑的收敛方向,帮助模型克服噪声干扰;在借鉴Teacher模型的同时,Student模型仍保留自身数据集和模型结构可能带来的差异化表达,实现增量提升。

知识蒸馏框架与训练机制

研究将大模型领域成熟的知识蒸馏思想引入AI选股模型的训练过程。其基本思路是:选取一个在全市场具有稳定且较强选股能力的成熟综合选股模型作为Teacher,将其对训练样本的预测结果作为蒸馏标签,引导Student模型在真实收益标签之外,同时学习Teacher的预测分布;通过这种“软标签+硬标签”的联合监督方式,让Student模型既保留自身数据集的差异化信息,又能借助Teacher的引导降低低信噪比数据集的训练难度。

在量化选股领域,知识蒸馏具有独特的应用价值,主要体现在两个方面:一是辅助低信噪比数据集训练。分钟K线理论上包含更丰富的日内交易信息,但同时噪声更高、训练难度更大;直接使用真实收益标签训练时,模型容易受到噪声干扰,样本外表现通常弱于日频模型。引入Teacher模型预测作为蒸馏信号,可以为分钟模型提供更稳定的收敛方向,本质上是用成熟模型的收益判断,降低低信噪比数据集的学习难度。二是学习优秀选股模型的收益预测信息。不同选股模型对未来收益的刻画角度不同,预测结果中可能包含互补信息;优秀Teacher模型的预测值、排序关系和中间表征,可以作为额外监督信号;Student模型在学习Teacher的同时,仍保留自身数据集和模型结构带来的差异化表达。目标不是简单复制Teacher,而是在Teacher指引下挖掘可迁移、可增量的alpha信息。

蒸馏信号验证与模型构建

为了验证知识蒸馏在AI选股中的实际效果,研究选取两类典型数据集进行原始信号与蒸馏信号的对比分析:一类是噪声相对较高的分钟K线数据集,用于检验“辅助低信噪比数据集训练”;另一类是常见的日频量价特征数据集,用于检验“借助Teacher提供增量收益预测信息”。在30分钟K线数据集上,原始信号因子多头超额25.4%、5日IC均值9.3%,蒸馏信号因子多头超额提升至34.2%、5日IC均值提升至11.7%;在日频量价特征数据集上,原始信号多头超额25.9%、5日IC均值10.4%,蒸馏信号多头超额提升至32.1%、5日IC均值提升至11.1%。蒸馏信号相比原始信号在多头与IC两个维度均有明显提升。

在模型构建方面,研究基于“时序LSTM+截面图注意力”基础架构构建Student模型,分钟K线数据先经ResNet降维后进入时序网络,基本面信息在时序网络之后、截面网络之前与隐藏层拼接。以已验证有效的成熟综合选股模型作为Teacher,为蒸馏过程提供高质量监督信号。Teacher模型在过去五年中表现出较强的选股能力,整体多头组合年化收益达133.6%,多头超额收益为54.3%,5日IC均值为14.7%,体现出较高的信息稳定性与预测有效性。

多源蒸馏因子集成与综合绩效

研究一共使用5类数据集分别独立训练AI选股模型,覆盖从高频量价到日频量价、再到基本面信息的多样化特征。考虑到基本面信息与量价信息在时序与截面维度的差异化贡献,对每个数据集分别按“是否融合基本面数据”训练两次,最终在5个数据集上得到10组蒸馏Student因子,用于后续的多源蒸馏因子集成。10个网络模型得到的10组因子集合之间平均相关性约80%。在此基础上,分别使用LightGBM、Xgboost、CatBoost三类GBDT模型进行加权集成。三类GBDT模型基于相同的输入因子集合分别训练,其预测结果高度相关,平均相关性约90%。

进一步将三类GBDT模型的预测结果取简单平均,得到最终的综合因子。结果显示,蒸馏综合因子与基准综合信号的相关性约76%,二者在底层信号维度上具有较显著的差异,蒸馏框架带来的增量信息明显。同时,蒸馏综合因子与Teacher模型因子值的相关性约87%——这一相关性水平表明:综合因子较好地学到了Teacher模型的特征表达,但并非简单复制,仍保留了Student自身数据集和网络结构带来的差异化空间。从回测结果来看,综合因子2021年以来5日IC均值13.0%,多头组合年化超额收益50.0%;基准模型5日IC均值12.6%,多头超额44.0%,综合因子在等权复合后多头超额从44.0%提升到50.0%,IC从12.6%提升到13.0%,相对基准的增量信息较明显。

指数增强组合构建与表现

以综合信号作为alpha因子,研究通过组合优化构建沪深300、中证500和中证1000指数增强组合。组合构建过程中,统一采用如下风控约束进行历史回溯:交易费率按照双边0.3%计算交易成本;指数成分权重下限80%;调仓周期周度调仓;换手率约束单次调仓约束单边15%换手上限,年度单边换手率约8倍;风格暴露相对指数Barra风格因子暴露不超过0.3;行业偏离相对指数行业偏离上限2%。

基于综合因子构建沪深300指数增强组合,2021年以来,沪深300指数增强组合绝对收益年化8.8%,相对沪深300指数超额收益年化12.8%;组合年化跟踪误差4.3%,信息比2.88,历史相对最大回撤幅度为-4.1%。基于综合因子构建中证500指数增强组合,2021年以来,中证500指数增强组合年化收益18.7%,相对中证500指数超额收益年化15.8%;组合年化跟踪误差4.8%,信息比2.99,历史相对最大回撤幅度为-6.1%。基于综合因子构建中证1000指数增强组合,2021年以来,中证1000指数增强组合年化收益23.0%,相对中证1000指数超额收益年化20.1%;组合年化跟踪误差4.8%,信息比3.72,历史相对最大回撤幅度为-5.4%。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至