2025年因子选股系列专题报告:DFQ_FactorGCL,基于超图卷积神经网络和时间残差对比学习的股票收益预测模型

  • 来源:东方证券
  • 发布时间:2025/07/23
  • 浏览次数:550
  • 举报
相关深度报告REPORTS

因子选股系列专题报告:DFQ_FactorGCL,基于超图卷积神经网络和时间残差对比学习的股票收益预测模型.pdf

本报告为因子选股系列专题,重点介绍了一种名为DFQ_FactorGCL的创新股票收益预测模型。该模型深度融合了超图卷积神经网络(HypergraphConvolutionalNeuralNetwork)与时间残差对比学习(TemporalResidualContrastiveLearning)技术,旨在解决传统量化因子模型在捕捉复杂非线性关系及时间序列依赖性方面的局限性。研究核心在于利用超图结构建模股票间的高阶关联特征,并通过时间残差对比学习增强模型对时序动态变化的感知能力。通过这一混合架构,报告详细阐述了模型在提升股票收益预测精度、优化因子选股效果方面的具体应用与实证分析,为量化投资提供了新...

一、HIST 模型回顾

在前期报告《DFQ-HIST:添加图信息的选股因子挖掘系统》中,我们提供了 DFQ-HIST 模 型。HIST 模型(sHare Information for Stock Trend forecasting,基于图的可通过挖掘概念共享信 息进行股票趋势预测),由中山大学和微软亚洲研究院合作在 2022 年 1 月发布于 arXiv。DFQHIST 模型在原文模型基础上进行修改和优化,是一种新的股票收益率预测框架,能够充分挖掘股 票预定义概念和隐藏概念中的动态共享信息。

1.1 HIST 模型整体架构

HIST 模型的设计出发点是对“黑箱式时序预测模型”的反思:直接基于个股自身特征进行 收益预测,虽结构简单,但难以建模股票间的横截面共性关联,且中间表达过程不可控、不透明, 容易在样本外失效。 为此,HIST 模型借鉴了主动投资者“先看行业,再看风格,最后看个股”的分析顺序,提 出了一个三阶段建模逻辑,力图将传统神经网络的“黑箱过程”白箱化。具体而言,模型将原始 股票特征表示拆解为三类来源清晰、含义明确的信息路径:与行业等预定义结构相关的显式共性 信息、从股票特征中自动提取的隐式共性信息,以及剥离共性后留下的个股自身特征。对三部分 信息来源分别建模,从而增强预测逻辑的透明性与稳健性。

step1:股票时序特征编码模块(Stock Features Encoder)。 模型首先对每只股票的历史时序特征? ?进行建模,采用 GRU 作为编码器,提取其时序变化 趋势信息,得到当前时刻 t 的股票潜在特征表示(记作? ?,0)。此表示仍为个体视角,尚未引入股 票间的横截面交互信息。 step2 :股票间关联网络模块。 这是 HIST 模型的核心,采用创新的双重残差学习架构来精细化处理股票之间的复杂关联。 将上一步得到的股票潜在特征向量表示? ?,0,通过三个模块进行连续处理,每个模块都专注于提 取不同层面的信息: 1. 预定义概念模块(Predefined Concept Module):该模块旨在挖掘股票特征中与预定义 概念相关的共性信息。具体来看,该模块首先利用人工预定义的行业、业务等概念结构,构建股 票-预定义概念关联图。然后基于这些结构信息对初始股票表示? ?,0 进行聚合与重构,从而得到每 只股票在预定义概念视角下的特征表达,记作 p_shared_info。该表示仍处于股票维度,但已融 合了预定义概念层级的群体性特征,是对原始股票编码的一次结构化重构。该信息经过两个前馈 网络路径进行处理,生成两部分输出:一条用于预测股票收益率(记作 ?̂?,0),一条用于计算下 一层模块的输入(记作?̂?,0)。 2. 隐藏概念模块(Hidden Concept Module):该模块旨在挖掘股票特征中预定义概念无法 捕捉到的、更深层次的隐藏共性信息。具体来看,该模块首先将预定义概念模块提取出的股票共 性信息?̂?,0 ,从初始时序编码表示? ?,0中剔除,得到残差信息(记作? ?,1),即? ?,1 = ? ?,0 − ?̂?,0。 这个残差中可能仍包含一些未被预定义概念结构覆盖的潜在共性信息,反映更加隐蔽但具有一致 性的市场联动模式。为进一步挖掘这些隐藏的共性结构,该模块基于股票间特征相似性,动态构 建股票-隐藏概念关联图,并基于这些结构信息对残差股票表示? ?,1 进行聚合与重构,从而得到每只股票在隐藏概念视角下的特征表达,记作 h_shared_info。该表示仍处于股票维度,但已整合 了隐藏概念结构下的跨股票共性信息。随后,h_shared_info 同样经过两条前馈路径进行处理, 生成两部分输出:一条用于预测股票收益率(记作 ?̂?,1),一条用于计算下一层模块的输入(记 作?̂?,1)。 3. 个股信息模块(Individual Information Module):该模块旨在处理上述预定义概念和隐 藏概念都未能涵盖的、每只股票独有的个体特质信息。该模块的输入是初始时序编码表示中剥离 前两条路径提取的共性信息后剩余的残差向量(记作? ?,2),即? ?,2 = ? ?,0 − ?̂?,0 − ?̂?,1,用于提 取股票自身独有的、不可归于任何共享概念的个股特质性特征。该模块不再构建截面交互结构, 直接通过一条前馈路径进行处理,得到用于预测股票收益率的输出信息?̂?,2。 step3:聚合模块。该模块将 step 2 中三个子模块提取出的用于预测股票收益率的所有股票 信息汇总起来,得到合成后的股票特征信息表达(记作? ?),即? ? = ?̂?,0 + ?̂?,1 + ?̂?,2。再通过 一个全连接层对聚合后的信息进行进一步处理,最终得出模型对每只股票的预测收益率? ?。

1.2 HIST 模型核心要点

接下来,我们对 HIST 模型的核心要点进行拆解,全面分析模型的思想。

1.2.1 添加股票截面交互信息

尽管在工程实现中,传统时序预测模型(如 GRU、LSTM)的输入常采用N × K × SEQLEN 的面板数据形式,将多个股票数据同时输入模型进行并行计算,但其底层结构仍然将每只股票数 据视作独立的时间序列,分别建模和预测。这种方式实际上仍然是按股票独立建模的,假设每只 股票的未来收益仅由其自身历史特征序列所决定。 然而在实际金融市场中,股票收益往往表现出显著的横截面相关性,行业轮动、主题炒作、 机构抱团等现象会使得多个股票呈现同步涨跌的联动关系。因此,仅基于个股自身历史信息建模 难以充分挖掘这类系统性机会,模型的样本外泛化能力也易受市场风格变化影响。 HIST 模型在提取个股时序特征信息的基础上,引入“股票–概念”图结构建模个股间的关 联关系,有效融合股票间的横截面交互信息,提升模型对群体联动信号的建模能力。具体来看, 模型首先设置股票时序特征编码模块,提取股票自身的历史时序特征信息。再将编码后的股票信 息输入股票间关联网络编码模块,融合图信息,对因子选股效果进行进一步的增强。

1.2.2 股票间关联信息的来源

HIST 模型将股票之间的关联信息来源划分为两类:一类是基于行业分类、主营业务关联等 人工标注的预定义概念,另一类是人脑无法直接观测和理解,但可通过数据挖掘发现的隐藏概念。 通过融合这两类概念信息,HIST 构建出更加全面且灵活的股票关联结构,既保证了模型的可解释 性,也扩展了对潜在联动关系的覆盖能力,弥补了传统概念标签方法中静态、冗余、遗漏等问题。

1.2.3 概念信息的提取

HIST 模型中的“股票-概念”关联网络是动态构建的,基于“人工预设概念标签 + 特征相似 度调整”生成。关联网络构建出之后,HIST 模型采用矩阵乘积机制,利用股票特征信息,聚合 生成每个概念的特征表示,从而实现概念信息的提取,作为后续股票收益预测的基础。

1.2.4 个股信息和概念信息的融合

在得到概念的特征表示后,需要将概念信息注入股票特征中,也就是基于概念信息对股票特 征进行聚合与重构,从而得到股票在概念视角下的特征表达,这一步骤即为个股信息和概念信息 的融合。 在实现个股信息和概念信息的融合时,HIST 模型采用 “基于余弦相似度的注意力权重计算 + 矩阵乘积”机制。首先使用类似注意力机制的方式,计算不同概念对每只股票的重要性权重, 而后结合矩阵乘积进行概念信息注入。 以预定义概念为例(隐藏概念模块采用相同逻辑),个股信息和概念信息的融合流程如图 5 所示,具体解释如下: a.相似度计算:计算初始股票特征与修正后的概念特征?? ?,1之间的余弦相似度。 b.归一化权重:使用 softmax 函数对每只股票在所有概念上的相似度进行归一化,从而得到 从概念到股票的聚合权重β?,? ? 。这个权重矩阵展示了每个概念对特定股票的重要性程度。 c. 加权聚合:使用该权重矩阵对概念的向量表示进行加权,得到融合了概念信息后的每只股 票的向量表示?̂ ?,0。这一步实质上就是矩阵乘积算法的应用,将概念信息根据其重要性 “注入” 到每只股票的特征中。 这一机制结构简洁透明,融合过程使用基础线性代数操作,不依赖复杂神经结构,权重矩阵 的计算和归一化过程清晰可见,有助于追踪每个概念在个股特征中的具体贡献。

1.2.5 级联残差结构

HIST 模型采用级联残差结构,将股票收益的驱动因素划分为三类,并按“由共性到个性” 的顺序逐层提取、依次建模。与传统模型将所有特征一次性处理不同,HIST 更像一位经验丰富 的分析师,能够抽丝剥茧、逐步识别不同信息来源的影响,厘清股票收益的形成路径。

1. 预定义关联信息提取

第一层关注行业、主营业务等预定义概念关联信息。该层生成的特征一方面用于收益预测, 一方面以残差形式将未解释的信息传递至下一层。类似于分析一只科技股时,首先判断其是否受 AI、5G 等产业趋势影响。

2.隐藏关联信息提取

第二层挖掘未被预定义概念覆盖的潜在结构性关联信息,如供应链关系、风格归属等。该层 生成的特征一方面参与收益率预测,一方面以残差形式将未解释的信息继续传递至下一层。类似 于分析一家公司时,除了明确的行业归属,还会观察它是否“跟谁走得近”。

3. 个股特质信息建模

最后一层建模个股自身无法归类于任何概念的独特信息,如治理能力、信息披露质量、管理 风格等,用于解释收益预测中的“个性化部分”。类似于分析一家公司时,除了分析股票间的群 体联动信号外,还要关注股票自身特质化的信息。 这种级联残差结构具备以下优势:a. 简化学习任务,聚焦核心驱动。每一层仅需解释前一层 未覆盖的残差信号,使得学习过程更聚焦,模型训练更高效。b. 融合多维视角,构建完整认知。 多层残差学习机制确保了不同来源的信息都被完整保留,从而生成更完整、稳健的收益预测。

1.3 HIST 模型的“类图神经网络”结构设计

虽然 HIST 模型在利用股票间关联信息建模的过程中,并未显式采用图神经网络(GNN)中 常见的结构模块,如 GCN 或 GAT 等标准算子,但其核心结构与 GNN 的设计理念高度契合。 在“概念信息的提取与回传”过程中,HIST 构建了一个“股票—概念—股票”的信息流通 路径,与图神经网络中的“节点–超边–节点”结构高度类似,实质上隐式实现了图神经网络中 的节点聚合与消息传递机制。 具体而言:在 HIST 模型中,每一只股票都可视为图中的一个节点,而概念(包括预定义概 念和隐藏概念)相当于连接这些节点的“中介节点”或“虚拟超节点”。模型通过以下两个阶段 实现概念层与股票层之间的双向信息交互:

阶段一:股票 → 概念

模型首先计算股票特征与概念特征之间的余弦相似度,作为关联权重(即股票对各概念的注 意力权重),并进行归一化(softmax)。随后,使用这些权重对所有股票特征进行加权聚合,从 而生成每个概念的特征表达,类似于 GNN 中对邻居节点信息的聚合操作。

阶段二:概念 → 股票

在概念特征更新后,模型再次计算概念到股票的相似度权重,将概念表示回传至股票节点, 生成股票在当前概念视角下的“因子驱动表达”。这一过程本质上与图神经网络中的“消息传递 —节点更新”过程完全一致。 但与传统图神经网络依赖静态图结构不同,HIST 模型中的图结构是动态构建的,基于“人 工预设概念标签 + 特征相似度调整”生成。这种机制本质上是通过特征驱动的自适应图生成方式, 避免了传统 GNN 对人工图结构的依赖。

1.4 HIST 模型的非线性因子模型理解视角

HIST 模型通过三路径结构划分股票特征信息,在投资者层面具有较好的直觉解释力。然而, 这种路径划分仍主要依赖经验设定,缺乏从理论模型出发的系统性推导。为弥补这一不足,我们 尝试从因子建模的角度对 HIST 模型结构进行重构性解读,建立起其与非线性因子模型之间的对 应关系,从而为模型提供更清晰的理论解释基础。

1.5 HIST 模型不足之处

HIST 模型在股票关联信息的建模方面具备一定的结构创新性,其建模思路借鉴了主动投资 者的分层分析逻辑,具有较强的直觉合理性,容易被投资者理解和接受。也可以在非线性因子模 型的视角下进行理解,具有一定的理论解释基础。然而,模型在具体实现上仍较多依赖人工设定 的规则与经验,在概念信息的提取和融合等关键环节,主要依靠人为设计,缺乏严谨的数学推导 或理论基础支撑。具体来看,HIST 模型存在以下几个方面的不足:

1.5.1 隐藏概念构建机制粗糙

HIST 将市场中所有股票作为隐藏概念的候选集合,并基于 Top-K 相似度选取强关联个股, 模拟潜在“隐藏概念”。这种构造方式存在以下问题:

1. 缺乏高层次语义抽象能力

HIST 模型将个股本身视为隐藏概念的候选单元,意味着隐藏概念仍处于微观个体层面,缺少 对更高层次市场结构的建模能力,如:赛道、主题、风格等。

2. 初始构建粗糙,表达稳定性不足

HIST 模型通过特征相似度选取 Top-K 股票构建隐藏概念,未引入明确结构约束,难以区分 真实潜在关系与偶然相似。部分入选隐藏概念虽与目标股票短期特征相近,但可能缺乏共性驱动, 易引入噪声,导致隐藏概念表达不稳定、语义不清晰。

1.5.2 概念关联权重生成方式失真

HIST 模型在计算股票与概念之间的关联程度时,主要依赖“余弦相似度 + softmax”的两步 权重生成机制。这一做法存在两个关键问题:

1. 余弦相似度忽略模长信息

HIST 使用余弦相似度来衡量股票与概念之间的关联。余弦相似度只衡量向量间的方向一致性, 忽略了向量的模长信息。而在金融场景中,特征模长往往承载着关键的量级信号,例如市值、交 易量或波动率等。这意味着,即便两只股票的特征方向完全一致(即余弦相似度为 1),如果一 只市值为 2000 亿、另一只仅有 20 亿,它们在与某一概念的加权过程中可能被赋予相同权重。

2. softmax 归一化进一步扭曲了权重分配

softmax 强制将所有相似度归一化为 [0,1] 区间并设置总和为 1,其本质是一种相对排名机制, 强调“谁更相似”而非“有多相似”。即使所有相关性都普遍偏低(如 [0.05, 0.04, 0.03]), softmax 仍会将最高的那个放大为主要权重,人为制造“赢家通吃”的结果,误导聚合表达。

1.6 HIST 模型绩效

按照前期报告《DFQ-HIST:添加图信息的选股因子挖掘系统》中给出的 DFQ-HIST 模型, 基于 60 个量价特征为特征,以 20 天收益率作为标签,使用研报中的模型超参数,HIST 基础模型 绩效表现如下: 测试集上 rankic 达到 16.03%,rankicir 达到 1.16,20 分组多头日度超额年化收益率达到 28.01%,多头日超额收益夏普比 2.90,多头日度超额收益最大回撤 8.76%。2024 年模型 rankic 降低为 14.05%,但 20 分组多头日度超额年化收益率为 35.18%,仍然稳健。

综合来看,HIST 模型的整体架构设计较为合理,具备良好的可拓展性。然而,其在路径构 建机制与结构表达能力方面仍存在前述不足。为此,本研究在 HIST 模型基础上进行改进,提出 引入超图卷积神经网络(HyperGCN)与时间残差对比学习(TRCL)两项关键技术,构建新模 型 FactorGCL,以提升其在股票收益建模中的结构表达能力与泛化性能。

二、HIST-HyperGCN 模型

在这一部分中,我们引入图卷积神经网络(HyperGCN)技术,对 HIST 模型进行改进,给 出 HIST-HyperGCN 模型,旨在解决 HIST 模型中“隐藏概念构建机制粗糙”、“概念关联权重 生成方式失真”、“概念交互机制结构表达能力不足”这三点不足。

2.1 超图(Hypergraph)介绍

超图是对传统图的一种泛化。在传统图中,一条边只能连接两个顶点。而超图允许一个超边 连接任意数量的顶点。 顶点 (V):代表我们直接关心的个体,如沪深 300 中所有个股。 超边 (E):代表这些实体之间存在的多对多(高阶)关系。一个超边可以包含两个或更多个 顶点,形成一个“组”或“集合”。如小市值风格股票池即为一条超边。

在金融市场中,股票之间常常呈现出群体性联动特征,这种高阶关系难以用传统图(一对一 连接)有效建模。超图通过一对多的超边结构,可从两个维度刻画市场中的联动机制:a. 因子驱 动路径:将“行业”“主题”“风格”等因子视作超边,连接所有受该因子共同影响的股票,构 建“因子—股票”群组结构,反映市场中基于外部信息的一致性行为;b. 结构传导路径:将具有 关联关系(如供应链、重仓、交叉持股等)的一组股票作为一个超边,刻画个股间潜在的联动或 传染路径。

2.2 超图卷积神经网络(HyperGCN)介绍

2.2.1 HyperGCN 原理

图是一种用于建模实体间关系的结构工具,但若希望从图结构中自动提取可预测的特征表示, 就需要引入图神经网络(GNN)。其中,图卷积神经网络(GCN)是最基础、最广泛应用的一类 方法。GCN 通过邻接关系传播信息,实现节点间的特征融合。在此基础上,超图卷积神经网络 (HyperGCN)利用超图结构,将传统图中的“成对连接”拓展为“多点连接”,即引入超边连接多个相关节点。相比传统 GCN 仅能捕捉局部配对关系,HyperGCN 能够直接建模群体行为模 式与高阶因子驱动结构,为表达股票间复杂联动提供了更强的结构建模能力。

超图卷积的建模逻辑:节点—超边—节点的信息传播

超图卷积通过双阶段的信息传递机制,在“节点—超边—节点”的结构中流动信息,让每个 节点的表达不仅包含自身特征,还融入了它所参与的多个群体的集体特征。

第一阶段:节点到超边

每条超边会收集它所连接的所有节点的特征,形成一个聚合后的“群体表示”。例如,一个 “AI 芯片”概念的超边,会汇聚英伟达、寒武纪、AMD 等相关股票的当前特征,形成“该主题目 前的整体状态”。

第二阶段:超边到节点

接下来,每个节点会从它所参与的超边中反向接收信息。例如,一只 AI 概念股,除了拥有自 身的财务、价格等特征外,还能融合“AI 芯片”这个超边聚合后的行业特征。同时,如果它还属 于“半导体板块”或“高研发投入”风格等其他超边,也会一并接收并整合这些信息。

2.2.2 HyperGCN 核心建模逻辑

在股票收益预测视角下,超图卷积神经网络(HyperGCN)的核心建模逻辑如下:

1. 构建“股票—因子(概念)”超图结构

a. 节点(V):表示当前截面上的所有股票,共 N 个。 b. 超边(E):表示预定义的因子群体,共 M 个。如 AI、新能源车、中字头等概念。 c. 连接关系(H):表示股票节点与超边之间的的多对多连接关系。如果股票 vi 属于因子 ej, 则 Hij=1,否则为 0。

2. 超图卷积的前向传播机制

在图神经网络(GNN)里,所谓“传播”,指的是:一个节点能把它的特征信息,按照连接 关系和权重,有控制地传递给其他节点,而不是简单的“加权平均”或“堆在一起”。所以需要做两件事:确定连接结构 —— 谁和谁相连;保证传播强度可控 —— 不能让度数高的节点过分主 导,或度数低的节点信号被冲淡。 HyperGCN 模型的前向传播核心在于:通过构建一个对称归一化的超图特征传播算子,实现 信息在“股票 → 因子(概念)→ 股票”上的传播,从而捕捉股票间的高阶群体联动关系。这一 传播机制可以实现概念层级的特征聚合与回传,确保信息在群体结构中的均衡扩散。

2.3 HIST-HyperGCN 模型具体做法

HIST-HyperGCN vs HIST

为详细说明 HIST-HyperGCN 相较原 HIST 在结构设计上的差异与优势,我们从以下四个核 心维度进行展开对比:

1. 预定义概念的建图方式:从动态特征相似度调整 → 静态 0-1 超图结构

原 HIST 做法:使用行业分类、主营业务标签等人工预设的预定义概念作为股票之间的关联 基础。但考虑到这些标签往往存在覆盖不全、冗余交叉、更新滞后等问题,HIST 并不直接采用静 态的 0-1 二值概念矩阵,而是在此基础上进行调整,进一步基于特征相似度计算股票与概念的关 联强度,从而形成一个连续权重矩阵。即认为:每只股票可能与所有概念相关,只是强弱不同。 HIST-HyperGCN 做法:直接采用人工设定的 0-1 二值关联矩阵作为预定义因子模块所采用 的关联矩阵?? ?。明确标定股票是否属于某一概念,不再做基于特征的动态调整,形成一个训练前 固定的静态超图结构作为输入。 改进优势:a. 避免余弦相似度误差,提高建图稳定性。直接使用明确的 0-1 概念标签,不再 依赖高维特征相似度的动态计算,消除了特征波动带来的关联偏差,更有利于图结构稳定训练。 b. 静态图结构更适配图卷积建模。由于超图结构在训练前即已构建完成,后续可直接通过统一的 超图卷积操作对所有节点(股票)进行信息传播与聚合,减少了训练过程中的图更新成本,提高 了模型整体的结构效率与计算稳定性。c. 更符合概念知识图谱的先验逻辑。行业归属、主题标签 本身就具有稳定性和人为先验的属性,用静态图表示更加贴合现实的知识结构,增强了模型对 “已知概念结构”的利用能力。

2. 隐藏概念的构建机制:从局部相似性聚合 → 可学习的全局因子原型

原 HIST 做法:不显式设定一组固定的隐藏概念,而是通过股票之间的局部相似性动态生成 隐藏概念特征。股票与隐藏概念之间的关联权重 β由个股在残差空间中的相似度决定,隐藏概念 表示则是以此β加权的聚合结果。换言之,每只股票的隐藏概念表达,实质上是“由我最相似的 那几只股票的特征加权得出”。这种方式下的隐藏概念并不具备稳定的定义或结构,其表示随样 本特征和相似度变化而变化,属于一种相对相似性驱动的概念建构方式。 HIST-HyperGCN 做法:隐藏概念不再依赖于其他股票的特征来动态生成,而是引入一组可 学习的因子原型C ∈ ? ?×?,作为隐藏概念的特征表示,每一行??代表一个固定的隐藏概念。这些 因子由模型在训练过程中直接学习得到,具有稳定性和全局性,在时序上保持不变。股票与隐藏 概念之间的关联权重 ?ℎ ?由股票特征与因子原型之间的内积计算而来,再通过 Sigmoid 函数归一化 为 0-1 之间的关联强度,即?ℎ ? = sigmoid(X ?? ? )。这种方式的核心思想是:先定义出一组清晰的因 子,再看每只股票与这些因子的关系,强调的是“我受哪些因子影响”,而不是“我像哪几只股 票”。将隐藏概念建模从基于相似度的相对构造,转变为面向因子的绝对表达。 改进优势: a. 摆脱对相似股票的依赖,更稳定。HIST 中,隐藏概念由“谁像我”决定,高 度依赖股票之间的相似性排序,受市场状态、特征波动等影响较大,且缺乏统一的、结构化的语 义表达。HIST-HyperGCN 直接学习概念原型,结构固定,显著提升概念表达的稳定性与一致性。 b. 建模抽象因子,更具结构表达力。因子原型法让隐藏因子从“相似股票集合”跃升为“抽象因 子集合”,实现对市场结构共性的统一建模。c. 贴近金融因子建模,更易解释和归因。股票与原 型之间的内积可以理解为“因子暴露”,符合金融学中“收益 = 因子 × 暴露”的经典建模方式。 d. 减少参数量,提升训练效率。模型只需学习少量因子原型,即可覆盖全市场的因子表达需求。相比传统方式为每个股票构建独立关联,原型方法在保持表达力的同时显著压缩参数量,提升泛 化性能与训练效率。

3. 关联权重的生成机制:特征相似度驱动 → 超图结构驱动

原 HIST 做法:采用“余弦相似度 + softmax”方式生成股票与概念之间的关联权重β。具体 而言,先计算股票特征与概念特征之间的余弦相似度,衡量它们在方向上的一致性;随后通过 softmax 归一化,将相似度转化为加权系数,作为信息聚合过程中的“注意力权重”。这一做法 属于特征相似性驱动下的权重构造机制,强调“我像哪个概念,我就更受它影响”。 HIST-HyperGCN 做法:不再依赖“相似度 + softmax”的加权方式,而是将股票与概念之间 的关系编码进一个超图结构中,利用图神经网络中的结构归一化传播算子,在结构基础上确定信 息传递的强度。具体而言,股票与概念之间的初始连接关系β由超边连接矩阵? 给出,可理解为 某只股票对各概念的初始暴露情况;但最终的信息传播强度,即“概念对股票的影响力”并不是 ?,而是通过超图卷积中的归一化传播算子,综合考虑节点度、超边度与超边权重计算得出的。 这种方式属于结构驱动的权重构造机制,强调“我在某个概念上的参与程度如何,这个概念又如 何通过图结构参与我的特征生成”。 改进优势:a.更合理地融合强度信息:由于不再对特征向量强制单位化,原始特征的模长 (如市值、波动率等“强度”信号)可以自然保留并参与聚合过程;b.规避 softmax 带来的非线 性压缩与偏差放大:归一化操作基于连接结构而非特征数值大小,使得权重分配更平滑,避免了 “赢家通吃”的信息失衡问题;c.具备更强的结构表达能力:归一化方式天然适配图结构,易于 扩展至多类超边、多阶关联、异构图等复杂金融结构。

4. 概念信息的传播机制:从基于注意力的规则式聚合 → 可学习的一体化超图卷积传播

原 HIST 做法:采用“股票 → 概念 → 股票”的两阶段加权结构完成信息交互。在第一阶段 中,先利用余弦相似度 + softmax 生成的关联权重,将所有股票的特征按权重加权,生成每个概 念的特征表示;在第二阶段中,再基于概念与股票之间的相似性,重新计算注意力权重,将概念 特征回传至每只股票,生成股票的共享信息表示。这个过程本质上是两次基于特征相似度的注意 力加权平均,整个信息聚合过程不包含可学习参数,属于规则驱动的显式融合路径。 HIST-HyperGCN 做法:同样遵循“股票 → 概念 → 股票”的信息路径,但聚合过程由一个 统一的超图卷积传播算子完成,将两阶段的信息流整合为一次结构归一化传播。同时,模型在传 播前加入了可学习的线性变换层,用于对原始股票特征进行映射,使得模型能够自动学习更有效 的因子表达方式,具备更强的特征提取与适应能力。 改进优势:a. 聚合过程更简洁统一:信息传播整合在一次算子运算中,避免手动设定多轮注 意力机制所带来的计算开销和信息退化问题;b. 具备学习能力:引入可学习参数,使模型能对信 息融合方式进行训练优化;c. 具备谱域理论支撑:传播机制源自谱图理论中的归一化特征传播算 子,支持更稳定的训练与非线性表达;d. 扩展性更强:可引入多阶邻接、结构注意力或异构超边 等设计,更好捕捉复杂的群体关系与市场结构。

2.4 HIST-HyperGCN 模型绩效

引入 HyperGCN 技术可以带来预测稳定性与多头选股能力的提升:

1.预测稳定性提升: 在引入 HyperGCN 后,RankIC 从 HIST 的 16.03%降至 15.70%。但 ICIR 从 HIST 的 0.98 上 升到 1.02;RankICIR 从 1.16 上升到 1.20。 这表明,尽管因子平均预测能力(RankIC)略有波动,但其在时间序列上的稳定性 (ICIR/RankICIR)却得到了增强。背后逻辑在于:HIST-HyperGCN 所引入的**因子原型机制 (Factor Prototype)**为股票与概念之间提供了更稳定、结构化的关联表达,从而生成更稳定的 Beta 矩阵。这使得模型不再依赖短期特征相似性带来的“噪声驱动”关联,而是能更持续地识别 潜在因子的长期影响。 2.多头选股能力的显著增强: 在多头表现方面,多头夏普比率从HIST的 2.90显著提升至 3.47。多头年化超额收益从 HIST 的 28.01%上升到 31.52%。这展示了 HyperGCN 改进后模型更强的多头选股能力。这一提升说 明模型在识别高质量 alpha 信号方面更具穿透力。HyperGCN 所构建的超图结构,有助于模型准 确聚合多个概念维度的信息,形成对“上涨潜力股”的更清晰刻画,强化了多头方向的 alpha 提 取能力。 3.不同特征变换矩阵对模型效果的重要性: 第三行和第二行的消融实验显示,不同 Beta 层(预定义 Beta 与隐藏 Beta)采用独立的特征 变换矩阵能提升模型性能。这说明两种因子结构所需的特征表达粒度存在差异,预定义 Beta 层更 侧重于对外部概念结构的建模,而隐藏 Beta 层则关注对个股潜在风格的抽象表达。因而为两者分 配专属的变换能力,能提升模型对多层次因子结构的适应能力,增强整体表达力与泛化能力。

三、DFQ-FactorGCL 模型细节

3.1 数据说明

样本空间:中证全指同期成分股。 数据区间:(1)训练集2014.01.01—2018.11.30;(2)验证集2019.01.01—2019.11.30; (3)测试集 2020.01.01—2025.3.31。数据集中额外的分割间隙是有意引入的,以避免特征和标 签的泄露。训练集用于迭代训练模型,通过反向传播算法计算损失函数关于模型参数的梯度,然 后按照梯度方向更新模型参数。验证集用于在模型训练过程中评估模型的性能,便于选择最优的 模型和参数。测试集用于观察模型样本外的表现,在模型开发完成后评估模型的泛化性能。 数据处理方法:(1)解释变量 X:按每日截面做 Z-score 归一化 + clip(-3,3),用 0 填充缺 失值。训练集、验证集、测试集相同处理;(2)预测标签 Y:截面取 csranknorm 分位标准化。 训练集、验证集相同处理。 针对 Y 的多种处理方式,测试显示:(1)使用绝对收益的 zscore 标准化:增添了预测未来 收益率分布的困难,因为这个分布会收到市场波动的影响,但实际只需要预测未来收益的排名, 数值上的分布并不重要。(2)使用绝对收益的排名分位数,效果有明显提升,再取 zscore 标准 化,效果还有提高。转为排名分位数可以在学习过程中减少异常收益带来的影响,并且百分位数 是均匀分布的,不受市场波动影响,可以提升数据稳定性。对排名分位数再取 zscore 标准化可以 扩大数据范围,更容易预测。

模型输入特征:量价特征,包括原始日线行情、基于分钟线提取的日频特征、基于 level2 数 据提取的日频特征等共 60 个。 我们尝试了两类输入:基础特征、alpha 因子。结果显示:(1)从输入来看,用基础特征因 子作为输入效果最好;用遗传规划和强化学习因子作为一个整体输入效果较差,在各项指标上都 弱于前者。

模型输入特征:量价特征,包括原始日线行情、基于分钟线提取的日频特征、基于 level2 数 据提取的日频特征等共 60 个。 我们尝试了两类输入:基础特征、alpha 因子。结果显示:(1)从输入来看,用基础特征因 子作为输入效果最好;用遗传规划和强化学习因子作为一个整体输入效果较差,在各项指标上都 弱于前者。

3.2 随机种子影响

我们测试了 5 个不同随机种子下,DFQ-FactorGCL 模型的绩效表现和相关性。可以看到, 随机种子模型结果对多头端的表现有一定影响:(1)不同种子下,月均 RANKIC 在 15.62%到 15.98%之间比较稳定;多头收益率在 28.00%到 31.55%之间;(2)不同随机种子下得到的模型 因子值相关系数在 95%以上,多头超额收益相关性在 90%以上。

四、DFQ-FactorGCL 模型结果

4.1 训练情况

DFQ-FactorGCL 模型在第 64 个 epoch 达到早停,训练用时 2h47min 左右。在中证全指成 分股中训练的显存占用在 5G 左右。 我们监测了训练过程中,每个 epoch 的损失值变化和 IC 变化。可以看到:(1)前三个 epoch 损失值下降明显,第 5 个 epoch 出现明显反弹,后面处于震荡缓慢下降状态。(2)前十个 epoch 的 IC 和 RANKIC 上升明显,后面增速放缓,但总体每个 epoch 上训练集、验证集、测试 集中 IC 都呈上升趋势,模型未出现明显过拟合。(3) 损失值的三个部分均保持一致的振荡趋势, 其中时序对比学习与截面对比学习的损失值有很高的相关性,显示时序对比学习的目的与截面对 比学习是一致的;同时两者均震荡幅度较大,在训练中增加对比学习的损失权重 gamma 会影响 训练的稳定性;MSE 损失曲线较为平缓。(4)RANKIC 在测试集和验证集数值接近,表示残差 对比学习提升了模型防止过拟合的能力。

4.2 因子绩效分析

本节展示 DFQ-FactorGCL 模型得到的因子得分(FactorGCL),在中证全指、沪深 300、 中证 500、中证 1000 四个股票池中的表现。 测试区间为 2020.1.1-2025.05.31。绩效指标计算细节如下:(1)IC 和 RANKIC 采用因子得 分和 20 日收益率标签计算得到,日度平均,ICIR 和 RANKICIR 未年化。(2)多头指标计算时, 沪深 300、中证 500 股票池中分组数为 5,中证 1000 股票池中分组数为 10,中证全指股票池中 分组数为 20。(3)多头组合月频调仓,绩效依次展示:日度超额年化收益率、日超额收益夏普 比、日度超额收益最大回撤、月度胜率、月均单边换手。此处的多头计算不考虑交易成本,但汇 报了月均单边换手率,费后收益可以根据费前收益和换手率近似估算。

中证全指股票池

在中证全指股票池中,DFQ-FactorGCL 模型整体表现较好,分组单调性较好。 1. 测试集上 IC 达到 12.46%,ICIR 为 1.05,RANKIC 达到 16.14%,RANKICIR 达到 1.22。 2. 20 分组多头超额年化收益达到 32.65%,多头日超额收益夏普比 3.59,多头日度超额收益 最大回撤 7.75%,多头月度胜率 85%,月均单边换手 75%。 3. 2025 年前 5 个月 IC 达到 14.72%,ICIR 为 1,RANKIC 达到 20.32%,RANKICIR 达到 1.3,均为 2020 年以来最高。20 分组多头超额收益 16.13%,最大回撤 1.48%。

沪深 300 股票池

在沪深 300 股票池中,DFQ-FactorGCL 模型整体表现较好,分组单调性较好。 1. 测试集上 IC 为 8.71%,ICIR 达到 0.49,RANKIC 达到 10.61%,RANKICIR 达到 0.57。 2. 5 分组多头超额年化收益达到 12.37%,多头日超额收益夏普比 1.41,多头日度超额收益 最大回撤 10.07%,多头月度胜率 68%,月均单边换手 50%。 3. 2025 年前 5 个月 IC 达到 11.62%,ICIR 为 0.5,RANKIC 达到 12.53%,RANKICIR 达到 0.55,均为 2020 年以来最高。5 分组多头超额收益 5.07%,最大回撤 4.48%。

中证 500 股票池

在中证 500 股票池中,DFQ-FactorGCL 模型整体表现较好,分组单调性较好。 1. 测试集上 IC达到 7.86%,ICIR达到 0.50,RANKIC达到 10.74%,RANKICIR达到 0.69。 2. 5 分组多头超额年化收益达到 12.53%,多头日超额收益夏普比 1.71,多头日度超额收益 最大回撤 7.75%,多头月度胜率 66%,月均单边换手 56.62%。 3. 2025 年前 5 个月 IC 达到 6.03%,ICIR 为 0.28,RANKIC 达到 6.22%,RANKICIR 达到 0.32。5 分组多头超额收益 3.97%,最大回撤 2.72%。

中证 1000 股票池

在中证 1000 股票池中,DFQ-FactorGCL 模型整体表现较好,分组单调性较好。 1. 测试集上 IC 达到 11.32%,ICIR 达到 0.84,RANKIC 达到 13.77%,RANKICIR 达到 0.98。 2. 10 分组 多头超额年化收益达到 20.61%,多头日超额收益夏普比 2.59,多头日度超额收益 最大回撤 7.34%,多头月度胜率 80%,月均单边换手 70%。 3. 2025 年前 5 个月 IC 达到 13.89%,ICIR 为 0.69,RANKIC 达到 16%,RANKICIR 达到 0.77。10 分组多头超额收益 10.69%,最大回撤 2.91%。

4.3 模型相关性

DFQ-FactorGCL 因子与 HIST 因子的相关性最高,因子值相关系数为 87.91%,多头超额收 益序列相关系数为 83.75%;另外和 FactorVAE、FactorVAE-new、Diversify 等模型的相关性 也比较高,因子值相关系数在 80%以上,多头超额收益序列相关系数在 75%以上。

五、指数增强组合结果

指数增强组合构建说明

(1)回测期:2020.01.01-2025.6.30,组合月频调仓,假设根据每月末个股得分在次日以 vwap 价格进行交易。 (2)组合约束:风险因子库(参见《东方 A 股因子风险模型(DFQ-2020)》)中所有的风 格因子相对暴露不超过 50%,所有行业因子相对暴露不超过 2%。沪深 300 增强跟踪误差约束不 超过 4%,中证 500 和 1000 增强跟踪误差约束不超过 5%。个股权重设置上限约束,绝对权重上 限设置为 1.5 倍基准权重+2%。限制指数成分股权重占比不低于 80%。 (3)考虑交易成本:假设买卖手续费双边千三,停牌涨停不能买入、停牌跌停不能卖出。

沪深 300 指数增强组合

DFQ-FactorGCL 模型得到的因子得分在沪深 300 指增组合中表现十分突出: (1)整体表现:2020 年以来年化信息比达到 2.20,年化对冲收益 12.14%,年化跟踪误差 5.28%,超额收益最大回撤 6.79%,单边年换手 7.35 倍。 (2)分年表现:2020-2023 每年取得 10%以上的正超额,2024 年超额收益为 5.72%,2025 年前 6 个月超额收益为 3.78%。 DFQ-FactorGCL 模型下的沪深 300 指增组合:(1)相对基准沪深 300 指数,在市值、信 息确定性、成长、BETA、流动性、波动率、维度具有明显的负向暴露。(2)20-25 年的指增超 额收益中有 66%来自特质收益,风格因子贡献 27%,行业因子贡献 8%。

中证 500 指数增强组合

DFQ-FactorGCL 模型得到的因子得分在中证 500 指增组合中表现十分突出: (1)整体表现:2020 年以来年化信息比达到 1.86,年化对冲收益 11.68%,年化跟踪误差 6.04%,超额收益最大回撤 8.01%,单边年换手 9.05 倍。 (2)分年表现:2020-2023 每年取得近 10%以上的正超额,2024 年超额收益为 5.70%, 2025 年前 6 个月超额收益为 5.07%。 DFQ-FactorGCL 模型下的中证 500 指增组合:(1)相对基准中证 500 指数,在市值、波 动率、信息确定性、成长、TREND、流动性维度具有明显的负向暴露。(2)20-25 年的指增超 额收益中有 44%来自特质收益,风格因子贡献 52%,行业因子贡献 4%。

中证 1000 指数增强组合

DFQ-FactorGCL 模型得到的因子得分在中证 1000 指增组合中表现十分突出: (1)整体表现:2020 年以来年化信息比达到 2.34,年化对冲收益 16.39%,年化跟踪误差 6.62%,超额收益最大回撤 7.31%,单边年换手 9.75 倍。 (2)分年表现:2020-2023 每年取得 10%以上的正超额,2024 年超额收益为 1.48%,2025 年前 6 个月超额收益为 3.22%。 DFQ-FactorGCL 模型下的中证 1000 指增组合:(1)相对基准中证 1000 指数,在市值、 波动率、TREND、流动性、成长、信息确定性维度具有明显的负向暴露。(2)20-25 年的指增 超额收益中有 67%来自特质收益,风格因子贡献 31%,行业因子贡献 2%。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至