动量Transformer模型及改进有哪些?

动量Transformer模型及改进有哪些?

最佳答案 匿名用户编辑于2025/06/17 09:07

Kieran Wood 等人在《Trading with the Momentum Transformer: An Intelligent and Interpretable Architecture》一文中提出了一种创新的时序动量交易策略,使用动量 Transformer 模型来优化资产的仓位管理。

1.动量Transformer模型

主体仍为多头自注意力机制,便于并行挖掘不同历史时点之间的关键依赖关系, 捕捉潜在的趋势结构与转折信号。各个注意力头在训练过程中自动学习不同的时间关注模 式,从而增强模型对跨周期动量特征的感知与表达能力。 与传统机器学习模型输出分类标签或回归数值不同,动量 Transformer 的输出是资产 仓位。若对应无杠杆的多空策略,输出在[-1, 1]之间。此外,在损失函数的设计上,模型 跳出了传统均方误差(MSE)等回归类损失的框架,转而采用夏普比率进行优化。通过将 收益与风险控制目标直接融入训练过程,模型能够在实际应用中实现更优的风险收益特征。

Kieran Wood 等人将动量 Transformer 模型应用于美国市场,构建了一个包含 50 种 流动性最高的期货合约的资产组合,应用多种动量策略,回测了 1995 年至 2020 年长达 25 年的收益表现。

2. 动量Transformer模型在A股上的运用与改进

上述回测的数据和代码可直接从github下载2,我们将其套用于A股进行了多轮测试, 但结果都和预期相去甚远。经过多维度的分析,我们对模型做出了如下三点针对性的改进。

核心改进1:改损失函数为信息比率

动量 Transformer 模型的核心之一在于其损失函数的设计。原文以夏普比率作为优化 目标,力求实现风险调整后收益的最大化。然而,由于 A 股市场波动率高,且长期向上的 趋势不明显。若以夏普比率为损失函数,很容易导致模型输出的风险资产仓位长期为 0。 因为此时组合的波动率极低,夏普比率将接近正无穷大,这显然不是我们想要的结果。 为解决这一问题,我们调整损失函数的形式,用基准收益(风险资产等权组合,对应 买入持有策略)代替无风险利率,引导模型在追求风险控制的同时,尽可能获取理想的投 资回报率。但即便如此,模型依然倾向于长期维持很低的仓位水平。因此,我们进一步在 损失函数中引入一个强约束:当组合各资产的平均仓位低于 10%时,给予较高的惩罚,从 而鼓励模型维持合理的市场参与度。损失函数的最终形式如下式所示。

Loss=−(策略收益 − 等权收益)/策略波动 + 100|平均仓位 < 10%

 核心改进2:增加特征类别

原文引入动量 Transformer 模型是为了改进 MACD 类策略,因而输入特征以 MACD 相关指标为主。但在 A 股市场上,MACD 类指标虽能反映一定的趋势特征,但有效性并 不显著。为提升模型对投资者行为的感知能力,我们延续技术分析的想法,在原有特征的 基础上引入了均线、波动率、动量及成交量类技术指标。我们认为,丰富的特征体系可能 更加利于多头注意力机制在不同维度间自动捕捉有效信号。

 核心改进3:重设训练-验证划分机制

在原始的动量 Transformer 模型中,作者按时间的先后顺序划分训练集与验证集。但 我们测试后发现,在 A 股市场上这样做,会使模型倾向于拟合验证集对应时段的市场规律。 那么,当测试集的市场风格与前期相比发生大幅切换时,如,18 至 19 年或 21 至 22 年, 模型的表现必然会大打折扣。 因此,为了提升模型的泛化能力,我们将训练集与验证集的划分方式改为随机抽样。 具体地,从历史数据中随机抽取多个时间片段组成训练集与验证集,尽可能保证两者都能 包含不同市场状态的样本。这种做法可在一定程度上迫使模型学习更为普适的动量规律与 市场结构。测试结果也表明,随机划分训练的模型,业绩表现更加稳定。 不过,随机划分的一大隐忧在于,训练-验证过程中可能包含未来信息。因此,我们 在选择输入特征时,采取较为严格的信息控制策略:摒弃所有与原始价格直接相关的指标, 如,绝对价格、未处理的收益率等,仅使用通过滑动窗口计算并经标准化后的特征。此外, 在训练框架上,我们采用滚动机制:每完成一轮训练,模型将在未来一年的测试集上进行 验证。我们认为,通过这样的特征和训练设计,可在一定程度上缓解对于信息泄露的担忧。

参考报告REPORT

人工智能和机器学习系列专题研究:基于动量Transformer模型的日内和隔夜交易策略.pdf

人工智能和机器学习系列专题研究:基于动量Transformer模型的日内和隔夜交易策略。为应对传统截面策略在极端市场环境下的失效问题,本文聚焦宽基指数组合,构建了一类日内和隔夜的时序交易策略。通过引入并改进动量Transformer模型,策略在指数模拟和ETF实测中均实现了良好的收益增厚。该时序策略与截面策略的相关性低,在截面策略大幅回撤时,时序策略通常表现较好,可形成有效的互补和分散化。【报告亮点】1.将动量Transfomer模型应用于A股时序策略,并根据A股实际环境,针对性地改进模型结构。2.基于改进的动量Transfomer模型构建日内+隔夜时序交易策略,并相对买入持有,实现了良好的收...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至