固定收益专题:利率短期预测的模型构建——基于四维信息框架

  • 来源:国盛证券
  • 发布时间:2026/09/17
  • 浏览次数:10
  • 举报
相关深度报告REPORTS

固定收益专题:利率短期预测的模型构建——基于四维信息框架.pdf

传统端到端机器学习模型在利率短期预测中普遍面临数据频率错配、先验知识缺失与震荡市识别困难等系统性局限。针对这一痛点,国盛证券提出了一种基于四维信息驱动的利率短期预测框架,借鉴“分而治之”的集成学习思想,将利率预测问题按照信息维度进行先验性拆解,并通过XGBoost元模型进行多源信息非线性融合。端到端基准模型的局限性暴露研究首先构建了以87个宏观因子及其一阶差分为输入的LSTM三分类基准模型,对10年期国债、30年期国债、5年期二级资本债(AAA-)及1年期同业存单(AAA)进行明日方向预测,准确率分别为42.47%、45.88%、45.50%和47.32%。尽管均高于随机基线,但长端品种预测概...

利率是一切金融资产定价的基石。无论是债券投资中的久期管理与套息策略,还是权益定价中的贴现率设定,利率的短期走向始终是市场参与者关注的焦点。对于固收投资而言,若能系统性地提升短期利率方向判断的准确率,将直接转化为久期调整、波段交易与风险对冲层面的决策优势。近年来,以LSTM、XGBoost等为代表的机器学习技术在金融时间序列预测领域得到了广泛的应用探索,但在实际应用中仍面临数据频率错配、先验知识缺失与震荡市识别困难等系统性局限。

端到端基准模型的构建与局限性

在展开多维信息驱动框架之前,首先需要建立一个端到端的深度学习模型作为对照基准。该模型以日频宏观因子作为输入特征,以三分类标签(明日利率上行、震荡、下行)作为预测目标,采用LSTM模型对宏观因子与利率变动之间的时序关系进行端到端的学习与预测。

模型选取的宏观因子覆盖经济增长、通货膨胀、货币政策、资金面、信用扩张、汇率与全球大宗商品等维度,共计87个因子及其一阶差分共174个指标构成的指标池。所有因子均统一为日频序列,月频与周频数据在前向填充后保留最新有效值,并进行Z-Score标准化处理。模型采用单层LSTM结构,隐藏层维度设置为64,序列长度为20个交易日,通过XGBoost筛选重要性最高的50个因子作为最终输入特征。

实证检验选取10年期国债、30年期国债、5年期二级资本债(AAA-)、1年期同业存单(AAA)四个即期收益率作为预测标的。结果显示,四个品种的三分类预测正确率分别为42.47%、45.88%、45.50%和47.32%,均相较于三分类基准线有一定程度的提升。整体来看,资产期限越短,利率序列的可预测性越强,模型预测准确率随期限拉长而逐步回落。

然而,端到端LSTM模型在实际应用中存在明显的系统性局限。一方面,概率分布区分度不足,长端品种预测信心偏低。对于10年期和30年期国债即期收益率,模型在三分类方向上的预测概率之间差距较小,三类概率往往集中在30%—40%区间,缺乏明显的概率优势。另一方面,预测类别分布不均,震荡市识别存在系统性偏差。对于5年期二级资本债和1年期同业存单,模型输出的预测类别中“震荡”类型占比较低,大量实际震荡样本被误判为“上行”或“下行”。当利率处于区间震荡状态时,宏观因子普遍处于中性区间,缺乏极端偏离信号,模型难以从中提取有效的区分信息。

四维信息驱动框架的子模型构建

端到端模型的局限性表明,利率的短期变动并非由单一类型的信息所驱动,而是由多个性质各异的信息维度共同作用的结果。将所有信息输入单一模型,忽略了不同维度信息在数据频率、传导机制和预测逻辑上的差异。因此,本文将利率影响因素系统性拆解为四个维度:稳定的宏观截面因素、极端情况下的宏观冲击因素、时序自相关与收益率曲线形态信息、市场情绪与交易行为信息,并分别构建四个子模型。

第一个子模型为宏观数据LSTM概率预测模型,对应稳定的宏观截面因素维度。与端到端三分类模型不同,该模型采用二分类设定,将上行与非上行作为预测目标,输出明日利率上行的概率值。这一设计降低了模型的分类难度,有助于提升模型在趋势方向判断上的稳定性,且二分类概率输出形式更易于与其他子模型的连续信号进行集成。测试结果表明,该模型对10年期国债、30年期国债、5年期二级资本债(AAA-)、1年期同业存单(AAA)的三分类预测正确率分别为44.50%、46.48%、47.99%和47.50%,相较于三分类模型有稍许提升。

第二个子模型为宏观极端信号捕捉模型,对应极端情况下的宏观冲击因素维度。真正驱动即期收益率出现大幅跳跃的力量,往往并非宏观因子的日常小幅波动,而是关键宏观变量的极端偏离。该模型在利率变化幅度最大的前20%极端日期中,筛选出与之相关性最高的宏观因子,并实时监控这些因子当前值相对于其历史分布的极端程度。模型使用斯皮尔曼相关系数与百分位信号加权合成的方法,生成综合信号值。全样本三分类正确率分别为35.21%、32.80%、35.71%和34.86%,但在变化量前20%的极端日期上,四个品种的正确率分别提升至41.33%、42.96%、42.92%和40.62%,显著高于全样本表现,验证了其在极端波动场景下的预警能力。

第三个子模型为NSS时序预测模型,对应时序自相关与收益率曲线形态信息维度。即期收益率曲线本身蕴含了丰富的市场预期信息,不同期限利率的相对位置及其随时间的变化,反映了市场对经济走势、通胀预期和货币政策路径的综合定价。该模型通过Nelson-Siegel-Svensson模型提取收益率曲线的水平、斜率与曲度因子,对各参数分别建立一阶自回归模型AR(1)滚动预测明日利率变化量。四个品种的准确率分别为39.86%、42.41%、44.80%和42.27%,且NSS模型对各类收益率曲线形态的拟合相关性均超过0.99。

第四个子模型为技术指标综合动量模型,对应市场情绪与交易行为信息维度。市场的短期走势不仅受基本面和政策面驱动,还受到参与者交易行为的显著影响。该模型计算涵盖趋势、动量、超买超卖、波动率、均值回归等五大类36个技术指标,通过过去250个交易日的滚动窗口筛选出与次日利率变化相关性最高的10个指标,并以其相关性强度为权重合成综合动量评分。四个品种准确率分别为47.92%、48.62%、42.35%和44.99%,其中30年期国债即期收益率准确率最高,反映长端品种的交易行为特征更为规律、技术面信号的有效性更强。

XGBoost元模型的多源信息融合

在完成四个子模型的构建与信号输出后,需要将这四个性质各异的信号有效整合,形成最终的三分类预测。四个子模型分别输出上行概率、综合极端信号评分、预测变化量和综合动量评分。元模型采用XGBoost作为融合算法,将四个子模型的输出信号作为输入特征,以利率的实际三分类方向作为训练标签,通过有监督学习的方式学习各子模型信号与最终利率方向之间的映射关系。

XGBoost能够自动学习四个特征之间的非线性交互与高阶组合,捕捉各子模型信号在不同市场环境下的协同与冲突关系,同时天然支持多分类输出,可直接输出上行、震荡、下行三个类别的概率。元模型采用扩展窗口滚动训练策略,每100个交易日为一个预测窗口,使用该窗口起始日之前的全部历史数据训练模型,然后对当前窗口的100个交易日进行预测。进入下一窗口时,训练集扩展100天,模型重新训练。

实证结果显示,XGBoost元模型对10年期国债、30年期国债、5年期二级资本债(AAA-)、1年期同业存单(AAA)的三分类预测正确率分别提升至52.95%、52.26%、54.37%和51.43%。相较于四个子模型中表现最优的模型,元模型在各品种上的准确率均有提升,验证了多源信息融合框架的有效性。元模型能够有效整合各子模型的互补信息,实现超越单一模型的预测能力。

当前市场状态的模型预测应用

基于上述四维信息驱动框架,模型对当前市场状态给出了明确的短期预测信号。根据最新的9月14日下一交易日预测结果,10年国债、5年AAA-二级资本债以及1年AAA存单分别是76.8%、68.4%以及76.7%概率处于震荡状态,而30年国债则以60.9%概率偏空。这一预测结果显示整体债市短期可能处于震荡状态,而超长债相对偏弱。

综合来看,本文提出的四维信息驱动框架通过将利率预测问题按照信息维度进行先验性拆解、分别建模、再通过元模型融合,有效解决了单一模型在频率错配、先验缺失和震荡市识别等方面的系统性局限。考虑到这是三分法预测的准确度,从实际操作情况来看,能够为固收投资提供较为准确的短期预测指导。需要注意的是,以上结论均基于历史数据和模型的测算,如果市场环境和结构发生剧烈改变,不排除模型失效的可能性。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至