大模型赋能投研:个股与产业动态知识库构建行业投资专家Agent

  • 来源:国金证券
  • 发布时间:2026/07/29
  • 浏览次数:51
  • 举报
相关深度报告REPORTS

大模型赋能投研之二十五:个股和产业动态知识库——行业投资专家Agent2.0.pdf

研究背景与目的本报告为国金证券"大模型赋能投研"系列第二十五篇,在前期构建的主观投资框架基础上,针对科技板块信息密度高、叙事跨越多季度的特点,将Agent能力从时点式判断升级为携带历史记忆与产业链认知的专家式推理,实现从单行业方法论验证到多行业策略化落地的关键一跃。核心创新:双层认知架构引入"个股记忆栈"与"产业链供需认知层"双层架构。个股记忆栈沿六个维度逐月滚动维护每只个股基本面画像,解决长上下文"中部迷失"与信息流"断点"问题;产业链供需认知层以申万三级行业为客观骨架、以过滤后的Wind概念板块生成需求锚点,按环节聚合跨主体供需信息,专门弥补科技板块订单确定性藏在客户与同行信息里的结构性缺...

记忆增强Agent:主动投研体系的下一块拼图

在国金证券前期构建的主观投资框架基础上,本报告将Agent能力从时点式判断升级为携带历史记忆与产业链认知的专家式推理。原框架以医药生物行业为样本,实现了从卖方研报自动挖掘投资思维链、经滚动回测筛选有效逻辑、再由多链投票生成持仓的主动化投研体系,但存在明显局限:LLM在每个截面上做个股判断时,输入仅为该股当月及滚动窗口内的增量信息,Agent相当于"没有记忆的分析师",对信息迭代速度极快、叙事跨越多个季度的科技板块而言,这种"时点式判断"的天花板显而易见。

全量堆料不可行,必须对历史信息做压缩与结构化。单只科技龙头两年累计文本量可达数十万字,逐股逐链判断的调用成本随上下文长度近似线性增长;更本质的是,长上下文模型对埋藏在提示词中部的关键事实存在"中部迷失","读得越多"并不等于"判断得越准"。同时,A股研报与新闻信息流存在"断点",热门标的单月数十篇、冷门标的可能连续数月无人覆盖,需要记忆做连续化。此外,跨主体信息定价迟滞构成产业链维度的系统性Alpha来源——受投资者注意力约束,客户公司的重大信息不会即时反映到其供应商股价中,基于"客户动量"的多空组合月度Alpha效应显著,且在分析师覆盖薄弱处更强。

双层认知架构:个股记忆栈与产业链供需认知层

本报告引入双层认知架构:第一层"个股记忆栈"纵向沉淀个股脉络,沿盈利与业绩趋势、估值水平与位置、一致预期变化、重要事件与催化剂、竞争格局与行业地位、风险与关注点六个通用维度,逐月滚动维护每只个股的基本面画像;第二层"产业链供需认知层"横向补全跨主体供需,按产业链环节而非个股维护,聚焦海外锚点需求、环节景气与价格、订单能见度、国产替代进度四个维度,专门弥补科技板块订单确定性藏在客户与同行信息里的结构性缺口。

个股记忆栈以"个股月度画像"为存储单元,每月月末将该股当月新增研报与新闻交给LLM,与上月记忆快照做迭代合并:新事实增量写入、旧信息压缩去重但保留业绩拐点与预期转折等关键节点,所有信息条目均带时间戳,画像长度控制在千字以内量级。产业链供需认知层的搭建过程全客观、可溯源、可介入:用申万三级行业作客观骨架做环节分区,以经过客观过滤的Wind概念板块自动生成需求锚点,通过"个股→环节"与"产业本身"两条互补支路聚合文本信息,最终生成四维画像。记忆压缩采用差异化半衰期的近因加权设计,价格、稼动率、库存等快变量以约一个季度为尺度压缩,海外资本开支指引等中期变量以半年到三个季度为尺度,国产替代进度等慢变量长期保留。

整体流水线分为七个环节:行业研报经质量筛选与文本清洗后,进入思维链组处理器完成月度思维链组提取与合并迭代;双层认知架构按月滚动更新个股画像与环节供需状态;每个月度截面上,LLM将"当月研报+新闻+记忆快照"与每条思维链逐一对照输出符合程度判断;随后在已走完的半年区间内对每条单链回测筛选,入选优质链对下一周期进行逐月投票生成持仓。思维链沿用三段式结构:驱动因素、链条推理与信号强度,针对科技板块研报数量大、质量分化的特点,入口处增加了研报清洗与信息量筛选机制。

多科技子行业策略超额表现

在半导体、元件、光学光电子、消费电子、通信设备、计算机设备六个科技属性最强的申万二级行业上平行运行完整流水线,样本外区间全部录得正超额。六个子行业在完全相同的框架参数下全部录得正超额,说明"思维链验证+记忆增强"的选股能力并非单一行业的偶然拟合。结构上看,半导体的超额弹性最大,其思维链组高度聚焦"先进制程国产替代-设备材料订单-业绩兑现"主线;通信设备的超额则集中在后期释放,体现了"逻辑蛰伏-集中兑现"的典型节奏。

将六个科技子行业子策略按行业间等权方式合并为科技组合,组合基准设定为六个行业指数的等权组合。分散化带来的改善在各风险维度均十分显著:超额年化波动显著低于所有成分行业,超额最大回撤大幅收窄,超额信息比率显著高于所有单一行业,呈现出明显的组合效应。这一结果的根源在于各行业超额收益之间的低相关性:由于各行业超额分别锚定其行业内部相互独立的选股逻辑,等权合并有效分散了单一行业的特异性噪声。

产业链供需认知层支持开关控制、平行新增,可做干净的A/B对照。数据显示,产业认知层在多个行业上带来了全面的超额改善,且改善并非以放大波动为代价。最突出也最稳健的是对回撤与尾部风险的压缩,这与将产业链供需认知加入LLM决策的初衷相吻合——通过跟踪海外锚点需求、环节景气与价格、订单能见度等跨主体供需信号,模型得以在产业链景气下行、客户资本开支指引转弱的早期更快识别风险、规避逻辑证伪的个股。

收益归因:超额源于选股Alpha

从持仓法与收益法两个独立口径做交叉验证。持仓法显示,策略系统性超配行业内大市值龙头、高成长、高质量与一致预期上修个股,同时低配动量、高波动与低估值,风格画像为"科技成长质量"。收益法以组合行业对冲后的日度超额收益为因变量,对Barra十大风格纯因子收益做OLS回归,结果显示风格因子解释力有限,剥离全部风格贡献后Alpha在统计水平上显著。综合两口径,策略核心风格是成长与质量,超额主体是统计显著的真实选股能力而非风格搭车。

技能与应用:从研究结论到决策辅助工具

框架成果被工程化为一条完整的数据管道对接两个应用产品。一是面向客户的active-quant智能问答技能,通过意图路由与只读取数机制,支持行业概览、有效单链、持仓预测、个股符合度与证据、跨行业定位个股、产业链环节供需等自然语言查询,并支持跨行业对比等复合问法。二是与每次问答相对应的单文件可视化看板,集净值曲线、绩效汇总与分年度表现、最新有效单链、持仓预测与个股查询于一体。至此,主观投资框架从研究结论升级为可对外交付的决策辅助工具,形成一条可持续迭代的个股决策Agent闭环。

后续方向

后续工作将沿四条线推进:深挖思维链提取环节优化机制,支持更高频的迭代更新与持仓生成;将框架继续横向复制到更多科技制造子行业,并向新能源、医药等非科技赛道延伸;探索记忆与认知的表征化,将个股画像与环节供需状态编码为低维语义向量,作为正交于传统量价因子的Alpha源纳入机器学习选股模型,打通"主观逻辑-记忆表征-量化组合"的完整链路。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至