2025年固收量化系列专题报告:债市研究智能体,“Prompt+”与多Agent协同

  • 来源:华泰证券
  • 发布时间:2025/05/15
  • 浏览次数:493
  • 举报
相关深度报告REPORTS

固收量化系列专题报告:债市研究智能体,“Prompt+”与多Agent协同.pdf

固收量化系列专题报告:债市研究智能体,“Prompt+”与多Agent协同。大语言模型(LLM)的出现为二级市场投研工作带来了更大的拓展空间。但简单的“提问+聊天互动”还远远无法满足复杂的工作需求,如何更好地使用大模型正在成为更值得研究的问题。优化提示词(Prompt)是引导大模型生成高质量内容的基础,我们建议使用思维链和完整框架进行强化。而后,还可以继续对大模型进行三项“升级改造”:1、搭建智能体系统,使用多个Agent协同,分步分环节完成复杂任务,类似Manus等;2、使用知识库+RAG,通过结合信息检索与生成模型,提...

前言:什么是 Prompt Engineering(提示词工程)?

大语言模型(LLM)的出现为二级市场投研工作带来了更高的效率。对二级市场投研工作 者而言,大模型首先是作为“超级助手”存在,通过“类人推理”、多任务处理和聚焦私 有知识库等手段,减少了很多低级和重复性的劳动;其次,它还可以扮演“数据侦探”的 角色,为投资者找到更多微观信息,而且其学习与处理问题的速度很快,节省时间本身就 是一种价值。

但大模型的作用远不止于它本身!如何更好的使用大模型可能是更值得研究的问题。我们 对大模型最简单的理解就是“提问+聊天互动”,以此替代传统的搜索引擎。当然,稍加扩 展还可以进行翻译外文、总结提炼、助写文字等工作,但这都仍只浮于大模型应用的表层。 因为在真实世界中,有很多人类工作非常复杂、甚至可能都难以描述,比如: 1)对宏观政策、经济增长路径的分析,即便是人也很容易输出“泛泛而谈”的内容; 2)股票基本面分析,尤其是上市时间不长、公开信息不多的公司,往往不知从何下手; 3)量化投资中的多因子挖掘,一般需要因子设计、回测、优化等几个工程顺次完成; 4)在生活中,还有心理调节或医学诊断等问题,显然也不是能一次性完成的任务…… 那么如何完成这些相对复杂的人类工作?众多实践派高手和学者总结了大量的 Prompt (提示词),并汇聚成对 Prompt Engineering(提示词工程)的研究。本质上,提示词 (Prompt)就是经过逻辑思考后给出更有“含金量”的上下文而非简单的问答,让 AI “听懂”并“执行”复杂任务,同时控制输出的质量与方向。好的 Prompt 的作用有三点: 1、尽可能避免了“Garbage in,Garbage out”的问题,也就是优化了模型的输入; 2、从底层启发了大模型的“思维链”,激活了一些大模型的隐藏性能、优化输出; 3、一定程度上能控制幻觉问题。

一个好的 Prompt 堪比大量训练数据。而 OpenAI 的官方博客(官网,OpenAI News) 也在 2020 年 GPT-3 刚发布时作过一个非常形象的比喻,那就是“Prompt 的意义就是, 给外星人讲地球上的故事”: “Designing your prompt is essentially how you ‘program’ GPT-3. Because GPT-3 doesn't have the context of the world in the same way a human does, you need to provide it context in the prompt. Think of it as giving instructions to an alien who's smart but doesn't know about Earth or our customs.”(“设计提示词(Prompt),本质上就是你对 AI 进行 “编程”的过程。但由于 AI 并不像人类那样天然拥有对世界的理解和认知,因此需要你有 意识地在对话中清楚地提供必要的上下文信息。想象一下,这就好比你在向一名智力超群 但并不了解地球人生活的外星人下达命令。”)

更直观的是,针对同一个问题,大模型在不同 Prompt 引导下“观感”差异悬殊: Prompt①:“请用一段话概括:2025 年春节之后中国 10 年期国债收益率走势。” Ans①(Kimi-1.5 长思考): 2025 年春节之后,中国 10 年期国债收益率整体呈现震荡下行的走势。在 3 月中旬,10 年 期国债活跃券收益率一度触及 1.90%的高点,随后在央行公开市场连续三日净投放呵护资 金面以及权益市场调整等因素作用下,收益率从年内高点回落。从全年来看,多数机构预 计 10 年期国债收益率会在 1.6%至 2.0%的区间内波动,并且整体呈现下行趋势。

Prompt②:“请用一段话概括:2025 年春节之后中国 10 年期国债收益率走势,并至少给 出三点启示。”

Ans②(Kimi-1.5 长思考): 2025 年春节之后,中国 10 年期国债收益率整体呈现震荡下行的走势。在 3 月中旬,10 年期国债活跃券收益率一度触及 1.90%的高点,随后在央行公开市场连续三日净投放呵护 资金面以及权益市场调整等因素作用下,收益率从年内高点回落。从全年来看,多数机构 预计 10 年期国债收益率会在 1.6%至 2.0%的区间内波动,并且整体呈现下行趋势。以下 是三点启示: 1、货币政策与市场预期的博弈:春节后国债收益率的波动表明市场对货币政策的预期变 化非常敏感。央行的操作和市场预期之间的博弈直接影响了债券市场的走势。投资者需要 密切关注央行的政策信号和资金面的变化,以便及时调整投资策略。 2、经济基本面的支撑作用:尽管收益率整体下行,但经济基本面的修复预期对债市形成 了一定的支撑。随着经济数据的逐步公布和政策效果的显现,市场对经济复苏的预期可能 会进一步影响债券市场的走势。因此,投资者需要综合考虑经济基本面因素,合理评估债 市的投资机会和风险。 3、资产配置的多元化需求:在债券市场波动加大的背景下,投资者应更加注重资产配置 的多元化。除了传统的利率债,还可以适当配置信用债、可转债等不同类型的债券资产, 以分散风险并提高整体投资组合的稳定性。同时,结合权益市场和其他资产类别的表现, 进行动态调整和优化配置。

Prompt③:请用一段话概括:2025 年春节之后中国 10 年期国债收益率走势,并至少给 出三点启示,在语言风格上尽量诙谐有趣。 Ans③(Kimi-1.5 长思考): 2025 年春节后,中国 10 年期国债收益率走势就像坐过山车,从 1.6%-1.7%的低位快速反 弹,一度冲到 1.922%,随后又有所回落,最终在 3 月 25 日收盘时回到 1.81%附近。这种 震荡上行的走势,反映了市场对经济复苏和货币政策的复杂预期。以下是三点启示: 1、央妈很关键。国债收益率的波动,很大程度上取决于央行的货币政策。春节后,市场 对降息降准的预期落空,导致收益率上行。这提醒我们,投资债市时,一定要紧盯央妈的 动向,她的每一个操作都可能影响你的钱包。 2、经济复苏的“拉锯战”。国债收益率的走势也反映了经济基本面的变化。虽然整体呈现 复苏态势,但过程中充满波折。投资者需要关注经济数据的发布,把握经济复苏的节奏, 以便在债市中找到合适的入场和离场时机。 3、“别把鸡蛋放在一个篮子里”。债券市场的波动加剧,说明单一资产的风险在增加。聪 明的投资者会将资金分散到不同类型的债券,比如短期债、信用债、可转债等,甚至跨市 场配置,以降低风险,提高收益的稳定性。 这种由不断深化的 Prompt 引导的大模型内容增强,在学术上被称为“知识涌现”现象, 是纯机器学习走向通用人工智能的必经之路。而对我们来说,则意味着固收研究的价值链 很可能被重塑,可以预见到的几个变化是: 第一、基础数据等整理不再会耗费大量时间,取而代之的是对复杂策略的尝试与思考; 第二、人类研究员的核心价值变成 “Deep Sight”,主要工作更多是设计“元指令”; 第三、极大地冲击现有常识,譬如改变原本是基于人类行为建立的“理性人假设”。 总之,研究 Prompt Engineering 的目的只有一个——生成高质量内容。

原理:提示词是如何对大模型进行引导的?

理论上,想要让大模型生成“超预期”的高质量内容有三种办法:模型微调、Prompt 引 导、外部内容嵌入。对这三种方法简单打比方就是:1、Prompt 相当于领导用更具体、更 细致的表述给员工布置复杂任务(强化输入+引导),能否完成好要看员工的经验和能力 (大模型性能);2、知识库嵌入则相当于提供了操作指南(定向信息),让员工可以边查 阅边工作(实时检索);3、微调就类似入职前培训,让员工在非工作环境中提前熟悉操作。 对大多数人来说,写好提示词并形成自有模板是最省力、投入产出比最高的选择。 好的提示词引导大模型产生高质量内容的原理是什么? 首先,大型语言模型的底层机制是基于概率的文本续写。大语言模型的背后是以 Transformer 为核心架构的神经网络,它会根据提示词(你的提问)来预测最可能的后续 词语序列(应该怎么回答问题)。更直白的讲,我们通过 Prompt 提供了语境和模式,大 模型会在这基础上“续写”答案;

其次,提示词还会决定输出格式与风格。Prompt 不仅会引导模型续写内容,还会影响回 答的形式。从底层来看,大模型是通过计算 Q-K-V 三个向量的点积,找到注意力权重最 高的内容并予以输出。Q 是 Prompt,K 是大模型的检索词,V 则是输出语料。很显然, 不同的 Prompt 会导致大模型检索不同的内容,也就导致输出不同。 从本质上说,Prompt 是与大模型交互时隐式编程的手段,我们相当于用语言对它进行 “调参”。我们并非直接修改模型,而是通过输入设计来影响模型的输出倾向,而它的输 出内容是从海量语料中学到语言模式,因此只要“说的够细”,大模型几乎是 100%会达到 要求。但是,对于市场研究而言,“说的够细”本身就很难,这往往需要我们把问题分解 成更清晰的数十个小点,而这也是我们在探索中需要付出的努力。 总结一下,Prompt 对大语言模型引导的底层机制可以归纳为以下几个方面: 一是激活相关参数。Prompt 中的关键词和上下文信息能够激活模型中与之相关的参数, 引导模型在生成文本时更倾向于使用这些参数,从而生成符合用户需求的输出。通俗来讲, 就是一个“好老师”会更容易启发学生的“灵感”; 二是调整概率分布。模型在生成文本时,会根据上下文信息调整下一个词(token)的概 率分布。由于精心设计过的 Prompt 提供了丰富的上下文信息,理论上模型就能够得到更 合理的输出概率表、从而更准确地预测下一个词。在这个过程中,Prompt 就好比一个 “航海图”,模型好比“船只”,所以有航海图的船只就更容易避开暗礁和漩涡(不合理的 输出); 三是减少歧义和不可靠输出。通过提供明确的指示和上下文信息,Prompt 能够减少任务 描述中的歧义,帮助模型更准确地理解任务要求,避免生成不符合预期的结果。这就好比 最初的指南针(简单的提问型 Prompt)与现代的 GPS(精心设计过包含全要素的 Prompt) 对模型的引导作用当然是天壤之别。

方法:上下文学习、思维链与设计框架

设计 Prompt 的方法本质上就是强化上下文学习(In-Context Learning)。上下文学习是 大模型的一种重要能力,它允许模型通过上下文信息来理解任务并生成相应的输出。具体 来说,上下文学习可以分为三种: 1、Zero-shot Learning(不给模型任何样例):仅通过自然语言指令来指导模型完成任务。 这种方法的优点是灵活性极高,但模型可能无法准确地把握任务的细微差别或特定要求;

2、Few-shot Learning(给模型多个任务示例):模型通过这些示例来更好地理解任务并 生成输出。由于模型首先看到的是好的例子,它可以更好地理解人类的意图和需要什么类 型的答案的标准,因此 Few-shot 学习往往比 Zero-shot 学习有更好的性能。

而上下文学习能力的背后是思维链(Chain-of-Thought)机制。思维链是一种改进的提 示技术,旨在提升大模型在复杂推理任务上的表现。它要求模型在输出最终答案之前,先 展示一系列有逻辑关系的思考步骤或想法,这些步骤相互连接,形成了一个完整的思考过 程,也就是我们常说的“推理”。不过,基础的思维链早已被大模型的工程师封装在模型 底层,不需要我们再去启发。其中一类是 Zero-Shot CoT,适用于数学等问题,本质上就 是增加了“请分步推理”的引导词,另一类则是 Few-Shot CoT,是通过连环问题来引导 大模型自己设计解决方案。不过,这些技术都是预训练中的范畴,我们不需要过多了解。

除此之外,还有 BROKE 框架、CHAT 框架、CRISPE 框架、CARE 框架等引导词设计框 架,由于它们在思路上大同小异,因此我们在此不再赘述。 而固收研究属于二级市场研究领域,还不能简单参照现有的 Prompt 框架,需要根据实战 进行更具体的设计。我们认为,要做出适应固收研究的通用 Prompt 还需要注意以下细节: 1、角色主要以“债券基金经理”、“权益研究员”、“资产配置研究员”等为主; 2、绝大多数目标可归为解读新闻、概念阐述和信息总结,语言风格应以“科普文”或 “商业研究报告”两种为主; 3、强调可解释性和归因,需要提示大模型依据逻辑框架“三段论”、“图尔敏法则”等, 并给出“理论依据”; 4、主观明确历史比较的时点,比如“参考 2015 年 A 股牛市经验”、“2020 年前后的风格 切换”、“2013 年钱荒”; 5、示例或输出格式应提前详细写好,例如“债券分析的五方面……”、“转债四大回报驱 动力……”、“股市三因素:流动性、盈利和风险偏好。……”等,这点对于启发大模型思 考非常必要; 6、反馈与限定,加入类似“请保证结论 100%有依据”、“请帮我总结本次分析信用事件 冲击的框架,并帮我优化为一个常用的 Prompt 模板”。 此外,在设计 Prompt 时,我们强烈推荐使用类似“##”作为 Prompt 的标识和分隔符。 这虽然不是绝对必要,但有明确的必要性和优势:1、清晰的结构具有较好的可读性,这 在哪里都不会有错。而且分隔符可以明确模块边界、有效避免提示词冲突,减少模型误读 指令的概率;2、结构化提示词符合模型的训练逻辑(IT 工程师们投喂的数据+模型语料库 也都是结构化的),因此大语言模型对结构化输入更敏感;3、有利于团队协作,减少格式 混乱导致的沟通成本。

进阶 1.0:搭建多 Agent 协同的智能体系统

在前文中,我们已努力将单个 Prompt 的原理和设计逻辑充分阐述。但这对实战研究仍有 一定距离。归根结底,是因为主观研究是一项多环节、多任务、多限定的工程,往往还需 要不断地“反刍”(想象领导或客户让你反复修改材料或验证观点)。所以研究一个问题, 本身就不是一个 Prompt 或一个大模型智能体可以单独完成的工作。实践中,比较合理的 解决方案就是创造一个工作流,采用多 Agent(智能体)协作。

多 Agent 系统:什么是 Agent 协同?

什么是 Agent 协同?就是设计多个大模型串联或并联工作。这非常容易理解,类似一个人 类的团队,包括几人到几十人不等。每个人都有明确且合理的分工,定位当然也不同,比 如 Leader 总领全局工作,把握研究观点或对文章,Researcher 负责每个部分的写作(股 市、利率、信用债等),再复杂一点可以设置“文字风格润色”、“逻辑检查”和“质量与 观点控制”等环节。当然,更前沿的是再加一层本地 RAG 检索增强,进一步提升输出内 容的满意度。

如何设计一个可以实战的多 Agent 系统?

如何设计多智能体系统(Agent 协同)?理论上至少要有任务分配、信息共享和反馈机制 三个模块:1、最核心的是任务分配,让每个 Agent 分别读取对应的 Prompt,处理不同的 任务;2、保证信息共享。各个 Agent 之间需要有一个信息共享和沟通的机制,这样它们 可以根据需要相互提供数据和结果;3、建立反馈机制,循环反馈能够推动各个 Agent 反 复优化自己的输出,并促使整个系统不断进化,提升长期的表现和稳定性。

进阶 2.0:RAG 与本地知识库

什么是 RAG(检索增强生成)?

检索增强生成(Retrieval-Augmented Generation, RAG)是一种将信息检索与文本生 成相结合的技术,用于提高大型语言模型(LLM)回答的准确性和上下文相关性。简单来 说,在回答用户问题时,引入一个检索模块从外部知识库中提取与问题相关的支持文档, 然后将这些文档与原始输入一起交给生成模型,产出最终答案。通过在生成前提供来自 “权威知识库”(由我们自己导入)的证据,RAG 可以有效弥补模型自身知识的不足,使 模型能够访问超出训练语料的最新信息,从而提升回答的可靠性与准确性。由于 LLM 的参 数记忆本质上是静态的,RAG 提供了一种无需重新训练模型就能扩展其知识范围的方法。 这不仅让回答更加贴合最新事实,减少了模型凭空猜测(即“幻觉”)的机会,也增强了 回答的可控性和上下文相关度。

怎样通过 RAG 技术构建本地知识库?

要在本地构建一个知识库并应用 RAG,通常需要以下步骤: 1、数据收集与预处理。首先收集领域相关的文档资料(如文本文件、PDF、网页内容等), 并进行必要的清洗和分段。为了便于检索,长文档通常被拆分成较小的“文本块” (chunks),每块涵盖一个完整语义单元; 2、向量化与索引。将每个文本块转换为向量表示(embedding)。这通常利用预训练的文 本嵌入模型,将语义相似的内容映射到临近的向量空间中。随后,将所有向量存储在向量 索引(如 FAISS、HNSW 等)或向量数据库中,以支持后续的相似度检索。这一过程相当 于构建了模型可理解的本地“知识库”索引; 3、查询与检索。当用户提出问题时,将问题句子同样向量化,在向量索引中搜索与之语 义相似度最高的几个文本块。这种基于向量的检索能够找到与问题相关的内容片段,而不 仅仅依赖关键词匹配。例如,用户询问一个专业术语,检索模块会返回知识库中解释该术 语的段落作为参考信息; 4、提示增强与生成。将检索到的相关文本片段与原始用户问题合并,构造成扩充后的提 示(Prompt)提供给 LLM。模型在提示中获得了额外的上下文后,便据此生成答案。由于 提示中包含了与问题密切相关的事实性信息,模型的回答更有依据,其内容的准确性和上 下文相关性大幅提高。例如,没有 RAG 时模型可能无法回答的最新事件,通过提供相关 资料片段,RAG 使模型能够给出基于新信息的回答。

如何对接多 Agent 系统并集成?

在前述的多 Agent 架构中引入 RAG,可以赋予系统更强的检索和知识引用能力,进一步 提升答案的可信度和专业性。如前所述,多 Agent 系统往往由多个分工明确的智能体协作 完成复杂任务。我们可以设计一个专门的“检索 Agent”,负责与本地知识库或外部数据库 交互。当其他 Agent 在推理过程中遇到知识盲区或需要引经据典时,就请求检索 Agent 获 取相关信息。检索 Agent 利用 RAG 从资料库中提取所需文本片段,并将其反馈给请求方 Agent,用于后续的决策和答案生成。这种模式相当于在 Agent 团队中加入了一位“资料 员”或“图书管理员”,确保系统在需要时能参考权威资料而非凭空臆测。 另一种方式是让每个 Agent 在各自职责范围内都具备检索增强能力。例如,一个解答用 户法律咨询的 Agent,可以在生成回答前自动检索本地法规条文数据库;又如撰写技术报 告的 Agent,可查询论文和文档以提供引用支持。通过将 RAG 集成到 Agent 的提示策略 中(即先检索再回答),每个 Agent 都能基于最新的知识执行任务。这样的多 Agent 系统 在协作时,不仅依赖自身的参数记忆,还共享了一个动态更新的外部知识源,使整体决策 更加依据事实依据。 值得一提的是,RAG 与 Agent 的结合已在一些前沿实践中展现出巨大潜力。所谓 “Agentic RAG”指的就是将自主 Agent 与检索增强相融合的新范式,被认为是构建动态决 策、实时适应环境的智能系统的关键。比如基于 LangChain 的 Agent 可以被配置成在需要 时调用检索工具,从向量数据库中获取额外信息,再决定下一步行动。这种自主检索的能 力让 Agent 在面对复杂任务时更从容——它们可以一边对话或规划,一边查询资料佐证自 己的判断。研究指出,结合了检索系统与自主 Agent 优势的 RAG 框架能够处理多样化的 真实世界任务,显著提升 AI 系统的上下文感知和决策可靠性。在实践中,这意味着无论是 客户服务助手自动查找 FAQ 答案,还是学术助理检索文献生成引注,多 Agent 系统借助 RAG 都能表现出更强的知识支撑能力,为最终用户提供带有依据的高质量回复。

实践:推荐使用 lightRAG 等工具

实践中,为了简化 RAG 流程的构建与部署,出现了多个成熟的开源框架。其中,我们更 推荐使用的是 lightRAG。它是一种轻量化、模块化的检索增强生成架构,专为实际应用 中的部署效率、易用性和灵活性设计。相较于传统的 RAG 框架(如基于 Faiss 或 Llama Index 的方案),lightRAG 摒弃了过重的工程依赖,强调“即插即用”的组合能力:用户可 以自由选配嵌入模型、检索后端、生成模型等组件,通过简洁的配置快速搭建起一个高效 的知识增强系统。

lightRAG 的最大优势在于“精简而不牺牲能力”。一方面,它通过轻量的代码结构降低了 集成和维护的门槛,特别适合中小型企业或个人开发者;另一方面,它保留了 RAG 的核 心机制,包括多文档检索、上下文构造与答案生成流程,并支持与现有 Agent 框架(如 LangChain Agent 或自定义多 Agent 系统)无缝衔接。开发者可以轻松调用 lightRAG 作 为某个 Agent 的知识接口,使其具备动态提取外部信息、丰富内容生成的能力。在复杂任 务中,如报告写作、文献对话或策略评估,lightRAG 为 Agent 提供了一个可靠的“信息基 座”,显著提升了整体系统的知识支持质量与响应可信度。此外,lightRAG 还支持本地部 署与私有知识库接入,保障数据安全的同时,避免对云端服务的重度依赖,适合对隐私性 或实时性有较高要求的场景。

总体来看,lightRAG 在工程简洁性与功能完整性之间实现了较好平衡,是当前在多 Agent 架构中引入本地知识增强的理想选择之一。

进阶 3.0:Socratic-Prompt 与 Self-Check 削弱模型幻觉

深度研究的最核心问题是:为什么大模型会产生幻觉?

在默认情况下,普通提示(prompt)下的语言模型往往缺乏对自身回答的反省和严格推 理结构的约束,这使其生成内容时容易出现“幻觉”(hallucination)现象。所谓幻觉, 指的是模型给出了看似合理但实际上虚假或不准确的答案。

造成这一问题的原因有多方面,但核心在于:大型语言模型本质上是通过在海量语料上学 习文本模式来预测下一个词语。模型并没有内置真实理解或事实校验的机制,因此当遇到 训练数据中缺乏的知识时,它倾向于根据学到的模式“填补空白”,甚至不惜编造信息以 完成一句话。简单来说,如果用户提问涉及模型知识盲区或需要推理而模型未被明确指导, 其回答可能只是凭借相关语境胡乱拼凑,缺乏真实性和一致性。这就是普通 Prompt 下幻 觉频发的根源。 此外,普通提示往往直接要求模型给出答案,没有要求模型展示中间推理过程或反思检查 步骤。这种“一步到位”的生成使模型倾向于跳过严谨的逻辑推演,直接产出表面上连贯 的结论。然而缺少逐步演绎过程,模型可能无法发现自己推理中的漏洞或事实错误。例如, 在没有约束的情况下,模型可能自信地提供一个不存在的引用出处,或将两个人物的事迹 混为一谈而不自知。模型输出的流畅性掩盖了其中潜藏的谬误,当提示缺乏引导时,模型 也缺少“反省”的契机去校正自己的回答。这正是普通 Prompt 的局限:模型缺少自我检 查和平行验证的机制,从而对谬误毫无察觉,最终将不真实的信息输出给用户。

可以显著改善幻觉问题的两种方法:Socratic-Prompt 与 Self-Check

针对上述问题,研究者和开发者提出了多种强化模型自我监督和推理的提示策略,其中具 有代表性的方法包括苏格拉底式提示(Socratic Prompting)和自我检查(Self-Check) 框架。 Socratic-Prompt(苏格拉底提示)借鉴了人类教学中的苏格拉底提问法,其核心思想是 通过提问-回答的循环引导模型逐步深入思考问题,而不是直接给出最终答案。具体来说, 代替一次性要求模型回答复杂问题,提示词引导模型先提出一系列相关的子问题,或让模 型自身针对原始问题进行拆解和反问,然后再逐一解答这些子问题,最终汇总形成完整答 案。

有趣的是,这个过程类似于模型同自己进行对话辩论:每提出一个假设或部分答案,即对 其加以反思或进一步追问。在不断的追问下,模型被迫检视自身对问题的理解是否透彻、 推理链条是否完整可靠。这样的逐层刨根问底可以避免模型匆忙给出未经深思的结论,鼓 励它在回答前先检验思路的正确性。从实践来看,“苏格拉底式提示”往往能促使大语言 模型给出更精确且有依据的答案,并能附带合理的解释过程。模型在对话中不断被要求阐 明理由、来源和逻辑,使其难以敷衍了事地编造事实,从而可以在一定程度上缓解幻觉问 题。

Self-Check(自我检查)则是一种让模型充当自身审查员的思路。其基本框架是:先让模 型按照常规流程生成回答草稿,然后引导模型对这个初始回答进行审核和反思,找出其中 可能的错误、不合理或不一致之处,并尝试纠正。Self-Check 提供了一种自监督回路,即 模型生成内容后,重新扮演“校对者”角色检查前面的输出。这种检查可以是多方面的, 例如核对事实陈述是否与已知常识或提供的资料矛盾,推理步骤是否合逻辑,答案是否完 整回答了提问等。如果发现问题,模型将在反馈基础上进行修改完善。研究表明,大型模 型在零样本设置下具备一定能力识别自身推理过程中的错误。Self-Check 正是利用这一能 力:通过设计适当的提示,模型可以标记出自己推理链条中的可疑环节,然后据此调整答 案,从而提高最终结果的准确度和一致性。 例如,一个模型计算一道数学题,如果最后结果可能有误,Self-Check 步骤会引导模型 重新审视每一步计算,发现某步算错或遗漏了某种情况。确认错误后,模型即可纠正并给 出更新的答案。又或者在生成一段历史叙述后,Self-Check 提示模型:“请检查以上叙述 中有无与已知史实不符之处”,模型若检测到某个年份或事件有出入,就会修正为正确信 息。这种自我审阅的过程类似于作者写完文章后自行校稿:通过反思来发现疏漏和谬误, 并在下一个版本中改进。值得注意的是,自我检查并不依赖额外的外部工具或数据,它更 多地是利用模型内部的知识和推理能力来交叉验证自己的答案。例如最新的研究 SelfCheck 框架提出,让模型对自己的逐步推理进行验证打分,并结合多个解答的自检结果投 票,能够显著提升复杂问答任务的正确率。 业界已经证明,由模型来审阅先前回答并提供改进建议,可以有效纠正模型常见错误,减 少不可靠信息的输出。总体而言,Self-Check 思路为大型模型增加了一道自审程序,使其 输出经过“二次思考”,从而更趋近严谨可信。

不同技术路线的对比与优劣

将普通 Prompt、Socratic-Prompt 和 Self-Check 三种策略进行对比,可以发现它们在 生成质量、一致性及幻觉控制方面各有特点。

普通 Prompt:优点是使用最为简单直接,响应速度快,适用于那些问题明确且模型 掌握充分知识的情境。但其缺陷也很明显:由于没有强制性的推理展开和验证过程, 模型往往倾向于给出即兴式的回答,哪怕不确定也会编造细节以满足提问要求。这导 致普通 Prompt 下回答的可靠性难以保证,事实错误和不一致之处可能不易被模型自 身察觉。特别是在开放领域问答或知识密集型任务中,普通 Prompt 生成的结果经常 缺乏依据支撑,出现幻觉的概率较高。

Socratic-Prompt:通过引导模型自问自答、步步深入,Socratic 提示显著强化了模 型的推理深度。模型被动转换为主动思考,多轮提问促使其检查前提、划分子任务、 解释每一步推论,这种过程有助于提高答案的逻辑性与完整性。相较普通 Prompt, Socratic 方式下模型更不容易前后矛盾或遗漏要点,因为在对话推进中不合理的地方 可能被下一问及时暴露并纠正。此外,由于模型需要为每个中间问题给出解释,它生 成的内容往往附带依据和分析过程,使最终答案更具透明度和说服力。当然, Socratic 提示的不足在于实现复杂度和时间开销更大——它相当于将一次提问扩展为 模型的一系列对话,对计算资源的消耗也更高。在多 Agent 架构下,可以考虑引入一 个专门的提问 Agent 来实现 Socratic 式的引导,但这增加了系统设计的复杂性。不过 在对答案质量要求极高的场景(例如医疗诊断、法律咨询),这额外的开销是值得的: 苏格拉底提示有效降低了模型胡乱回答的倾向,让每一步都有据可循,从源头上减轻 了幻觉风险。

Self-Check:自我检查为模型输出把了一道“后置关”。与 Socratic 不同的是,它不 干预模型最初的思考过程,而是在生成初稿后再进行审核修正。其优势在于提高答案 准确性的同时不显著增加用户交互轮次:用户仍然只提一个问题,模型内部完成回答 和校对两个阶段。例如在多 Agent 系统中,可以在主 Agent 生成答案后,引入第二个 担任“审查官”的 Agent 来依据已有知识或规则校验该答案,再决定是否让主 Agent 修正。这种双重把关机制下,最终给出的答复更可靠。一大优点是 Self-Check 能捕 捉到一些模型自己都没注意的错误。例如模型在编造一个引文后,审核步骤可能让它 意识到引文不存在从而改正。相比苏格拉底提示,自我检查对提示设计的侵入性更小 ——无需彻底改变模型回答方式,只是在结尾追加检查指令即可。因此在工程实施上 更易于整合到现有 Agent 流水线中。然而,Self-Check 也有局限:它依赖于模型识别 自身错误的能力。有些情况下,模型可能对自己的谬误抱有不正确的信心,从而在检 查阶段也未能发现问题。此外,自我检查可能会增加一次模型调用,如果模型本身计 算昂贵,这也需要在效率上权衡。尽管如此,研究和实践表明,引入自我验证的模型 往往比单次输出的模型稳定性更好,在知识问答、推理题等场景下正确率更高。特别 是结合多 Agent 架构时,一个负责自我检查的 Agent 或模块可以极大提升团队决策的 可靠性:它为所有 Agent 的输出提供了统一的质量门控,减少了错误信息被进一步传 播的风险。

综上,三种提示策略各有适用情境: 1、普通 Prompt 胜在简单高效,但在复杂任务中容易幻觉频出; 2、Socratic-Prompt 通过结构化对话增强了模型思考深度,适合需要缜密推理、不容出 错的任务,但实现相对繁琐; 3、Self-Check 为结果增加了校验纠错环节,在保持交互简洁的同时提高了答案准确度, 是权衡效果和成本的一种折中方案。

在多 Agent 系统中,这些方法也可融合应用:例如先用 Socratic 式提问 Agent 挖掘各方 面信息,再用 Self-Check 机制由另一 Agent 审核整合最终答案,从而最大程度地降低谬 误。随着对抗幻觉需求的提高,未来的智能体很可能同时具备这两种“自省”能力——既 能在回答前透过提问深入推理,又能在回答后反思检验,在群体协作中实现更高层次的可 靠与智能。

债市深度研究实践案例

可转债研究:分析正股基本面

固收领域中最容易让大模型入手的工作就是转债个券研究。一方面,转债品种涉及行业较多, 而机构在正股研究上对颗粒度要求相对不高,非常适合大模型进行批量化研究;另一方面, 转债投资又对量化技术有一定需求,大模型在写代码及编制量化策略方面也很有优势。 我们使用大模型对转债进行研究实践主要有以下几个尝试: 第一、正股个券研究。全覆盖个券研究在转债上几乎很难实现:一方面,转债市场总量规 模不大、但个券数量过多,必然导致研究员数量较少→难以跟踪如此多数量的个券;另一 方面,大量转债个券正股为微盘股,几乎没有行业研究员深度覆盖,现成的研究资源本就 匮乏。但大语言模型能大幅提升转债研究员覆盖个券的能力:1、快速整合财报、公告等 数据;2、大模型的 Deep Research 版本能快速生成较好的个券深度报告;3、联网搜索 个券已有的市场公开信息 第二、转债策略量化研究。转债市场个券繁多+择时重要性强于股市+低价等天然的因子指 标→量化研究是转债投资者的基本功。大模型对于代码的提升毋庸置疑,基本能让代码初 学者短期快速提升至熟练水平。尤其在金融领域的类脚本代码,大模型几乎能完全替代研 究员的代码写作。譬如我们需要复盘过去几年不同股债配比下的策略净值,大模型能够快 速给出 python 代码、实现策略。 第三是、市场复盘、调研总结等市场信息层面。股市复盘、转债市场复盘等日度信息层面, 经过训练的大语言模型能快速总结。大语言模型还能快速总结单只个券的调研信息、会议 记录等,并且其中的搜索功能还能够获取常规搜索很难看到的部分信息,能够极大提升转 债投资者的研究效率。

先以正股个券研究为例,如何使用大模型进行深度研究?首先,我们已经根据前文构建了 多智能体研究系统,包括研究主管、独立研究员、质量控制、资料搜索引擎以及文字润色 者等多个 Agent。需要特别设计的主要是针对 转债的 Prompt,我们建议尽量参照深度研 究报告大纲,再加入一些短期信息,整合为一个研究框架,示例: ## 公司基本面研究框架 请基于一名专业的 A 股行业分析师的视角,对公司进行详细的研究: 1、公司概况与重要信息:公司的起源与发展历程、公司的创始人与主创团队梳理与分析、 当前的股权持有结构。 2、行业分析 :公司所处行业、核心业务、产业链中的位置、主要竞争对手等。结合波特 五力模型对公司所处的行业进行分析。 3、业务模式与盈利能力:主要产品/服务结构、客户与供应链、盈利能力、成本控制。4、 成长性与市场拓展:市场份额、公司扩张路径、行业趋势。 5、经营效率与财务健康 :收入与利润增长、ROE/ROIC/ROA、资产负债结构、财务估值。 6、竞争优势与投资亮点 :核心竞争力、增长催化剂、市场与估值预期、2025-2027 年的 盈利预测模型。 7、未来股价波动因素。

再以转债量化为例,能够快速获取简单的策略代码,譬如构建转债市场的风格因子: 请利用 python 代码构建以下转债因子: 已有的 dataframe:A:资产价格、B:资产平底溢价率、C:资产余额…… 构建及输出因子的方式:算数平均的指数构建方式 1、高价、中价、低价:通过价格 110、130 元分为三类; 2、大盘、中盘、小盘:通过余额 10、40 亿分为三类; 3、偏债、平衡、偏股:通过平底溢价率 0.8、1.2 分为三类; …… 最后输出成为一个各风格指数 dataframe 返回 其他需要注意的有:价格、平底溢价率、余额……的 index、columns 不完全匹配

当然,简单 prompt 在实践中存在不少问题: 1、大模型很容易泛泛而谈,需要加入很多限定词强化提示。如 分析前:1)所有分析都要基于最新财务报告;2)行业分析要篇幅多一点,重点关注产业 链关键环节、商业及盈利模式、行业竞争格局;3)聚焦公司,分析市场份额、关键财务 数据、估值和基本面的匹配度、短期和中期股价上涨的催化剂;4)请按照以下报告模版 输出内容:【1、2、3、4……】 2、正股个券研究幻觉一般比较严重——单纯 prompt 可能难以完全解决,建议用 RAG 与 本地知识库。我们建议使用 1~3 万份文字材料作为资料喂进本地知识库(如招股书、券商 研报、微信公众号文章等),实践证明十分有效。但对于一般投资者而言,搭建 RAG 及知 识库嵌入成本较高,可以用其他两个方法减轻幻觉:①Socratic-Prompt 强制反刍;②selfcheck。再简单一点,还可以将答案变为问题再重复投喂给大模型,当然如果能够 python 实现,后续答案质量一般会更好。 3、转债量化研究中代码持续报错,且将报错信息返回后大模型仍不能解决。解决方式通 常有:①尽量分步骤提升大模型,不要单次生成过长的代码;②完善原始的输入,并提式 大模型我们已有的数据库;③不单纯返回报错,将原始语句、语句输入输出一同返回;④ 提示大模型灵活调整算法,不局限于报错函数。

信用债研究:分析主体信用资质和偿债能力

信用研究方面,我们以发债主体信用资质分析这一主要日常工作任务为例,来探讨 AI 技 术可以如何赋能。从主观研究角度出发,要分析发债主体(非银为例)信用资质、偿债能 力和风险,首先要把主体区分两大类:城投与产业公司。二者适用不同的分析框架,如果 是城投平台,那么区域资源禀赋、政府支持力度的分析重要性高于主体本身的盈利能力; 如果是产业公司,那么则重点分析行业、主营业务情况。相应地,输入给大模型的研究框 架区别就很大: 如果公司属于城投平台,需要在 Prompt 主体中增加以下框架要求: ## 信用资质分析框架 请严格按以下逻辑逐步分析【XXX】公司的信用资质情况,注意使用最新数据(不晚于 2025 年一季度)。 1、确认平台层级(省/市/区县),分析区域宏观经济情况,如 GDP 及增速、人均 GDP、 人均可支配收入(城镇/农村/全体)、固定资产投资增速;分析区域地方政府财政实力和债 务压力,如一般公共预算收入、政府性基金收入、上级补贴收入、税收收入、地方政府债 务余额、地方显性债务率、地方隐性债务率;分析区域主要金融机构资源,如本区域存款 贷款总额及增速、本省银行数量、对本省贷款投放情况等。 2、分析政府对公司的支持力度(资产划入、注资、补贴等),公司在同层级平台中的地位; 3、介绍公司主营业务,包括各板块收入总量及占比;根据毛利率、净利率、ROE 指标分 析公司盈利能力; 4、分析公司资本结构(品种、期限、成本等),偿债能力; 5、总结城投平台相关化债政策和公司所处区域有关政策,以及各类融资政策变化是否对 公司偿债能力有所影响。

如果是产业公司,则是: ## 信用资质分析框架 请严格按以下逻辑逐步分析【XXX】公司的信用资质情况,注意使用最新数据(不晚于 2025 年一季度)。 1、分析公司所属行业特征、供需关系、行业最新政策动向、宏观经济对景气现状影响及 展望,企业在产业链中的位置、议价能力,周期性强弱,现有市场规模及未来增长潜力等; 2、公司主营业务介绍,包括各板块收入总量及占比,公司的核心竞争力/发展策略;根据 毛利率、净利率、ROE 指标分析公司盈利能力; 3、分析公司资本结构(品种、期限、成本等)、偿债能力; 4、明确公司属性(央企、国企、民企),以股权穿透的最终结果为基础总结当前股权结构, 股东背景;是否获得资产划入、注资、补贴等形式的政府支持。以及融资能否获得较多银 行的支持。 最后再根据以上分析,结合主观判断指出公司偿债安全性如何、公司抗风险能力的主要优 点及应该持续跟踪的风险点等。

AI 可以帮助我们进行基本信息的搜集和整理,通顺且有逻辑的文字描述,对一个主体进行 初步、迅速的了解和分析,但是距离深入精细的研究尚有一段距离。需要格外提防并人为 优化的地方有三点: 第一、数据的准确性、全面性和及时性。如何解决数据方面的问题?可以把输入的指令详 细化,譬如具体到什么公告、哪一个外部链接或者具体的网址,公告/网址中的哪部分内容。 不过,搜集整理具体的网址也比较花费时间,如区域财政金融数据,每个省/市/区县都有 自己的网站,每次整理相应的数据来源也较为繁琐,需要自己建立并积累起相应的资料库。 第二、资料来源方面,信用债的研究需要较大程度地参考信用评级公告。但信用评级公告 尚未更新的情况下,可能只能依托:1)公司披露的年报或半报报;2)市面上的公开信息; 3)调研得到的一手资料但相对私密、说服力不足。这就需要进行更大范围的深度搜索与 研究,较为耗费资源与人力;第三、大模型“思辨性”仍不够,因此在定性判断上还不能完全替代人类,例如政府对于 公司的支持力度,公司在所处区域中的地位等,这部分内容还是只能以主观判断为主,大 模型结果只能适度参考。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至