2025年AI大模型在投资研究中应用及未来趋势

  • 来源:招商证券
  • 发布时间:2025/02/20
  • 浏览次数:1509
  • 举报
相关深度报告REPORTS

AI大模型在投资研究中应用及未来趋势.pdf

AI大模型在投资研究中应用及未来趋势。近期DeepSeek系列开源大模型凭借低成本高性能的优势,引发全球关注。随着大模型训练和推理成本的快速下降,在投研场景下运用大模型技术对关键步骤进行赋能的可行性也在不断提升。当前,如何将大模型深度融入投研工作以提高投资决策的效率和质量仍然处在探索期。本文将梳理大模型的发展路径、关键技术和面向金融领域的应用案例以供参考。随着模型能力的不断提升以及模型训练成本的不断降低,AI大模型的应用范围正在不断扩大。DeepseekR1模型在性能和价格上的优势使其成为日常工作的最佳选择之一。R1蒸馏系列模型可以在本地较低的硬件条件下进行部署并满足简单的日常工作,14B参数...

一、大语言模型的发展回顾

1.1. 大语言模型的技术发展路线

1948 年 香 农 发 表 开 创 性 的 论 文 《 A Mathematical Theory of Communication》,首次在论文中提出了信息熵的概念,并通过统计方法研 究英语文本的冗余度,引入了预测下一个字符概率的思想,这一思想也奠 定了语言模型的理论基础。从 1948 年开始计算,语言模型已经发展了 70 余年。

从按照语言模型的演进路线来看,主要分为四个阶段: 1) 统计语言模型时代(1948-2012), 安德烈·马尔科夫(Andrey Markov)在 1913 年首次将马尔科夫链应用于语言分析,通过研究普希 金的《叶甫盖尼·奥涅金》中元音和辅音的转换序列,开创了用概率模 型处理语言序列的先河。这种处理方法后来发展成为了 N-gram 模型的 理论基础。1976 年,Frederick Jelinek 等人在语音识别研究中首次系 统地提出并应用了统计语言模型,通过 N-gram 模型来计算词序列的概 率,这标志着现代统计语言模型的正式诞生。 2) 神经网络语言模型时代(2013-2017),Bengio 等人在 2003 年提出通 过神经网络实现词的分布式表示的方法,开创了深度学习在自然语言 处理领域的先河。2013 年,Mikolov 等人提出 Word2Vec,通过高效的 训练方法获得词向量表示,极大推动了词嵌入技术的发展和应用。这一 时期的主要贡献是解决了传统统计语言模型中的维度灾难问题,实现 了词的低维稠密表示。 3) Transformer 革命时代(2017-2019),2017 年 Google 团队发表了里 程碑论文《Attention is All You Need》,通过自注意力机制取代了传统 的循环和卷积结构,实现了更高效的并行计算和长距离依赖建模。这一创新引发了预训练语言模型的第一波发展浪潮。这一阶段的主要成果 主要以 BERT 和 GPT 为代表。BERT 采用双向编码器架构,通过掩码 语言模型(Masked Language Model)和下一句预测(Next Sentence Prediction)两个预训练任务,在多个自然语言理解任务上取得突破性 进展。与此同时,GPT 采用单向解码器架构,通过自回归语言建模进 行预训练,在生成任务上展现出强大能力。 4) 大规模预训练模型时代(2020-至今),以 GPT-3 的出现为标志性事件, 该模型首次将参数规模扩展到 1750 亿,展示出显著的 few-shot 学习能 力,验证了"规模即智能"的可能性。这一时期的发展特点是训练范式的 演进,从基础预训练发展出指令微调和人类反馈强化学习(RLHF)等 更 复 杂 的 训 练 方 法 。 在 开 源 生 态 方 面 , 以 LLaMA 、 Qwen 和 DeepSeek 为代表的开源大模型推动了社区创新,同时带来了架构优化、 训练效率提升等技术创新。模型能力也实现了质的飞跃,在上下文理 解、推理能力、代码生成和多模态理解等方面取得重要突破。表 1 中 展示了大模型技术发展的主要阶段。

以 ChatGPT 应用的火爆为标志,大语言模型逐渐从实验室阶段开始进 入商业应用阶段。而随着模型能力的不断提升以及模型训练成本的不断降 低,AI 大模型的应用范围正在不断扩大。

1.2. 能力提升和训练成本降低加速 AI 应用普及

在当下的时间节点,国内外的大模型已呈现出百花齐放的状况。从整 体表现来看,大模型在不同类型的数据集上的表现已经接近人类的表现, 有部分数据集甚至超过人类的表现。 OpenAI 在基准测试中整体保持了领先的优 势。总体来看, 国内大模型与国外如 OpenAI、Anthropic 等开发的大模型整体处于同一梯 队。

AI 大模型当前正处于快速发展的阶段,上述的得分排名仅代表特定时间 节点的表现,2025 年大模型之间的竞争更加激烈。但还是可以得出两点结 论: 1.大模型的各方面能力都在持续提升; 2.国内大模型的能力与国际一流模型处于同一梯队。 虽然国外大模型在综合性能表现有小幅的优势,但在涉及自主可控、信 息安全的领域,国内大模型可能是更好的选择。

大模型的性能表现是最重要的指标,但在大规模应用落地的过程中, 成本也是重要的考虑因素,不过令人鼓舞的是随着 AI 算法的不断升级,大模型的成本也在快速降低。根据 Semianalysis 的测算,过去 几年,每年 AI 算法效率提升约 4 倍,这意味着要达到相同的能力,所需计 算量每年减少 75%。根据 Latent Space 测算的 LMSys Elo 得分的成本曲线得分来看,截止 2025 年 1 月,过去 3 个月 OpenAI-O1 水 平的模型使用成本下降了 27 倍。OpenAI-GPT4 水平的模型在过去 1.5 年 内下降了 1000 倍。

在上述章节中,本文回顾了大语言模型的技术发展历程。当前大模型 的技术主要以 Transformer 结构为骨干网络,通过 Pre-Training – PostFinetuning 的范式获得在不同场景下都能符合预期的大型语言模型。在当 前时间节点,大语言模型在不同领域的能力(文本理解、编程、数学、推 理等)正在快速提升,同时成本也在快速下降,这为 AI 应用的普及提供了 可能性。在下一章节中,本文将重点聚焦对当下大语言模型在金融场景/投 资研究领域的应用如何落地进行探讨。

二、 大语言模型在金融领域中的应用

利用大模型的能力的前提是接入大模型。通常接入大模型通常有两种 方式,一是通过 ChatBot 形式交互,例如 ChatGPT,DeepSeek 等都提供 了以文本对话为主要形式的交互方式,适用于基础的日常工作。二是通过 API 接入,这种方式更具有灵活性,可以嵌入各种工作流和 Agent 之中, 适用于更加定制化和复杂化的场景。

2.1. 大语言模型的官方 API 调用与本地部署

为了构建定制化的 AI 应用,ChatBot 这样的交互方式在与其他模块进 行集成的场景下就显得捉襟见肘。本文主要探讨通过 API 交互的方式。当 前国内以 DeepSeek 为代表的大模型性能表现不俗,成本相比于 OpenAI 等国外厂商也具有一定优势,在大模型选型的时候主要考虑国内的大模型。其中 DeepSeek-R1 为 DeepSeek 开发的 模型,Qwen 的开发厂商为阿里巴巴,Step 为阶跃星辰,GLM 为智谱, Ernie 为 百 度 , Hunyuan 为 腾 讯 , DeepSeek-R1-distill-qwen-32b 为 DeepSeek 利用 Qwen 模型蒸馏得到的模型。总体来看,O3-mini-high 得 分最高,然后是 O1,其次是 DeepSeek-R1 以及 Qwen-Max-32k。

使用官方 API 方便简单在日常研究中可以比较好的满足需求,但是在 涉及到数据隐私安全和定制化的需求(后期训练和微调)的时候,本地部 署开源的大模型可能是更好的选择。开源的大模型中相对主流的有 DeepSeek 系列、阿里的 Qwen 系列、Meta 的 Llama 系列等。 在本地部署大模型已经有比较成熟的工具可用,当前主流的本地模型 部署框架主要是 vLLM 和 Ollama,两个框架都有一定的优缺点。

本节分析了当前国内主流模型与 OpenAI 主流模型在 LiveBench 测试 中的表现和 API 价格对比,总体来看 Deepseek-R1 以较低的价格达到接近 openai-o1 的能力水平,在日常工作中是一个比较好的选择。同时,在对 API 稳定性、数据安全和模型后续可微调有要求的场景下,本地部署大模 型是更好的选择。 本文利用 Ollama 框架在本地环境中部署了 Deepseek-R1 利用开源 qwen 模型蒸馏的版本,包括 1.5b 到 32b 的模型。在简单测试中发现,模 型主要依赖显存运行,更大的 GPU 显存是支持部署更大模型的主要条件之 一。同时本文发现 7b 及以下的模型可能存在比较明显的指令理解问题,在 投研工作中,14b 以上的模型可能是更佳的选择。

2.2. 大模型在投研场景中的应用

在投研场景下大模型与人的协同也遵循 AI 应用的主流范式,主要包括 三类: 1) Embedding 模式,人类作为决策者和指挥者,例如报告撰写中人通过 prompt 模板来进行自动化的图表生成,AI 作为工具执行人的命令。 2) Copilot 模式,人类与 AI 作为合作者,例如程序代码的自动生成、错误 检查和性能优化,在 这一模式下 AI 的知识与人的知识形成互补,共同 完成工作目标。 3) Agent 模式,人类为 AI 设定工作目标并提供必要资源(计算能力、相 关数据等)并监督和评估 AI 的工作结果,AI 通过拆解目标,规划过程, 选择工具,完成大部分的工作。投研 Agent 系统可能是未来大模型在 投研场景中应用的主要范式之一。

当前大模型已经具备参与投研工作流的各个环节的能力,在本章节中 本文将结合当下的相关实践来探讨 AI 大模型的在投研工作中应用方式。

2.2.1. 面向金融领域的大模型

面向金融领域的大模型相比于通用模型的特点是在金融领域的特定任 务上的关注度更高,对于金融知识、金融文本理解、投研应用等领域的能 力有特化的要求。

通用模型在特定领域的表现可能不佳,在行业分析层面也表 现不佳。为了改进大模型在金融细分领域的能力。通常有两类方法:

1) 利用大规模金融数据集和金融行业的垂直任务重新训练模型,例 如 Bloomberg 利用自身的数据优势,通过构建世界上最大的特定 领域数据集之一来训练一个金融行业大模型 BloombergGPT。 Bloomberg 宣传在当年(2023 年)的内部和外部金融任务基准测 试中都大幅击败了所对比的通用模型。

2) 利用通用模型+微调的方式构建金融大模型,例如 AI4Finance 社 区通过开源驱动的 FinGPT9。与 BloombergGPT 类似 ,FinGPT 的训练也是以数据为中心,区别在于 FinGPT 主要通过公开的金融 数据来进行训练。通过清洗、校验等预处理后得到训练用的金融语 料,然后利用这些语料微调预训练的开源大模型(包括 Llama、 Falcon、MPT 等)而不是重新训练一个大模型。

从 FinGPT 技术文档中可以得知,FinGPT 使用了 LoRA(Low-Rank Adaptation)技术来微调开源的大模型(FinGPT v3.3 利用 llama2-13b 微 调)。LoRA 的基本原理是在需要训练的模型层上增加一个 LoRA 旁路并冻 结原始模型层的参数来降低训练开销。

LoRA 相当于对原始的参数矩阵 W 做了低秩分解,r 为 LoRA 的秩,这 样大大降低了需要训练的参数使得使用很少的硬件资源来对大模型进行微 调成为可能。此外 FinGPT 还使用了基于股票价格的强化学习技术 (RLSP),这一技术通过将新闻舆情与相关股票的后续表现联系起来进一 步改进模型的表现。

相比于重新训练一个大模型,LoRA 这种参数高效的微调方法极大地降 低了训练一个金融领域大模型的成本。FinGPT 表示在单次训练成本少于 30 美元且仅使用单卡 的情况下 便在公开金融任务测试中超过了 BloombergGPT,GPT-4 等模型的表现。

通用的大模型由于预训练阶段主要在大规模的通用任务语料上进行训 练,在投研关注的领域/任务中的表现不一定能够达到预期。为了训练得到 面向特定金融场景的大模型,一种方式收集大量的金融语料重新训练一个 垂直领域的大模型,例如 BloombergGPT;另一种方式是利用现有的通用 的大模型结合 LoRA 等参数高效的训练方式结合金融语料进行微调。 在经过预训练+针对性微调之后大模型在金融场景下任务(例如股票、 行业分析)的表现通常能够有比较明显的提升,从而能够更好地完成投研 工作任务。

2.2.2. 思维链与检索增强

在上一节中,本文介绍了训练面向金融场景大模型的主流方法,这些 大模型在面向特定的金融任务,例如金融文本的情感分析、财报摘要总结 等能取得相比于通用大模型比更好的表现。但所有大模型都有其知识局限 性即训练的语料。 面对不断变化的金融市场,预训练大模型的知识无法及时更新,其应 用也会受到限制;另一方面,在涉及严谨的数学推理和事实描述的时候, 大模型中普遍存在的幻觉现象又会使得模型输出不可靠。为了解决大模型 的这些局限性,思路链和检索增强技术是其中的关键。 大模型的幻觉一般是指模型的输出与事实不符(事实性幻觉)或者与 用户指令或输入提供的上下文的出现分歧(忠实性幻觉)。Huang L et al. 2023 在其论文中比较详细地研究了大模型幻觉出现的原因。

此外,除了可以利用添加简单的“一步步思考”的 prompt 这种让模型 自己进行思路链生成的方式,也可以自定义 prompt 模板实现 Few ShotCoT。例如在分析股票财报的时候,通过在 prompt 中加入逐步分析资产负 债表、利润表、现金流量表的思维链模板来引导大模型进行财报总结的方 式能够获得更好的效果。 思路链技术显著改善了大模型在推理任务中的表现,提高了模型输出 的准确性。但由于模型训练完后内在知识存在边界,模型在面对未在训练 集中出现的知识时则会无能为力甚至强行编造结果。因此扩大大模型的知 识边界是进一步提高大模型输出准确性的关键。于是便出现了检索增强生 成技术(Retrieval-Augmented Generation,RAG)。

Gao Y et al. 2023 对 RAG 技术作了详细的梳理,根据文中的梳理,实 现 RAG 的典型流程主要包括: 1) 知识库构建与预处理,通过专用文档加载器从 PDF/Word/Excel 等 多格式数据源中提取文本,对原始数据进行清洗与结构化处理(去 除特殊字符、实体解析等)。使用分块策略将长文本切分为相互重 叠的合适大小的语义块。 2) 向量化处理与索引构建,使用 BGE10等词嵌入模型将文本转化为 语义向量并存储到向量数据库,存储时同步记录文档来源、时间等 元数据 3) 混合增强检索,结合传统检索与向量语义检索,通过 Rerank 模型 (如 Cohere 的 Rerank-1 模型)对 TOP 结果进行相关性重排序。 4) 上下文增强,通过思维链(CoT)重构用户指令,为 LLM 补充领 域知识和必要的上下文。 5) 生成优化控制,通过 prompt 模板和输出格式限制,生成符合预期 格式的内容。

2.2.3. 基于 LLM 的 AI Agent 系统

在上述章节中本文介绍了通过思维链(CoT)和检索增强生成(RAG) 技术可以使得大模型获得金融领域的最新知识以及更严谨的思维过程,从 而最终给出高质量投资策略的过程。在这一过程中,大模型可以看作了一 个智能体(Agent),接受外部的信息并产生符合预期的输出。 如果给予 LLM 更多模态的输入(图像、音频等)以及使用其他工具的 能力,LLM 作为 AI Agent 自主规划完成更多的工作。例如 Auto-GPT11的 出现证明了 LLM 作为自动化 Agent 的巨大潜力。Xi Z et al. 2023 梳理了 AI Agent 从概念背景到结构模型以及未来应用前景。

三、 投研场景下的 AI Agent 应用案例

案例 1:金融文本情感分析

Zhang H et al. 2024 研究了 A 股市场中,基于 LLM 对金融新闻文本情 感进行分析的策略。该策略通过给定的提示词模板,对每一条金融新闻文 本给出三个类别的情感分类:GOOD NEW、BAD NEW、NOT SURE,并给出理由。然后基于该情感分类构建情感因子,最终基于情感因子构建投 资组合。

案例 2:基于 LLM 的多智能体投资决策框架

在投研领域,基于多智能体角色模拟的投资决策框架也展现出巨大的 潜力。例如,Fatouros et al. 2024 研究了利用不同类型的金融数据(财经 新闻、基本面信息、宏观分析、股票历史量价信息)和大模型综合形成投 资决策的框架。Li et al. 2023 研究了具有分层记忆的多智能体交易决策系统,通过具有不同个性的智能体之间的相互交流和辩论来生成交易决策。 Xiao Y et al. 2025 提出了一个更成熟的多智能体投资决策框架。

Trading Agents 框架介绍: 提出了一个受交易公司启发的创新股票交 易框架,包含多个由 LLM 驱动的专业 Agent 团队构成: 1. 分析师 Agent 团队,不同类型的分析师(具体包括:基本面、情 绪、新闻、技术指标)将各自的研究和发现汇编成简明的专业分析 报告,报告中需包括关键指标,专业见解,基于其专业分析的建议。 2. 研究员 Agent 团队,包括持牛市观点和熊市观点的两类,通过分 析师 Agent 团队提供的报告,通过多轮辩论评估投资决策的潜在 风险,分析投资决策的潜在收益,并形成报告。 3. 交易员 Agent 团队,交易代理负责执行交易决策,其决策依据来 自于分析师 Agent 团队提供的综合分析和研究员 Agent 团队提供 的细致观点。在评估整合的信息后确定最优交易决策。 4. 风险管理 Agent 团队,评估当前市场的风险,向交易 Agent 提供 风险敞口信息,建议调整交易策略。 5. 基金经理 Agent 团队,批准和执行交易。 整个 LLM Agents 系统通过 OpenAI 提供的 API 来运行(gpt-4o,o1), 根据论文回测的结果显示该框架在 AAPL,GOOGL,AMZN 上的收益和风险 表现大幅超过了基于技术指标规则构建的交易策略。

案例 3:基于人机交互的因子挖掘框架

在量化投研中,大模型同样能够发挥巨大的作用。基于人机交互的因 子挖掘范式在大模型出现后成为了可能。例如 Wang S et al. 2023 提出了 基于人机交互的因子挖掘框架 AlphaGPT。

四、 展望

当前大模型技术正在飞速发展,AI 大模型在各个领域的应用也在快速普 及。在投研领域中大模型技术展示出巨大的潜力。展望未来,大模型在投研 中的核心应用场景可能包括以下几个方面: 1. 投研自动化辅助,自动解析研报资讯,提取核心观点生成初稿,并 通过会议录音转录+自动摘录功能快速形成纪要。 2. 量化策略升级,采集卫星图像、社交媒体情绪数据等多模态的数据, 利用大模型的对非结构化数据的处理能力构建另类量化因子;利用 知识图谱技术整合实体关系数据结合大模型提升资产价格预测精度。 3. 降低智能投顾成本,基于大模型的智能投顾将逐步覆盖各类客户, 降低客服成本。 4. 投研范式创新,利用多智能体框架可以支持全天的行业动态监控, 可快速完成当日所有分析师深度报告的解析。 5. 监管科技赋能,基于大模型构建合规审查系统,可以快速扫描交易 数据,缩短违规预警响应时间。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至