DeepSeek V4 Pro金融投研能力评测:估值回测与行业研究实测

  • 来源:国金证券
  • 发布时间:2026/08/17
  • 浏览次数:36
  • 举报
相关深度报告REPORTS

大模型赋能投研系列之二十八:DeepSeek V4 Pro金融投研能力评测.pdf

DeepSeekV4Pro正式版于2026年8月13日上线,核心升级在于Agent执行能力跃升与Harness开放架构。本报告通过估值建模、多因子回测及行业研究三类真实投研任务,对比评测DeepSeekV4Pro、KimiK3与GLM-5.2的实际表现。技术架构与定价策略V4Pro采用MoE架构,支持100万Token上下文,引入low/high/max三档思考强度。API改用峰谷定价,空闲时段成本显著低于竞品,兼具前沿Agent能力与成本优势。Harness插件化架构实现了模型与执行环境的解耦,增强了任务的可追溯性与安全性。三大投研任务实测结果估值建模任务中,KimiK3因预测颗粒度细排名第...

DeepSeek V4 Pro架构升级与Agent能力跃升

2026年8月13日,DeepSeek V4 Pro正式版正式上线,其核心更新并非单纯扩大参数规模,而是将后训练重点转向生产环境中的Agent执行能力。该模型采用MoE架构,总参数量达1.6T,单Token激活参数为49B,原生支持100万Token上下文。在工程接口方面,V4 Pro补齐了Responses API与Codex适配,并引入low、high、max三档思考强度控制,以适应不同复杂度的任务需求。相较于预览版,正式版在HLE工具增强、TerminalBench 2.1、DeepSWE等公共基准上均有显著提升,其中DeepSWE提升幅度超过300%,表明其在真实代码仓库修改和长程执行上的短板得到实质性修补。

与此同时,DeepSeek同步开放了Harness开发者预览版,采用“一切皆插件”的开放架构。Harness作为位于大模型与业务工具之间的Agent运行时,负责管理上下文、文件、沙箱及多Agent编排,并记录完整执行轨迹。这一设计使得模型能力从单点评分转向模型与执行系统的协同,为金融机构提供了可追溯、可审计的执行链条,降低了单一平台绑定的风险。

API定价策略调整与性价比分析

自2026年8月17日起,DeepSeek API改用峰谷定价机制。高峰时段为工作日的上午9点至12点及下午2点至6点,其余时间为空闲时段,空闲时段价格为高峰时段的一半。以“100万未命中输入+20万输出”的长程Agent任务为例,V4 Pro在空闲时段的成本约为7.2元,高峰时段约为14.4元。尽管相比旧价有所上涨,但相较于Kimi K3和Claude Opus 4.8等前沿模型,V4 Pro仍具有明显的成本优势,空闲时段成本仅为Kimi K3的17%左右。

从能力与成本的匹配度来看,V4 Pro在多项Agent基准测试中与Kimi K3持平,高于GLM-5.2和Claude Opus 4.8。对于高频、可重试的日常任务,V4 Flash凭借更低的绝对成本更具性价比;而对于知识密度高、失败代价大且需要长程工具协同的复杂投研任务,V4 Pro在统一执行环境下展现出更强的稳定性与可靠性。机构在进行采购决策时,应结合自有任务集的成功交付成本进行综合衡量,而非仅关注单Token价格。

估值建模任务实测:颗粒度与公式联动性差异

在针对中际旭创的估值建模任务中,Kimi K3表现最佳。其收入预测采用“分产品销量×单价”的拆解方式,预测逻辑颗粒度最细,且投资分析报告结构完整,结论与目标价、评级保持一致。尽管其Excel模型部分关键数据以静态形式呈现,限制了假设修改后的自动重算能力,但整体逻辑自洽性较强。

DeepSeek V4 Pro排名第二。其报告口径更新及时,结论审慎,但在收入预测上未建立销量与单价的分产品模型,预测方法略显粗糙。更为关键的是,其交付的Excel模型存在系统性公式错位,如经营预测表后四年无法承接上期收入、DCF折现公式错误等,导致修改假设后无法可靠重算。GLM-5.2排名第三,其工作簿核心公式出现异常,收入增速、EPS等关键数据无法正常计算,且投资报告中的目标价与评级存在明显冲突,底稿可用性较差。

多因子回测任务实测:交易约束与可复核性

在多因子回测任务中,DeepSeek V4 Pro排名第一。该模型能够正确处理历史成分股、行业分类及财务披露日,明确区分信号形成日与交易执行日,并扣除单边0.03%的交易成本。其交付的底稿包含29个工作表,保留了每期选股得分、调仓记录及组合净值,具备较高的可逐期复核性。尽管在持有期口径上与标准惯例存在细微偏差,但整体工程完整度显著优于其他模型。

Kimi K3排名第二,其交付文件链条较为完整,但未扣除交易成本,也未处理涨停、跌停及停牌等不可交易状态。在高换手率策略下,忽略交易摩擦会导致收益被明显高估。GLM-5.2排名第三,其回测结果中毛收益与净收益完全相同,相当于未考虑交易成本,且中间过程披露不足,使用者难以还原策略形成的具体路径,可核实性最弱。

行业研究任务实测:知识库沉淀与来源追溯

在半导体设备行业研究任务中,DeepSeek V4 Pro再次位居第一。其不仅交付了结构完整的行业深度报告,还构建了包含17个公司实体页、20个来源摘要页的Wiki知识库。关键数据可追溯至SEMI、WSTS等权威来源,投资框架采用六维评分体系,分项与合计均可复算,体现了较强的知识沉淀与来源管理能力。

Kimi K3排名第二,其投资框架给出了明确的权重与计算过程,评分逻辑清晰。然而,其Wiki知识库沉淀不足,仅建立了少量公司实体页,缺乏来源摘要页,导致报告中的大部分数据难以通过知识库追溯至具体来源。GLM-5.2虽然知识库覆盖面较广,但缺少评分权重与计算方法,结论无法还原,且内部链接存在多处断裂,可核实性在三个模型中最弱。

总结与展望

综合三项实测任务,DeepSeek V4 Pro在回测与行业研究中表现优异,尤其在数据处理的严谨性、交易约束的处理以及知识库的可追溯性方面展现出优势。Kimi K3在估值建模的逻辑颗粒度上表现突出,但在执行细节与知识沉淀上仍有提升空间。GLM-5.2在三项任务中均存在底稿可用性或逻辑一致性问题,排名靠后。

当前大模型在金融投研中的应用已从单纯的文本生成转向复杂的长程任务执行。模型之间的差距主要体现在预测方法的颗粒度、底稿的可复核性、交易约束的处理以及来源追溯能力等方面。随着Harness等执行系统的开放,未来投研能力的竞争将更多体现为模型与执行栈的协同效率。机构在应用此类工具时,需建立严格的插件签名、权限管理及审计策略,以应对潜在的安全与合规风险。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至