GLM-5.3与Flash金融投研能力实测:估值回测与行业研究表现

  • 来源:国金证券
  • 发布时间:2026/08/30
  • 浏览次数:63
  • 举报
相关深度报告REPORTS

大模型赋能投研系列之三十:GLM_5.3与GLM_5.3_Flash金融投研能力评测.pdf

智谱于2026年8月发布GLM-5.3与GLM-5.3-Flash,前者沿用744B底座强化长程Agent能力,后者以320B多模态底座提供高性价比服务。本报告通过估值建模、多因子回测及行业研究三类任务,对比评测了其与DeepSeekV4系列及KimiK3的表现。估值建模方面,GLM-5.3凭借完整的三表联动与可重算性位居第一,优于其他模型在公式错位或静态数据上的缺陷。GLM-5.3-Flash虽简化了三表结构,但仍保持了较好的假设联动能力,且成本极低。回测任务中,DeepSeekV4系列因计入交易成本及更严格的时点处理领先,GLM-5.3虽数据链完整但缺乏交易摩擦模拟,排名第三。GLM-5....

模型架构演进与成本效益分析

2026年8月,智谱发布GLM-5.3及GLM-5.3-Flash两款大模型。GLM-5.3沿用744B总参数底座,通过长程强化学习栈提升复杂编程与工具执行能力,主打深度推理与稳定性。GLM-5.3-Flash则采用全新320B多模态底座,激活参数仅18B,支持文本、图像和视频输入,旨在以更低成本实现接近旗舰的Agent能力。在通用基准测试中,GLM-5.3在DeepSWE和AutomationBench上较前代显著提升,多数Agent指标略高于竞品V4 Pro;Flash在工具编排和自动化任务上表现优异,局部超越自家旗舰,但在硬推理指标上仍有差距。

价格方面,GLM-5.3维持原价,未命中输入8元/百万Token。GLM-5.3-Flash标价约为5.3的十分之一,限时折扣后仅为二十分之一。在典型长程Agent场景下,Flash的综合使用成本显著低于竞品V4 Flash及V4 Pro的谷时价格,具备极高的性价比优势。本地部署方面,Flash权重大约306 GiB,虽重于V4 Flash,但作为原生多模态模型,其在视觉闭环任务中具有集成优势。

估值建模任务实测表现

在针对中际旭创的估值建模任务中,各模型需完成从数据获取、经营预测到三表联动及DCF估值的全流程。GLM-5.3表现最佳,其交付的工作簿实现了分产品量价假设与三表、估值模块的完整贯通,修改假设可自动重算,且保留了完整的原始查询记录与研报全文,底稿可追溯性强。GLM-5.3-Flash排名第二,虽能实现主要假设联动,但产品拆分较粗,三表结构简化为损益表加现金桥,来源留存较弱。

相比之下,DeepSeek V4 Pro虽然报告逻辑审慎,但Excel模型存在系统性公式错位,修改假设无法可靠更新,综合排名靠后。DeepSeek V4 Flash模型联动完整,但收入预测实质由公司层增速驱动,产品量价未真正接入利润表,存在误导风险。Kimi K3则因关键数据静态化、跨表联动弱及公式错误,在可调整性上表现不足。总体而言,GLM-5.3在财务模型的严谨性与可复核性上确立了优势。

多因子回测任务执行差异

回测任务重点考察模型对历史成分股、交易时点、成本及不可交易状态的处理能力。DeepSeek V4 Pro综合排名第一,其回测框架计入交易成本,区分信号日与执行日,并保留详细的调仓记录与持仓明细,工程完整度最高。DeepSeek V4 Flash排名第二,是唯一计入交易成本的Flash版本模型,但存在信号形成日与执行日口径不一致的问题,可能高估收益。

GLM-5.3排名第三,其优势在于数据链完整且具备纠错留痕能力,能识别并修正“下一交易日”取数错误。但其未扣除交易成本,且未严格处理涨跌停等交易约束,实盘参考性受限。GLM-5.3-Flash排名第四,同样缺失成本与交易约束处理,且采用每日恢复等权的计算方式,偏离标准回测逻辑。Kimi K3因数据库连接中断导致数据覆盖不全,且完全忽略交易成本与约束,排名最后。这表明当前模型在生成研究级代码方面已趋成熟,但在模拟真实交易摩擦方面仍需人工介入。

行业研究与知识库构建能力

在半导体设备行业研究任务中,DeepSeek V4 Pro凭借规范的知识治理位居第一。其建立的Wiki知识库包含完整的实体页、主题页及来源摘要,关键数据可回溯至公开来源,投资框架可复算。GLM-5.3排名第二,其优势在于覆盖广度,建立了33家公司的数据库及大量研报检索结果,但在来源反链和知识库迁移性上略逊于V4 Pro。GLM-5.3-Flash排名第三,实体覆盖较广,但原始资料留存不足,部分页面为空占位,知识沉淀深度有限。

DeepSeek V4 Flash排名第四,虽然报告覆盖范围广,但Wiki知识库仅有少量实体页,且缺乏交叉引用,报告与知识库相互独立,来源难以追溯。Kimi K3排名第五,其投资框架清晰且权重披露完整,但Wiki沉淀极少,缺乏来源管理,难以支持持续更新的研究工作。综合来看,GLM系列在数据整合与初稿生成上效率较高,而DeepSeek系列在知识结构的规范性与可维护性上表现更佳。

投研应用启示与风险提示

评测结果显示,GLM-5.3适合承担资料检索、结构化取数及研究底稿生成任务,尤其在需要长程执行和多文件组织的场景中表现突出。GLM-5.3-Flash则适合作为低成本默认执行层,用于批量处理和联调。然而,所有模型在金融口径严格性、交易可执行性及来源治理上均存在短板。估值结果高度依赖假设,回测结果受限于交易摩擦模拟的缺失,行业研究结论需人工复核数据来源。因此,AI生成的投研内容不能直接作为投资决策依据,必须经过程序侧的代码检查与分析师侧的业务逻辑复核,以确保数据的准确性与合规性。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至