2026年7月国产AI旗舰模型投研能力横向对比评测

  • 来源:广发证券
  • 发布时间:2026/07/24
  • 浏览次数:89
  • 举报
相关深度报告REPORTS

互联网传媒行业AI双周专题(五):模型横向对比,国产模型能力进步显著.pdf

研究目的本报告为广发证券互联网传媒行业AI双周专题(五),旨在通过横向对比评测国内外新一代旗舰AI模型在金融投研场景下的综合能力,跟踪AI产业数据与动态,并给出投资建议。核心内容报告选取ClaudeFable5、GPT-5.6-Sol、豆包办公2.1Pro、KimiK3(Agent集群模式)四款模型,设置六项投研任务进行评测:金融数据清洗与交互式Dashboard开发、涨停板监控模拟器、量化交易策略回测引擎、券商周报Excel自动化、宏观情景推演与传导链分析、行业研究报告撰写。评测结论显示,头部旗舰模型均已跨越投研场景可用门槛,模型间差距从"能否完成"转向"完成质量与信息密度",呈现效果、工程...

评测背景与样本选取

近期多家国内外AI厂商相继推出新一代旗舰模型。继Anthropic发布Claude Fable 5并开放使用、OpenAI发布GPT-5.6之后,月之暗面于7月16日发布Kimi K3模型。本报告选取Claude Fable 5、GPT-5.6-Sol、豆包办公2.1 Pro、Kimi K3(Agent集群模式)四款模型,推理强度均调至最高档,围绕六项贴近投研实务的任务开展横向评测,涵盖编程开发、多文档财报分析、宏观情景推演与行业研究报告撰写等场景。

编程开发能力:功能实现完整,交付形态分化明显

在金融数据清洗与交互式Dashboard开发测试中,四款模型均能良好完成任务。Claude Fable 5采用A股红涨绿跌配色惯例,鼠标悬停交互体验良好;GPT-5.6-Sol在空数据呈现、配色惯例与版式适配上与国内用户使用习惯存在偏差,且默认以竖屏/手机页面为场景;Kimi K3在空数据标注等细节上处理相对严谨,以灰色空格明确标注"无数据"月份。

涨停板监控模拟器测试中,各模型功能实现完整,主要差异在于API服务的便捷程度。国内两款产品默认将行情接口封装于页面内,一体化程度较高;海外两款产品需用户在本地终端自行启动API服务。Claude Fable 5采用卡片式UI,其余三家采用表格式呈现。

量化回测引擎开发是区分度最高的测试项。Claude Fable 5生成的回测报告结构完整,包含核心绩效指标卡片、资金曲线与回撤图及逐笔交易明细表;GPT-5.6-Sol支持CSV上传与参数配置,默认以Sites在线链接交付;Kimi K3回测报告采用浅色主题,行情与交易信号图支持区间缩放与悬停查询,金融口径表述规范。各模型在CSV录入环节均出现日期格式不兼容问题。

办公自动化:头部模型差距已不明显

券商周报Excel自动化测试中,四款模型均能完成模板读取、数据填充、条件格式与目录跳转等规定动作,直接对标金融行业日常工作流。各模型输出大同小异,就标准化办公任务而言,头部模型间已无明显能力差距。

复杂推理与研报撰写:信息来源构成本质分化

宏观情景推演测试中,各模型均能构建基本完整的传导框架。Claude Fable 5具备可见的逻辑推理能力,复杂可视化表现良好;GPT-5.6-Sol推理相对孤立,对三项冲击间交互作用着墨较少,但对核心假设与最大不确定性节点的标注规范。信息来源方面,海外两款模型均通过官方渠道获取信息,未引用券商/第三方投研来源。

豆包办公2.1 Pro推演框架完整,涵盖三大政策事件的本质影响与完整传导机制,但输出未附引用。Kimi K3因Mermaid渲染效果依赖渲染器,直接以Python生成图表;更为关键的是,其Agent能够从中文财经媒体及公开渠道的券商报告获取信息,Agent集群能力更强、本地化更好,整体逻辑链更稳健、精度更高。

行业研究报告撰写测试中,各模型在输出格式上均无错误。Claude Fable 5引用以国外来源为主;GPT-5.6-Sol具备可视化输出,逻辑基本清晰,能基于自身知识进行市场推算;豆包办公2.1 Pro图表以ASCII字符画形式呈现,渲染未能完全实现;Kimi K3信息量更大,可视化更为丰富,是唯一能够信息收集微信公众号等较为私域流量内容的模型,在中文场景下的信息量与信息源广度上相对领先。

评测结论:从"能否完成"转向"完成质量与信息密度"

头部旗舰模型均已跨越投研场景可用门槛,四款模型的功能实现均完整达标,模型间差距已从"能否完成"转向"完成质量与信息密度"。呈现效果与工程稳健性是当前主要分化点,A股配色惯例、空数据处理、版式适配、渲染稳定性等细节直接决定投研用户的实际体验。交付形态呈"国内一体化封装、海外本地化启动"的分化趋势。信息获取与Agent能力构成本次评测的增量分化维度,Kimi K3依托原生Agent集群,可触达中文本地投研信息源,分析颗粒度与信息量领先。

AI数据跟踪与产业动态

OpenRouter大模型token调用量持续上升,2026年7月6日至7月12日调用量达52.6T,环比增长。腾讯Hy3 (free)凭借免费开放策略推动调用量攀升至榜单首位,MiMo-V2.5排名维持第二,DeepSeek V4 Flash位列第三。Agent产品方面,Hermes Agent、Claude Code、Kilo Code三大产品位居应用消耗量前三。

国内主要AI大模型产品网页端访问量中,DeepSeek保持领先,豆包iPhone端下载量排名第一。海外方面,ChatGPT、Gemini、Claude网页端访问量稳居前三。

科技大厂动态方面,月之暗面发布Kimi K3,为2.8万亿参数MoE模型,基于KDA与AttnRes架构构建,原生支持视觉理解及100万token上下文窗口,完整模型权重将于7月27日前开源发布。OpenAI发布GPT-5.6系列,包括Sol、Terra、Luna三款模型,强化端到端知识工作流与Agent能力。Meta正式开放Muse Spark AI模型API并启动商业化,采用按Token调用收费模式。

投资建议

本轮AI产业链的核心驱动来自模型agentic coding能力的增强,以Claude Code、Codex为代表的编程工具正从辅助补全跃迁至自主协作,并由此向上下游传导出多层投资机会。向上游看,Agentic Workload对算力的消耗大幅提升,推动云厂商IaaS&MaaS业务高增长。向模型厂商自身看,Agentic任务驱动Token消耗飙升、头部模型ARR加速提升。向下游应用看,Coding Agent最先验证PMF,关注"Claude Code for X"式的场景复制与Token经济性提升带来的扩展空间。建议围绕自研模型+算力+云生态的垂直整合进行标的选择。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至