2026年8月第3周计算机行业周报:大模型评测基准解析

  • 来源:国联民生证券
  • 发布时间:2026/08/17
  • 浏览次数:28
  • 举报
相关深度报告REPORTS

计算机行业周报:大模型竞相“打榜”,如何评估谁最强?.pdf

2026年7月中旬以来,国产语言大模型迎来密集发布潮,月之暗面KimiK3、DeepSeekV4系列及智谱GLM-5.3等模型相继亮相,在编程、Agent能力及垂直领域表现上取得显著突破。面对各家模型评测维度不一、基准饱和的现状,如何科学评估大模型实力成为行业焦点。本报告系统梳理了当前最具参考价值的大模型评估基准体系。指出传统基准因得分趋同已失去区分能力,评估重心应转向反映真实工作场景的动态基准。重点分析了五大类基准:工具调用与MCP编排(如Toolathlon-Verified)、环境交互与计算机操作(如Terminal-Bench3.0)、代码开发与软件工程(如DeepSWE、NL2Rep...

市场回顾与行业动态

本周计算机板块整体呈现震荡走势,沪深300指数与中小板指数小幅下跌,创业板指数则录得上涨。在个股表现方面,兆日科技、ST易联众等位居涨幅前列,而汇金科技、朗科科技等则出现较大幅度回调。行业层面,SpaceX完成对AI编程公司Cursor的大额收购,标志着科技巨头在AI工具链领域的布局进一步加深。同时,前阿里巴巴千问大模型负责人林俊旸创办语用科技,聚焦下一代Agent研究,显示出高端人才在智能体领域的持续流动与创业活力。

大模型密集发布与评测困境

2026年7月中旬以来,国产语言大模型进入密集发布期。月之暗面发布的Kimi K3在编程榜单中登顶,实现开源模型对头部闭源模型的首次超越。DeepSeek相继推出V4-Flash及V4-Pro正式版,显著增强了Agent能力,并在多项基准测试中表现优异。智谱发布的GLM-5.3通过后训练Scaling提升了智能上限,在编程与网络安全任务中取得开源第一。然而,各家模型在Benchmark展示上维度不一,导致投资者与从业者难以科学评判模型优劣。随着近一半主流基准趋于饱和,评估标准亟需从静态知识考察转向真实工作场景的任务执行能力。

核心评测基准体系解析

针对大模型评估,当前值得重点关注的基准主要涵盖五个维度。在工具调用与MCP编排方面,Toolathlon-Verified评估智能体在现实环境中使用工具的能力,强调多步骤工具链的编排。环境交互与计算机操作方面,Terminal-Bench 3.0因难度较高且区分度好,成为衡量Agent通过终端操作计算机能力的关键指标,GLM-5.3在此基准中表现突出。代码开发与软件工程领域,DeepSWE、NL2Repo和ProgramBench因规避了数据污染问题,能更真实地反映智能体从零开发软件的能力,目前前沿模型得分仍有较大提升空间。

高级推理与长周期规划能力是智能体落地高价值场景的关键。Agents' Last Exam(ALE)旨在评估AI在长期跨度、具有经济价值的真实世界任务上的表现,目前主流模型通过率极低,显示该领域远未饱和。垂直领域专业智能体能力方面,CyberGym、Harvey LAB-AA等基准分别针对网络安全、法律等专业领域,其中GLM-5.3在CyberGym测试中展现出优于部分国际主流模型的漏洞发现能力,体现了垂直领域专业化的突破。

投资建议与风险提示

伴随开源模型与闭源模型差距持续收窄,K3 License开创的分成模式有望加速渗透,DeepSeek的涨价正式打开国内大模型量价齐升的商业化黄金期。这一趋势利好开源模型公司与算力租赁厂商两大方向。建议重点关注智谱、MiniMax等开源模型方向标的,以及宏景科技、集智股份、协创数据等算力租赁方向标的。需注意人工智能政策落地不及预期及行业竞争加剧带来的潜在风险。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至