2025年人工智能专题:AutoGLM沉思,DeepResearch+Operator,开启智能体新阶段

  • 来源:国海证券
  • 发布时间:2025/04/18
  • 浏览次数:497
  • 举报
相关深度报告REPORTS

人工智能专题:AutoGLM沉思,DeepResearch+Operator,开启智能体新阶段.pdf

人工智能专题:AutoGLM沉思,DeepResearch+Operator,开启智能体新阶段。AutoGLM沉思实现了深度研究能力(DeepResearch)+实际操作(Operator)的结合,推动AIAgent进入“边想边干”的阶段。AutoGLM沉思的技术演进路径包括:GLM-4基座模型→GLM-Z1推理模型→GLM-Z1-Rumination沉思模型→AutoGLM模型。智谱AutoGLM沉思模型GLM-Z1-Rumination突破了传统AI单纯依赖内部知识推理的局限,创新性地结合实时联网搜索、动态工具调用、深度分析和自我验证,...

1、智谱发布 AutoGLM沉思,Agent 能力再迎突破

AutoGLM 沉思正式发布。2025 年 3 月 31 日,智谱正式发布AutoGLM沉思,是全球首个集深度研究与实际操作能力于一体的Agent,AutoGLM沉思的推出是自主智能体技术的一次重要进步,也是设备操控智能体的进一步升级。AutoGLM 沉思的技术演进路径包括:GLM-4 基座模型→GLM-Z1推理模型→GLM-Z1-Rumination 沉思模型→AutoGLM 模型。

AutoGLM 沉思的基座模型——GLM-4-Air-0414,模型具有320亿参数,在预训练阶段加入了更多的代码类、推理类数据,并在对齐阶段针对智能体能力进行了优化,模型在工具调用、联网搜索、代码等智能体任务上的能力得到大大加强。

AutoGLM 沉 思 的 推 理 模 型 ——GLM-Z1-Air 。在性能表现上,可以与DeepSeek-R1(671B,激活 37B)媲美。智谱公司在AIME 24/25、LiveCodeBench、GPQA 等基准测试中对 GLM-Z1-Air 进行了评估,评估结果显示GLM-Z1-Air展现了较为强大的数理推理能力,为更多复杂任务的解决提供了支持。

AutoGLM 沉思模型——GLM-Z1-Rumination。模型突破了传统AI 单纯依赖内部知识推理的局限,创新性地结合实时联网搜索、动态工具调用、深度分析和自我验证,形成完整的自主研究流程。

智谱“AutoGLM”模型。在斯坦福大模型中心《AI 指数2024》选定的智能体基准评测 AgentBench 上,AutoGLM 系列模型在5 个测试环境中取得了SOTA的 成 绩 。 其 中 , 在 Phone Use 基 准 ( AndroidLab&AndroidWorld)中,AutoGLM-Phone 的任务成功率较此前最佳成绩提升超过20%;在BrowserUse基 准 上 , AutoGLM-Web 也 全 面 超 越OpenAI GPT-4o 和AnthropicClaude-3.5-Sonnet,展现了在网页交互场景中的领先能力。在 GUI 智能体领域,智谱自研模型 GLM-PC(CogAgent)在多个权威评测榜单 上 取 得 SOTA 成 绩 。 凭 借 仅 9B 的 参数,CogAgent 超越了包括GPT-4o+UGround、Claude Computer Use 等更大规模的同类模型或商用API。

2、Deep Research+Operator:Agent 产业新范式

智谱 AutoGLM 沉思是全球首个结合了 Deep Research+Operator 能力的智能体,我们实际操作试用总结:沉思可以广泛收集所有来源的信息,并且进行整理归纳和深度分析、同时可以自动调用浏览器工具进行信息检索。

2.1、Deep Research:搜索+推理的深度融合,头部大厂相继布局

Deep Search 的核心理念是通过搜索、阅读和推理三个环节中不断循环,直到输出最优答案。搜索环节通过搜索引擎搜集信息,阅读环节专注于对特定网页进行深入分析,推理环节负责评估当前状态,决定是否将原始问题拆解为更小的子问题或尝试其他搜索策略寻找答案。Deep Research 在DeepSearch基础上增加结构化框架,系统性将 DeepSearch 应用在输出报告的每个所需部分,最终整合所有章节到一个提示词中,形成一个连贯性的长篇报告。

进入 2025 年来,Deep Research 功能已逐步成为模型搜索能力标配。包括OpenAI、Google、xAI 以及 Perplexity。

1)OpenAI:OpenAI 在 2025 年 2 月推出 Deep Research,功能上表现为可以使用推理能力综合大量信息,并为用户完成多步骤研究任务。OpenAI 声称,DeepResearch 仅需数十分钟就能完成人类需要数小时才能完成的工作。

Deep Research 基于 OpenAI 的 o3 模型,并针对多种特定任务进行了深度优化和精调。

其一关键点是端到端强化学习。传统机器学习在处理复杂任务时需要人为划分多个阶段进行训练和优化,而 Deep Research 通过端到端学习学会自行规划多步骤研究轨迹,从而制定合理的研究计划。从信息渠道获取开始,到分析再到判断下一步研究方向;若研究过程中发生偏离,模型也可以进行回溯重整执行策略,确保得到准确且有价值的研究成果。

其二关键点是去除模型的响应限制。该能力克服了传统模型追求响应速度而对任务处理浅尝辄止的应对方式,Deep Research 允许模型花费5-30分钟甚至更长的时间来处理问题,模型拥有足够的时间对信息进行筛选和处理,并输出更加全面、深入和准确的研究成果。

2)Google:2024 年 12 月 google 发布 Deep Research,全球首个AI 研究助手。2025 年 3 月,Google 宣布 Deep Research 功能免费开放,Gemini 免费用户每月可以获得免费使用次数。Deep Research 基于Gemini1.5pro模型,具备联网和上传文件的能力。具体流程上表现为用户先告诉Gemini 需求,在需求对齐后系统便会创建一个多步骤研究计划,用户批准后Gemini 进行反复搜索整理,最终提供一份研究报告。

3)xAI:2025 年 3 月,xAI 上线 DeeperSearch 功能;从功能定位来看,DeeperSearch 是此前 DeepSearch 的升级版。Deeper Search 也是伴随xAI 最新模型Grok 3 推出的功能,能够执行搜索、整理数据并生成报告的任务。

4)Perplexity:2025 年 2 月 Perplexity 推出 Deep Research,功能实现上表现为 Perplexity 搜寻海量资料,而后进行专家级别的推理,最终生成一份全面清晰的报告,同时支持 PDF、Markdown 和 Perplexity Page 格式文件导出。

5)Manus:2025 年 3 月,中国团队蝴蝶效应发布Manus,号称全球首个完全自主通用的 AI Agent。与传统人机协作模式的智能体有很大不同,是完全自主自动化执行任务,根据 Manus 公布的通用测试平台GAIA 数据显示,Manus在1 级、2 级、3 级通用任务上,全部大幅度超过了OpenAI 发布的DeepResearch。

2.2、Operator:模型以工具调用替代人类操作,加速迈向 L3 级 AGI

Agent 能力的实现通常需要规划能力、记忆系统、工具使用、行动执行四大能力,我们认为 Operator 则是模型在工具使用能力上的再一次跃升。

我们认为,Operator 工具调用实现自动化操作的范式通常包括GUI 智能体以及通过 API 调用的 Agent。 1)GUI Agent:GUI Agent 是一种基于多模态视觉模型驱动的人工智能系统,能够自动推理并执行 UI 交互,模拟人类用户的操作,如点击、输入、拖拽、读取界面信息等,以完成人类要求的工作任务。大语言模型+多模态模型加速提升 GUI 智能体能力边界。大语言模型+多模态模型结合下,GUI 智能体可以根据自然语言指令自动操作图形界面并完成复杂的多步骤任务。具体表现为,大语言模型通过多步推理和任务分解将用户指令解析为一系列可执行的操作步骤,视觉模型(VLM)在多模态技术加持下分析GUI 截图理解界面元素并执行精准操作,最后配合智能体对实时反馈做出响应并动态调整策略。

2)API 调用:通过系统或者应用程序的 API 实现工具调用,适用于提供了编程接口的应用程序;一个计划旅行的 Agent 场景可以会调用航班搜索API、酒店预定 API 以及天气预报 API 等等,实现对完整旅行规划的制定和输出。

Anthropic 开源 MCP 协议加速 Agent 能力构建进程。2024 年11月Anthropic推出 MCP 协议,旨在为 AI 模型与外部工具、数据源提供标准化的交互接口。其核心理念是即插即用——通过统一协议,让AI 应用无需重复适配即可调用任意兼容 MCP 的服务,如同 USB-C 接口连接不同设备。OpenAI 宣布正式宣称支持 MCP 协议,开发者可以通过统一接口标准,为智能体接入各种第三方工具,大幅提升复杂自动化应用的开发效率。

OpenAI 的 Operator 及 Anthropic 的 computer use 能力对比如下:

OpenAI:2025 年 1 月 OpenAI 发布其 Agent 工具operator。据DeepTech深科技,在 OpenAI 的官方演示中,用户只需要输入需求,Operator 就可以完成餐厅订位、购买日常用品、预订比赛门票等任务。用户可以实时查看进度,并随时介入,遇到付款信息、家庭住址等隐私信息,Operator 还会主动暂停让用户接管。 底层技术上,Operator 由一种名为“计算机使用代理(Computer-UsingAgent,CUA)”的新模型提供支持,通过强化学习,将GPT-4o 的视觉能力与高级推理能力相结合,让 Operator 可以“看到”(通过屏幕截图)并与浏览器“交互”(使用鼠标和键盘所允许的所有操作),使其能够在网络上采取行动,无需通过自定义 API(应用程序接口)集成。如果遇到困难或犯错,Operator 还可以利用其推理能力进行自我纠正,当需要帮助时,控制权将可以交还给用户。

2024 年 10 月,Anthropic 发布新版本 Claude 3.5 Sonnet,computeruse功能与 operator 类似。computer use 在通过适当的软件设置运行后,可以按照用户的指令在电脑屏幕上移动光标,点击相关位置,并通过虚拟键盘输入信息,模拟人们与电脑进行交互的方式。 Anthropic 在工具使用和多模态方面的工作为compute use 奠定了基础。操作计算机需要具备查看和解释图像的能力(计算机屏幕上的图像),同时要求推理如何以及何时根据屏幕上的内容执行特定操作。结合这些能力训练Claude解读屏幕上的内容,然后使用可用的软件工具执行任务。

OpenAI 将通用人工智能划分为五个等级,我们认为,当前Agent 能力逐步将AGI 带到了 L3 级别。五个等级具体包括 1)L1:聊天机器人,具有对话能力的AI。2)L2:推理者,像人类一样能够解决问题的AI。3)L3:智能体,不仅能思考,还可以采取行动的 AI 系统。4)L4:创新者,能够协助发明创造的AI。5)L5:组织者,可以完成组织工作的 AI。

3、AutoGLM 推动行业加速发展,2025年迎来Agent 落地元年

2025 年 4 月 15 日,智谱宣布开源其最新 GLM 模型系列,包括32B和9B尺寸,涵盖基座、推理、沉思三类模型,全部遵循 MIT 开源许可协议,面向商业用途免费开放。用户可通过新平台 Z.ai 及智谱 MaaS 平台进行体验。我们认为其有望加速产业对 Agent 的落地和商业化应用。具体表现为:

生态搭建层面,智谱将搭建 Agentic LLM 平台,助力生态合作伙伴利用智谱模型与智能体的能力,构建行业、地域与场景深度融合的智能体应用。

在行业生态方面,智谱将作为模型厂商致力于帮助应用合作伙伴在GLM模型上实现成功的大模型应用。目前已合作金融、教育、医疗、政务、企服等领域的合作伙伴,共同推进 Agentic LLM 的落地应用。

我们认为 Agent 产业的演变格局将以通用 Agent+细分领域垂类Agent 为趋势。我们可以类比传统互联网行业的发展模式,一个或者几个传统大型门户网站将成为所有互联网流量的基座,但在此基础上会延伸出不同细分领域的垂类流量入口,比如抖音、淘宝、小红书等等。AGI 时代下,掌握了流量以及生态入口的厂商最终会成为通用 Agent 的主要玩家,但掌握了用户数据/生产数据以及行业know-how 的垂类领域,凭借行业壁垒将延伸出一众垂类Agent 玩家,共同组成AGI 时代的建设者。

具体看,我们认为通用Agent厂商可能包括海外的OpenAI、Anthropic、Google等,国内的字节跳动(豆包)、腾讯(混元)、阿里(Qwen)、智谱、DeepSeek等。

而垂类 Agent 主要以金融、工业、办公、教育等细分垂类掌握了大量客户资源以及行业 knowhow 的厂商,具体应用场景例如:

1)金融场景,同花顺同创智能体平台打造国内第一家支持百万日活的金融垂类Agent 平台,内置插件、工作流、知识库、数据库及多模型适配等系列工具,提供快速构建 AI 智能体及快速落地能力,包括投资Agent、风控Agent、写作Agent等。

2)工业 Agent:输入端提供捕获和处理来自传感器、机器和操作员的输入信息,指导 Agent 的行动和决策;决策端利用大脑的模块来自动化和优化制造流程。通过将复杂的任务分解为可操作的步骤,提升生产运营效率。

智谱 AutoGLM 沉思开源是对 Agent 产业的持续推动。我们认为,对于通用类的 Agent 契合的 C 端或者通用类任务场景,有望借助本身成熟的应用生态实现加速扩张;而垂类领域的 Agent,受限于对准确率和及时性的高要求,更考验基础模型的能力以及深度融合场景 knowhow。当前DeepSeek、Qwen等一众模型已经实现了能力跃升,我们认为后续在一众国产模型的持续迭代及生态逐步完善的背景下,2025 年有望成为真正的 Agent 元年。

从市场空间上,B/C 端 Agent 落地都有望加速软件价值重构;一方面实现对SaaS 应用的价值重构;另一方面在商业化应用领域,加速带动传统行业转型升级。

预计 2023-2028 年中国 AI Agent 市场规模年均复合增长率将达到72.7%。据观研天下公众号数据,2023 年,中国 AI Agent 行业市场规模为554亿元,预计2028 年市场规模将达 8520 亿元。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至