2025年人工智能行业分析:当前Agent的发展进行到了什么阶段?

  • 来源:中信建投证券
  • 发布时间:2025/05/20
  • 浏览次数:717
  • 举报
相关深度报告REPORTS

人工智能行业分析:当前Agent的发展进行到了什么阶段?.pdf

人工智能行业分析:当前Agent的发展进行到了什么阶段?尽管尚未有明确的产品定义,但Agent类别与应用场景已迅速丰富。其中,中美大厂Agent发展思路存在差异,北美云厂商主要关注帮助客户高效部署模型和Agent,国内互联网大厂Agent布局仍延续互联网时代用户流量逻辑;而中美B端企业则均关注Agent创建和管理平台。考虑到Agent类产品对算力消耗大,Agent发展有望继续带动AI产业链向上,建议关注后续技术突破→商业化落地拐点。尽管尚未有明确的产品定义,但Agent类别与应用场景已迅速丰富。工程师流程调优与否对应Agent发展的两条不同路线。学界普遍认为Agent需要具备规划能力...

1、Agent定义尚未明确,但类别及应用场景已然丰富

Agent尚无明确定义,自主规划与否为核心争议点

工程师流程调优与否对应Agent发展的两条不同路线。传统的软件系统大多遵循清晰的“请求-响应”模式,即前端(用户) 发送请求,后端(软件)接收请求,访问数据库,执行变更,最终返回结果,这种模式使得软件可以根据用户的需求进行定 义,软件工程师可以通过对代码、架构的精细打磨优化产品性能。而在AI时代,依靠大模型进行动态推理和生成响应则存在 大量的模糊计算,软件的响应不再由静态代码决定,而是基于不断进化的模型能力动态驱动,此时软件工程师对产品额外的 优化代码可能会在模型更新后失去意义,甚至完全失效。上述情形反映到Agent中对应了两条路径,一是由工程师设计复杂 的工作流,让模型在框架里运行;二是不断提升大模型的推理能力,搭建更灵活、通用的Agent。 学界普遍认为Agent需要具备规划能力。目前Agent尚没有统一或公认的定义,学界和业界往往从不同的角度对其进行说明。 学界普遍认为Agent需要具备规划能力:例如李飞飞团队的多模态通用Agent范式中主要包括五个模块,1)环境与感知 (Environment&Perception)模块进行长期任务规划和技能观察;2)学习(Learning)模块使Agent能力不断提升;3)记忆 (Memory)模块使Agent学习到的知识可以被编码并在后续调用;4)认知(Cognition)模块使Agent能够针对任务采取最合 适的行动,并允许环境反馈;5)执行(Action)模块用于完成特定任务或动作。

OpenAI强调Agent能够独立完成任务。OpenAI将AI Agent定义为“以大语言模型为大脑驱动的系统,具备 自主理解、感知、规划、记忆和使用工具的能力,能够自动化执行并完成复杂任务的系统”。具体而言, Agent会将大型任务分解为子任务,规划执行任务的流程并进行评估;在执行任务的过程中,Agent具备记 忆能力,其中短期记忆用于存储上下文以支持多轮对话,长期记忆则通过向量数据库实现,存储用户特征、 业务数据等新信息;此外,Agent还能够通过API、插件调用外部工具,拓展应用能力。 而在OpenAI近期发布的《智能体构建实用指南》中,Agent进一步被定义为“能独立完成任务目标的系 统”,包括两大核心特征:1)使用LLM管理工作流执行并决策;能识别工作流完成状态,必要时主动纠 正操作;失败时可中止执行并将控制权交还用户。2)配备多种工具与外部系统交互(获取上下文或执行 操作),根据工作流状态动态选择工具,始终在明确定义的护栏内运行。

基于大模型构建核心能力, Agent类别多样

Agent AI的核心能力源于基础大模型的深度集成。以LLMs(大型语言模型)和VLMs(视觉语言模型)为 代表的预训练模型,通过海量多模态数据的自监督学习,形成了对语义、视觉及环境上下文的理解能力, 成为Agent智能行为的认知基座。具体而言,基于基础大模型的Agent通过任务规划和环境反馈实现自主决 策,此时基础大模型能够作为数据生成器合成专家演示数据,以在环境约束下确定代理行为的基准,从而 使Agent能够在虚拟世界中理解场景、生成内容和进行交互式编辑。 Agent AI的能力提升遵循“模仿学习→解耦→泛化→涌现”的递进范式。模仿学习阶段,多模态Agent整合 基础大模型的跨模态数据源,利用强化学习(RL)和模仿学习(IL)构建物理与虚拟世界的映射,解决初 始状态缺乏处理问题能力的难题。解耦阶段将学习过程与任务特定的奖励函数分离,使得该策略能够在不 同任务之间泛化,而不依赖于特定的奖励函数。泛化阶段则通过识别系统行为的基本元素或规则,使系统 能够适应新情境,展示出从简单规则中涌现的更复杂的行为。

NLP与多模态技术不断发展,Agent应用场景丰富

识别任务指令并执行一直是交互式AI和自然语言处理的核心挑战,大模型技术迭代下NLP Agent为进一步 提升人机协作效率提供了可能。1)工具使用和知识库查询:将外部知识库、网络搜索或其他工具集成到 AI Agent的推理过程中,使Agent能够利用丰富数据源增强其理解能力,并提供更准确且具有上下文感知的 响应。2)改进 Agent 推理和规划:通过开发能够理解复杂指令、推断用户意图并预测未来情境的模型,能 够使Agent做出更明智的决策。例如,可以通过要求Agent反思过去的行为和失败,或通过将Agent思维过程 进行展示以模拟不同结果并评估。3)整合系统和人工反馈:AI Agent 的运行环境主要分为两种,其中系统 反馈指提供明确操作有效性信号的环境;人类反馈则与人类协作,由人工对操作提供反馈。Agent需要通过 自适应学习机制不断学习和适应不同反馈来源,持续改进策略并纠正错误,从而确保始终有效地提供帮助, 满足用户需求。

游戏作为虚拟的独立场景,能够为测试Agent行为提供独特的沙盒环境,从而帮助开发人员拓展Agent能力 边界,具有大量应用方向。1)NPC 行为控制:当前游戏系统中NPC行为主要由预先设定的脚本控制,无 法根据玩家的行为或游戏环境的动态变化进行调整,此时Agent可以用于用户互动式游戏的动作预测和互动 编辑,进而提高互动的细腻感和吸引力。 2)玩家行为分析:当今的游戏系统在与人类玩家的互动方面存 在不足,亟需AI 系统实时分析玩家行为并在必要时提供支持。通过结合玩家互动与反馈、像素输入以及自 然语言的规划和理解,Agent可以优化游戏进程,推动游戏环境向玩家更期待的方向演进。3)场景合成: 现代游戏通常包含广阔的开放世界环境,手动设计景观既耗时又耗费资源,通过AI能够减少人力成本,甚 至创造出极具想象力的特殊结构。此外,大模型还能够遵循预定义或学习的规则辅助场景中的对象放置, 使其满足光影效果和氛围需求,进一步提升游戏的沉浸感。

2、大厂助力Agent部署,B端场景已实现商业化价值

北美AI Agent:大厂关注部署,B端聚焦平台

北美的云厂商主要关注帮助客户高效部署模型和Agent,而B端厂商更聚焦打造Agent创建和管理平台: 1)云计算大厂:北美云厂商多凭借自身云能力辅助用户高效部署模型和Agent,如Google的Vertex AI和 Agentspace分别为AI工具和Agent的管理平台,助力AI产品的部署和使用;Microsoft的Azure AI Foundry同样 提供模型部署、Agent定义、SDK/API集成、安全防护等全流程解决方案。同时,云计算厂商也会在自身 优势领域开发相关Agent产品,例如Microsoft基于自身在办公领域的优势在Microsoft 365中提供多种办公 Agent;Amazon推出智能助手Alexa+,并基于其广泛的合作伙伴产品进行搭载推广。Meta相对更注重大模 型的能力, Llama 4上新进一步以更低成本实现极强的性能表现。同时,Meta亦持续关注Agent领域发展, 重点包括客户支持、销售服务、编程等方面的Agent。 2)B端办公企业:目前北美B端办公软件企业在Agent方面的布局多为平台产品。Salesforce的Agentforce平台 支持用户用自然语言构建Agent;ServiceNow的AI平台提供CRM、HR、IT等领域的数千个AI Agent供客户选 择;Workday的AI Marketplace和Agent System of Record两大平台分别对AI应用及Agent进行管理,同时支持 三方AI应用。从商业化进展看,B端办公软件的Agent发展主要聚焦利用数字员工完成重复性劳作,解放员 工生产力。其中, Salesforce部分项目中Agentforce的收入占比能达到35%;Workday 24Q4的销售中已有30% 的比例来自AI相关产品。

Google:助力Agent高效部署,A2A协议降低信息传输损耗

谷歌在AI时代关注帮助用户高效部署模型和Agent。作为头部云厂商,谷歌在迭代大模型的同时,致力于帮助客户快速落地 AI整体解决方案。Vertex AI为谷歌云托管的 AI 工具部署平台,企业可以从数百个第一方、第三方和开源模型中选取最适合 其业务需求的基础模型,并将其一键部署到应用。而在AI Agent领域,谷歌同样推出多种方案助力用户高效部署:1)Agent 开发工具包作为开源框架,大幅简化构建复杂AI Agent和多Agent系统的流程;2)Agent设计师则为一款低代码工具,内置超 过100个企业Agent供用户快速开发部署;3)Agentspace则是Agent管理平台,能够帮助员工更好的访问数量众多的企业Agent, 提供例如Agent搜索、自动定义Agent启动点、分析Agent运行状况等多种功能,大幅提升Agent应用效率。 发布全新A2A协议,降低Agent间信息传输损耗。2025年4月10日,谷歌于Google Cloud Next 2025公布了一项新的开放协议 Agent2Agent (A2A),旨在连接不同生态系统中的 AI Agents。相较于时下流行的MCP更关注模型与Agent之间的适配,A2A更 关注Agent之间的互联,能够大幅降低多Agent信息传输的损耗。此外,A2A 协议建立在现有流行的通信标准之上,包括 HTTP(网络通信基础协议)、SSE (向客户端服务器推送更新的基础协议)和 JSON-RPC(应用程序使用 JSON 消息进行远 程相互通信的基础协议),能大幅降低A2A部署难度。

3、国内Agent发展现状:互联网厂商把握流量趋势,B端企业提供Agent平台

国内Agent现状:大厂遵循流量逻辑,B端基于平台选取价值场景落地

国内互联网大厂Agent布局仍延续互联网时代用户流量逻辑,通过类“Manus”的通用Agent产品抢占用户: B端企业则类似北美,基于AI/Agent平台选取有价值的产品进行落地: 1)互联网大厂:和海外大厂基于云计算向Agent发展不同,国内互联网厂商在Agent时代仍遵从互联网时代 流量入口的打法。尤其自Manus爆火以来,字节扣子空间、百度心响、阿里心流等通用类Agent产品迅速推 出,力求通过先发优势先一步抢占市场。尽管腾讯目前尚未推出类通用Agent产品,但其在R1发布后对元 宝的大规模投流亦反映其对用户流量的重视;同时,由于腾讯本身具备微信流量的基础优势,AI布局主要 围绕微信及公众号生态,构建应用闭环。 2)B端办公企业:国内B端办公企业在Agent方面的布局与北美类似,先推出平台化产品,再选取部分有价 值的环节推出垂域Agent。金蝶在苍穹Agent平台的基础上构建财务、人力资源、供应链、制造等领域 100+AI应用, BOSS助理、合同智能审查、人才智搜等Agent关注度相对更高;用友YonGPT 2.0涵盖Agent 应用框架,目前人力资源、财务数智、采购招标文件生成等Agent实现头部客户应用;泛微Xiaoe.AI平台将 智能体视为业务落地抓手,提供50+开箱即用的Agent产品,并支持用户自行构建;致远互联产品则迭代至 AI-COP,并推出CoMi智能体产品家族,基于协同运营领域模型及Agent builder平台助力企业构建专属AI能 力。

百度:关注普通C端市场,移动端通用Agent让用户“心响”事成

打造移动端Agent心响,下沉AI应用至普通C端用户。百度当前在AI 领域的处境与Meta类似,即文心系列模型性能良好,但缺乏在应用 端的爆款产品,百度文库AI、百度网盘AI修图、文小言APP等产品 均未能引发市场大规模关注。在此背景下,百度于2025年4月25日 的Create 2025AI开发者大会上推出首款移动端通用智能体APP心响, 并发布即用,全面免费,意味着百度着眼于更广泛的普通C端用户, 希望通过进一步降低使用门槛,获得更多用户流量。具体而言,心 响APP将AI应用方式尽可能简化,用户只需要一句话说出自己的需 求,智能体即可进行自动处理;据百度表示,心响App目前支持超 过 200 种任务类型,并在例行任务、城市旅游、AI 相亲、AI 绘本、 摸鱼游戏、深度研究、法律咨询、等10大场景中表现出色,未来计 划扩展到10万+场景,满足更广泛的用户需求。 此外,百度在从底层拥抱MCP协议的基础上,也为心响APP引入了 全新的智能体接入方案Agent Use,使其能够自动调度百度自己和 市面上所有第三方智能体,以及各种内外部 AI 工具、应用和服务 接口,最终交付精准契合用户需求的成果。

4、Agent落地带来的改变和面临的挑战有几何?

Agent对话交互Token消耗达十万,底层算力需求仍然旺盛

AI原生应用推动Token消耗量激增。量子位结合市场数据观察,2024下半年国内大模型商用落地日均Tokens消耗量翻了近10 倍,从1000亿级规模到10000亿规模,只用了6个月,月复合增长率达到45%,其中10-12月增长进一步提速。以火山引擎为例, 2024年5月其日均Tokens水平为百亿级,不及全行业1/5;8月初突破千亿Tokens大关,并在之后保持迅速增长,12月日均 Tokens市场份额占比超50%,超过其他玩家份额总和。大模型Token数消耗量激增的核心影响因素在于AI原生应用爆发,以 豆包为例,截至12月中旬,豆包大模型的日均Tokens使用量已超过4万亿,较七个月前首次发布时增长了33倍。进入2025年, AI原生应用对token的消耗趋势仍然持续,截至2025年3月底,豆包大模型日均 tokens 调用量已超过12.7万亿,是2024年12月的 3倍,是一年前刚刚发布时的106倍。 Manus单次任务消耗token数或达十万,远超chatbot类AI产品。当Agent成为新的AI落地趋势,其对Token的消耗量则成为了市 场新的关注点。通过接近Manus团队的自媒体《赛博禅心》的文章透露, Manus单条任务的成本在2美金左右(与Manus定价 一致,19美元每月对应1900积分,澎湃新闻测试进行数据分析的任务消耗了200积分),是Deep Search的1/10。而Manus主要 基于Claude 3.7 Sonet进行推理执行,其API输出定价分别为每百万token15美元,则倒推Manus每次任务消耗token数超10万,高 于chatbot类产品单次任务token消耗量至少一个数量级。

Agent落地仍面临意图混淆、多Agent合作、幻觉等多种问题

自然语言描述存在模糊表达,大模型指令跟随能力重要性凸显。意图混淆指大模型在处理模糊指定任务时 存在能力不足的问题,主要系自然语言的固有模糊性或故意的未明确指定使大模型难以明确任务目标,增 加了模型误解问题设定意图的风险。反映到大模型落地,指令跟随一直是重要benchmark之一,尤其在多轮 交互过程中如何保持大模型回答的一致性更受到产业的关注。 学界如《Active Task Disambiguation with LLMs》从贝叶斯实验设计的角度来构建任务消歧问题,提出了一 种使LLMs能够通过提问澄清问题来逐步缩小可行解空间并减少生成不满意输出风险的方法;阿里通义实验 室则发布《 IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization 》,通过提出IOPO方法,不仅将指令作为输入来直接学习Response偏好,且基于相同的 Response 深入探索指令差异,以促进对细粒度约束的有效感知,在复杂指令评测数据上取得了显著提升。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至