智能体定义、技术演进及落地进展如何?

智能体定义、技术演进及落地进展如何?

最佳答案 匿名用户编辑于2025/07/14 14:59

智能体全新交互中枢,终端流量入口重塑。

1. 智能体定义:决策+记忆+规划+工具

AI 智能体是一种具备环境交互、自主决策与任务执行能力的软件程序,由人类设定 目标,智能体独立选择最优行动路径。虽然业界在模块命名和架构安排上各有差异,例 如 OpenAI 更偏向工程实现,复旦 NLP 实验室则立足于未来 AI 产业趋势构想,但在底 层结构上高度一致,体现出一定程度的行业共识: 1. 以 LLM 为大脑,具备推理、知识整合与语言交互能力。 2. 记忆系统支撑上下文连贯与经验积累。 3. 工具接口打破模型“只读”边界,实现动作执行 4. 反馈闭环支持状态保存与动态调整,保障任务的持续感知-决策-行动循环。 总体来看,“LLM+记忆+工具+闭环”构成智能体的核心架构要素。

未来智能体有望沿着“数字助理型”与“具身/社会型”两大技术路径演进。根据研究 机构对智能体的定义不同,我们判断未来其生态系统有望沿着两条技术路径同步演化: 一类是以提升个人效率为目标的“数字助理”,聚焦于自然语言交互与多工具协同,广泛 应用于办公自动化、信息检索、知识管理等场景;另一类则是具备感知与行动能力的“具 身/社会型”智能体,强调多模态感知、实体控制与多智能体协作,在机器人、智能制造、 智慧交通等领域具备落地潜力。尽管两者在功能侧重与硬件要求上存在显著差异,但其 底层均依托于大语言模型(LLM)为核心,辅以记忆系统、任务规划与工具调用构成“智 能闭环”。

大语言模型作为智能体的认知中枢,承担理解、决策与交互的核心职责,是通向 AGI 的关键起点。根据南洋理工大学研究,智能体技术已历经三代演进路径:第一代为算法 驱动阶段(2006~),以博弈论与优化算法为主,解决结构化策略问题,智能水平有限; 第二代为强化学习驱动阶段(2017~),强化对复杂动态环境的建模能力,应用于推荐、 交易、博弈等场景,但在泛化与迁移上仍存瓶颈;第三代为大语言模型驱动阶段(2023~), 以 ChatGPT、Gemini 等为代表的 LLM 赋予其自然语言理解、任务规划与工具调用等能 力,通过 ReAct、CoT 等机制实现“感知—认知—执行”闭环,首次使智能体具备自主 决策与完成复杂任务的能力,标志其从“智能工具”向“通用生产力”跃迁。

2. 智能体落地终端,超级入口迎来重塑窗口期

AI 时代超级入口强调跨应用场景智能协作,终端厂商生态控制力有望加强。超级 入口的本质在于高频用户需求的聚合与流量变现能力。回顾 PC 与移动互联时代,终端 设备和操作系统通过整合多种功能和服务,成为用户获取商品、服务和内容的主要入口。 进入 AI 时代,超级入口的核心逻辑从“功能驱动”转向“任务驱动”。用户无需逐一操作 应用程序,仅通过自然语言提出任务,AI 助手即可跨应用调取服务完成如报告生成、日 程管理等复杂操作。该类跨应用协同依赖底层系统级调用,天然利好掌握操作系统与终 端硬件的厂商。根据普华永道,当前手机端涌现出三类超级入口雏形:个人助手、社交 与搜索。终端厂商正加快 AI 生态系统构建,围绕自身能力圈深耕多样化场景,抢占 AI 时代流量入口重构的战略窗口。

3. 端侧 AI 部署加速落地,功能形态与技术路径初步成型

3.1. PC/手机端承接系统枢纽,可穿戴设备探索形态突破

当前,智能体在消费电子终端的集成正加速推进。本节将从 PC、手机与可穿戴设 备三大典型终端出发,梳理端侧 AI 落地的最新进展与功能演化路径。 手机方面,厂商正把 智能体从“语音助手”升级为深度嵌入操作系统的执行引擎。智 能体不再停留在问答层面,而是接管联系人、相册、定位、支付等高权限接口,能够跨 应用解析用户意图、自动完成多步操作。苹果计划让新版 Siri 直接在端侧调用日程、照 片与邮件等私有数据,并在必要时通过加密云推理补齐复杂逻辑,目标是把填写表格之 类的事务完全交给系统处理;三星的 Galaxy AI 已在 S25 系列统一 30 个本地应用和十余 款高频第三方应用;安卓阵营的 OPPO、vivo、小米等也在各自定制的系统框架里加入 “星环”“PhoneGPT”“超级小爱”等智能体,重点打通外卖、出行、社交消息等高频场 景,以展示跨 App 动态调度能力。

实测结果显示,这一代手机智能体在“导航”和“订机票”这类结构化流程中的成 功率已达到可用水平,而在外卖下单、社交消息等任务上仍响应不稳定。总体来看,我 们认为手机端 AI 已从“功能演示”过渡到“系统能力”,为未来进一步向生产力工具演 进奠定了平台基础。

PC 方面,重点体现办公创意效率提升与系统级自动优化。功能上,我们认为各厂 商端侧 AI 已从简单对话助手演进为复杂任务协同系统,涵盖办公与创意和系统级智能 优化两大核心方向: 办公与创意:包括文档润色、内容生成、跨语种翻译、图像直搜、结构化摘要 等。 系统级智能优化:涵盖亮度、键盘背光调节、噪音降除、屏幕聚焦、语言控制 系统设置等。

可穿戴硬件方面,我们认为厂商“先看硬件天生擅长的感知维度,再向 AI 延伸”。 回到三大典型形态——眼镜、TWS 耳机、智能手表——它们各自的 AI 侧重点与用户原 生使用动机基本吻合,但又在向下一阶段的“多模协同”递进。整体看,可穿戴硬件细分 产品各自都在探索如何利用自身形态优势放大端侧 AI 的常用价值,行业仍处百花齐放 的早期阶段。 智能眼镜:听觉 + 视觉的双通道。眼镜天生占据视线与耳道,从接听电话、语音助 手这类“免手占耳”落地场景,逐步拓展到实时字幕、场景识别和导航提示等场景。最新 一代 Ray-Ban Meta 与 OPPO Air Glass 3 已可在端侧完成语音问答、拍照解说,并把翻 译、导航等重计算任务分级上云。往前看,一旦光机与电池再减薄、算力再下沉,AI 眼 镜有潜力替代手机的部分功能。 TWS 耳机:听觉入口的深耕。耳机原本的卖点是音质和降噪,如今 AI 在优化这些 基本功能后,还在实时语音助手、同声传译、会议转写等场景深耕。接下来耳机还可能 切入声学健康,或将全天候的听觉代理。 智能手表:持续感知与生理闭环。目前集成 AI 功能的智能手表落地产品仅见 Phancy 等少数厂牌,功能上与耳机、眼镜的语音交互并无本质区分;然而苹果已公开把下一代 Watch 系列定位为“AI 驱动的腕上医疗监控”,腕表赛道的差异化最终或将落在对多模态生理信号的融合分析与长期模型训练。

3.2. 技术路径:“端优先”成趋势,可穿戴侧重协同算力

端云协同:云端大模型提供通用知识能力,端侧小模型提供个性化和快速响应。随 着大语言模型在智能终端的落地需求上升,端侧集成能力成为技术焦点。传统的中心化 云端机器学习架构虽具计算优势,但在实际应用中逐渐暴露出用户隐私数据风险、中心 服务器带宽压力和离线不可用瓶颈。端云协同模式应运而生:云端负责大模型的集中训 练与能力输出,端侧则部署经过裁剪优化的小模型以实现本地实时推理,并将关键反馈返回云端用于进一步优化,形成“有机循环”的能力增强体系。 当前端云协同智能计算主要分为五类路径: 1)高效计算硬件:在端侧部署高性能、低功耗芯片,支撑本地推理任务 2)以端为中心的协同计算:终端主导计算,云端辅助。适用于隐私保护与个性化训 练。 3)以云为中心的协同计算:云端主导全局训练,终端仅保留本地数据并回传模型 更新。解决隐私保护与模型泛化兼容问题。 4)端云双向协同计算:端云模型双向优化、协同推理与训练。 5)可信端云协同计算:结合因果推断、去偏学习等方法,提升多端异构环境下的稳 定性与可信性。

PC 和手机端:端云协同向“端优先”策略收敛。我们认为产业已经在“大模型云端、 轻模型端侧”这一基本范式上形成高度共识:多数厂商都将轻量级的语言模型下沉至终 端,用以实现实时推理、离线可用与隐私本地化;而更大规模的通用模型仍托管在云侧, 通过加密或可信执行环境等机制来保证远程调用的安全可信。共同诉求背后,对应的正 是前文提到的三大痛点——隐私保护、中心服务器算力压力和离线可用性——这几乎驱 动了各家向“端优先”策略收敛。

可穿戴端侧:“端-近端-云”三层协同,云端推理重要性提升。以 Ray-Ban × Meta 智 能眼镜为例,设备本体承担唤醒词识别等轻量实时推理;手机作为近端算力负责任务转 发与复杂任务处理;云端托管大规模多模态模型,为复杂推理与知识检索提供高精度输 出。未来,“端—云—近端”动态算力调度将成主流,手机等近端设备将成为协同核心。 同时,可穿戴设备的多模态感知能力(如 ECG)为个性化 AI 模型提供高价值数据支撑, 助力厂商构建生态闭环,提升用户粘性与产品附加值。

参考报告REPORT

电子行业深度报告:端侧AI重构终端生态,硬件升级驱动换机潮,多设备协同催生商业模式跃迁.pdf

电子行业深度报告:端侧AI重构终端生态,硬件升级驱动换机潮,多设备协同催生商业模式跃迁。智能体构建全新交互中枢,终端流量入口重塑:AI智能体通过“决策(LLM)+记忆+规划+工具”构建智能闭环,正逐步重塑终端交互中枢,成为新一代超级入口核心。其发展沿着“数字助理型”与“具身/社会型”两条技术路径演化,并加速落地于PC、手机与可穿戴设备等多元终端。各大厂商围绕端侧部署与云端协同展开技术布局,推动智能体从功能演示走向系统集成。手机、PC等终端正采用“端优先”策略强化本地推理能力,而可穿戴设备则通过&ld...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至