2024年计算机行业专题报告:“AI操作系统”时代已至

  • 来源:财通证券
  • 发布时间:2024/12/03
  • 浏览次数:827
  • 举报
相关深度报告REPORTS

计算机行业专题报告:“AI操作系统”时代已至.pdf

计算机行业专题报告:“AI操作系统”时代已至。AI+OS,操作系统级Agent开启人机交互革命。AI赋能OS,操作系统级Agent由于其C端入口特性,有望成为首个“爆款”AI应用。当前市场中长期缺乏“爆款”AI应用,我们认为主要系C端大众对AI的感知度仍然较低,尽管有大量可下载、可付费的AI应用存在,但从广大用户体验来讲,各类AI软件对其生活重塑的边际变化不大。而近期,包括手机端苹果、荣耀、Vivo等,以及PC端联想等厂商上新操作系统级Agent作为新的人机交互形态,以端侧入口形式首次深入群众,令其“被迫&rd...

1 AI+OS,操作系统级 Agent 开启人机交互革命

AI 赋能 OS,操作系统级 Agent 由于其 C 端入口特性,有望成为首个“爆款”AI 应用。AI Agent(人工智能代理)一般认为是能够感知环境,基于目标进行决策, 并利用工具自主执行动作的智能化应用,其包括规划、记忆、工具、行动四大核 心能力。我们认为 Agent 可以进一步划分为通用与垂域两个层级:

通用层级:壁垒在于底层大模型能力,终局大概率为少数有实力的大型厂商。 其分类包括操作系统级与平台级 Agent:操作系统级 Agent 可跨应用、跨界面 甚至跨设备操作,是对不同细分功能协调的“总指挥”;平台级 Agent 是底层 通用模块的组合,用户可根据自己所需功能调用或搭建。

垂域层级:壁垒在于高质量数据、工作流 know-how 与行业工具生态。包括 众多细分行业的应用智能化与流程自动化,包括办公、金融、医疗、法律、 教育、创意设计等。不过其中一些非交互性、高度流程化的应用功能,也存 在被通用层级 Agent“吃掉”的风险。 当前市场中长期缺乏“爆款”AI 应用,我们认为主要系 C 端大众对 AI 的感知度 仍然较低,尽管有大量可下载、可付费的 AI 应用存在,但从广大用户体验来讲, 各类 AI 软件对其生活重塑的边际变化不大。而近期,包括手机端苹果、荣耀、 Vivo 等,以及 PC 端联想等厂商上新操作系统级 Agent 作为新的人机交互形态, 以端侧入口形式首次深入群众,令其“被迫”体验接受新的操作范式,有望打造 首个“爆款”AI 应用,由此将带动 AI 端侧硬件需求涌现,以及刺激软件内部 AI 功能快速迭代。

智谱开创了操作系统级 Agent 从模型训练到应用落地的先河,搭建了完备的技术 栈,开启了新的人机交互革命。11 月 29 日智谱 Agent 开放日,智谱发布了多项 Agent 突破,包括:自主任务完成智能体 AutoGLM 可以自主执行超过 50 步的长 步骤操作,也可以跨 App 执行任务;AutoGLM 开启“全自动”上网新体验,支持数 十个网站的无人驾驶;GLM-PC 启动内测,基于视觉多模态模型实现通用 Agent 的技术探索,涵盖会议代理、文档处理、网页搜索与总结、远程及定时操作、隐 形屏幕等功能。自 2023 年 4 月份推出 AgentBench 以来,智谱团队投入一年半时 间,专注于 AutoGLM 及 CogAgent 的研发,在国内乃至国际上实现了领先。今年 10 月 23 日,Anthropic 推出了 Computer Use 功能,让 Claude 能够像人类一样操 作电脑,目前仍处于测试阶段,而当前智谱已实现了 Agent 技术的产品化。从技 术层面,AutoGLM 团队研究发现,GUI Agent 发展趋势与大模型相似,同样存在 推理的 Scaling Law 和模型涌现:

Agent 有 o1 Scaling(推理规模扩张带动模型能力提升),与 o1 的推理过程类 似,存在环境的反馈监督,以及随着推理训练时间的增加,模型能力也显著 提升。

Agent 有 EmergentAbility(涌现能力),在计算量较低时 Agent 可以适应单应 用、短距离的任务复杂度,但当计算量突破一定程度模型突然能够实现跨应 用长距离的复杂任务,同时还能在从未训练过的环境执行命令,泛化能力显 著增强。

打造多终端 Agent 产品矩阵,以 AutoGLM、CogAgent 作为技术底座,实现在各 类终端的 GLM-OS 通用性。智谱认为,手机+AI 会变成随身个人智能助理,PC+AI 将会成为全新生产力工具,汽车+AI 将会让车成为人们的智能第三生活空间,大 模型不仅仅会为手机、PC 和汽车带来机会,更会惠及各种各样的智能设备。随着 端侧算力的不断提升,以及专为 AI 原生设备设计的模型和端云协同架构的出现, Agent 技术不仅在操作系统和应用层面引领用户体验的革新,更将这一变革延伸至各类智能设备,包括手机、电脑、汽车、眼镜、智能家居等,Agent 赋能软硬件 一体将重塑人机交互范式。

2 建立交互数据集,深耕 Post-Training,获得“从 Chat 走向 Act”通用 Agent 能力

2.1 CogAgent:CogVLM 结合高分辨率交叉模块,实现高效 GUI 推理

CogAgent 是 18B 参数的视觉语言模型(VLM),专门用于 GUI 理解和导航。2023 年 12 月,清华 KEG 实验室与智谱 AI 联合推出了 CogAgent,一个通用的视觉理 解大模型,具备视觉问答、视觉定位(Grounding)、GUI Agent 等多种能力,可接 受 1120×1120 的高分辨率图像输入,使其能够识别微小的页面元素和文本。 CogAgent 是基于预训练的 VLM(CogVLM-17B,开源大型视觉语言模型),并添 加了一个交叉注意模块(EVA2-CLIP-L,0.30B 参数的高分辨率图像编码器)来处 理高分辨率输入。添加该模块主要是因为高分辨率图像会导致极大的计算时长和 内存开销:视觉语言模型通常将文本和图像特征序列连接起来作为输入提供给解 码器,因此自注意力模块的计算成本与视觉补丁的数量成二次方。在低分辨率下, 图像能够有效地描绘大多数物体和布局,然而在清晰呈现文字方面有所不足;高 分辨率模块强调与文本相关的特征,对于理解图形用户界面至关重要。因此,该 方法通过合理分配资源,使模型能理解高分辨率的 GUI 图片,同时有效降低了显 存与计算开销。

预训练数据集与训练方法与一般多模态训练有明显不同:(1)文本识别:识别高 分辨率图像中各种大小、方向和字体的文本能力,数据包括来自语言预训练数据 集(8000 万)的合成渲染图像中的文本、自然图像的光学字符识别(OCR)(1800 万张)、学术文献(9M);(2)视觉定位:图像中文本和对象的定位能力,使用从 LAION-115M 中采样的包含 4000 万张图像及其图像-标题对的构建的视觉定位数 据集,将标题中的实体与边界框相关联以指示它们的位置;(3)GUI 图像分析: 对 GUI 图像(如网页)的专门理解能力,作者设计了两个开创性的 GUI 定位任 务,一是 GUI 引用表达式生成(REG),即模型根据屏幕截图中的指定区域为 DOM (文档对象模型)元素生成 HTML 代码,二是 GUI 引用表达式理解(REC),即 为给定的 DOM 元素创建边界框。 为提升模型性能,并确保其在 GUI 环境中与人类指令保持一致,需要进行模型微 调与对齐。作者手动从手机和电脑收集了超过 2,000 张截图,每张都由人类标注 员以问答的形式标注了屏幕元素、潜在任务和操作方法。同时还利用 Mind2Web 和 AITW 这两个专注于网络和安卓行为的数据集,并使用 GPT-4 将其转换为自然语言的问答格式。此外,作者将多个公开可用的视觉问答(VQA)数据集纳入对 齐数据集中,提升模型与人类行为的一致性。 CogAgent 作为一个通用的视觉语言模型,在众多视觉问答基准测试中实现了最 先进的水平,包括 VQAv2、OK-VQA 等。测试发现,CogAgent 在一般视觉问答 与富含文本的视觉问答基准测试当中都表现优异,尤其相比通用模型有明显得分 优势,与微调专业模型相比也属于领先梯队。此外,CogAgent 在 PC 和 Android GUI 导航任务 Mind2Web 和 AITW 上也优于基于 LLM 的方法的模型,如 GPT-4、 LLaMA2 等。

2.2 AutoWebGLM:基于大语言模型的 Web 导航 Agent

通过简化 HTML 增强网页阅读能力,添加人类与 AI 混合方法构建的网络浏览数 据集进行微调,大幅提升大语言模型的 Agent 能力。2024 年 10 月,清华与智谱 团 队 发 布 基 于 大 语 言 模 型 ChatGLM3-6B 微调的 用 于 网 页 自 动 导 航 的 AutoWebGLM。该模型由两个关键组件组成:LM 代理和交互框架。LM 代理从各 种来源获取数据进行学习,利用强化学习和 RFT 来增强网页浏览能力;交互框架 使用各种网页处理模块来组织简洁的 HTML 和其他信息,供 LM 代理做出决策, 然后由自动化浏览程序执行这些决策。该模型有几大创新点解决了传统 LLM 的 痛点问题:

HTML 简化算法降低了 HTML 文本数据的复杂性:作者通过 HTML 简化和 OCR(光学字符识别)模块处理信息,在获取 HTML 和网页截图后生成简化 的 HTML 表示形式,并为 Agent 交互标记了可操作元素。OCR 模块用于在图 像解析期间标注文本元素。

采用一种人类与 AI 混合的方法来构建网络浏览数据进行课程训练,实现网 页上操作的通用性:鉴于人工成本高昂以及当前大模型在自动数据生成方面 的不足,作者在网页识别、简单任务操作、复杂任务操作构建方面都采用了 人机混合的方法,人工筛选网站并构建网页操作类型分割,大模型辅助生成 任务和操作意图。

通过强化学习和拒绝采样微调(Rejection Sampling Fine-Tuning)来增强模 型,以进一步促进网页理解、浏览器操作和高效的任务分解:将模型采样的 输出与正确答案相结合,构建具有正负对的对比数据,让模型通过认识自己 的错误进行强化学习;拒绝采样微调采用监督学习模型来生成推理路径,奖 励模型会收集准确并拒绝错误的路径,随后将其用作扩充的微调数据集。

为解决高质量、复杂的网页浏览数据稀缺的问题,创建合适的训练数据集非常关 键。数据集构建分为两个主要阶段,第一阶段是网页识别任务和简单任务操作构 建,第二阶段是复杂任务构建。

网络识别的主要目标包括理解特定的 HTML 格式、识别不同类型的网络元素 (如文本框、按钮、图像等),以及理解这些元素在用户交互中的作用。简单 任务操作数据集的主要目标是训练模型执行单步网络操作。这包括在网页上 执行基本功能,如点击链接、填写表单或导航到特定部分。

通过复杂网络任务开发数据集,使模型能够在网络浏览场景中进行规划和推 理。数据集中的每个样本都包含复杂网络浏览任务、完成该任务的操作序列 以及每一步的意图。通过浏览器插件,利用人工标注来捕获网页任务执行情 况,该插件记录网站任务期间的操作。为实现高效链式思考推理,使用 GPT4 作为操作意图的预测器。

AutoWebBench 在小参数规模下实现更高的网页导航能力。作者建立了一个双语 (中文-英文)基准 AutoWebBench,并评估了公开可用的代理的能力,还针对众 多基准进行了大量实验,以评估 AutoWebGLM 在涉及英语和中文网站导航的各种 任务中的性能,使用步骤成功率(SSR)作为评估指标。通过在 Mind2Web 上测 试,发现 AutoWebGLM 在跨任务、跨网站、跨域的表现均有明显优势,且其 6B 规模相比其他大多数模型参数量更小;在 MiniWoB++和 WebArena 上实现了效果 最优。

2.3 AutoGLM:图形用户界面的自主基础 Agent,可用于网页浏览与安 卓手机操作

GUI 场景下实现通用自主 Agent,加速 Agent 于终端落地。虽然基础模型在获取 人类知识方面表现出色,但在动态的现实世界环境中进行决策时往往会遇到困难, 这限制了它们在通用人工智能方面的进展。主要由于 GUI 基础 Agent 的预训练数 据集当中缺乏决策数据,互联网包含大量的静态人类知识,无法充分捕捉人类决 策和环境交互。构建有能力的 GUI 基础代理需要为其注入动态知识,要么通过与 现实世界环境的直接交互,要么通过从合成轨迹中学习。 2024 年 10 月,清华与智谱团队将网络浏览器和手机作为具有代表性的 GUI 场 景,开发了 AutoGLM 作为适用于现实 GUI 交互的基础 Agent 系统,实现适合用 户交付的可部署的 Agent 系统。其中包括了两个创新的设计: 设计一个适当的“中间界面”用于 GUI 控制至关重要,它能够将规划和定位 行为分离,这两种行为分别需要针对灵活性和准确性进行不同的优化。 开发了一种新颖的渐进式训练框架,使 AutoGLM 能够进行自我演进的在线 课程强化学习。 用户可通过语音或文字向 AutoGLM 命令,该模型即可在 App 端自主多步操作, 对于模糊命令,执行过程仍需用户进行选择,但整体大幅简化了操作流程。在诸 如点餐、打车、查询信息并发布等常见场景下取得较高成功率,加速 Agent 进入 端侧应用。

AutoGLM 在基准测试中有显著的进步,缩小了自主 Agent 和人类表现之间的差 距。评估表明,AutoGLM 在多个领域都有效:在网页浏览方面,AutoGLM 在 VABWebArena-Lite 上实现了 55.2%的成功率(第二次尝试提高到 59.1%),在 OpenTable 评估任务上实现了96.2%的成功率。在安卓设备控制方面,AutoGLM在AndroidLab (VAB-Mobile)上实现了 36.2%的成功率,在流行的中国应用程序中的常见任务 上实现了 89.7%的成功率。

3 GLM 多端 Agent 家族,打造手机、PC、汽车等终 端交互入口

3.1 GLM-Phone:可实现跨 APP 操作、支持超长任务流程、支持更多 主流 APP

AutoGLM 可在手机端接受文字和语音指令,模拟人类的行为完成一系列任务, 如点外卖、订酒店等。智谱推出了升级版的 AutoGLM,针对手机端应用提供了新 的解决方案,显著扩展了其在手机端的应用场景和操作能力,标志着智能手机人 机交互进入了一个全新的高度。通过在淘宝进行产品复购的案例,表明前版本的 AutoGLM 在手机端应用方面,已具备在单个 APP 上模仿人类行为的功能。首先, 其能够理解用户的自然语言指令(如:“购买上个月买的牙膏”)并将其分解为一 系列可执行的步骤(如:“上个月”进行历史订单并查找筛选)。此外,该项活动 表明其能够识别 APP 的界面布局并精确定位功能模块(如:查找到历史订单、商 品列表等),并模拟人类的点击、滑动等行为完成任务。

跨 APP 操作为本次产品升级的一个亮点。通过 AutoGLM,可以在美团和饿了么 之间筛选价格更实惠的肯德基套餐并下单购买,表明在已有功能的基础上,升级 版不仅可以在单个应用内完成复杂任务,还能实现在不同的APP间实现无缝切换。 在“打开美团选择肯德基并下单全家桶—切换饿了么搜索商品—对比价格后订单” 等任务中,达成多个平台间的的数据传递和智能化决策,而无需用户手动干预, 并极大提高了操作效率。

支持更多主流 APP,快速建立应用生态。除了此前版本支持的微信、淘宝、美团 等平台外,新增了抖音、微博、饿了么、京东、拼多多等更多主流平台。这意味 着 GLM-Phone 能够覆盖用户日常生活中更丰富的使用场景,从社交、购物到短视 频娱乐和外卖服务,提供了一站式的操作体验。 支持多步超长任务流程。这意味着 Agent 可以将一个任务链拆解成多个操作并自 动完成,以本案例为例:“帮我上小红书查火锅要准备什么食材,去小象超市全部 采购回来”被分解为“小红书查找信息-小象超市食品筛选(40 余步)-下单”,共 53 步。除上文提到的跨 APP 操作功能外,其能够对非结构化信息(如:小红书的 文本、图片等)进行理解并提取关键信息,且能够根据所得信息,通过逻辑规划 和动态交互完成任务规划,并分步骤拆解及逐一完成,在此过程中实现了不同阶 段的数据传递,能够在短时间内快速完成复杂任务。

支持自动循环任务,重复动作高效完成。GLM-Phone 可实现微信群聊实现循环点 赞,“帮我给 AGI 群里所有人的第一条朋友圈点赞”可以由 Agent 自动检索目标 群聊并识别群用户板块,逐个循环进行首条朋友圈动态点赞(指进入-点赞-退出再进入)。循环功能适用于重复性的操作,如热点内容抓取、物流信息更新等常见 情景,满足自动化处理高频重复操作的需求,减少用户的手动干预。

3.2 GLM-PC:办公领域将迎来生产力跃升

3.2.1 CogAgent 实现Computer Use

GLM-PC 初步实现 Computer Use,开启 PC 端“无人驾驶”新探索。智谱推出的 基于 CogAgent模型的 PC 端 Agent GLM-PC,目前开放第一阶段内测场景,包括会议替身(帮用户预定和参与会议,发送会议总结),文档处理(支持文档下载、 文档发送、理解和总结文档),网页搜索与总结(在指定平台,如微信公众号、知 乎、小红书等,搜索指定关键词,完成阅读、总结),远程和定时操作(远程手机 发指令,GLM-PC 可以自主完成电脑操作;设定一个未来时间,在开机状态下定 时执行任务)等。GLM-PC 是能够帮助用户操作计算机的智能体,用户只需输入 指令,GLM-PC 即可理解指令、规划任务,然后识别电脑界面中的窗口、图形、 文字等,并自动操作电脑。例如在会议替身场景下,用户发布指令“加入这个飞 书会议,静音,关闭摄像头,开启会议录制”,GLM-PC 会进行理解,并规划任务, 再逐步操作电脑打开应用会议、输入会议号、进入会议,最终完成任务。GLM-PC 能够大幅提升用户办公效率,有望成为未来桌面端的必备助手。

“隐形屏幕”功能即将推出,不干扰主页工作流,实现 Agent 效率提升。基于视觉 和操作的智能体常与用户争夺屏幕和输入设备资源,迫使用户被动等待任务完成, 干扰电脑正常使用。GLM-PC 的“隐形屏幕”技术让用户可在 AI Agent 执行任务的 同时,继续使用电脑进行其他工作,实现 Agent 高效利用,该功能与相关模型技 术报告预计在 2025 年一季度推出。

像人一样使用电脑,具备更高能力上限。GLM-PC 拥有跨平台、跨系统的泛化能 力,能像人一样使用电脑,包括“眼看”(进行图形、图像、文字的视觉理解),“脑 思”(进行步骤拆解和任务规划)和“手动”(进行仿人类操作:点击、滚动、悬停、 输入)。GLM-PC 通过模拟最基本的人类操作进行工作,对人类设计的应用适应程 度较高,而无需依赖 HTML、API,具备更高的能力上限。

3.2.2 AutoGLM-Web 进一步扩展 AI 搜索能力边界

AutoGLM-Web 是一款基于大语言模型的 AI 浏览器助手,能够模拟用户进行网 页浏览与交互,执行包括网页访问、信息检索、内容总结等任务。用户可通过简 单的文字指令让其搜索特定网页、查找商品或总结文章内容,对百度、微博、知 乎、Github 等数十个网站实现自动操作。这体现了 Web Agent 在提升用户体验、 优化效率方面具有巨大潜力,未来有望持续拓展 AI 搜索能力边界,形成自主思考 分析、自主执行操作的网页版高级智能体。

3.3 GLM-Car&More:Agent 为 AI 终极形态,加速万物智能、万物互 联

Agent 在车端已开始落地,广大硬件智能化并不遥远。智谱同小鹏汽车携手打造 智能语音助手,可通过简单的语音指令激活,对调节车内环境、设置导航、播放 音乐、查询天气等要求迅速响应并精准执行,全面提升车主的智能化驾驶体验。 随着 GLM-Car 应用落地,车端操作系统可作为路途中的“生活与工作助手”,如 智谱与小鹏合作的“AI 小 P”可实现实现聊天对话、百科问答、车辆控制、知识 科普等功能,未来有望作为多智能终端的“移动入口”,真正实现智能化座舱。 未来 Agent 有望渗透至各类智能设备,落地 AI 原生设备,实现设备主动服务用 户。通过全域数据的快速整合与深度洞察,Agent 将具备快速处理复杂任务的能 力,自动规划并高效执行各类任务。此外,Agent 还将具备专属记忆功能,随着时 间的推移逐步学习用户的需求与偏好,从而提供更加个性化的服务,真正做到与 用户的生活和工作深度融合。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至