AI手机发展经历几个阶段?

AI手机发展经历几个阶段?

最佳答案 匿名用户编辑于2024/06/05 10:05

AI 手机仍处早期阶段,AI OS 赋予完整 AI 体验。

1. 初级 AI 手机形态:基础 AI 应用+AI 增强功能

目前 AI 手机主要是在原有操作系统上集成 AI 功能或 AI 应用。集成 AI 功能:以原有操作系统为基础,通过搭载端侧大模型增加或增强 AI 功 能,如增加 AI 助理智能摘要生成、实时翻译功能等;集成 AI 应用:通 过 OpenAI 发布的 GPT Store 下载定制化、个性化的 AI APP,如 ChatGPT APP 等,可通过自然语言交互实现旅行规划、智能问答、图像识别生成 等功能。基于生成式 AI 的美图秀秀 APP 可支持 AI 绘画、AI 修图、AI 美容等功能。基于原有操作系统的 AI 手机通过集成 AI 应用或 AI 功能, 能够以自然语言与用户进行交互并高效处理任务,但本质仍是通过 API 接口调用生成式 AI 模型,未实现 AI 系统级应用。

Galaxy AI 赋能多项应用,Galaxy S24 系列 AI 体验全面升级。Galaxy AI 首创即圈即搜功能,用户只需长按 Home 键并在当前文本、图片或视频 界面圈选图像即可获得优质结果。Galaxy S24 系列内置笔记助手,可根 据内容智能排版、生成摘要和封面;内置转录助手可识别多人讲话并转 录为支持编辑的文本,也可直接翻译录音并生成摘要;原生通话应用程 序引入通话实时翻译功能,支持 13 种语言实时双向和文本翻译;图像 应用具有智能修图建议、生成式编辑等功能,可快速去除反光、改变人 物或对象位置大小等。

谷歌 Pixel 8 系列增强图像编辑,个人助理 Gemini 智能提升。谷歌 Pixel 8 系列内置的 Magic Editor 可以通过生成式人工智能编辑照片,ZoomEnhance 通过生成式 AI 预测照片细节,填充像素间间隙,增强变焦;个 人助理 Gemini 支持文本、语音及图片交互,可帮助朗读和翻译网页并 生成摘要;录音机增加 AI 功能,可自动总结对话并生成摘要;Audio Magic Eraser 通过 AI 识别声音,可直接从视频删除不想要声音。 HarmonyOS 4 率先接入 AI 大模型,小艺同学增加多项 AI 功能。 HarmonyOS 4 采用全新华为方舟引擎,与 HarmonyOS 3 相比,滑动流畅 性提升约 20%,续航增加约 30 分钟;并且对超级中转站等进行优化, 支持手机、平板、PC 等不同端口,具备跨端流转能力。HarmonyOS 4 将 AI 大模型技术接入小艺,全新小艺增强自然语言理解能力,支持用 户更日常的表述方式;增加智能摘要和文案辅助创作功能;可依托多模 态大模型技术,对已有图像进行个性化二次创作。

小米 14 搭载底层重构的澎湃 OS,支持人车家全生态。小米澎湃 OS 重 构子系统,优化内存管理提高应用启动速度。澎湃 OS 拥有 AI 大模型植 入系统,基于端侧大模型的小爱助手可智能创作文本、快速撰写购物评 价、生成发言稿等。小米 14 内嵌图像应用可实现 AI 妙画、AI 搜图、 AI 写真、AI 扩图等功能。搭载的 Xiaomi HyperConnect 可实现所有智能 设备实时统一组网,可在手机、平板等设备的“融合设备中心”进行快捷 控制。 搭载 ColorOS 14 的 OPPO Find X7 实现 AndesGPT 模型端云协同。 ColorOS 14 系统端侧支持 70 亿参数的 AndesGPT·Tiny 大模型,云端支 持 AndesGPT·Turbo/Titan 大模型。OPPO Find X7 搭载 ColorOS 14 系统, 内置小布助手具有智能摘要、智能消除、内容创作等 AI 功能,并且系 统内置的图像软件具有 AIGC 消除效果,可智能生成写真照片。

Vivo OriginOS 4 搭载自研 BlueLM,X100 系列具备丰富 AI 功能。基于 10 亿参数 BlueLM 的 Vivo X100 系列,其内置的 AI 助手“蓝心小 v”具备 超能语义搜索、超能问答、超能写作、超能创图和超感智慧交互等功能, 能够实现智能问答、文案撰写、摘要生成、图片编辑。摄影应用基于生 成式 AI,通过人像识别、场景识别等功能可优化拍摄效果。

2. 进阶版 AI 手机:基于意图交互的 AI OS

意图交互升华 AI 认知,AI OS 深度融合端侧大模型。AI OS 改变原有操 作系统指令式的工作逻辑,通过集成智能感知技术实时获取用户行为、 偏好等环境信息,实现意图式人机交互,使 AI 或系统可更好地理解用 户当下所处场景及基于自然语言的用户指令;通过将端侧大模型融入底 层架构,AI OS 可持续从与用户交互过程中学习并优化自身性能,为用 户提供更个性化、精准的服务;基于 AI OS 的 AI 助理可理解应用界面 及相应功能,通过调用应用 APP,自动完成用户任务,简化重复枯燥的 操作过程。 荣耀 MagicOS 8.0 首次实现意图识别人机交互。与主要负责管理硬件资 源的传统 OS 内核不同,Magic Live 平台级 AI 负责“管理”与人相关的因 子,如个人知识库、位置与状态、习惯与画像等,帮助 OS 精准识别用 户意图,高效调度系统服务。基于 Magic Live 平台级 AI 的场景感知、 意图决策、用户理解能力,Magic OS8.0 支持自然语言、语音、图片、 手势、眼动等多模态交互方式,可智能识别用户意图,进行快速推理决策,主动提供个人化服务,提升交互效率。MagicOS 8.0 内嵌的任意门 功能可基于意图识别让服务实现跨应用、跨设备一步直达、智慧流转, 支持 100 多款国内主流应用服务,覆盖出行、办公、社交、搜索、娱乐、 购物、美食等应用场景。内置的 YOYO 智能助理可理解用户意图,高效 安全地连接云侧大模型,分发、融合、调度原子化服务,完成复杂任务 闭环。

苹果 Ferret UI 模型增强 iOS 意图识别,致力打造 AI OS。Ferret UI 以 Ferret 模型为基础,通过将手机 UI 界面分割为更小的子图像捕捉 UI 界 面细节特征,并将所有子图像单独编码获取图像特征,最后将子图像与 全局图像特征输入端侧大模型中,使端侧大模型可更好地捕捉 UI 界面 细节信息。并且 Ferret UI 通过收集各种初级 UI 任务的训练数据,如图 标识别、查找文本、组件列表等,以精准定位和理解 UI 组件;通过收 集与 AI 交互相关的高级任务数据集,如详细描述、感知/交互对话和功 能推理,以增强模型与 UI 相关的推理能力。基于 Ferret UI 可显著增强 AI OS 对手机 UI 界面的理解能力,并可根据用户指令找到具体元素完成 交互。

iPhone 环境下 Ferret UI 性能接近或超过 GPT-4V。Ferret UI 模型可完 成简单的 UI 定位和查询任务,在 iPhone 环境下 130 亿参数的 Ferret UI 模型在初级 UI 任务中超越 GPT-4V。并且可根据 UI 与用户进行感知对 话、交互对话,告诉用户相应位置具体的 UI 内容,如何与 UI 进行交互, 根据 UI 元素推断软件功能,在高级任务中的表现与 GPT-4V 接近。若 将 Ferret UI 与 AI 助理进行结合,AI 助理可深入理解用户意图,并基于 用户自然语言指令与手机 APP 进行交互,实现 AI 系统级应用。

Siri 将迎来重大革新,iOS18 预计搭载更多 AI 功能。根据彭博社,苹果 正在改进 Siri 和消息应用程序间的交互,使 Siri 更有效地自动生成文本 并回答复杂问题;根据 The information 报道,Siri 将与 Shortcuts 应用程 序进行更深入的集成,进而可自动执行复杂任务。2024 年 5 月 13 日 OpenAI 发布 GPT-4o,其具备强大的语音和视觉感知功能。用户无需等 待模型完成发言即可插话,回应音频输入平均时间仅为 320 毫秒,较 GPT-3.5/ GPT-4 下降 88.6%/94.1%,并且可根据语气判断用户情绪,针 对用户情绪改变自身语气,拟人化程度大幅提升。根据 OpenAI 官网, GPT-4o 在 MMLU、GPQA、MATH、HumanEval 等推理测试中超越 GPT-4 Turbo、Claude 3 Opusn、Gemini Pro 1.5 等前沿模型,并且在 MLS 基准 测试中优于 Whisper-v3 以及 Meta、谷歌的语音模型。根据彭博社报道, 苹果已与 OpenAI 达成合作协议,计划在 6 月 11 日 WWDC 全球开发者 大会公布一系列全新人工智慧技术。OpenAI 技术加持的 Siri 有望以低延 迟进行语音对话,提高人机语音交互的自然流畅度。并且有望增强用户 情绪感知,大幅提升拟人化水平。根据彭博社,苹果与 OpenAI 双方正 确认一项新协议,将 ChatGPT 技术应用在 iOS 18 中。根据 macrumors, iOS18 中多款应用程序如 Spotlight、Apple Music、Keynote、Shortcuts 等将具备生成式 AI 功能。

3. 高级版 AI 手机:全自主执行能力的 AI Agent

AI OS 的最终形态是具有全自主执行能力的数字人格。《PERSONAL 大 模型 AGENTS: INSIGHTS AND SURVEY ABOUT THE CAPABILITY, EFFICIENCY AND SECURITY》基于 AI Agent 智能水平将其分为 L1-L5 五个级别。具有意图交互与自我学习能力的 AI OS 将帮助 AI 助理深入 理解用户需求,持续学习用户个人习惯等信息。伴随手机硬件配置升级 以及端侧大模型推理性能提升,基于 AI OS 的 AI 助理有望成长为高度 智能化的数字人格,可根据用户指令自主生成任务规划,完美执行用户 任务并进行反馈。

AutoGPT 具备长期和短期记忆管理,可实现任务自主规划及执行。 AutoGPT 是基于 GPT-3.5 或 GPT-4 API 接口开发的 AI Agent,其可将用 户提出的复杂任务拆解为多项子任务,自动生成相应任务提示并执行, 无需用户进行干预和指导。并且可以基于互联网搜索获取最新数据、新 闻等信息,实现知识库实时更新。通过集成 Pinecone 数据库,AutoGPT 可保存与用户的对话、文本和上下文信息,并在对话中快速检索相关的 内容,回顾历史对话,进而更好地理解用户需求,提供更个性化的服务。

Mobile-agent 打破 APP 界限,联用多款应用实现拟人化操作。 Mobile-Agent 基于视觉感知模块可从设备屏幕截图中准确定位视觉和文 本元素以及图标信息,并通过视觉信息将语言模型生成的操作指令映射 到具体的屏幕位置执行点击等操作。其具备自主规划能力,能够根据操 作历史和系统提示自主规划新的任务。并且引入自我反思机制,在执行 过程中若遇到错误或无效操作,可根据屏幕截图和操作历史进行反思, 尝试替代操作或修改当前操作的参数。目前 Mobile-agent 已学会阿里巴 巴、TikTok、Youtube 等 10 项 APP 使用,并在部分跨应用场景中取得出 色的结果。

参考报告REPORT

AI手机行业专题报告:AI手机走向AIOS,系统级AI定位端侧智能助理.pdf

AI手机行业专题报告:AI手机走向AIOS,系统级AI定位端侧智能助理。AI手机时代来临,基于意图交互的AIOS及具有自主规划和执行的AI助理将赋予用户个性化、智能化的服务体验,驱动新一轮换机浪潮,相关供应链深度受益。云侧与端侧大模型协同是AI手机未来,端侧大模型成本、隐私安全等多方面占优。以GPT-4为代表的云侧生成式AI大模型在多模态复杂任务指令执行中表现卓越,强大的泛化能力可支持多样化AI应用开发。但高使用成本、云侧存储及处理用户数据导致其不适用于指令简单、用户信息敏感以及离线应用等场景。经测算端侧大模型使用成本为云侧1/100以下;其将用户数据存储至终端,隐私安全性高;并且在离线状态下...

我来回答
分享至