大模型研发+硬件支持+第三方合作。
苹果加码 AI 研发。2 月 28 日,彭博社称苹果在一次内部会议上决定取 消自动驾驶电动汽车的开发计划,汽车团队有近 2000 名员工,部分员 工将转到苹果 AI 部门。苹果已将 AI 视为其内部极其重要的研发方向, 资源开始向 AI 部门倾斜,24 年初库克在业绩会表示将于今年公布苹果 AI 的重要进展。
从 Core ML 到 OpenELM,苹果持续推进 AI 大模型研发。 1)Core ML 架构:2017 年苹果发布 Core ML,CoreML 旨在将预先训 练的 AI 模型部署到苹果设备的各种应用程序中。2018 年苹果在 Core ML 基础上添加了 Create ML,无需编码即可创建简单 ML 模型。2023 年苹果再次对 Core ML 进行更新:Core ML 推理引擎更快;新增 Async Prediction API,可同时运行多个预测,支持取消预测请求;新版 Core ML Tools 改进了模型转换选项。 2)Ajax 框架:2023 年 7 月,据彭博社透露,苹果已经建立了大语言 模型框架“Ajax”,并基于 Ajax 创建了聊天机器人服务,Ajax GPT 训 练参数或超 2000 亿,苹果已经基于 Ajax 对搜索、Siri、地图进行了人 工智能的改进。
3)Ferret 多模态大语言模型:2023 年 10 月,苹果与康奈尔大学共同 推出 Ferret 多模态大语言模型,Ferret 可以处理自由形式区域输入的模 型,拥有强大的视觉语言全局理解能力,在这项任务上的表现优于 GPT-4。Ferret 模型有 70 亿参数版本,可在移动设备端运行。 4)LLM 端侧可用化技术:2024 年 1 月苹果发布一篇关于如何在内存 受限的设备高效运行 LLM(大语言模型)的论文,通过“窗口化”技 术(重复使用激活过的神经元减少数据的传输)和“行列捆绑”技术 (定制访问数据块顺序,增加从闪存读取的数据块大小)大幅提高内存 使用效率,设备可运行 2 倍于 DRAM 的 LLM,有效提升 LLM 适用性,此外,与 CPU 和 GPU 的原始加载方法相比,推理速度分别提高了 4-5 倍和 20-25 倍。 5)MM1 多模态大语言模型:2024 年 3 月苹果在论文中公布了多模态 大语言模型 MM1,参数达 30 亿、70亿、300 亿。得益于大规模多模态 预训练,MM1 在上下文预测、多图像和思维链推理等方面具有不错表 现,在指令调优后 MM1 还具备较强的少样本学习能力。
6)ReALM模型:2024年 3月底苹果发布关于新模型ReALM的论文, ReLAM 能够同时理解用户屏幕上的内容和正在进行的任务,利用大语 言模型解决对话实体和非对话实体(例如屏幕实体和后台实体)的指代 解析问题。模型效果方面,最小的模型在屏幕实体识别上的准确率也比 原有模型提升5%以上,与GPT-3.5和GPT-4.0相比,最小模型与GPT4.0 性能相当,而在更大模型版本上,ReLAM 明显优于 GPT-4.0。 ReLAM 的发布可视为苹果在端侧大模型领域的重大突破,有望在 Siri 优化、多设备交互等方面得到应用。 7)端侧 OpenELM 模型:2024 年 4 月苹果发布开源大型语言模型系列 OpenELM 模型,包含了 2.7 亿、4.5 亿、11 亿和 30 亿四个参数版本, OpenELM 使用了分层缩放策略以有效分配 Transformer 模型每一层参 数,从而提升准确率,OpenELM 可在笔电、智能手机等端侧设备独立 运行,无需连接云端服务器。

苹果自研芯片为端侧 AI 功能落地提供硬件支持。2017 年苹果首次在 A 系列芯片 A11 中加入 NPU(神经网络引擎),A11 采用 10nm 工艺, NPU 算力仅 0.6TOPS,最新的 A17 Pro 采用 3nm 工艺,NPU 算力提 升至 35TOPS。M 系列芯片亦采用 CPU+GPU+NPU 架构,2023 年 10 月苹果最新发布 M3 Max 芯片,采用 3nm 工艺,最高拥有 16 核 CPU、 40 核 GPU、支持 128GB 的统一内存、400GB/s 的内存带宽,NPU 算 力 18TOPS,搭配苹果 2023年 12 月发布的专门在苹果芯片上用于机器 学习的开源阵列框架 MLX,可以直接跑 70 亿参数大模型、训练 Transformer 模型或是进行 LoRA 微调。2024 年 5 月 7 日苹果发布的 M4 芯片主打 AI 功能,采用 3nm 工艺,NPU 算力高达 38TOPS,首搭 新款iPad Pro,M4系列芯片将与高通X Lite、英特尔Arrow Lake/Lunar Lake 和 AMD 9050 系列竞争,相关 Mac 产品线也将于 24 年-25Q1 陆 续推出。
收购多家初创公司,赋能 AI 发展。2010年以来苹果收购了 30+家 AI初 创公司,主要涉及语音识别、面部识别、图像识别等技术,为改进 Siri 语音助手、FaceID 人脸识别、优化图片应用、增强音乐服务功能、提 高天气预报精度等多个产品服务提供支持,而 24 年初收购的加拿大 AI 初创企业 DarwinAI,其技术优势在于 AI 系统小型化,同时兼顾较高的 处理速度,有望赋能苹果端侧 AI 发展。
苹果或将引入 OpenAI、谷歌等大模型,强化终端 AI 能力。在 AI 领域 苹果也将采用自研+第三方合作方式,或将引入 OpenAI、谷歌等大模 型,24 年 3 月彭博社透露,苹果正在与谷歌磋商,计划在 IOS/iPadOS 系统中引入 Gemini 模型,目前尚未达成协议;24 年 5 月彭博社称苹果 即将与 OpenAl 达成合作,为 iOS 18 带来 ChatGPT 功能。苹果选择引 入第三方大模型的原因可能在于短时间内自研大模型成熟度尚不及头部 厂商 AI 大模型,而终端品牌 AI 竞争激烈,升级 AI 功能较为迫切,采用 第三方大模型可以快速强化苹果终端 AI 能力,也能为苹果自研大模型 争取优化升级的时间。
现阶段手机 AI 以赋能基础场景为主,未来有望向生态级 AI 演进。目前 手机 AI 功能主要基于现有基础场景进行赋能,例如三星 AI 手机 Galaxy S24具备实时翻译、写作助手、即圈即搜、照片助手、AI相机等多项AI 功能,vivo 蓝心大模型支持内容生成、看文创图、总结内容等,OPPO Find X7 支持内容生成、通话摘要、智能修图等功能。后续端侧 AI 能力 有望推动应用市场快速发展,AI体验有望向高维数据、多数据联合处理 的生态级 AI 演进,精准识别用户意图,支持跨厂商数据协同决策实现 服务调度,成为真正的 AI 助理。
苹果或升级 Siri、Spotlight 等原生应用 AI 功能,推出 AI 应用商店。 1)Siri:苹果或将于 WWDC2024 推出 iOS18,Siri 预计为苹果 AI 核心 升级应用,自 2010 年收购 Siri 以来,苹果陆续收购多家 AI 初创公司以 优化 Siri 语音识别和对话能力,然而现阶段与其他语音助手相比,Siri 并无明显优势。后续苹果或运用大模型框架强化 Siri 能力,以实现更为 智能、流畅的对话,甚至与其他 APP 联动执行 AI 功能,成为真正意义 的智能助手。 2)多款已有应用:将 AI 引入相册以优化照片视频智能分类和搜索功能; 升级 Spotlight 搜索,使其能够在应用中的特定功能间切换,并依据大 模型回答更复杂的问题,以及深入挖掘应用程序以启动特定功能;在 Pages、Keynote 等生产力应用程序中加入生成式 AI 功能,帮助用户写 作或自动创建 PPT 等。 3)开发工具 Xcode:据彭博社信息,苹果将为其旗舰程序软件 Xcode 加入生成式 AI 功能,新系统可能接近微软 GitHub Copilot。GitHub Copilot 是微软和 OpenAI 此前推出的人工智能开发工具,可自动生成或 补全代码、提供 bug 修正以及优化建议等,苹果 Xcode 升级 AI 功能将 简化开发者编程过程,提升效率降低成本。 4)iCloud:AI 应用于 iCloud 或将优化同步功能、分类功能、安全功能 等,例如自动对云端文件或照片进行智能分类,通过 AI 检测安全威胁 以强化 iCloud 安全性等。5)AI 应用商店:根据 Melius Research 信息,苹果或在 6 月 WWDC 大会推出全新 AI 应用商店,预计将包括各大供应商提供的 AI 应用。
AI+Vision Pro 具备想象空间。1)内容生态:AIGC 通过 AI 技术快速 生成虚拟数字图像/音视频,内容生成门槛和成本显著降低。2 月 OpenAI 发布的文生视频模型 Sora 可直接输出长达 60 秒的视频,并且 包含高度细致背景、复杂多角度镜头以及富有情感的多个角色。未来 Sora 等 AI 视频生成大模型有望为 Vision Pro 带来丰富且高质量、高沉 浸度的 3D 内容,用户甚至可以创造属于自己的虚拟世界,生态应用极 具想象空间。2)硬件感知交互:AI 可基于图像渲染、立体几何重建和 深度理解高效还原真实环境,解决图像畸变失真等问题,AI算法亦有望 优化眼动追踪、裸手交互、面部识别等多种感知交互效果,持续提升感 知体验。