2024年谷歌公司研究:把握Alpha,Bet on AI

  • 来源:国盛证券
  • 发布时间:2024/02/20
  • 浏览次数:1245
  • 举报
相关深度报告REPORTS

谷歌公司研究:把握Alpha,Bet on AI.pdf

谷歌公司研究:把握Alpha,BetonAI。全球科技巨头,立足搜索、不断创新。Alphabet为谷歌的母公司,2023年收入3074亿美元(yoy+8.7%),其中谷歌服务/谷歌云/创新业务三大分部,分别占据收入的88.7%/10.8%/0.5%。三大分部中,谷歌服务经营利润率约为34%,谷歌云业务从1Q23起经营利润扭亏,未来亦有望持续为公司贡献利润。从行业地位来看,谷歌搜索和谷歌云分别位居全球第一和全球第三。此外,公司的创新业务是有望长成参天大树的种子。无论是基本业务还是创新业务,未来均有望受益于AI的加成。技术基础:全面夯实,引领AI发展。谷歌在人工智能领域的优势是扎实且全面的:1)算...

一、全球科技巨头,立足搜索、不断创新

1.1 巨头的成长之路:搜索奠基,创新驱动

1996 年,Larry Page 和 Sergey Brin 发明了搜索引擎 BackRub,这便是谷歌 PageRank 算法的前身。

1998-2004 年,搜索奠基。1998 年,Google 公司正式注册成立,于 2000 年发布 AdWords,允许企业购买与搜索词相关的广告,2001 年、2003 年,公司又先后推出了 图片搜索,成立了 AdSense 站点定向广告,不断完善其基于搜索的广告业务板块。 2004 年 4 月,公司发布了电子邮件服务 Gmail。 2004-2010 年,多向拓展。2004 年 8 月,公司在纳斯达克主板上市。此后,谷歌将目 光投向了搜索业务之外的领域。2005 年,谷歌先后收购了 Android,上线了谷歌地图, 与 NASA 达成合作。2006 年,谷歌继续收购了 YouTube,设立了数据中心,发布了 Google Cloud。接着,其又在 2008 年推出了第一部安卓智能手机和 chrome 浏览器。 2009 年 11 月,谷歌收购了手机广告公司 AdMob,次年完成收购。2010 年初,公司推 出了智能手机 Nexus One。 2010 年至今,创新驱动。2010 年后,谷歌走向了科技掘金的道路,不断探索新的领 域。其成立的 Google X 实验室针对各方面的重大挑战每年构想上百个创意,主导了许 多极具创意和前瞻性的项目,如比如互联网热气球、谷歌眼镜、无人飞机、太空电梯和 无人驾驶等。此后,谷歌陆续布局自动驾驶、人工智能、生物科技、智能家居、生命科 学、智慧城市等诸多领域的全面发展。

1.2 架构调整后,以搜索“现金牛”养育创新业务

2015 年架构调整后,Alphabet 为谷歌的母公司。由于 2010 年以来,谷歌不断拓展新 业务,涵盖领域过于庞杂。2015 年,名为 Alphabet 的法人实体得以创建,作为谷歌和 集团其他子公司的母公司。其中,谷歌包含了搜索广告、谷歌云、安卓、视频、地图、 硬件和基础设施等。

公司当前可分为 1)谷歌服务、2)谷歌云、3)其他创新业务三大分部,2023 年分别 占据收入的 88.7%、10.8%、0.5%。谷歌服务又可以分为广告业务和谷歌其他: (1) 广告业务为公司的现金牛业务,占据公司收入的 77.4%。其中,谷歌搜索和其 他广告占据公司整体收入的 56.9%,谷歌联盟等占据 10.3%,YouTube 广告占 据 10.2%。 (2) 谷歌其他,例如 Google Play、Pixel 手机、YouTube Premium 等,占据公司整体 收入的 11.3%。

从盈利能力方面看,谷歌服务是现金牛业务,支撑其他业务发展。2023 年公司收入 3074 亿美元,同比增长 8.7%,毛利率达 56.6%;经营利润 843 亿美元,经营利润率 12.6%。三大分部中,谷歌服务经营利润率同比增长 1.4pct 至 35.2%。谷歌云扭亏为 盈,实现 5.2%的经营利润率。创新业务的经营亏损率为 268.2%。

谷歌以“高市占率、低增长率”的广告现金牛业务养育“低市占率、高增长率”的其他 创新业务。创新业务能否成长为明星业务或者未来的现金牛业务,多年来一直是个“问 号”。但可以确定的是,AI 将为每一个业务领域加成。未来 AI 不仅应用于其核心的广告 和智能云业务,也会体现到公司前期布局的智能硬件、自动驾驶等多个领域。

1.3 AI 驱动下,科技龙头股价处于上行周期

公司发行多种类型的股票,不同股票所代表的投票权有所差异,但股价差异不大。股 票代码为 GOOGL.O 的 A 类股票所有者每股拥有一票表决权,股票代码为 GOOG.O 的 C 类股票没有投票权。而 B 类股票全部由创始人持有,每股代表 10 票的投票权。截至 2023 年 4 月 4 日,谷歌的创始人拉里·佩奇和谢尔盖·布林是 Alphabet 的最大股东, 合计持股 11.1%。 当前公司及其他美股科技龙头的股价处于上行周期。回顾公司过去几年的股价走势, 与美股其他科技龙头较为一致,大体可以分为三个发展阶段: (1)2020 年-2021 年 11 月,2020 年全球疫情爆发,线上经济快速发展,互联网等科 技巨头直接受益,叠加全球流动性持续宽松,美股科技龙头迎来一波牛市; (2)2021年 11 月-2022年末,全球通胀水平高,美联储大规模加息;加之疫后线上活 动减少、购买力降低,营收增速回落;市场存在美国经济衰退担忧。诸多影响因素下, 美股科技股呈现较大幅度的下跌; (3)2022 年末至今,美联储加息预期见顶、美债收益率回落、AI 产业周期到来等因素 的带动下,美股科技股再次上涨。

无论是从业务层面看,还是股价表现上看,人工智能已经成为核心看点。因此,本篇报 告将主要拆解公司人工智能在各个层面的发展,以窥公司的长期竞争力。

二、技术基础:全面夯实,引领发展

前文已经看到,在 AI 领域,谷歌贡献了许多里程碑作品,例如,围棋机器人 AlphaGo 以 4:1 击败韩国围棋冠军李世石、开发了广泛应用的深度学习模型 Transformer 等。下 文梳理了谷歌在 AI 基础设施、深度学习框架、模型等不同层面的技术基础,我们可以 发现,谷歌在人工智能领域的优势是扎实而全面的。

2.1 AI 基础设施:TPU v5 性能升级,Vertex AI 模型更新

2.1.1 芯片:TPU v4 高扩展、可重配置,TPU v5 性能再升级

近年来,各类势力均在发力 AI 芯片,参与者包括传统芯片设计公司、IT 厂商、互联网 以及云厂商等,产品覆盖了 CPU、GPU、FPGA、ASIC 等。在龙头——英伟达 GPU 之外, 包括谷歌在内的云服务商也在自研 AI 芯片。

谷歌自 2015 年发布 TPU v1 以来,不断迭代升级,在 TPU v2 时已经可以支持训练,其 在 2021 年 Q2 发布的 TPU v4 性能大幅提升,通过光互联实现可重配置和高可拓展性, 性能大幅提升。 在 TPU 超级计算机(由 4096 个 TPU v4 组成)拓扑结构中,物理距离较近的 TPU v4 (即在同一个 4x4x4 cube 中的芯片)可以用常规的电互联(例如铜绞线)方法连接, 距离较远的 TPU 之间(例如在 cube 之间的互联)使用光互联。TPU v4 的光互联具有两 大特性:高可拓展性和可重配置。

高可拓展性:可以有数千个芯片同时加速,从而实现一个为了机器学习模型训练而 设计的超级计算机。在谷歌的设计中,超级计算机的拓扑结构为:将 4x4x4(64) 个 TPU v4 芯片互联在一起形成一个立方体结构(cube),然后再把 4x4x4 这样的 cube 连在一起形成一个总共有 4096 个 TPU v4 的超级计算机。

可重配置:谷歌在 TPU v4 中的主要突破是使用可重配置的光互联(即加入光路开 关,optical circuit switch OCS)来快速实现不同的芯片互联拓扑。也就是说,芯片 之间的互联并非一成不变的,而是可以现场可重配置的。这样做一方面可以根据具 体机器学习模型来改变拓扑,另一方面改善了超级计算机的可靠性。

这些特性使得 TPU v4 的性能大幅提升。根据谷歌发布的论文《TPU v4:An Optically Reconfigurable Supercomputer for Machine Learning with Hardware Support for Embeddings》,TPU v4 相比 TPUv3 获得较大幅度的性能提升。使用 TPU v4 芯片进行嵌 入训练时,相比于使用 TPU v3 芯片,可以获得 2.7 倍的性能提升。

与英伟达的 A100 相比,TPUv4 和英伟达 A100 的 MLPerf 结果都可扩展到 4000 多片芯 片的规模,TPUv4 与 A100 相比亦具有一定的性能优势:

1) MLPerf 基准测试性能:芯片数量规模相似的情况下,对于自然语言处理 BERT 模型,TPUv4 的速度是 A100 的 1.15 倍;对于图像分类模型 ResNet,TPUv4 的 速度为 A100 的 1.67 倍。

2) 功耗方面,TPU v4 运行的功率更低。从 MLPerf 基准测试时测量的功率来看, A100 平均功率是 TPU v4 的 1.3–1.9 倍。

因此,TPU v4 已经是一款非常优秀的 AI 芯片产品,不仅相比较上一代产品更有,在一 些方面亦可与英伟达 A100 一试,为机器学习模型奠定坚实的基础。 2023 年 8 月/12 月,谷歌发布新一代的 AI 芯片 Cloud TPU v5e/ v5p。Cloud TPU v5e 专为提供大中型训练与推理所需的成本效益和性能而设计。与 Cloud TPU v4 相比, TPU v5e 使得大语言模型和生成式 AI 模型推理和训练的成本降低到大约一半,可以让 更多企业训练和部署更大、更复杂的 AI 模型。TPU v5p 更加强大。每个 TPU v5p pod 具备 8,960 个芯片,芯片间的互联速度达 4,800 Gbps,相较于上一代的 TPU v4,Cloud TPU v5p 提供了 2 倍的 FLOPS 与 3 倍的高带宽内存(HBM)。

2.1.2 云平台:Vertex AI 上新三款大模型

Vertex AI 作为一个托管机器学习平台,旨在帮助开发者更轻松的部署和维护其 AI 模 型。Vertex AI 是 Google Cloud 的端到端 AI 平台,包括工具、完全托管的基础设施以及 内置的隐私和安全功能。其发布于2021年5月,彼时相较其他机器学习平台,VertexAI 训练模型所需的程序码减少了 80%,不只大幅降低开发工作负担,也使得各种专业知 识等级的数据科学家和机器学习工程师,都能拥有机器学习操作(MLOps)的能力。 相比较 AWS Sagemaker 和 Azure 平台,谷歌 Vertex AI 更适用于谷歌云用户、使用 TensorFlow 或 KubeFlow 的团队、尚未选择云的团队、那些为他们的机器学习工作流程 寻求创新想法的人、面向容器的团队。

2023 年 5 月,谷歌为 Vertex AI 上新了三款大模型: Imagen:text-to-image,生成高质量图像; Chirp:speech-to-text,通用语音模型; Codey:text-to-code,帮助程序员写代码。

除此之外,在 Vertex AI 上现在还能使用文本和图像的嵌入式 API。它支持将文本和图 像数据转换为多维数值向量、映射语义关系,从而允许开发者创建出更加有意思的应用。 2023 年 12 月,Google DeepMind 宣布推文生图大模型 Imagen2,强调其通过参考图片 和文本生成新图片和局部编辑的强大效果,该模型具有改进的图像描述理解和在多个领 域的性能提升。

2.2 深度学习框架:从 TensorFlow 到 Jax,深度学习的奠基人

深度学习框架提供了一系列深度学习的接口、库或工具,利用预先构建和优化好的组件 集合定义模型。世界主流的深度学习框架有 PaddlePaddle(飞桨)、TensorFlow、Caffe、 Theano、MXNet、Torch 和 PyTorch 等等。谷歌的 TensorFlow、Facebook 的 PyTorch 等 是当前最流行的深度学习框架。 TensorFlow 系统最初由 Google Brain 团队开发,并于 2015 年在 Apache 2.0 开源许可证 下发布,用于研究机器学习和深度神经网络(DNN),其通用性同样适用于其他各种领 域,旨在开发和部署先进的机器学习应用程序,其工作流程包括数据预处理、构建模型 和训练模型。谷歌利用 TensorFlow 支持其谷歌翻译、谷歌地图、谷歌相册、Gmail 等多 项业务。

虽然 TensorFlow 已经取得了巨大的成功,谷歌仍在开发更优秀的深度学习框架。目前 正在开发的 Jax 可以支持 GPU 和云 TPU 加速器、自动微分的 Numpy。其出发点在于将 Numpy 的灵活、调试方便、API 稳定等独特的优势与硬件加速结合,进而支持机器学习 研究。PaLM2 大模型即为基于 Jax 构建的。

2.3 算法模型:Gemini 是光辉的未来

2.3.1 预训练大模型的基础:变形金刚 transformer

Transformer 模型由谷歌在 2017 年首次提出,最早用于机器翻译任务且达到了 SOTA 效 果。它具有以下明显的优点: 并行计算:由于自注意力机制的引入,Transformer 可以实现并行计算,加快训练 速度。 长序列处理:相比传统的循环神经网络和卷积神经网络,Transformer 可以处理更 长的序列,这是由于自注意力机制可以学习到全局的序列信息。 模块化结构:Transformer 由编码器和解码器两部分组成,每部分都包含了多层相 同的模块,这种模块化结构使得 Transformer 更易于扩展和调整。

在 Transformer 出现之前,主流的序列转入模型是 RNN 和 CNN。RNN 模型的优点是 能够考虑文本的顺序性,但其结构特点要求每个时刻按顺序执行,不能实现并行计算, 限制了运行效率。另一方面也是由于历史信息是一步步往后传递,对于长序列文本,越 靠前的信息在后面越容易丢失。用 CNN 来替代 RNN 可以减少文本时序的计算。然而 CNN的每个卷积核只能看到其中一段文本的内容,对于长文本任务,需要堆叠很多层才 能看到文本全局的内容,这样一来模型需要做得更大。 Transformer 的出现,1)改进了 RNN 最被人诟病的训练慢的缺点,利用自注意力机制 实现快速并行;2)可以增加深度,充分发掘 DNN 模型的特性,提升模型准确率。

自 2017 年推出之后,各种基于 Transformer 结构的模型层出不穷,Transformer 已经形 成了自己的家族体系。 1) 自编码模型,例如 BERT、RoBERTa、ALBERT 等,均采用类似 BERT 的结构。 其预训练任务通常是“破坏一个句子,然后让模型去预测或填补”。因此其擅长 进行文本表示,适用于做文本的分类、实体识别、关键信息抽取等任务。 2) 自回归模型,例如 GPT,GPT-2,GPT3.5 等,均采用类似 GPT 的结构,预训练 任务通常是 Next word prediction,在训练时无法看到全文,只能看到前面的信 心,因此这类模型适合做文本生成。 3) encoder-decoder 模型,例如 BART/B5 等。由于包含了 encoder 和 decoder,所 以预训练的目标通常是融合了各自的目标,但通常还会设计一些更加复杂的目 标,比如对于 T5 模型,会把一句话中一片区域的词都 mask 掉,然后让模型去 预测。此类模型适合做翻译、对话等需要根据给定输入来生成输出的任务。

2.3.2 NLP(自然语言处理):基于 Jax 和 TPU v4,从 PaLM 升级为 PaLM2

在 Transformer 的基础上,Google 先是在 2018 年基于 Encoder 架构推出了 Bert,创造 了广泛下游任务中的最优性能,而后在 2019 年推出了基于 Encoder-Decoder 架构、性 能更强、下游应用更广泛的 T5。但随着 Decoder-only 的 GPT-3 展现出强大的性能, Google 也逐步探索并推出了一系列的 Decoder-only 模型,如 FLAN、LaMDA、PaLM 等。

5 月,在 2023 年 I/O 开发者大会上,谷歌升级了大模型 PaLM,推出 PaLM2 模型。 该模型是基于最新的 JAX 和 TPU v4 计算设施构建的。其在 100 多种语言的多语言文本 上进行了训练。根据基准测试,对于具有思维链 prompt 或自洽性的 MATH、GSM8K 和 MGSM 基准评估,PaLM 2 的部分结果超越了 GPT-4。

在翻译、推理和写代码等表现上,与第一代 PaLM 相比,有明显改进。 PaLM2 在“多语种”方面改变最大,因为它在 100 种语言的多语言文本上接受了 “更加严格的训练”。  其次是推理能力,PaLM2 数据更加广泛地覆盖了科学论文、带有数学表达式的网页, 以提高逻辑、常识推理和数学能力。 最后是写代码能力,Google 使用了大量源代码数据训练新模型,包括 Python、 JavaScript、Prolog、Fortran 和 Verilog 等在内的代码都是 PaLM2 训练的一部分。

PaLM2 不再像前任那样只是一个单一的模型,而是可以根据用户需求和使用场景做定 制化调整。它拥有四种不同尺寸,Google 以动物主题从小到大命名为 Gecko(壁虎, 3.3B)、Otter(水獭,6.08B)、Bison(野牛,8.95B)和 Unicorn(独角兽,14.7B), 其中最小的 Gecko 甚至可以在手机上离线运行,每秒能处理 20 个 token(16 个左右单 词)。

此外,PaLM2 还可以在不同场景中微调成适用于不同垂类的模型。在谷歌 I/O 大会上, 谷歌展示了其在医学和信息安全两个垂直场景的特殊微调,两个模型分别名为 MedPaLM2 和 Sec-PaLM2,例如 Med-PaLM2 就具有理解 X 光片的特殊能力。2023 年 6 月 7日,谷歌云业务部门表示,正在与 Mayo Clinic 合作测试一项新的服务,以定制专用的 医疗领域的聊天机器人。通过这项最新推出的基于生成式人工智能的企业搜索服务,未 来在医疗健康领域,生成式 AI 技术的发展将许医生通过简单的查询更快地获得患者的 病史、影像记录、基因组学或实验室等数据,即使这些信息以不同的格式或者位置存储。

2.3.3 CV(计算机视觉):ViT 将 Transformer 应用从 NLP 拓展到 CV

Transformer 模型的应用不仅在 NLP 领域,也拓展至另一热门领域——CV。2019 年, Google 提出了一种 Vision Transformer(ViT)的架构,可以直接处理图像,而不需要使 用卷积层(CNN)。其基本思想是把输入的图像分成一系列的小块,每个小块可以理解 成过去处理文章时候的一个文字,然后把这些小块转换成向量,就像在普通的 Transformer 中处理文字一样,试图捕捉图像中不同部分之间的关系。

ViT 的发展,不仅仅是将 Transformer 从 NLP 拓展为 CV 领域,实际上也是大模型向“多 模态”迈进的关键一步。

2.3.4 多模态:发展不止步,Gemini 是未来

2022 年 9 月,在 ViT 模型的基础上,谷歌推出了多模态模型 PaLI。在《A JointlyScaled Multilingual Language-Image Model 》 论 文 中 , 谷歌的研究者 提 出 PaLI (Pathways Language and Image)模型,能够在各种视觉和语言问题上利用跨任务的 迁移学习,并提高语言和图像理解能力:包括图像字幕、视觉问答、场景文本理解等。 此后,公司还陆续推出了文本-图像生成模型 Muse、音乐生成模型 MusicLM 等。

2023 年 3 月,谷歌发布了当时最大多模态具身视觉语言模型、“最强大脑”—— PaLM-E。其参数量达到 5620 亿,可理解图像、理解并生成语言,调用 API 操作机械 臂。该模型的参数规模达到了 5620 亿个,里面集成了用于控制机器人的视觉与语言。 2023 年 12 月,谷歌宣布推出 Gemini 1.0,包含三种不同版本。2023 年 12 月 6 日, 谷歌宣布 Gemini 的初始版本已在 Bard(12 月 6 日)中提供,开发人员版本将于 2023 年 12 月 13 日通过 GoogleCloud 的 API 提供。谷歌针对不同场景发布了三种不同版本—— Gemini Ultra、Gemini Pro 和 Gemini Nano: Gemini Ultra - 用于处理高度复杂任务的最强、最大的模型。 Gemini Pro - 用于扩展各种任务的最佳模型。 Gemini Nano - 用于手机等设备的最高效模型。 至此,谷歌的大模型体系已包含:大语言模型 PaLM 2(5400 亿参数)、计算机视觉 ViT (220 亿参数)、多模态模型 PaLM-E(5620 亿参数)、以及多模态大模型 Gemini,等。 大模型版图继续补齐。

Gemini 具备多模态能力,性能更强,应用端实现硬件、软件同步布局。 多模态能力:归纳并流畅地理解、操作以及组合不同类型的信息,包括文本、代 码、音频、图像和视频。性能更强:Gemini Ultra 的性能在 32 个广泛使用的学术基准测试中有 30 个都表现 出了超越当前时代的“先进结果”。其中,以 90.0%的得分成为第一个在 MMLU (大规模多任务语言理解)上超越人类专家的模型(该测试结合了数学、物理、 历史、法律、医学和伦理等 57 个学科)。Gemini Ultra 还在新的 MMMU 基准测试上 表现出了 59.4%的领先级性能,该测试涵盖了“需要深思熟虑的”不同领域的多 模态任务。 应用方面:Gemini 实现硬件、软件同步布局。软件方面,Gemini 将赋能聊天机器 人 Bard、搜索、广告、Chrome和 Duet AI等。硬件方面,谷歌将 Gemini引入Pixel 手机。

2024年 2月 8日,谷歌Google正式宣布一系列在AI领域的最新进展,开启商业化: 1)谷歌把对标 ChatGPT 的 AI 聊天机器人平台 Google Bard 更名为 Gemini。 2)Gemini 发布安卓版本的独立 App,并将在 Google iOS 和安卓版本中内嵌 Gemini 对 话功能。 3)谷歌正式发布史上性能和功能最强大的 Gemini Ultra 1.0 模型,并推出基于此模型的 付费 Gemini Advanced 产品,按 Google One AI Premium 订阅计划付费、每月 19.99 美 元。 4)谷歌大模型能力将接入 Google Workspace(包括 Gmail、Docs、Meet 等应用)和 Google Cloud 中。此前两款产品内置的 Duet AI产品都纳入 Gemini 品牌,并重新命名, 如 Gemini for Workspace 等。

2024 年 2 月 15 日,谷歌 DeepMind 推出 Gemini 1.5 Pro。Gemini 1.5 Pro 在处理 大量视频、文本和图像的能力上得到增强,可支持运行 100 万个 tokens,包括 1 小时视 频、11 小时音频、超过 3 万行代码或超过 70 万字,实现了飞跃。 综上,我们认为谷歌在 AI 技术发展上面的优势是全面而扎实的。芯片领域,公司的 TPU v4 兼具性能强、功耗低的双重优势;深度学习框架 TensorFlow 和 Jax 为大模型的 发展奠基;在模型方面,基于 Transformer 发展出优秀的 PaLM2 语言大模型,多模态大 模型 Gemini 更是出类拔萃。

三、业务生态:AI 大时代下,软硬件全面探索

应用展望:我们预计 Gemini 将在 1)C 端应用、2)B 端云业务、以及 3)AI 硬件方 面赋能、并进行变现。

1、C 端应用: 1)聊天机器人 Bard(现已更名为 Gemini):我们预计 Gemini 加持下,用户可以实现多 模态的交互,通过订阅模式变现。目前 Gemini 已经开启商业化,安卓 APP 免费、但功 能有限。基于 Gemini Ultra 的高阶版本 Gemini Advanced 另外付费,按 Google One AI Premium 订阅计划付费、每月 19.99 美元。 2)搜索:我们预计 SGE 将带来更快、更精准的搜索生成体验,降低搜索延迟、提升内 容质量,并且可以进行多模态的搜索交互。Chrome 方面,预计 Gemini 将以插件的形式 存在嵌入 Chrome 浏览器中,或提供网页文字、图片、视频等多模态内容的总结等。但 谷歌搜索当前面临微软 bing 等 AI 竞争加剧,份额有所下滑。3)广告:  创新广告形态:我们预计对话式广告将传统搜索广告形式及类别引入聊天,让用 户在问答中获取对应商品信息。 广告系统有望在大模型的加持下,实现更加精准投放和竞价优化。 为广告主提供对话式广告素材生成。 4)办公领域:对标 Copilot,谷歌将大模型能力 Gemini for Workspace 整合进 Workspace 办公套件。Duet AI 是谷歌在 Workspace 中推出的办公助手,对标微软 Copilot 的 AI 助手。升级 Gemini 能力后,我们预计将在 Google Slide、Google Sheet、 Google Meet、Docs 等中发挥比此前更加智能的作用,提升工作效率和用户体验。

2、B 端云业务: 我们预计Gemini有望推动谷歌云业务的增长,包括 IaaS业务(AI算力)、MaaS业务(大 模型 API 调用、二次开发等)、SaaS 办公套件等的增长。我们预计未来谷歌云份额或将 提升,但仍面临微软云的强势竞争。

3、硬件: 在硬件&安卓方面,谷歌继续探索机器人应用的同时,在手机、平板、安卓等消费电子 领域引入 AI 功能,加强产品竞争力。 1)Pixel 手机:谷歌将 Gemini 引入 Pixel。Pixel 8 Pro 是首款搭载 Gemini Nano 的智能手 机,可以支持录音应用中的“总结”等新功能,并在 Gboard 中推出“智能回复”功能, 从 WhatsApp 开始,后续还将推出更多信息应用。 2)机器人:我们认为多模态大模型可在机器人领域得到较好应用。此前,PaLM-E 驱动 的机器人可以执行长跨度任务、执行规划任务、在给定图像的情况下讲述笑话等。我们 认为,Gemini 亦有望被应用在完善机器人任务层的实践当中。

3.1 对话:Gemini 加持,能力全面提升

Bard 背后的模型不断升级,从 LaMDA 到 PaLM2 到 Gemini。2023 年 2 月,谷歌推 出生成式人工智能 Bard,Bard 的技术采用了自然语言处理技术和机器学习算法,可以 进行文章创作、语音对话、翻译等多项功能。最初的 Bard 是基于 LaMDA 的轻量级版本, 使用更少的计算能力,使其能够扩展到更多的人,并提供额外的反馈。谷歌首席执行官 Sundar Pichai 在 2023 年 3 月 31 日接受 Hard Fork 播客节目采访时表示,Bard 将从基 于轻量级 LaMDA 模型升级为更大规模的 PaLM 模型。2023 年 5 月,谷歌 I/O 大会上, 皮查伊表示,PaLM2 将为谷歌最新的 Bard 提供支持。2023 年 12 月,谷歌宣布推出 Gemini 1.0,将赋能聊天机器人 Bard。2024 年 2 月 8 日,谷歌宣布把对标 ChatGPT 的 AI 聊天机器人平台 Google Bard 更名为 Gemini,并发布免费安卓版本的独立 App、及基 于高阶 Gemini Ultra 付费 Gemini Advanced 产品。

Gemini 加持下,对话机器人的能力全面提升: 1) 复杂的推理,Gemini 1.0 具有复杂的多模态推理能力,可帮助理解复杂的书面 和视觉信息。这使得它具有独特的技能,可以在海量的数据中发掘难以辨别的 知识内容。 2) 理解文本、图像、音频及更多。Gemini 1.0 经过训练,可以同时识别并理解文 本、图像、音频等,因此它能更好地理解具有细微差别的信息,回答与复杂主 题相关的问题。这就让它尤其擅长解释数学和物理等复杂科目中的推理。 3) 高级编码能力,Bard支持超过 20 款的编程语言,无论是编写,解释还是纠错, 目前的 Bard 都可轻松回答。在给出代码后,用户不必复制到本地电脑上运行, 可以直接发送到谷歌的 Colab 上,直接在网页上看到代码的运行效果。

Bard 与谷歌生态的其他应用有极强的协作性,包括不限于谷歌搜索、邮箱、文档等。 举个例子,我们提问:“在宾夕法尼亚有没有一些有很好的动画课程的大学”,便可以在 bard 中快速获得答案,并且将有用的东西转移到 Docs 或 Sheets,以便于他人合作共享。

2024年 2月 8日,谷歌Google正式宣布一系列在AI领域的最新进展,开启商业化: 1)谷歌把对标 ChatGPT 的 AI 聊天机器人平台 Google Bard 更名为 Gemini。 2)Gemini 发布安卓版本的独立 App,并将在 Google iOS 和安卓版本中内嵌 Gemini 对 话功能。 3)谷歌正式发布史上性能和功能最强大的 Gemini Ultra 1.0 模型,并推出基于此模型的 付费 Gemini Advanced 产品,按 Google One AI Premium 订阅计划付费、每月 19.99 美 元。 4)谷歌大模型能力将接入 Google Workspace(包括 Gmail、Docs、Meet 等应用)和 Google Cloud 中。此前两款产品内置的 Duet AI产品都纳入 Gemini 品牌,并重新命名, 如 Gemini for Workspace 等。

3.2 搜索:市占率第一,但份额略有下滑

谷歌搜索和其他业务主要包括谷歌搜索产生的收入(如使用 Google.com 作为浏览器、 工具栏等默认搜索的搜索分销合作伙伴产生的流量收入),以及谷歌其他产品如 Gmail、 谷歌地图、谷歌 Play产生的流量收入。2023 年谷歌搜索及其他收入 1750亿美元,同比 增长 8%,保持稳步增长。据 eMarketer,2022 年谷歌搜索广告市场份额约为 59%,远 高于其他参与者。

谷歌在搜索领域的优势包括但不限于:  算法方面:2015年,RankBrain更新引入了新的机器学习人工智能,以帮助确定与 某一查询最相关的搜索结果。2019 年,基于 Transformer 架构的 BERT 算法帮助搜 索引擎理解句子中的词语对人类的意义。通过高效的算法,谷歌让用户的搜索需 求能迅速得到解决,也能利用算法避免搜索结果中充斥垃圾内容。  生态方面:例如,在学术领域,谷歌拥有谷歌学术搜索引擎,拥有大量的学术资 源。在购物领域,谷歌拥有一个庞大的产品信息数据库,叫做谷歌购物图 (Google Shopping Graph)。它包括来自世界各地数百万商家的产品信息,包括产 品名称、品牌、价格、可用性、评论等。这使得用户使用 Bard 购物更加方便。

在 2023 年谷歌 I/O 大会上,谷歌宣布将生成式 AI 引入搜索引擎,新的搜索服务称为 “搜索生成体验”(SGE)。SGE 可在搜索结果的顶部显示 AI 生成的响应,回答用户的 查询、总结关键信息并链接到网站资源。其特点在于: 1) AI-powered 概述:SGE 将展示人工智能快照,可以利用人工智能系统为用户 总结搜索结果,包括需要考虑的因素和有用的信息,SGE 将显示支持快照中信 息的资源链接。 2) 更简单的跟进:人们可以点击“询问跟进”,询问后续情况、完善搜索,不必重 述上下文。 3) 垂直体验:搜索中的生成式人工智能也将有助于与垂直领域相关的信息检索, 如购物或本地搜索。例如在购物中,生成式人工智能可以帮助发现关键的考虑 因素和产品信息。SGE 还提供产品描述,包括相关评论、评级、价格和产品图 像。 4) 搜索广告:有了 SGE,搜索广告将继续出现在整个页面的专用广告位,但会使 广告与自然搜索结果区别开来。 5) 图像生成:SGE 中引入了在生成式 AI 的帮助下创建图像的能力。1)AI 技术的 进步将强化谷歌搜索引擎回应搜索查询的能力。

市场格局方面,谷歌搜索市占率全球第一,但面临微软等竞争、份额呈下滑趋势。在 搜索竞争格局方面,由于 AI 能力的率先加入,微软搜索的竞争力在提升。Statcounter 数据显示,谷歌搜索的市场份额稳居全球第一,但 2023 年 2 月以来整体呈下滑趋势, 市场份额由 2023 年 2 月的 93.37%下滑至 2024 年 1 月的 91.47%,而微软 Bing 市占率 持续提升、由 2.81%提升至 3.43%。我们预计未来影响或将持续存在。

3.3 谷歌云:份额提升,但微软云更强势

谷歌云服务主要包括:1)谷歌云平台(Google Cloud Platform):基础设施、平台和其 他服务产生费用和订阅。这些服务提供网络安全、数据库、分析和人工智能产品等解决 方案,包括人工智能基础设施、Vertex AI 平台和谷歌云的 Duet AI。2)Google Workspace:包括为企业订阅基于云的通信和协作工具,如 Calendar、Gmail、Docs、 Drive 和 Meet 等,并在 Workspace 集成了 Duet AI 等功能。3)其他企业服务。谷歌云 近年来保持较快增速,收入由 2018 年的 58亿美元提升至 2023年的 331 亿美元,2018- 2023 年 CAGR 为 41%。

需求端,人工智能模型的迭代、下游应用的探索,大幅带动了上游的算力需求。以GPT 系列预训练过程为例:13 亿参数的 GPT-3 XL 模型,训练一次需要算力约为 27.5PFlop/s-day(假如每秒计算一千万亿次,需 1800-2000 天),1750 亿参数的 GPT-3 模型,训练所需算力约为 3640 PFlop/s-day,约合 3.14E23 FLOPs。GPT-4 模型,据澎 湃新闻报道需要大约 2.15E25 FLOPS,是 GPT-3 版本的 68 倍。信通院报告指出,2021 年全球算力规模约 615EFLOPS。2030 年,全球算力规模有望达 56ZFLOPS,2022-2030 年复合增长率达 65%。我们预计,算力紧缺拉动 GPU IaaS 业务蓬勃开展;此外伴随着 大模型的层出不穷,云厂商们提供的 MaaS 服务也在积极开展。

供给端,谷歌云份额提升,但微软云表现更强势。根据 Synergy 的统计,近年来微软、 谷歌云的市场份额均在不断提升。2023Q1 微软云 IaaS+PaaS 及托管私有云的全球市场 份额为 23%、谷歌为 10%,仅次于亚马逊云的 32%、微软的 23%。SaaS 方面,微软 云市占率位列第一、而谷歌 SaaS 产品市占率位列第五。

从竞争上看,我们认为目前微软云具备更强的竞争优势:微软云具备完整且打通的 IaaS、PaaS 和 SaaS 云生态、协同发展,且率先通过 OpenAI 引领 AI 浪潮,目前微软 Azure 及其他云服务收入保持行业领先的增速。从各家公司云计算增速看,亚马逊云增 速显著放缓,微软云增速已经超越谷歌云位列第一。

据谷歌 2024 年 2 月 8 日的更新,对于云客户,Duet AI 也将在未来几周内升级成为 Gemini 版本,有望帮助公司提高生产力、开发人员更快地编码、组织保护自己免受网 络攻击等。我们预计后续 Gemini 有望推动谷歌云业务的增长,包括 IaaS 业务(AI 算力)、 MaaS 业务(大模型 API 调用、二次开发等)、SaaS 办公套件等的增长。我们预计未来 AI 将重塑云计算格局,微软云有望持续获得市场份额,谷歌在 Gemini 模型加持下、市 场份额或有望提升,但依旧面临微软云更强势的竞争压力。

3.4 办公:对标 Copilot,Duet AI 整合进 Workspace 办公套件

除了其优势领域搜索引擎外,谷歌也进一步探索其过往不擅长的领域,例如办公。 2023 年 3 月,谷歌宣布 AI 工具整合进 Workspace“全家桶”,包括谷歌文档、Gmail、 Sheets、Slides 等。5 月 5 日,谷歌 I/O 大会上,谷歌将 Duet AI 整合进 Workspace“全 家桶”中,包括 Gmail(邮件)、谷歌 Docs(文档)、Sheets(表格)、Slides(幻灯片) 以及 GmailMeet(会议)等应用程序。同时还推出了一项名为 Sidekick 的侧边栏新功能, 能够跨不同的谷歌应用程序进行阅读、总结和回答文档。

Duet AI for Workspace 的核心能力全面对标 Copilot。AI 可以为 Workspace 中的所有应 用程序中充当教练、思想伙伴、灵感来源以及生产力工具。Duet AI+sheet 可以进行数 据分析,Duet AI+Docs 可以生成草稿,Duet AI+Slides 根据长文总结要点生成演示文 稿,Duet AI+Gmail 能够提供智能化自动回复,Duet AI+Meet 能够自动生成会议纪要。

除了办公套件,借助 Duet Al,谷歌云推出了一系列开发者工具,还有适用于 Google 云 服务的代码辅助、聊天帮助等服务。 代码协助:为云用户提供 AI 驱动的代码协助。在输入时实时给出代码建议,生成 完整的功能和代码块,并识别代码中的漏洞和错误,同时建议修复。将通过整个谷 歌云的多种产品和服务提供,例如在云工作站、完全管理的安全开发环境以及谷歌 云控制台的其他代码编辑体验中。开发人员还可以在云壳编辑器或通过公司为 VSCode 和 JetBrains IDEs 提供的云代码 IDE 扩展找到代码协助。支持多种语言, 包括 Go、Java、Javascript、Python 和 SQL。  聊天协助:允许人们使用简单的自然语言获得关于特定开发或云计算相关问题的答 案。用户可以通过聊天协助获得各种主题的实时指导,例如,如何使用某些云服务 或功能,或为他们的云项目获得详细实施计划。可以提供架构或编码的最佳实践, 帮助减少去寻找相关文件的需要。将在多个谷歌云表面区域提供,例如 IDE、云控 制台,以及通过产品和服务。 Duet AI 是谷歌在 Workspace 中推出的办公助手,对标微软 Copilot 的 AI 助手。升级 Gemini 能力后,我们预计将在 Google Slide、Google Sheet、Google Meet、Docs 等中 发挥比此前更加智能的作用,提升工作效率和用户体验。

3.5 硬件&安卓:继续探索机器人,消费电子引入 AI 功能

在硬件领域,除了谷歌多年来一直在探索的机器人研发与应用,谷歌也尝试在传统硬件 产品上引入 AI 功能,比如 Pixel 8 手机、Pixel 平板电脑等。此外,安卓 14 也引入了生 成壁纸等 AI 功能。

(1)具身模型驱动机器人

一直以来,谷歌对智能机器人领域投入很大,且抱有很高的期望。其曾经先后收购波 士顿动力公司、Schaft 公司、IndustrialPerception公司、Redwood Robotics 公司等十多 家机器人企业。波士顿在被软银收购之前的谷歌时期,开发了许多知名的机器人产品, 例如人形机器人 Atlas、小型机器人 SpotMini 等。 尽管出售了波士顿公司,谷歌不在执着于两足步行机器人,但仍然致力于机器人技术。 2020 年 3 月,谷歌、佐治亚理工学院和加州大学伯克利分校合作发布 Rainbow Dash, 一个通过 AI 技术自学走路的四足机器人 Rainbow Dash。它只需花费约数个小时,就能 自己学会向前、向后以及左右转弯等运动。2022 年和 2023 年,谷歌还推出了 Gato 具 身模型、PaLM-E、RT-X 系列具身模型。PaLM-E 驱动的机器人可以执行长跨度任务、执 行规划任务、在给定图像的情况下讲述笑话等。RT-X由控制模型RT-1-X和视觉模型RT2-X 组成,在特定任务(搬运东西、开窗等)的工作效率是同类型机器人的 3 倍,同时 可执行未训练动作。

(2)Pixel 8:首次搭载谷歌 AI 模型

2023 年 10 月 4 日,谷歌发布了搭载谷歌 AI 基础模型的 Google Pixel 8 系列手机。Pixel 8 Pro 是第一款可以直接在设备上运行谷歌 AI 模型的手机,其计算量是 Pixel 7 上最大的 ML 模型的 150 倍。此外,2023 年 12 月谷歌宣布已将 Gemini Nano 集成到其最新的 Pixel 手机中。 

芯片端:Pixel 8 系列的 Tensor G3 芯片基于三星 4nm 工艺打造,搭载了 1×CortexX3、4×Cortex-A715、4×Cortex-A510 的 CPU 核心。Tensor G3 芯片更注重 AI 方 面能力,可运行更复杂的机器学习模型。

AI 功能:可提供更好的拍照和视频功能,翻译 49 种语言的面对面对话,实时转录 消息以及翻译符号,Google Assistant 可以检测并过滤垃圾电话,Pixel 可检测用户 是否遭遇严重车祸并呼叫紧急服务,Fitbit 将使用生成式 AI“为用户带来个性化指 导、动态锻炼建议。引入 Bard 后,Google Assistant 将个性化功能与大模型的推理和生成能力相结合,可以实现听、说、影响处理能力的全面升级,以发布会展示 端侧大模型的功能为例: 1)告诉 Bard“查看本周所有未读邮件”,Bard会整理出收件箱中未读邮件、并总 结概要,其中有一封关于派对邀请的邮件; 2)追问 Bard“派对的地址在哪”,Bard 通过访问手机谷歌地图,提供具体位置; 3)追问 Bard“到派对需要多长时间”,Bard 会进一步在谷歌地图上给出路线信息。

以谷歌 Best Take 功能为例,用户可以将拍到的一系列照片做组合,给一张照片中 的人物“换头”,实现表情的修改。

音频消除:以谷歌的 Audio Magic Erase(音频消除)功能为例,结合机器学习和人工 智能来识别和去除音频视频中不需要的背景噪音。

出行规划:跨应用综合规划建议

通过 AI phone 实现出行规划、定制差旅的需求。比如助理可提供目的地的天气、酒店、 游玩景点的交通建议,以及关联货币、汇率、手机流量、翻译工具等,还会根据目的地 特征进行高效信息提示、返程安排建议等。 以谷歌 Bard 规划行程为例,如果计划和朋友一起旅行,可以让手机助理做出规划。手 机助手在收到指令后,可通过查阅邮箱信息找到每个参与者的可出行日期,查找实时航 班和酒店信息,前往机场的地图路线等,最后生成出行规划。

(3)Pixel 平板电脑

Pixcel 平板电脑采用最新的 Android 功能、谷歌 Tensor G2 芯片和标志性的 Pixel 设计。 快速性能和电池寿命(全部由 Pixel 手机中的 Tensor G2 芯片驱动)使其成为玩游戏的 理想平板电脑。 AI 为视频会议添彩。超过 50 个谷歌应用程序为 Pixel Tablet 进行优化,包括 Google Meet。由于公司最新的 AI相机技术和 Tensor G2,用户视频聊天总是针对用户所在的位 置和光线进行优化。因此无论用户在做什么,都能以最佳状态出现。用户甚至可以通过 360 度背景为用户视频通话增添一点乐趣,比如海滩和未来城市,这些背景会随着用户 移动和位置变化而调整。 大屏幕适配 AI 图片编辑。平板电脑的大屏幕使其成为利用 AI工具编辑照片的最佳 Pixel 设备。使用分屏工具把谷歌照片中的图片放入 Gmail 时,用户还可以在 Pixel 平板电脑 上使用助理语音打字(语音打字速度几乎是普通打字的三倍),让写邮件变得轻而易举。 AI 助力智能家居。首创设计了一款充电扬声器底座,当平板电脑放在底座上便处于 Hub中控模式。Pixel平板电脑会变成一个数字相框、一个强大的智能家居控制器、一个 语音激活助手、一个共享的娱乐设备。在 Hub 中控模式时,点击 Google Home 图标就 能访问所有兼容的智能家居设备,包括查看视频门铃、调节恒温器、打开客厅的灯等, 也可以通过语音控制智能家居设备。

(4)安卓 14

安卓 14 可生成壁纸和信息文本。在 2023 年 I/O 大会上,谷歌在安卓系统的默认短信 (Messages)应用中引入了 Magic Compose 功能,AI 可以根据消息内容生成回复文本。 此外,谷歌通过引入文本转图片扩散模型,允许用户输入 prompts,描述想要获取的图 片信息,系统将会自动生成相应的壁纸。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至