我来对海内外大模型进行简单梳理。
1.海外大模型梳理
1.1 OpenAI 和微软
OpenAI 是目前全球估值最高的 AI 初创公司,22 年拥有 375 名员工,根据路透社报道,OpenAI 在 2022 年收入数千万美元,并预计 2023、2024 年收入为 2 亿、10 亿美元。OpenAI 成立于 2015 年 12 月,其研究方向 大致聚焦在三个领域:强化学习领域、自然语言处理领域、多模态模型领域。截止 2022 年,OpenAI 拥有大约 375 名员工,主要面向以下三个方面:Capabilities,不断的提高 AI 的功能和能力;Safety,确保这些 AI 系统拥 有和人类一致的价值观念;Policy,确保这些 AI 系统能够得到适当的治理。截止 2023 年 4 月 29 日,OpenAI 历史融资额超 200 亿美元,当前估值为 290 亿美元,是全球估值最高的 AI 初创公司。OpenAI 的主要盈利模式 包括:会员订阅费、API 许可费、与微软合作带来的商业收入。

从时间维度上看,OpenAI 的研究方向大致聚焦在三个领域:强化学习领域、自然语言处理领域、多模态 领域。在强化学习领域,OpenAI 采用通用的强化学习策略来帮助 AI 应对灵活多变的困难问题;在自然语言处 理领域,OpenAI 开辟自回归建模路径,大语言模型无需在特定领域微调也有出色的任务表现;在多模态模型领 域,OpenAI 围绕 Transformer 主架构不断增强多模态能力。OpenAI 的研究方向始终关注问题的通用性解决方 案,而不是聚焦在特定问题之上,与其通用人工智能的研究目标契合。
OpenAI 开辟自回归建模路径。用于翻译任务的 Transformer 模型是自然语言处理领域的基础模型,基于 Transformer 模型衍生出三条路径,分别为 BERT、T5、GPT 路径。BERT 采用掩码建模策略,利用双向文本信 息学习语言信息,在文本理解、情感分析方面具备一定优势;GPT 采用自回归的建模策略,通过对上文文本学 习预测下文,在零样本或者少样本的生成方面表现优异。
OpenAI 是大语言模型的技术先驱。OpenAI 基于 Transformer 模型开辟自回归建模路径,发布了 GPT 系列 模型。GPT-1 开启了自然语言预训练时代,GPT-2 证明大模型无需微调也可以完成广泛下游任务,GPT-3 证实了 无监督预训练路线的正确性,ChatGPT 引入强化学习机制增强人机对话表现,GPT-4 拥有卓越的文本处理能力, 并且初步融合多模态能力。 ChatGPT 引入强化学习机制增强人机对话表现。在 GPT-3.5 版本的基础上,通过 3 个步骤实现基于人类反 馈的强化学习微调(RLHF),得到人机对话模型 ChatGPT。RLHF 触发了大语言模型的多项能力,其中包括: 应尽翔实的回应、公正的答复、拒绝不当问题等,通过与人类答案的对齐过程,显著提升了大模型的人机对话 体验。
GPT-4 具备卓越的文本处理能力,初步融合多模态能力,能力再度升级。2023 年 3 月 15 日,OpenAI 发布 多模态预训练大模型 GPT-4,相较于过去的 GPT 系列模型,提升包括几个方面:
1) 具备多模态信息处理能力,能够接受图像和文本两种模态的输入,再通过文字给出正确的文本答复。GPT-4 不仅拥有图像阅读能力,还可以从图像中提取逻辑,进行分析思考。
2) 文本处理能力更为出色,在为机器学习设计的模型评判标准和为人类设计的专业测试中均取得良好表现。 在为机器学习模型设计的传统基准上,GPT-4 的表现大大优于了目前的最好的语言模型,以及大多数 SOTA 模型(目前最好的模型)。相较于 GPT-3.5 以及当前最好的语言模型,GPT-4 在机器学习模型学术基准数据 集上的表现实现了全面突破,在 7 项数据集中的测试均优于当前最优的语言模型。在为人类设计的各种专 业测试和学术基准数据集中,GPT-4 展现出媲美甚至优于人类的水平。GPT-3.5 模型在一些相对简单的人 类专业测试中已经展现出不错的性能,但当任务的复杂度上升后其便难以处理。而 GPT-4 模型在一些相对 困难的任务中也已经取得相当优异的性能,例如其在模拟律师考试中取得了应试者中前 10%的成绩,而 GPT-3.5 模型只有倒数 10%的成绩。GPT-4 模型在 SAT、LSAT、美国高中数学竞赛中表现均超越了人类平均水准。
3) 模型训练结束之后进行了大量的规范性调试,提升了回答的可控性和安全性。在内部评估中,GPT-4 回答 可能生成有害内容的可能性降低了 82%,产生符合事实回复的可能性高出 40%。GPT-4 主要通过三方面增 强了回答的可控性和安全性:引入人类反馈进行训练;从实际使用中不断提升,Open AI 定期更新和改进 GPT-4;GPT-4 协助进行安全方面的研究。
4) GPT-4 构建了用于模型性能预测的深度学习堆栈。深度学习堆栈能够在模型训练早期,在仅有 1/1000‒1/10000 训练计算量情况下外推实现 GPT-4 模型某些方面性能的准确预测,降低了模型训练过程中 的试错成本,缩短了整体训练周期。
OpenAI的成功源于技术路线的长期坚持。在GPT-1模型发布后4个月,Google 发布了自己的语言模型BERT, 其采用编码器作为模型主体且采用双向编码结构。从性能上看,与 GPT-1 模型参数规模相当的 BERTBASE 性能 超越 GPT-1,参数量更大的 BERTLARGE 更是形成了压倒性优势,双向结构的 BERT 模型很快得到了学术界的广 泛欢迎。GPT 可能是一条难度更高、同时天花板更高的技术路径。直到 1750 亿参数量的 GPT-3 模型诞生,在 各类下游任务中无需微调便可取得良好成绩,越来越多的企业和研究机构才开始转向 GPT 技术路线,BERT 路 线的影响力开始逐渐转弱。OpenAI 在自然语言模型方面的领先得益于公司对于其技术路径的长期坚持,即使早 期并未得到学术界的广泛认可。
1.2 谷歌
在上一轮深度学习的 AI 革命中,AI 逐步达到了与人类媲美,甚至超越人类(部分场景)的水平,逐步走 入大众视野,而 Google 和 Deepmind 是其中的的引领者。由 Google 和 Deepmind 提出的 Word2Vec、AlphaGo 等模型以及 sequence to sequence、深度强化学习等技术是上一轮 AI 革命乃至这一轮 AI 浪潮的开创性、奠基性 工作,推动着 AI 技术的成熟与发展。在这一轮预训练大模型的 AI 浪潮中,AI 展现出在更多具体场景中强大的 应用性能,逐步从学术研究走向商业化落地,Google 和 Deepmind 也面临着了更多竞争者的挑战。Google 提出 的 Transformer 模型是这一轮预训练大模型的技术基础,其强大能力推动了各个 AI 细分领域的快速发展。在后 续基于Transformer研究与应用中,OpenAI率先布局的Decoder-only成为更主流的路线,同时包括Meta和Amazon 也先后推出自己的大模型,Google 面临着更多强劲竞争者的挑战。
在 NLP 方面,Google 提出 Transformer,引领 AI 领域变革。Google 于 2017 年推出 Transformer,其基于 Encoder-Decoder 的核心架构,最早在翻译任务上取得了良好性能。但其对 AI 领域的影响远远超过了翻译乃至 NLP 的细分领域中,其将残差网络和注意力机制结合的模型结构应用成为了近年来人工智能领域应用最为广泛 的基础模型结构,引领了包括 NLP、CV 等多个细分领域的变革。 从 Encoder-Decoder 到 Decoder Only,Google 在日益激烈的竞争中逐步调整发展方向。在 Transformer 的 基础上,Google 先是在 2018 年基于 Encoder 架构推出了 Bert,打造了广泛下游任务中的最优性能,而后在 2019 年推出了性能更强、下游应用更广泛的 T5。但随着 Decoder-only 的 GPT-3 展现出强大的性能,Google 也逐步探 索并推出了一系列的 Decoder-only 的模型,如 FLAN、LaMDA、PaLM 等。
在 CV 领域,Google 通过 ViT 将 Transformer 引入 CV 领域。尽管 Transformer 网络结构在 NLP 领域展现 出了强大的性能和能力,但在 ViT 之前,其在 CV 领域中的效果仍远不如 CNN 网络结构。Google 在 2021 年推 出了 ViT,其通过将图片划分为不同的部分的方式构建出了类似于文本的序列输入和词向量,进而可以通过 Transformer 结构对图像特征进行提取和分析。最终在大规模的训练数据集中展现出相较于 CNN 结构的模型更 加强大的性能。其提出标志着 Transformer 模型在 CV 领域的应用落地。 近年来,Google 进一步探索在 CV 领域中预训练大模型的能力边界。2021 年的研究中,其中最大版本的 ViT 模型(ViT-Huge)参数量为 6.32 亿。2023 年 4 月,谷歌在模型架构方面进行了升级,推出了 ViT 的 220 亿 参数量的版本(ViT(22B))。和 GPT-2 到 GPT-3 的变化趋势相似,其具备了强大的 Zero-shot 图像分类泛化能 力(如下图所示,在两个下游任务中都比小参数模型更强大)。同时引入了人类反馈来使模型的能力与人类的目 标相对齐,并且成功将模型公平性和稳健型控制在了一个合理的范围。

在技术发展方面,Google 在 AI 方面的布局完善程度是各家科技巨头中最高的。核心环节如人工智能芯片 的自研,一方面可以与算法模型的研发相互配合实现协同发展,另一方面将有效避免 AI 竞争加剧后的算力供应 风险。同时,随着 Google Brain 和 DeepMind 的合并,两大世界级 AI 团队将共同探索 AI 技术的上限。在商业 化应用方面,Google 具有庞大、稳定且成熟的应用生态,包括有 Google 搜索、Chrome 浏览器、安卓、YouTube 等互联网时代重要的流量入口,将赋能 AI 发展与应用落地。一方面,这将给谷歌的 AI 发展提供海量的数据, 加速相关 AI 技术的成熟和商业化落地,另一方面,谷歌成熟的 AI 技术也可以为谷歌生态中的不同环节深度赋 能,增强谷歌整体业务的竞争力,例如将 AIGC 技术引入到谷歌的广告业务中帮助营销人员制造广告材料,以 及 Workspace、Google Docs 和 Gmail 等应用中。 展望谷歌在这一轮 AI 浪潮中的发展,我们认为谷歌依旧是下一轮人工智能变革中不可忽视的科技巨头, 相关进展值得密切关注。
1.3 Meta
Meta 是生成式 AI 大模型中强有力的竞争者,旗下模型包括 OPT、LLaMA、SAM 等。 OPT (Open Pre-trained Transformer Language Models) 模型是由 Meta AI 提出的一系列开源的大型因果 语言模型,旨在向公众开源高性能大型语言模型 (LLM)。OPT 提供了一整套 LLM,大小从 1.25 亿到 1750 亿个 参数不等,以及用于训练这些模型的代码。值得注意的是,最大的 OPT 模型——OPT-175B 在性能方面,不管 是 zero-shot 还是 multi-shot 中都取得了与 GPT-3 可比的成绩。
PT 模型在多个场景下都有较为不错的表现。在仇恨语言检测、刻板印象偏见识别、对话安全评估等多个 领域,OPT-175B 都具有类似或超过 GPT-3 的表现。 LLaMA:2 月 25 日,Meta 官网公布了一个新的大型语言模型 LLaMA(Large Language Model Meta AI), 从参数规模来看,Meta 提供有 70 亿、130 亿、330 亿和 650 亿四种参数规模的 LLaMA 模型,并用 20 种语言进 行训练。与现有的最佳 LLM 相比,这一模型的性能具有竞争力。Meta 推出的 LLaMA 参数规模有 70 亿(7B)、 130 亿(13B)、330 亿(33B)和 650 亿(65B)四种。LLaMA-13B 在大多数基准测试中,参数仅为十分之一, 但性能优于 OpenAI 的 GPT-3(175B),而且能跑在单个 GPU 上。LLaMA-65B 与 DeepMind 700 亿参数的 Chinchilla-70B 和谷歌 5400 亿参数的 PaLM-540B 不相上下。
SAM:2023 年 4 月 5 日,Meta 发布 SAM 模型(Segment Anything Model),是 CV 图像分割领域的基础模 型。SAM 由一个图像编码器、一个提示编码器和一个掩码解码器组成,具有以下特点:1)使用提示工程进行 任务学习,交互式点击、选择框甚至文本操作进行物体分割;2)具有模糊感知功能,面对分割对象存在歧义时, 可以输出多个有效掩码;3)与 ChatGPT 类似,SAM 巧妙的将人工标注与大数据结合(数据引擎),最终实现 了“分割一切”的功能。SAM 在边缘检测、object proposal generation、实体分割、text to mask 等下游场景表 现依旧出众,虽然某些领域下不如最优模型的表现,但其良好的 zero-shot 泛化能力依旧证明该模型性能的强悍。
DINOv2:DINOv2 是 Meta 在 2023 年 4 月 17 日发布的第一种使用自监督学习来训练计算机视觉模型方法。 使用 DINOv2 方法的模型,可在任何图像集上进行训练,在提供强大的性能的同时,不需要对模型进行微调, 适合用作许多不同计算机视觉任务的骨干。由于自监督特征学习和轻量化特定任务执行模块的加入,DINOv2 在深度估计方面的表现明显优于其他算法。测试结果显示,DINOv2 对分类、分割和图像检索等任务的非常强 大的预测能力。同时,该模型在图像网络分类、视频分类、目标识别、密集识别任务等场景下,较其他模型表 现更加优秀。
2.国内大模型梳理
2.1 百度
百度自然语言技术积淀深厚,形成知识图谱的核心技术竞争力。从 2010 年的百度搜索开始,百度成立了自 然语言部门,初步研究互联网机器翻译技术,2013 年推出百度语音助手,2014 年推出智能搜索小度机器人,2017 年推出智能客服。长期的布局和发展中百度构建了完整的语言与知识技术布局,包括知识图谱、语言理解与生 成技术,以及上述技术所支持的包含智能搜索、机器翻译、对话系统、智能写作、深度问答等在内的的应用系 统。
2023 年 3 月 16 日,百度发布了生成式人工智能大模型“文心一言”。作为文心大模型家族的新成员,文心 一言在文心知识增强大模型 ERNIE 及对话大模型 PLATO 的基础上研发。文心一言包含六大核心技术模块,包 括:1)有监督精调;2)基于人类反馈的强化学习;3)提示;4)知识增强;5)检索增强;6)对话增强,前 三类技术在目前流行的对话大模型如 ChatGPT 中都有所应用,而后三类技术则是百度基于自身技术积累的再创 新,它们共同构成了模型的技术基础。
文心一言模型具备文学创作、商业文案创作、数理逻辑推算、多模态生成等多方面的能力。在文学创作方 面,文心一言可以总结出小说《三体》的内容,也可以从哲学角度对《三体》进行续写;在商业文案创作方面, 文心一言可以根据公司业务类型为公司取名,生成 slogan 或撰写几百字的新闻稿;在数理逻辑推算方面,文心 一言可以完成鸡兔同笼问题的计算;在多模态生成方面,基于文心大模型的通用且可控的文生图系统,文心一 言具备图片生成的能力,同时具备语音生成、视频生成能力。从百度承认文心一言的存在到发布会当天,已有 超过 650 家合作伙伴宣布加入文心一言生态,商业化落地前景广阔。
百度 AI 产业打造全栈式布局,构建完整产业生态和独有技术优势。百度是目前全球少有的在“芯片-框架模型-应用”四个层面上均有所布局的人工智能公司,芯片层有高端芯片昆仑芯,框架层有飞桨深度学习框架, 模型层有文心预训练大模型,应用层有百度智能云、百度自动驾驶、小度智能语音助手等应用。百度 AI 全栈布 局的优势在于,可以在技术栈的四层架构中实现端到端优化,大幅提升效率。尤其是框架层和模型层之间,有 很强的协同作用,可以帮助构建更高效的模型,并显著降低成本。例如,为了支持海量参数模型的高效分布式 训练,百度飞桨专门研发了 4D 混合并行技术。后续“芯片-框架-模型-应用”四个层面将形成高效的闭环反馈, 推动百度人工智能持续迭代升级。
2.2 华为
华为在大模型研发领域积累深厚,有望快速实现商业化。华为盘古大模型发展,其基础大模型、行业大模 型、细分场景模型已经在不同领域率先取得成功。
华为云团队于 2020 年立项 AI 大模型,并且于 2021 年 4 月发布“盘古大模型”。自“盘古大模型”发 布以来,已经发展出 L0、L1、L2 三大阶段的成熟体系持续进化。所谓 L0 是指 NLP 大模型、CV 大模型等五大 水平领域的基础大模型;而 L1 指行业大模型,比如气象、矿山、电力等行;L2 指面向各行业中细分场景的模 型,比如电力行业的无人机巡检。
基础大模型研发与迭代能力强劲,持续创新推动大模型发展。NLP 大模型方面,作为一个拥有万亿参数的 语言模型,2023 年 3 月发布的盘古-Σ 大模型是一个具有稀疏架构的大型语言模型,包含 1.085 万亿个参数,模 型训练方面,该模型的训练基于分布式 Ascend 910AI 计算芯片和 MindSpore 代码框架,训练数据量达 3290 亿 token。其实现 NLP 在多个领域和下游任务的 SOTA 水平。在效率方面,其是在适度的算力集群上训练具有最强 系统性能的万亿参数模型。在可用性方面,其可扩展到各种领域或任务,无需从头开始重新训练模型。在模型 部署中,其可在各种具体应用场景中轻松定制和部署。 在 CV 领域,盘古 CV 大模型拥有 30 亿参数,能同时满足底层图像处理与高层语义的理解需求。在多模态 领域,华为发布 FILIP,其通过更细粒度的信息学习提升多模态 Transformer 的能力。此外,华为开源首个亿级 中文多模态数据集-悟空,填补中文社区数据空白。
多行业、多场景成功验证模型能力。盘古预训练大模型能力已经在包括能源、零售、金融、工业等领域得 到验证。例如,在电力领域,华为云团队在盘古 CV 大模型的基础上,利用海量无标注电力数据进行预训练, 并结合少量标注样本微调的高效开发模式,提出了针对电力行业的预训练模型,巧妙地解决了数据标注的问题。 应用盘古大模型之后,样本筛选效率提升约 30 倍,筛选质量提升约 5 倍,以永川每天采集 5 万张高清图片为例, 可节省人工标注时间 170 人/天。在掘进场景中,基于盘古矿山大模型的掘进作业序列智能监测,动作规范识别 准确率超过 95%,用规范的 AI 流程来替代不确定的人工流程,让 AI 成为矿工规范作业的好帮手,保障井下作 业安全。在气象预测方面,盘古气象大模型在一张 V100 显卡上只需要 1.4 秒就能完成 24 小时的全球气象预报, 相比传统数值预报提速 10000 倍以上。华为药物分子大模型则生成了 1 亿个创新的类药物小分子筛选库,其结 构新颖性为 99.68%,并且可以有效地生成理化性质相似的新化合物,为发现新药创造可能性。盘古 OCR 金融 大模型则能够覆盖通用文字识别场景。
2.3 阿里
多年来,阿里巴巴达摩院一直深耕多模态预训练,并率先探索通用统一大模型。自 2021 年起,阿里达摩院 先后发布多个版本的多模态及语言大模型,在超大模型、低碳训练技术、平台化服务、落地应用等方面实现突 破,引领了中文大模型的发展。具体来看,通义-大模型整体分为三个层次,分别为行业模型、通用模型与模型 底座。1) 模型底座层:统一学习范式与模块化设计;2)通用模型层:NLP 模型“通义–AliceMind”;CV 模 型“通义-视觉”;多模态模型“通义-M6”;AI 大模型“通义千问”。 3)行业模型层:深入电商、医疗、娱 乐、设计、金融、工业、制造业等行业。
通义-M6 已经从 2020 年 6 月的 3 亿参数基础模型逐渐发展到 2021 年 10 月的 10 万亿参数全球最大预训练 模型再到 2022 年 1 月的业界首个通用统一大模型 M6-OFA。2020 年 1 月,阿里巴巴达摩院启动中文多模态预 训练模型 M6 项目,同年 6 月推出 3 亿参数的基础模型。2021 年 1 月,模型参数规模到达百亿,已经成为世界 上最大的中文多模态模型。2021 年 3 月,千亿参数模型发布。2021 年 5 月,具有万亿参数规模的模型正式投入 使用,追上了谷歌的发展脚步。2021 年 10 月,M6 的参数规模扩展到 10 万亿,成为当时全球最大的 AI 预训练 模型。2022 年 1 月,业界首个通用的统一大模型 M6-OFA 发布。
通义千问大模型:在 2023 年 4 月 11 日的阿里云峰会上,阿里正式宣布推出大语言模型“通义千问”,并 开始邀请用户测试体验。“通义千问”是一个超大规模的语言模型,由阿里云智能首席技术官周靖人领衔的团 队自主研发,功能包括多轮对话、文案创作、逻辑推理、多模态理解、多语言支持等。同时,“通义千问”可 通过 API 插件实现 AI 能力的泛化,不仅可以通过实现续写小说,编写邮件和生成会议摘要等功能帮助用户提升 工作效率,还可以通过调用差旅接口推荐差旅产品,作为智能购物助手自动推荐品牌和产品提升用户购物体验。 总体来说,“通义千问”是一场“AI+云计算”的全方位竞争,超万亿参数的大模型研发,并不仅仅是算法问 题,而是囊括了底层庞大算力、网络、大数据、机器学习等诸多领域的复杂系统性工程,需要有超大规模 AI 基础设施的支撑。
未来,阿里所有产品将接入大模型实现全面升级。2023 年 4 月 17 日,阿里巴巴集团董事会主席兼 CEO、 阿里云智能集团 CEO 张勇在云峰会上表示,阿里巴巴所有产品未来将接入“通义千问”大模型,进行全面改造。 他认为,面向 AI 时代,所有产品都值得用大模型重新升级。以钉钉为例,接入通义千问后,可实现近 10 余项 新 AI 功能,举例来看:1)在钉钉文档中:可创作诗歌小说、撰写邮件、生成营销策划方案等,全面辅助办公;2)在钉钉群聊中:可以帮助自动总结未读群聊信息中的要点;3)在钉钉会议中:随时生成会议记录并自动总 结会议纪要、生成待办事项。 未来十年,阿里云将全面拥抱智能化时代。张勇表示,智能化时代带来算力的爆发,同时也提出了更高的 要求,阿里云将为 AI 时代提供好算力基础和大模型能力,全面服务智能化进程。为此,阿里云要做好核心两 件事:让算力更普惠、让 AI 更普及。