2024年生成式人工智能行业专题研究:海外大模型篇,生成式AI加速创新,行业迎历史性机遇

  • 来源:国元证券
  • 发布时间:2024/04/02
  • 浏览次数:534
  • 举报
相关深度报告REPORTS

生成式人工智能行业专题研究:海外大模型篇,生成式AI加速创新,行业迎历史性机遇.pdf

该文档聚焦于生成式人工智能领域的海外大模型市场,深入分析行业当前的创新加速趋势及面临的历史性机遇。报告重点考察了海外主要大模型厂商的技术进展、产品迭代路径及商业化落地情况,探讨了生成式AI技术如何推动各垂直行业的效率提升与应用场景拓展。通过对比分析国际市场的竞争格局与发展经验,旨在为理解全球AI技术演进脉络、把握产业投资方向提供详实的数据支持与深度洞察,帮助读者厘清生成式AI在技术创新与商业变现之间的关键逻辑。

第一部分:生成式AI快速发展,技术奇点有望到来

发展历程:算法模型持续迭代,AI行业快速发展

2014年,伊恩·古德费洛(lan Goodfellow)提出的生成对抗网络(Generative Adversarial Network, GAN)成为早期最为著名的生成模型。 GAN使用合作的零和博弈框架来学习,被广泛用于生成图像、视频、语音和三维物体模型。随后,Transformer、基于流的生成模型 (Flow-based models)、扩散模型(Diffusion Model)等深度学习的生成算法相继涌现。

Transformer模型是一种采用自注意力机制的深度学习模型,这一机制可按输入数据各部分的重要性分配权重,可用于自然语言处理 (NLP)、计算机视觉(CV)领域应用,后来出现的BERT、GPT-3、laMDA等预训练模型都是基于Transformer模型建立的。

预训练模型是为了完成特定任务基于大型数据集训练的深度学习模型,让AI模型的开发从手工作坊走向工厂模式,加速AI技术落地。 2017年,Google颠覆性地提出了基于自注意力机制的神经网络结构——Transformer架构,奠定了大模型预训练算法架构的基础。 2018年,OpenAI和Google分别发布了GPT-1与BERT大模型,意味着预训练大模型成为自然语言处理领域的主流。

随着人工智能技术的不断发展,其应用场景日益丰富,各行各业所汇聚的庞大数据资源为技术的实际应用和持续完善提供了坚实基础。 根据第三方咨询机构格物致胜的统计数据,2022年中国人工智能市场规模达到2058亿元,预计2023-2027年市场规模将保持28.2%的 复合增长率,2027年中国人工智能市场规模将达到7119亿元。根据statista的统计数据,2023年全球人工智能市场规模达2079亿美元, 预计2030年将增至18475亿美元。

趋势展望:从单一模态到多模态,从AI迈向AGI

多模态较单一模态更进一步,已经成为大模型主战场。人类通过图片、文字、语言等多种途径来学习和理解,多模态技术也是通过整 合多种模态、对齐不同模态之间的关系,使信息在模态之间传递。2023年以来,OpenAI发布的GPT-4V、Google发布的Gemini、 Anthropic发布的Claude 3均为多模态模型,展现出了出色的多模态理解及生成能力。未来,多模态有望实现any to any模态的输入和 输出,包括文本、图像、音频、视频、3D模型等多种模态。

多模态大型语言模型(MLLMs)的通用架构,由1) 视觉编码器(Visual Encoder)、2) 语言模型(Language Model)和3) 适配器模块 (Adapter Module)组成。1) 负责处理和理解输入的视觉信息,通常使用预训练的视觉模型,如Vision Transformer(ViT)或其他卷积神 经网络(CNN)架构,来提取图像特征;2) 负责处理文本输入,理解和生成自然语言,语言模型基于Transformer架构,如BERT或GPT 系列模型;3) 负责在视觉和语言模态之间建立联系。

第二部分:技术创新百花齐放,海外巨头引领潮流

OpenAI引领大模型技术,终极目标剑指AGI

OpenAI由Sam Altman、Elon Musk等在2015年创办,主旨是努力在安全的前提下创建通用人工智能(AGI)并让全人类共同受益; 2020年发布GPT-3模型,2022年11月发布GPT-3.5模型,能够与人类进行多轮连续的各种对话,给出较为合理的回答;2023年3月 发布GPT-4模型;2024年2月发布AI视频生成模型Sora,AI视频生成领域迎来ChatGPT时刻。

GPT-1通过无监督预训练和有监督微调两个步骤训练;GPT-2无需有监督微调,而是通过更大规模的模型参数和训练数据集进行无 监督预训练,模型参数量达到15亿;GPT-3的模型参数和数据集进一步扩大,模型参数量增加到1750亿,上下文窗口宽度增加到 2048个token。

ChatGPT/GPT-3.5:2022年11月30日发布,在GPT-3的基础上进行有监督微调(Supervised Fine-Tuning)、奖励模型训练(Reward Modeling)和来自人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)。ChatGPT具有以下特征:主动承 认自身错误、质疑不正确的问题、承认自身的无知和对专业技术的不了解以及支持连续多轮对话,极大提升了对话交互模式下的用 户体验。

2023年11月7日,OpenAI在开发者大会披露新版本具备:1) 更长的上下文长度:支持128K上下文窗口,相当于300页文本;2) 更 便宜:新模型的价格是每千输入token 1美分,而每千输出token 3美分,输入和输出费用分别降至GPT-4(8K)的1/3和1/2,总体使 用上降价约2.75倍;3) 更聪明:内部知识库更新至2023年4月,并支持上传外部数据库或文件;4) 视听多模态:支持文生图模型 DALL·E3、文本转语音模型TTS,未来还将支持自动语音识别模型Whisper v3;5) 更快的速度:用户每分钟的Token速率限制将会 翻倍,可通过API账户申请进一步提速。

Meta采取开源策略,发布多款重磅大模型

2023年7月,Meta发布了开源大语言模型——LLaMA 2。LLaMA 2是在LLaMA 1基础之上构建而成,训练数据比上一版本多出40%, 拥有70亿、130亿和700亿三种参数,并且允许商业化。技术方面,该预训练模型接受了2万亿个标记的训练,上下文长度是上一版 本的两倍,能处理更长的文本内容;性能方面,LLaMA-13B在大多数基准上超过了参数量达1750亿的GPT-3。

2023年4月,Meta AI在官网发布了基础模型Segment Anything Model (SAM) 并开源。SAM已在1100万张图片和11亿个掩码的数据 集上进行了训练,具有超强的自动识别、切割功能。SAM能感知超出数据训练的对象和图像,就算图片不在SAM训练范围内,它 也能识别。这意味着,用户无需再收集自己的细分数据,并为用例模型进行微调。SAM可以集成在任何希望识别、切割对象的应 用中,在医疗、农业、气象、天文、媒体等主流行业拥有广阔的应用空间。

2023年5月,Meta开源了多模态大模型ImageBind,可跨越图像、视频、音频、深度、热量和空间运动6种模态进行检索。例如, 输入鸽子的图片,外加一个摩托音频,模型能够检索出一张摩托和鸽子的图片。ImageBind模型把不同模态数据串联在一个嵌入空 间(Embedding Space),从多维度理解世界,未来将引入更多模态增强对世界感知,比如如触觉、语音、嗅觉和大脑fMRI信号。

Anthropic与OpenAI一脉相承,发布Claude大模型

Anthropic是一家人工智能创业公司,由OpenAI前研究副总裁达里奥·阿莫迪(Dario Amodei)、大语言模型GPT-3论文的第一作者汤 姆·布朗(Tom Brown)等人在2021年创立。2023年2月,获得Google投资3亿美元,Google持股10%;2023年3月,发布类似 ChatGPT的大语言模型Claude;2023年7月,发布新一代Claude 2模型;2024年3月,发布Claude 3模型。

2024年3月,Anthropic发布最新的多模态模型Claude 3,该系列包含三个模型:Claude 3 Haiku、Claude 3 Sonnet和Claude 3 Opus。其中,能力最强的Opus在多项基准测试中得分都超过了GPT-4和Gemini 1.0 Ultra,在数学、编程、多语言理解、视觉等多 个维度树立了新的行业基准。多模态方面,用户可以上传照片、图表、文档和其他类型的非结构化数据,让AI分析和解答。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至