2024年AI行业专题报告:模型技术持续演进,交互体验有望升级

  • 来源:西南证券
  • 发布时间:2024/07/31
  • 浏览次数:393
  • 举报
相关深度报告REPORTS

AI行业专题报告:从模型视角看端侧AI-模型技术持续演进,交互体验有望升级.pdf

AI行业专题报告:从模型视角看端侧AI-模型技术持续演进,交互体验有望升级。基础的构建:模型实现高效压缩是端侧AI的第一步。模型尺寸变小、同时具备较好性能,是端侧AI的前提。目前,在10B参数规模以下的模型中,7B尺寸占据主流,3B及以下小模型仍在探索,部分小模型性能正逐步接近更大参数模型,如谷歌Gemini-Nano模型在部分测试基准上接近GeminiPro、MetaLlama-3-8B模型表现可与Llama-2-70B匹敌。模型厂商为兼顾模型尺寸与性能,在算法优化上进行积极探索,在模型压缩技术、稀疏注意力机制、多头注意力变体等领域取得持续进展,帮助模型减少参数、降低存算需求,同时保持较好的...

1 基础的构建:模型实现高效压缩是端侧AI的第一步

小模型24H1加速迭代,模型性能持续提升

发展节奏:24H1小模型加速推出,Meta Llama领先发布,微软、谷歌相继迭代,苹果厚积薄发。 模型参数:7B模型占据主流;3B及以下小模型进一步探索,其中苹果小模型梯队分布明显。 训练数据:Meta在有限参数下追求数据量上的scaling law;微软专注小而精的数据集;苹果旗下 小模型的训练数据量与参数量的比值不低。 算力消耗:23年GPU大多采用A100,24年主要采用H100;谷歌使用自研TPU;创企选择上云等。

谷歌Gemma系列模型:基于第一代模型架构对技术细节进行优化

基于千张TPU集群训练,模型性能在同类中较为领先。1)Gemma-2-9B:在4096张TPUv4上进 行训练,在多数基准中得分超过Llama-3-8B和Mistral-7B等同类模型,MMLU 5-shot、GSM8K 5-shot的测试得分相较于前一代模型Gemma-1-7B分别有11%和32%的增长。2)Gemma-2- 2.6B:在512张TPUv5e上进行训练,沿用第一代模型架构,对技术细节进一步优化,Gemma-2- 2.6B模型较上一代Gemma-1-2.5B模型在参数量基本不变和数据集更小的情况下实现更优性能, MMLU 5-shot、GSM8K5-shot的测试得分相较于上一代模型分别有21%和58%的增长。

谷歌Gemini-Nano系列模型:部分任务性能距Gemini Pro较小

专为设备部署而设计,擅长总结和阅读理解。2023年12月6日,谷歌发布Gemini系列自研大模型, 参数规模从大至小分别为Gemini-Ultra、Gemini-Pro、Gemini-Nano,其中Gemini-Nano模型包 括两种版本,Nano-1参数规模为1.8B,Nano-2为3.25B,旨在分别针对低内存和高内存的设备。

Gemini-Nano-1和Nano-2模型与参数规模更大的Gemini-Pro模型对比来看:1)根据BoolQ基 准(主要用于衡量模型理解问题和回答问题的逻辑能力)得分,Gemini-Nano-1的准确率为71.6%, 性能是Gemini-Pro的81%,Gemini-Nano-2的准确率为79.3%,是Gemini-Pro的90%,更接近 Gemini-Pro的性能;2)TydiQA(GoldP)基准涉及回答复杂问题的能力,Gemini-Nano-1和 Gemini-Nano-2的准确率为68.9%和74.2%,分别是Gemini-Pro的85%和91%,性能差距较小。

Gemini-Nano-1和Gemini-Nano-2模型对比来看:随着模型参数规模从Nano-1的1.8B增加至 Nano-2的3.25B,模型的性能表现在大多数任务性能均能得到提升。

Meta Llama系列模型:在有限参数下追求数据上的scaling law

同等参数情况下性能大幅提升,较小模型可以通过扩大训练数据量实现优秀性能。1)对比同等参 数模型来看,Llama-3的8B和70B模型相对于Llama-2的7B和70B模型性能均得到大幅提升。2)对 比Llama-3-8B和Llama-2-70B来看,在算力消耗基本持平的情况下,更好的模型性能可以通过在 更大规模的数据集上训练实现,Llama-3-8B模型的参数量约为Llama-2-70B的1/9,但训练数据集 是其7.5倍,最终的模型效果基本可与70B的模型相匹敌,且经过指令微调后,指令微调模型Llama3-8B明显超过Llama 2 70B。

Meta MobileLLM系列模型:强调小模型的深度比宽度更重要

模型参数进一步缩小,模型架构追求深而窄。MobileLLM的模型参数仅为1.25亿和3.5亿,其技术 报告聚焦于少于10亿参数的sub-billion(<1B)模型,强调模型架构对小模型的重要性,认为模型 深度比宽度更重要,并引入分组查询注意力机制等优化技巧,相较于同类125M/350M大小模型的 基准测试得分相比,MobileLLM的平均分均有提高。1)Zero-Shot常识推理任务方面:在125M 参数量级下,MobileLLM的模型性能显著优于OPT、GPT-Neo、Calaclafa等其他模型;在350M 参数量级下,MobileLLM的各项测试得分均优于此前最先进的模型OPT-350M。2)问答和阅读理 解 任 务方 面 :根据在TQA问 答的benchmark和RACE阅 读 理解 的benchmark的测 评结 果, MobileLLM-125M和MobileLLM-350M模型的精度比同等量级的小模型要高出较多。

微软Phi系列模型:主要创新在于构建教科书质量的训练数据集

训练数据追求小而精,模型参数逐步扩大。2023年6月,微软发布论文《Textbooks Are All You Need》,用规模仅为7B tokens的“教科书质量”的数据集,训练出1.3B参数、性能良好的Phi-1 模型。此后,历代Phi模型沿用“Textbooks Are All You Need”的训练思想,进一步使用精挑细 选的高质量内容和过滤的Web数据来增强训练语料库,以提升模型性能。在最新迭代的模型中, Phi-3-mini-3.8B通过3.3T tokens的训练,在学术基准和内部测试上可与经过15T tokens训练的 Llama-3-In-8B模型相匹敌。

模型架构持续优化,压缩技术不断创新

为压缩模型大小、在保持较小模型尺寸的同时实现高性能、以及能够支持较长的上下文,各海外模 型厂商纷纷布局小模型,并在模型算法优化方面进行积极探索,于24H1呈现出多种技术创新方向, 主要集中在模型压缩技术,稀疏注意力机制、多头注意力变体三大领域。

模型压缩技术:参数量化运用广泛,知识蒸馏热点较高

模型压缩技术持续发展,助力端侧部署。模型压缩技术旨在保持模型基本性能的情况下降低对推理 算力的需求,主要包括三种方法:1)参数剪枝(Pruning):删除部分权重参数、去除神经网络 中的冗余通道、神经元节点等;2)参数量化(Quantization):将浮点计算转成低比特定点计算, 业内应用普遍;3)知识蒸馏(Knowledge Distilling):将大模型作为教师模型,用其输出训练 出一个性能接近、结构更简单的学生模型,由Geoffrey Hinton等人在2015年谷歌论文《Distilling the Knowledge in a Neural Network》中提出,目前关注较高,业内通常使用GPT-4和Claude-3 作为教师模型。

多头注意力变体:减少注意力头数量,降低内存占用

KV cache:通过缓存中间计算结果,以“内存空间”换“计算时间”。当前,主流的大语言模型 基本采用Transformer decoder-only架构,其推理过程主要包括预填充和解码阶段。1)预填充阶 段:根据用户提出的prompt,生成第一个token;2)解码阶段:在生成第一个token之后,开始 采用自回归方式逐个生成后续的token,每个token的生成均需要依赖并attention此前的token, 因此,随着解码过程的进行,需要向此前生成的token的关注会越来越多,计算量也逐渐增大。 为减少解码过程中的重复计算,可以通过引入KV Cache,即缓存中间结果、在后续计算中直接从 Cache中读取而非重新计算,从而实现“以空间换时间”,使显存占用增加、但计算需求减少。

稀疏注意力机制:选择性处理信息,降低计算需求

稀疏注意力(Sparse Attention)机制:选取一部分信息进行交互,节省注意力机制成本。在当前主 流模型架构Transformer中,注意力矩阵可以通过限制Query-Key对的数量来减少计算复杂度,即 将注意力机制稀疏化。稀疏注意力机制主要采用基于位置信息和基于内容的稀疏化方法,其中,基 于位置信息的稀疏注意力方法更加主流,主要包括全局/带状/膨胀/随机/局部块五种类型。近年来, 随着大语言模型的加速发展,计算和存储压力增大,使得稀疏注意力机制不断优化,逐步衍生出基 于以上稀疏注意力机制的复合模式,涌现出Longformer等稀疏注意力模型。

2 落地的关键:模型适配终端硬件是端侧AI的第二步

从小模型论文看端侧硬件瓶颈——内存容量

将LLM装进终端要求手机内存有多少DRAM容量? 苹果在其发布的论文《LLM in a flash》中指出:在通常的LLM推理阶段,LLM直接加载至DRAM 中,一个7B参数、半精度的LLM,完全加载进DRAM所需的存储空间超过14GB。考虑到目前主流 手机的DRAM最高也就16GB的水平,在端侧直接使用DRAM来加载7B LLM面临巨大挑战。 通常一个应用最多可以占用多少DRAM内存? Meta在其MobileLLM模型论文中指出:将8-bit量化权重下的LLaMA-2-7B模型整合至手机,内存 代价过高,手机目前DRAM容量从iPhone 15的6GB到Google Pixel 8 Pro的12GB不等,由于 DRAM需要与操作系统和其他应用程序共享,一个移动应用不应超过DRAM的10%(即1~2GB)。 微软在其Phi-3模型技术报告中指出,Phi-3-mini可在手机上实现本地推理,在3.8B尺寸、在量化 为4-bit权重下,大约占用1.8GB的内存。

从芯片厂商布局看硬件升级趋势——先进制程

手机芯片采用先进制程,工艺有望向3nm迈进。23Q4,高通和联发科分别在其10月和11月峰会上 发布旗下手机芯片骁龙8Gen3和天玑9300,两者均采用台积电4nm制程工艺。根据高通和联发科历 年一年一迭代的发布节奏,骁龙8Gen4和天玑9400手机处理器可能于24Q4推出,并有望基于台积 电3nm工艺打造。而苹果相较于其他手机芯片厂商工艺更为领先,于23Q3率先推出采用3nm制程 的iPhone芯片A17 Pro,未来有望在先进制程上保持领先。

3 体验的突破:模型助力人机交互是端侧AI第三步

UI模型:手机界面理解能力提升,任务设计为人机交互奠定基础

发展节奏对比:苹果推进加速,谷歌尝试较早。1)苹果:面对日益激烈的AI竞争,苹果于23年10 月推出第一代可理解指代和定位的多模态大模型Ferret,24年4月提出可以处理更高分辨率图像的改 进版本Ferret-v2,以及专门针对手机用户界面的多模态大模型Ferret-UI,赋予AI理解和操作应用界 面的能力。2)谷歌:由于LLM作为大语言模型,通常无法直接理解UI界面,谷歌针对这一痛点, 于2022年9月和10月发表Spotlight和Pix2Struct相关论文,对终端UI界面的理解进行初步探索; 2024年2月,谷歌推出UI模型Screen AI,完善相关布局。目前,大语言模型(LLM)难以直接理解 手机UI界面,应用形态以chatbot为主,而谷歌Screen AI和苹果Ferret-UI采用多模态视觉语言模 型(VLM),实现对屏幕信息的理解,为用户与终端设备之间的交互提供UI理解基础。

系统级AI:云端模型补充交互体验,系统升级支持更多AI场景

MoE架构集成多个专家模型,处理任务专业高效。MoE模型(mixture-of-experts model)即混 合专家模型,作为大模型架构的一种,MoE基于“术业有专攻”的设计思想,由多个子模型(专家 模型)组成,通过将任务分门别类、再分配给不同的专家模型,使处理问题更加灵活高效;而稠密 模型(Dense model),偏向于“通才”模型,能够处理众多任务,但专业能力可能不及MoE。

云端模型补充端侧AI能力,MoE架构可适配于多种场景。近半年来,海外模型厂商纷纷采用MoE架 构,其中,谷歌基于过去的领先研究在Gemini-1.5-Pro模型中采用MoE架构,苹果基于MoE架构对 MM1模型进行扩展,且两者分别应用于苹果和三星手机的AI系统中。此外,由于MoE模型中的每 个子模型能够专注处理某类特定任务,因此,手机厂商可以针对端侧AI的应用场景,对混合专家模 型进一步微调优化,使其与多种端侧任务适配,推动端侧AI的推理效率。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至