2024年AI行业专题报告:模型技术持续演进,交互体验有望升级
- 来源:西南证券
- 发布时间:2024/07/31
- 浏览次数:393
- 举报
AI行业专题报告:从模型视角看端侧AI-模型技术持续演进,交互体验有望升级.pdf
AI行业专题报告:从模型视角看端侧AI-模型技术持续演进,交互体验有望升级。基础的构建:模型实现高效压缩是端侧AI的第一步。模型尺寸变小、同时具备较好性能,是端侧AI的前提。目前,在10B参数规模以下的模型中,7B尺寸占据主流,3B及以下小模型仍在探索,部分小模型性能正逐步接近更大参数模型,如谷歌Gemini-Nano模型在部分测试基准上接近GeminiPro、MetaLlama-3-8B模型表现可与Llama-2-70B匹敌。模型厂商为兼顾模型尺寸与性能,在算法优化上进行积极探索,在模型压缩技术、稀疏注意力机制、多头注意力变体等领域取得持续进展,帮助模型减少参数、降低存算需求,同时保持较好的...
1 基础的构建:模型实现高效压缩是端侧AI的第一步
小模型24H1加速迭代,模型性能持续提升
发展节奏:24H1小模型加速推出,Meta Llama领先发布,微软、谷歌相继迭代,苹果厚积薄发。 模型参数:7B模型占据主流;3B及以下小模型进一步探索,其中苹果小模型梯队分布明显。 训练数据:Meta在有限参数下追求数据量上的scaling law;微软专注小而精的数据集;苹果旗下 小模型的训练数据量与参数量的比值不低。 算力消耗:23年GPU大多采用A100,24年主要采用H100;谷歌使用自研TPU;创企选择上云等。
谷歌Gemma系列模型:基于第一代模型架构对技术细节进行优化
基于千张TPU集群训练,模型性能在同类中较为领先。1)Gemma-2-9B:在4096张TPUv4上进 行训练,在多数基准中得分超过Llama-3-8B和Mistral-7B等同类模型,MMLU 5-shot、GSM8K 5-shot的测试得分相较于前一代模型Gemma-1-7B分别有11%和32%的增长。2)Gemma-2- 2.6B:在512张TPUv5e上进行训练,沿用第一代模型架构,对技术细节进一步优化,Gemma-2- 2.6B模型较上一代Gemma-1-2.5B模型在参数量基本不变和数据集更小的情况下实现更优性能, MMLU 5-shot、GSM8K5-shot的测试得分相较于上一代模型分别有21%和58%的增长。
谷歌Gemini-Nano系列模型:部分任务性能距Gemini Pro较小
专为设备部署而设计,擅长总结和阅读理解。2023年12月6日,谷歌发布Gemini系列自研大模型, 参数规模从大至小分别为Gemini-Ultra、Gemini-Pro、Gemini-Nano,其中Gemini-Nano模型包 括两种版本,Nano-1参数规模为1.8B,Nano-2为3.25B,旨在分别针对低内存和高内存的设备。
Gemini-Nano-1和Nano-2模型与参数规模更大的Gemini-Pro模型对比来看:1)根据BoolQ基 准(主要用于衡量模型理解问题和回答问题的逻辑能力)得分,Gemini-Nano-1的准确率为71.6%, 性能是Gemini-Pro的81%,Gemini-Nano-2的准确率为79.3%,是Gemini-Pro的90%,更接近 Gemini-Pro的性能;2)TydiQA(GoldP)基准涉及回答复杂问题的能力,Gemini-Nano-1和 Gemini-Nano-2的准确率为68.9%和74.2%,分别是Gemini-Pro的85%和91%,性能差距较小。
Gemini-Nano-1和Gemini-Nano-2模型对比来看:随着模型参数规模从Nano-1的1.8B增加至 Nano-2的3.25B,模型的性能表现在大多数任务性能均能得到提升。
Meta Llama系列模型:在有限参数下追求数据上的scaling law
同等参数情况下性能大幅提升,较小模型可以通过扩大训练数据量实现优秀性能。1)对比同等参 数模型来看,Llama-3的8B和70B模型相对于Llama-2的7B和70B模型性能均得到大幅提升。2)对 比Llama-3-8B和Llama-2-70B来看,在算力消耗基本持平的情况下,更好的模型性能可以通过在 更大规模的数据集上训练实现,Llama-3-8B模型的参数量约为Llama-2-70B的1/9,但训练数据集 是其7.5倍,最终的模型效果基本可与70B的模型相匹敌,且经过指令微调后,指令微调模型Llama3-8B明显超过Llama 2 70B。
Meta MobileLLM系列模型:强调小模型的深度比宽度更重要
模型参数进一步缩小,模型架构追求深而窄。MobileLLM的模型参数仅为1.25亿和3.5亿,其技术 报告聚焦于少于10亿参数的sub-billion(<1B)模型,强调模型架构对小模型的重要性,认为模型 深度比宽度更重要,并引入分组查询注意力机制等优化技巧,相较于同类125M/350M大小模型的 基准测试得分相比,MobileLLM的平均分均有提高。1)Zero-Shot常识推理任务方面:在125M 参数量级下,MobileLLM的模型性能显著优于OPT、GPT-Neo、Calaclafa等其他模型;在350M 参数量级下,MobileLLM的各项测试得分均优于此前最先进的模型OPT-350M。2)问答和阅读理 解 任 务方 面 :根据在TQA问 答的benchmark和RACE阅 读 理解 的benchmark的测 评结 果, MobileLLM-125M和MobileLLM-350M模型的精度比同等量级的小模型要高出较多。
微软Phi系列模型:主要创新在于构建教科书质量的训练数据集
训练数据追求小而精,模型参数逐步扩大。2023年6月,微软发布论文《Textbooks Are All You Need》,用规模仅为7B tokens的“教科书质量”的数据集,训练出1.3B参数、性能良好的Phi-1 模型。此后,历代Phi模型沿用“Textbooks Are All You Need”的训练思想,进一步使用精挑细 选的高质量内容和过滤的Web数据来增强训练语料库,以提升模型性能。在最新迭代的模型中, Phi-3-mini-3.8B通过3.3T tokens的训练,在学术基准和内部测试上可与经过15T tokens训练的 Llama-3-In-8B模型相匹敌。
模型架构持续优化,压缩技术不断创新
为压缩模型大小、在保持较小模型尺寸的同时实现高性能、以及能够支持较长的上下文,各海外模 型厂商纷纷布局小模型,并在模型算法优化方面进行积极探索,于24H1呈现出多种技术创新方向, 主要集中在模型压缩技术,稀疏注意力机制、多头注意力变体三大领域。
模型压缩技术:参数量化运用广泛,知识蒸馏热点较高
模型压缩技术持续发展,助力端侧部署。模型压缩技术旨在保持模型基本性能的情况下降低对推理 算力的需求,主要包括三种方法:1)参数剪枝(Pruning):删除部分权重参数、去除神经网络 中的冗余通道、神经元节点等;2)参数量化(Quantization):将浮点计算转成低比特定点计算, 业内应用普遍;3)知识蒸馏(Knowledge Distilling):将大模型作为教师模型,用其输出训练 出一个性能接近、结构更简单的学生模型,由Geoffrey Hinton等人在2015年谷歌论文《Distilling the Knowledge in a Neural Network》中提出,目前关注较高,业内通常使用GPT-4和Claude-3 作为教师模型。
多头注意力变体:减少注意力头数量,降低内存占用
KV cache:通过缓存中间计算结果,以“内存空间”换“计算时间”。当前,主流的大语言模型 基本采用Transformer decoder-only架构,其推理过程主要包括预填充和解码阶段。1)预填充阶 段:根据用户提出的prompt,生成第一个token;2)解码阶段:在生成第一个token之后,开始 采用自回归方式逐个生成后续的token,每个token的生成均需要依赖并attention此前的token, 因此,随着解码过程的进行,需要向此前生成的token的关注会越来越多,计算量也逐渐增大。 为减少解码过程中的重复计算,可以通过引入KV Cache,即缓存中间结果、在后续计算中直接从 Cache中读取而非重新计算,从而实现“以空间换时间”,使显存占用增加、但计算需求减少。
稀疏注意力机制:选择性处理信息,降低计算需求
稀疏注意力(Sparse Attention)机制:选取一部分信息进行交互,节省注意力机制成本。在当前主 流模型架构Transformer中,注意力矩阵可以通过限制Query-Key对的数量来减少计算复杂度,即 将注意力机制稀疏化。稀疏注意力机制主要采用基于位置信息和基于内容的稀疏化方法,其中,基 于位置信息的稀疏注意力方法更加主流,主要包括全局/带状/膨胀/随机/局部块五种类型。近年来, 随着大语言模型的加速发展,计算和存储压力增大,使得稀疏注意力机制不断优化,逐步衍生出基 于以上稀疏注意力机制的复合模式,涌现出Longformer等稀疏注意力模型。
2 落地的关键:模型适配终端硬件是端侧AI的第二步
从小模型论文看端侧硬件瓶颈——内存容量
将LLM装进终端要求手机内存有多少DRAM容量? 苹果在其发布的论文《LLM in a flash》中指出:在通常的LLM推理阶段,LLM直接加载至DRAM 中,一个7B参数、半精度的LLM,完全加载进DRAM所需的存储空间超过14GB。考虑到目前主流 手机的DRAM最高也就16GB的水平,在端侧直接使用DRAM来加载7B LLM面临巨大挑战。 通常一个应用最多可以占用多少DRAM内存? Meta在其MobileLLM模型论文中指出:将8-bit量化权重下的LLaMA-2-7B模型整合至手机,内存 代价过高,手机目前DRAM容量从iPhone 15的6GB到Google Pixel 8 Pro的12GB不等,由于 DRAM需要与操作系统和其他应用程序共享,一个移动应用不应超过DRAM的10%(即1~2GB)。 微软在其Phi-3模型技术报告中指出,Phi-3-mini可在手机上实现本地推理,在3.8B尺寸、在量化 为4-bit权重下,大约占用1.8GB的内存。
从芯片厂商布局看硬件升级趋势——先进制程
手机芯片采用先进制程,工艺有望向3nm迈进。23Q4,高通和联发科分别在其10月和11月峰会上 发布旗下手机芯片骁龙8Gen3和天玑9300,两者均采用台积电4nm制程工艺。根据高通和联发科历 年一年一迭代的发布节奏,骁龙8Gen4和天玑9400手机处理器可能于24Q4推出,并有望基于台积 电3nm工艺打造。而苹果相较于其他手机芯片厂商工艺更为领先,于23Q3率先推出采用3nm制程 的iPhone芯片A17 Pro,未来有望在先进制程上保持领先。
3 体验的突破:模型助力人机交互是端侧AI第三步
UI模型:手机界面理解能力提升,任务设计为人机交互奠定基础
发展节奏对比:苹果推进加速,谷歌尝试较早。1)苹果:面对日益激烈的AI竞争,苹果于23年10 月推出第一代可理解指代和定位的多模态大模型Ferret,24年4月提出可以处理更高分辨率图像的改 进版本Ferret-v2,以及专门针对手机用户界面的多模态大模型Ferret-UI,赋予AI理解和操作应用界 面的能力。2)谷歌:由于LLM作为大语言模型,通常无法直接理解UI界面,谷歌针对这一痛点, 于2022年9月和10月发表Spotlight和Pix2Struct相关论文,对终端UI界面的理解进行初步探索; 2024年2月,谷歌推出UI模型Screen AI,完善相关布局。目前,大语言模型(LLM)难以直接理解 手机UI界面,应用形态以chatbot为主,而谷歌Screen AI和苹果Ferret-UI采用多模态视觉语言模 型(VLM),实现对屏幕信息的理解,为用户与终端设备之间的交互提供UI理解基础。
系统级AI:云端模型补充交互体验,系统升级支持更多AI场景
MoE架构集成多个专家模型,处理任务专业高效。MoE模型(mixture-of-experts model)即混 合专家模型,作为大模型架构的一种,MoE基于“术业有专攻”的设计思想,由多个子模型(专家 模型)组成,通过将任务分门别类、再分配给不同的专家模型,使处理问题更加灵活高效;而稠密 模型(Dense model),偏向于“通才”模型,能够处理众多任务,但专业能力可能不及MoE。
云端模型补充端侧AI能力,MoE架构可适配于多种场景。近半年来,海外模型厂商纷纷采用MoE架 构,其中,谷歌基于过去的领先研究在Gemini-1.5-Pro模型中采用MoE架构,苹果基于MoE架构对 MM1模型进行扩展,且两者分别应用于苹果和三星手机的AI系统中。此外,由于MoE模型中的每 个子模型能够专注处理某类特定任务,因此,手机厂商可以针对端侧AI的应用场景,对混合专家模 型进一步微调优化,使其与多种端侧任务适配,推动端侧AI的推理效率。
报告节选:


编辑:火腿肠 -
标签
- AI
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 中国临床肿瘤学会指南工作委员会-医疗行业中国临床肿瘤学会(CSCO)非小细胞肺癌诊疗指南2026.pdf
- 5 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 6 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 7 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 8 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 9 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 10 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 1 储能与电力设备行业2026年中期策略报告:全球需求共振,算电协同启新.pdf
- 2 中国汽车流通协会-汽车行业:2026年6月中国汽车保值率报告.pdf
- 3 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 4 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 5 行业景气度跟踪报告(2026年7月):景气,右侧AI景气持续,左侧细分方向亦值得关注.pdf
- 6 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 7 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 8 硕远咨询-银发旅游行业:2026年银发旅游研究报告.pdf
- 9 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 10 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 2 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 3 2026年春季港股及海外中资股投资策略:分化与回归
- 4 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 5 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 6 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 7 2026年春季海外宏观展望:结构性“滞胀”
- 8 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 9 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 10 2026年春季转债投资策略:主线清晰,冲击已过,仓位致胜
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 4 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 5 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 6 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 10 2026年中期医药生物行业投资策略:AI新药加速推进
