2026年电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量

  • 来源:财通证券
  • 发布时间:2026/03/18
  • 浏览次数:110
  • 举报
相关深度报告REPORTS

电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量.pdf

电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量。LPU为新一代面向大模型推理阶段的芯片,核心为TSP架构:LPU是专为顺序处理的计算密集型任务设计的新型芯片架构,核心在于TSP架构,包含五大功能模块,将经典的处理器五级流水线拆散在整个芯片内,进而消除了硬件的复杂性,使指令执行顺序和时间具有确定性。在TSP架构下,编译器可以直接访问并精确控制芯片的底层硬件状态,实现了软件定义硬件。LPU可缩短大模型推理过程中的延迟,提高用户体验感:大模型在推理过程中会存在延迟,延迟与用户体验感精密挂钩,大模型推理过程中的延迟主要在Decode阶段,核心瓶颈在于内存带宽。LPU...

LPU 面向大模型推理阶段,TSP 架构为核心

1.1 LPU 是一款用于大模型推理阶段的定制芯片

LPU 是一款专用于大模型推理阶段的定制芯片。LPU(Language Processing Unit,语言处理单元)是专为顺序处理的计算密集型任务设计新型芯片架构,其 核心目标是通过架构创新优化语言模型的推理效率。LPU 由 Groq 公司推出, Groq 成立于 2016 年,LPU 旨在用于大模型推理阶段,LPU 是唯一一款为开发 者提供所需性能且成本不影响开发者的定制推理芯片。

LPU 采用 14nm 制程工艺,集成 SRAM,可提供 80TB/s 的片上内存带宽。LPU 没有采用尖端制程工艺,选择了 14nm 制程,集成了 230MB 容量的 SRAM 来 替代 DRAM,以保证内存带宽,其片上内存带宽高达 80TB/s。在算力层面,Groq 芯片的整型(8 位)运算速度为 750TOPs,浮点(16 位)运算速度则为 188TFLOPs。

1.2 LPU 核心在于 TSP 架构,指令执行顺序和时间具有确定性

LPU 核心 TSP 架构,包含五大功能切片。整体芯片架构包含五大功能切片,MXM 用于执行矩阵运算,SXM 用于对矢量进行移位和旋转操作,MEM 用于内存读/ 写运算,VXM 用于向量上的算术运算,ICU 为指令控制单元,负责获取和调度 指令并在其他切片上执行。从整体来看,ICU 排布于芯片下方,MXM、SXM、 MEM 功能切片以 VXM 功能切片为中心呈双侧对称分布。

相较于传统多核处理器,TSP 将经典的处理器五级流水线拆散在整个芯片内。在 传统的 MultiCore 架构中,每个 PE 都是一个完整的多级流水线架构配置了独立 的指令译码/派发器件和独立的 Cache 层次化结构;在 TSP 微架构上,对传统的 多核处理器微架构进行了重组。经典的处理器五级流水线被拆散在了整个芯片内。

指令垂直下发,数据水平流动。相较于传统多核处理器,Groq 整个芯片构建了独 立的 ICU(Instruction Control Units)用于取指和译码,整个芯片被水平地划分 为多个功能切片。在每个时钟周期中,ICU 会向下方对应的功能切片垂直地、同 步地广播指令,这种执行方式类似于 SIMD,所有位于同一垂直列上的 FU 在同 一时刻执行由顶部 ICU 发出的指令;数据从一个功能切片产生,变成一个“流”, 水平地流向下游的功能切片进行运算,计算结果再继续以流的形式向下游传递, 或者被写回 MEM 单元。

TSP 架构消除了硬件的复杂性,指令执行顺序和时间具有确定性。基于微架构的 设计,在 CPU 和 GPU 上执行指令是不确定的,无法保证特定指令何时执行、完 成需要多长时间以及何时提供结果。CPU 中指令执行的顺序和时间不确定且难 以推理,而 GPU 还有其他一些非确定性因素,包括缓存、共享和全局内存、动 态资源分区等。非确定性带来的问题是,很难推理程序的性能,也很难保证最坏 情况下的性能限制。相较于 CPU 和 GPU,Groq 的 TSP 没有不确定的行为, 这消除了硬件的复杂性,使编译器能获得更大的权利,精确调度和控制指令的执 行,保证对程序性能的限制。

1.3 软件定义硬件,编译器定义芯片行为

软件定义硬件,编译器可以直接访问并精确控制芯片的底层硬件状态。TSP 的设 计人员简化了硬件,编译器需要精确地调度指令和数据流,以正确执行给定的程 序,并以最有效的方式执行;同时,由于 TSP 硬件中没有非确定性行为,因此编 译器可以准确了解每条指令的延迟,以及程序中的数据流,编译器的后端可以跟 踪片上任何流的位置和使用时间,称为软件定义硬件。

1.4 单节点内 Fullmesh 拓扑,单机柜内 Dragonfly 拓扑

单节点包含 8 个 GroqChip,一个机柜包含 9 个 GroqNode。据 Groq 提供的整 体端到端实时 AI 和 HPC 解决方案,主要是四部分:GroqChip、GroqChip、 GroqNode、GroqRack。

节点内 Fullmesh 拓扑,机柜内 Dragonfly 拓扑。在 Node 中,8 张 GroqCard 通过线缆构成一个 Fullmesh 的结构,每张卡顶部有 7 个互联接口,通过线缆链 接到其他 7 张卡;每张 GroqCard 背板位置有 4 个接口用于链接其他 Node,并 构成一个 Dragonfly 拓扑。

LPU 可缩短大模型推理过程中的延迟,提高用户 体验感

2.1 大模型推理延迟与用户使用体验感紧密挂钩,延迟主要发生在 Decode 阶段

2.1.1 大模型推理过程分为 Prefill 和 Decoding 两个阶段

大模型推理过程可分为 Prefill 和 Decoding 两个阶段。目前主流的大模型采用的 架构是 Decode-Only 架构,在使用 Decode-Only 架构的大模型进行推理时, 整个推理过程主要分为两个阶段:一个是 Prefill 阶段,一个是 Decode 阶段。

Prefill 阶段:大模型接收到用户输入的问题(Prompt)后,生成回答中的第一个 单词(Token)的阶段;Decode 阶段:大模型根据输出的第一个单词(Token) 的回答后继续进行后续预测输出的阶段。 在大模型推理过程中,大模型会不断根据输入的 Prompt 持续输出 Token。从大 模型与使用者进行交互并生成回答的过程中,使用者会先将问题输入给大模型, 对于大模型而言,这个问题叫做“Prompt”,也就是提示词;大模型接收到提示 词后,便开始执行推理过程:大模型会根据“Prompt”来回答第一个回答的单词, 随后会根据输出的第一个回答的单词来不断地预测后一个回答的单词,直到把需 要回答的单词全部生成完。 Prefill 阶段和 Decode 阶段具有共通点。两个阶段在大模型运行的过程是一样的, 不一样的是大模型接收到的输入不一样。以下图场景为例,对于大模型来说,第 一次的输入(Prefill 阶段的输入)是“今天吃饭了吗”这句话,模型的输出是回 答中的第一个词,也就是“我”,随后将得到的输出和输入合并成一个新的 Prompt输入给大模型,大模型输出“不”,依次类推,直到满足一定的条件(如输出最后 一个字符),大模型停止输出,模型回答完毕。

引入 KVCache 技术减轻计算量。在每个步骤输入的 Prompt 存在大量的重复单 词,为减轻重复单词带来的计算量,引入了 KVCache 技术,KVCache 技术就 是把上一步骤已经计算过的单词进行缓存,方便在下一步骤的时候直接使用,并 且把新的输入加到已经缓存好的单词的末尾就可以了。

2.1.2 延迟/吞吐/利用率为衡量大模型推理性能的指标,延迟与用户使用体验感 紧密挂钩

大模型在推理过程中有一些重要的性能指标的定义和含义,对于这些指标,大致 可分为三类:延迟 Latency、吞吐 Throughput、利用率 Utilization。

2.1.3 大模型推理过程中的延迟主要在 Decode 阶段,核心瓶颈在于内存带宽

Prefill 阶段和 Decode 阶段对于资源的需求不同。1)Prefill 阶段:大模型一次 性对 Prompt 中所有 Token 进行计算 QKV,由于不同 Token 的计算是独立的, 因此该过程可以并行,在 Attention 部分,计算得到的 QKV 进一步计算出 Output 矩阵,再经过后续的 FFN 层和解码得到首字母 Token。因此 Prefill 阶段存在大 量矩阵乘法和 Attention 计算,GPU 的算力利用率很高,但内存带宽压力较小。 Prefill 是典型的 Compute-bound 阶段;2)Decode 阶段:计算过程可以复用 Prefill 阶段的 KV 结果,也可以复用 Decode 阶段已经产生的 KV 结果,在 KVCache 技术下,对于 Q 矩阵,每次需要计算的只是 Q 的最后一行 q,计算关 于 qKV 的 attention,而不是关于 QKV 的 attention,这样复杂度降低了一个量 级,实现以存换算。每次 Decode 阶段只需要把最新的生成的 Token 输入进去, 拿之前的 KVCache 来做 attention,预测下一个 Token,而每生成一个 Token, 都需要访问所有历史的 KVCache,计算量小,但内存带宽压力大。Decode 是 典型的 Bandwidth-bound 阶段。 LLM 推理的核心瓶颈在于逐个 Token 生成的 Decode 阶段,其本质受限于内存 带宽,而非计算峰值。LLM 推理阶段包括 Prefill 阶段和 Decode 阶段,其中 Prefill 阶段类似于训练,需要同时处理输入序列的所有 Token,本质上具有高度并行性, 通常受计算能力限制。相比之下,Decode 阶段本质上是顺序执行的,每一步仅 生成一个输出 Token,这使其性能受限于内存带宽。大模型推理过程中 90%以 上的时间耗费在Decode阶段,单线程生成首个Token的延迟一般不超过0.1s, 后续每生成一个 Token 的量级大概为 50ms。

2.2 LPU 具备更快的内存带宽,可缩短大模型推理过程中的延迟

2.2.1 LPU 采用 SRAM 作为存储介质,解决大模型推理阶段面临的内存带宽 受限问题

LPU 采用 SRAM 作为存储介质,解决大模型推理阶段面临的内存带宽受限问题。 在 Groq 的设计中,芯片内部没有调度器。每一比特数据在芯片内部的流动路径、 在哪个时钟周期到达哪个功能单元,全都在编译阶段由算法计算完成,带来了硬 件不再需要为了“猜测”指令流向而浪费晶体管和功耗。同时,Groq 采用 SRAM 替代 HBM,带来了确定性时延、数据流设计等优势。Groq 通过静态调度,去除 了所有与计算无关的“控制开销”,而在传统 CPU/GPU 中,约有 60%-80%的 能量消耗在数据的搬运、缓存管理和指令调度上。

2.2.2 基于 LPU 的大模型具有更快的推理速度和更具性价比的价格

基于 LPU 的大模型具有更快的推理速度和更具性价比的价格 。根据 Articical Analysis 的数据显示,Grop 推出的 Mixtral 8×7B Instruct API,以每秒处理约 430 个 Token 的速度,且每百万个 Token 的价格仅为 0.27 美元。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至