燧原科技如何通过DSA架构与全栈软件生态突破国产云端AI算力瓶颈?

在国产AI芯片加速替代的背景下,燧原科技作为云端AI算力的重要参与者,其技术路径与市场表现备受关注。与传统GPGPU相比,燧原采用的DSA架构在计算效率与灵活性之间如何取得平衡?其自主研发的驭算TopsRider软件平台在降低CUDA迁移成本方面有哪些具体举措?

此外,面对大模型训练对万卡集群稳定性的严苛要求,燧原科技在高速互联技术与集群商业化落地方面取得了哪些进展?结合其财务数据与客户结构,如何评估其在国产算力产业链中的竞争地位及未来增长潜力?

最佳答案 匿名用户编辑于2026/09/02 13:10

燧原科技通过采用DSA(领域专用架构)技术路线,成功在计算效率与可编程能力之间找到了平衡点。相较于传统GPGPU,DSA弱化了非AI通用计算,将更多晶体管资源投入矩阵计算单元,从而在AI训练与推理场景中实现更高的能效比。同时,保留了AI领域内的可编程能力,使得模型更新仅需重新编译而无需重新流片,兼顾了ASIC的效率与GPU的灵活性。第四代邃思400芯片原生支持FP8低精度计算,并引入硬件多线程与动态调度机制,进一步优化了大规模并行计算的效率。

在软件生态方面,燧原科技自主研发的驭算TopsRider全栈AI计算及编程平台是其核心竞争力之一。该平台构建了“框架—算子库—编程语言—驱动—固件”五层软件栈,已适配DeepSeek、Qwen、GLM等200余个主流大模型,以及PyTorch、TensorFlow等主流深度学习框架。通过提供近2000个优化算子和自研Tops C++编程语言,TopsRider实现了对CUDA程序的高效迁移,显著降低了用户从英伟达生态切换至国产平台的成本,解决了国产芯片普遍面临的生态短板问题。

针对大模型训练对集群规模的极高要求,燧原科技通过自研GCU-LARE片间高速互联技术,突破了传统PCIe总线的带宽与延迟限制。该技术支持Scale-up超节点弹性扩展及Scale-out万卡集群构建,目前已实现千卡及万卡智算中心项目的商业化收入。其云燧智算集群采用分布式架构及高带宽全互联拓扑,能够支撑千亿参数以上大模型的并行训练,标志着其集群能力从技术验证迈向规模化落地。

从财务与市场表现看,燧原科技营收快速增长,2025年AI加速卡及模组销量达6.49万张,市场占有率约1.7%。虽然客户集中度较高,腾讯作为第一大客户贡献了大部分收入,但这种深度绑定也为其提供了稳定的应用场景与技术反馈。随着第五代、第六代芯片的研发推进及先进封装供应链的完善,燧原科技在国产云端AI算力领域的竞争地位有望进一步巩固,成为推动国产算力生态成熟的关键力量。

参考报告REPORT

计算机行业国产ASIC系列研究之7:国产算力趋势向上,燧原领跑云端AI算力.pdf

2025年中国AI芯片市场规模超过400万张,国产算力与国产AI模型生态闭环逐步建立,推动国产AI芯片加速渗透。在此背景下,燧原科技凭借自主DSA架构与全栈软硬协同能力,在云端AI算力领域崭露头角。本报告深入分析燧原科技的技术路径、产品迭代、财务状况及市场布局,揭示其在国产算力产业链中的核心价值。行业背景与市场格局国内互联网大厂及运营商持续加大AI算力资本开支,支撑国产算力产业链扩容。2025年,英伟达在国内市场份额约为55%,但华为、平头哥、寒武纪、燧原科技等国产厂商份额持续提升。特别是在外部供给扰动下,国产AI芯片在性能、供给及生态适配上取得较大进展,规模化验证与商业落地加速。燧原科技核心...

我来回答
分享至