2026年7月具身智能瓶颈与突破:智源大会启示录

  • 来源:国盛证券
  • 发布时间:2026/07/10
  • 浏览次数:67
  • 举报
相关深度报告REPORTS

通信行业点评:具身智能的瓶颈与突破——2026智源大会启示录.pdf

本文基于2026北京智源大会,分析具身智能行业的发展现状、技术瓶颈、突破路径及投资逻辑。大会显示AI正从“预测下一个词元”向“预测下一个物理状态”演进,具身智能成为核心主题。现场展示表明机器人已在受控环境中实现遥操作、自主抓拿放及人机互动等点状能力,但距离开放环境的高度泛化仍有差距。当前主要瓶颈包括数据获取成本高、物理理解不足、评测标准缺失及多模态感知局限。解决方案趋向于仿真合成、人类第一人称视频与真机数据多路并进,以及VLA与世界模型的融合。产业分工呈现全栈自研与大脑平台两派,前者强调软硬件闭环,后者主张模型通用性。业界对发展节奏判断为近端1-2年基础模型进步与数据闭环跑通,远端2-5年通用...

具身智能成为AI演进新范式

随着人工智能从“预测下一个词元”向“预测下一个物理状态”演进,具身智能正成为行业核心议题。2026北京智源大会将具身智能与世界模型置于核心位置,标志着AI技术从纯数字空间向物理世界渗透的加速。大会现场展示了从遥操作辅助到自主抓拿放,再到人机实时互动的能力梯度,表明机器人已在受控环境中实现特定任务的突破,但距离在开放环境中具备高度泛化能力仍有显著差距。

数据瓶颈与多模态感知挑战

当前具身智能面临的主要瓶颈集中在数据获取、物理理解及评测体系。传统视觉-语言-动作模型依赖昂贵的遥操作数据,难以规模化。行业共识正转向利用仿真合成、人类第一人称视频及真机数据多路并进,以降低采集门槛并提升数据规模。同时,现有世界模型在语言、像素、三维结构及视觉表征四条路线上均未完全触达物理规律,仅靠视觉感知不足以支撑人类级操作,触觉与力觉等多模态融合成为突破关键。

技术路线融合与分工深化

在技术路线上,“VLA与世界模型之争”逐渐走向融合,世界模型被视为VLA体系的核心组成部分,负责短程物理预测,而长程规划依赖语言推理。产业界在组织形态上呈现“全栈自研”与“大脑平台”两派分歧。全栈自研派强调软硬件一体化以掌握数据闭环,而平台派则主张模型不绑定单一本体,通过预训练实现跨本体兼容。这种分工深化有助于不同环节的专业化发展与效率提升。

商业化节奏与投资逻辑

业界对具身智能的发展节奏呈现“近端密集、远端发散”的判断。短期1-2年内,重点在于基础模型的显著进步与真实部署数据闭环的跑通;长期2-5年则聚焦于通用基础模型的演进。投资逻辑上,建议关注能率先在窄场景形成数据闭环与现金流的环节,如动作捕捉、仿真引擎、端侧算力及核心零部件。同时,需警惕以真机数据量为唯一护城河的企业,因人类视频与合成数据范式可能削弱其稀缺性优势。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至