具身智能技术路线中VLA与世界模型的融合趋势及产业分工逻辑是什么?

背景:2026智源大会显示具身智能成为焦点,但技术路线存在分歧。

范围:聚焦于视觉-语言-动作模型与世界模型的关系,以及全栈自研与平台化分工的产业逻辑。

最佳答案 匿名用户编辑于2026/07/10 15:50
在具身智能的技术演进中,VLA(视觉-语言-动作)与世界模型的关系正从竞争走向融合。世界模型负责对环境进行稠密、含时间维度的4D预测,擅长处理短程物理后果,如物体掉落等即时物理反应;而长程任务规划则更多依赖语言推理能力。两者融合可使机器人兼顾即时物理交互与长期策略规划。此外,世界模型还能生成真实环境中难以采集的边缘样本,补足VLA的数据短板。 在产业分工上,主要存在两派逻辑。全栈自研派主张软硬件一体化,认为在突破通用智能前,企业需掌握关键闭环,通过打磨硬件来优化数据与模型循环,类似早期个人电脑模式。大脑/模型平台派则主张模型不绑定单一本体,通过大规模人类视频预训练,实现跨本体、跨场景的通用能力,利用人类数据的预训练天然向下兼容多种本体与末端分工。这种分工深化有助于提升整体产业效率,不同企业可根据自身优势选择路径。
参考报告REPORT

通信行业点评:具身智能的瓶颈与突破——2026智源大会启示录.pdf

本文基于2026北京智源大会,分析具身智能行业的发展现状、技术瓶颈、突破路径及投资逻辑。大会显示AI正从“预测下一个词元”向“预测下一个物理状态”演进,具身智能成为核心主题。现场展示表明机器人已在受控环境中实现遥操作、自主抓拿放及人机互动等点状能力,但距离开放环境的高度泛化仍有差距。当前主要瓶颈包括数据获取成本高、物理理解不足、评测标准缺失及多模态感知局限。解决方案趋向于仿真合成、人类第一人称视频与真机数据多路并进,以及VLA与世界模型的融合。产业分工呈现全栈自研与大脑平台两派,前者强调软硬件闭环,后者主张模型通用性。业界对发展节奏判断为近端1-2年基础模型进步与数据闭环跑通,远端2-5年通用...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至