2025年机器人大模型行业深度报告:我们距离真正的具身智能大模型还有多远?
- 来源:东吴证券
- 发布时间:2025/08/12
- 浏览次数:286
- 举报
机器人大模型行业深度报告:我们距离真正的具身智能大模型还有多远?.pdf
机器人大模型行业深度报告:我们距离真正的具身智能大模型还有多远?1.人形机器人为何需要高智能的大模型?尽管人形机器人的形态早已实现工程可行,但其真正实现产业化落地的关键,在于摆脱传统工业机器人“控制刚、泛化弱”的局限,补足对不确定性的理解与适应能力。工业机器人主要基于确定性控制逻辑运行,缺乏感知、决策与反馈能力,导致高度依赖集成,成本高、通用性差。相比之下,人形机器人以“通用智能体”为目标,强调感知—推理—执行的完整链路,必须依托大模型支撑的多模态理解与泛化能力,才能适应复杂任务与动态环境。当前多模态大模型的兴起,为人形机...
1.人形机器人为何需要高智能的大模型?
人形形态并非技术难点,核心在于通用智能的补足
人形形态的机器人早已实现工程落地,但长期停留在“仿形不仿智”阶段。过去的人形机器人主 要以模仿人类形态为目标,相关技术早在数十年前已初步成熟。早期典型代表如2000年本田推出 的ASIMO与2013年波士顿动力的Atlas,虽具备出色的运动能力,但执行逻辑高度依赖预设行为库。这类机器人可完成跑跳等复杂动作,体现了运动控制硬件的成熟度,但其行为均来自人工设定的 指令序列,无法自主理解任务或适应环境变化。因此,本质上这类产品仍是“人形的机器”,而 非“具备人类智能的机器人”。它们缺乏对环境的感知、任务的理解与泛化能力,尚不具备真正 的智能交互与通用任务执行潜力。
多模态大模型的出现,为人形机器人装上“智能大脑”
本轮人形机器人热潮的底层驱动力,是市场对其“智能性”的高度期待。随着多模态大模型的突 破,机器人首次具备了“感知—理解—决策”的潜力,被视为拥有“大脑”的关键起点。大语言 模型(LLM)的成功,验证了通过大规模互联网文本训练神经网络具备推理能力的可行性;而视 觉语言模型(VLM)进一步拓展模态边界,使模型可以“看懂图像、理解语言”。LLM专注于文 本推理,VLM则通过融合图像/视频与语言等模态信息,构建起跨模态的统一表征体系,从而支持 模型理解现实世界的更多维度。
动作模态的融入,让模型端真正赋予机器人执行操作的能力。仅能感知、理解世界并不是机器人 大脑的终极目标,机器人的最终目标是在认知的基础上实现与现实世界的动作交互。目前机器人 模型的核心迭代方向,是将动作模态融入现有的视觉语言模型。
初级具身智能模型撬动人形机器人产业0-1落地
当前大多数人形机器人仍处于展示阶段,核心瓶颈在于智能程度不足。一旦具备初步智能化能力,机器人即可在特定场景中落地应用,并通过任务反馈不断优化模型,开启数据飞轮与产品迭代循 环,从0-1迈向1-100的演化。
数据飞轮是驱动智能系统能力提升的核心机制。本质是“收集数据—改进模型—提升产品—吸引 更多用户和数据—再次改进”的正向循环,有望带动人形机器人快速迈入迭代加速期。
当前模型水平有限,距离真正泛化仍有较远距离
现阶段人形机器人仅在智能化的初级阶段。北京市人形机器人创新中心牵头,联合上海市、浙江 省人形机器人创新中心,以及优必选、宇树科技、中国信息通信研究院、工业互联网研究院等多 家头部企业与科研机构,共同制定了全球首个《人形机器人智能化分级》标准,从感知、决策、 执行、协作四维度划分L1-L5五级。目前主流产品智能水平普遍仅在L2左右,尚未具备自主泛化 与应变能力。未来向更高智能等级进化仍需突破模型、数据与算力多重门槛。真正实现通用智能 机器人仍有较长路径要走,需在技术、数据体系和生态协同上持续积累。
2.从架构端和数据端看,目前机器人大模型的进展 如何?
发展历程:三条主线驱动,加速技术衍变
多模态、动作频率和泛化能力三条主线驱动技术衍变。 1)多模态:22年4月Saycan发布,能够根据任务指令在动作库中输出最优动作。22年12月RT1发布, 动作输出升级为由Transformer生成的动作Token。23年3月PaLM-E发布,较Saycan在任务理解能力上 显著升级。23年7月RT2发布,结合RT1和PaLM-E两者优势,将动作信息纳入模型输出空间。 2)动作频率:RT2只能输出1-5Hz的动作序列,为克服这一问题。24年10月π0发布,引入采用 FlowMatch模型的动作专家,动作输出升级为50Hz的动作轨迹。25年2月Helix发布,采用快慢脑结构,操纵频率进一步提高,输出200Hz动作序列。 3)泛化能力:由于现实世界极其复杂,不可能通过枚举穷尽所有场景,因此机器人必须具备“零样本 泛化”能力。纵观模型发展史,各模型均强调多任务联合训练、预训练迁移能力以及跨平台迁移能力,核心目的就是提升零样本泛化表现。
SayCan:语言模型与可行性评估结合的任务规划框架
SayCan 是由 Google 于 2022 年提出的一种将语言模型(LLM)与机器人可行性模型相结合的任务规划系统。 它的核心思想是将自然语言指令拆解为一系列子任务,然后由 LLM(如 PaLM)生成可能的动作候选,再由一 个训练好的“Can”模型(基于 Q-learning 的 Affordance Model)评估每个动作在当前环境下的可行性。
具体流程:SayCan 首先接收一段用户指令(如“请帮我从厨房拿一瓶水”),通过语言模型推理出多个可能的 操作步骤(如“走到冰箱前”、“打开冰箱”、“拿出水瓶”),之后使用训练得到的可行性模型为这些步骤 打分,最终选取可执行性最高的动作序列传给机器人控制器执行。该方法巧妙地将 LLM 的语义理解能力与机 器人在现实场景中的动态感知能力连接起来,实现了“说得通也做得到”的人机交互模式。
SayCan 在真实机器人平台上展示出显著优于传统方法的任务执行能力,验证了“语言+可行性打分”架构的 有效性。 在实验中,SayCan在真实世界的厨房环境中执行了101项任务,规划成功率为81%,执行成功率为 60%,比未经过现实世界约束的LLMs执行准确性提高了约15%。
SayCan 的两阶段结构在工程部署和模型泛化上存在一定限制,难以满足大规模通用机器人系统需求。 1)语 言理解模块和可行性模型是独立训练,无法实现全局端到端优化,导致部分情况下任务分解与动作打分之间 存在语义脱节;2)可行性模型依赖预定义的状态特征和Q值训练,对不同场景需重新标注和学习,迁移成本 高;3)系统整体对任务顺序依赖强,缺乏自主 replanning 能力,难以处理开放环境中的任务中断或失败恢复。
RT-1:端到端 Transformer 控制模型
Google Robotics于2022年发布的RT-1(Robotics Transformer 1),基于Transformer模型及简约标记化方法, 利用大规模开放式语言及视觉数据实现实时、可扩展、可泛化、适用于实际场景的机器人运动控制 。RT-1 使用 Transformer 编码器将图像帧与语言指令联合编码,输出动作 token(例如控制机械臂的末端位姿与夹爪 状态)。训练数据来自于机器人远程操作演示,总共包含 13 万条动作轨迹,涵盖700多个任务目标。
具体流程:当听到用户的简单指令如“帮我拿起桌子上的一瓶水”时,EfficientNet会接收图像信息,然后FiLM 层把语言指令与图像结合,输出token到Tokenlearner,并由其提取关键Token输送给Transformer,最后由 Transformer输出具体动作token序列,如关节旋转几度、电机如何运行等。
RT-1 是业界首个大规模部署的机器人端到端 Transformer 控制模型,实现了从感知输入到控制输出的全流 程统一。相比 SayCan 模块化架构,RT-1 提供了更高效率和更强适应能力的系统训练范式,大大简化了机器 人模型设计与训练流程。模型在厨房、实验室等家庭环境中实现了可扩展的多任务执行,平均任务成功率大 幅超过传统控制策略。
PaLM-E:多模态具身语言模型
PaLM-E 是 Google 于 2023 年发布的融合语言、视觉和传感器状态信息的大规模多模态语言模型,能够实现 具身智能任务中的高层推理与决策生成。其核心机制是在预训练的大语言模型(如 PaLM)中,注入来自视 觉、状态估计等模态的连续输入,统一转化为“多模态句子”(multimodal sentence),并作为 Transformer 解码器的输入。这些连续模态通过专门训练的编码器(如 ViT、OSRT、MLP)映射到语言 token 所在的嵌入 空间,与语言 token 共同组成输入序列,最终输出自然语言形式的回答或动作指令。
具体流程:面对“请把蓝色积木放在黄色积木上”的指令,PaLM-E 可生成一个多步文本决策:“1. 拿起蓝 色积木;2. 移动到黄色积木上方;3. 放下蓝色积木”。该文本决策随后由底层控制策略(如 RT-1)执行动 作。PaLM-E 在架构上实现了感知—语言—行动之间的自然耦合,具备端到端推理能力。
RT2:动作信息纳入VLM模型,构成端到端VLA
架构&输出:采用经动作信息训练的VLA模型,输出1-5Hz的动作序列。VLM模型以PaLM-X或 PaLM-E为骨干,经过上述方法训练后成为端到端的VLA模型。后者在应用中可直接分析经ViT处 理的图像信息和语言信息,最后视模型大小输出1-5Hz的动作序列。
具体流程:当听到“帮我从冰箱里拿一瓶水的指令时”,由VLM模型分析图像和语言信息,直接理 解任务要求,并输出如手臂旋转几度、电机如何运行的动作Token序列。其相较于RT1,主要结合 了PaLM-E推理和决策的优势,增强了对任务的理解能力。
π0/π0-Fast/π0.5:引入动作专家,输出50Hz动作轨迹
π0:采用VLM+动作专家,输出50Hz动作轨迹。π0由预训练的VLM(视觉模型SigLIP+LLM模型 Gemma)和使用Flowmatch模型的动作专家组成。图像信息经ViT后和语言信息一同输入给VLM, 经其处理后输入给动作专家,后者结合当前状态qt,输出50Hz连续动作轨迹。 π0-Fast:采用Fast算法+Transformer动作专家,训练时间缩短5倍。Fast算法先将动作轨迹用DCT (离散余弦变换)压缩,再由BPE(字节对编码)后生成离散动作Token,进而可将运动数据放入 动作专家模型中训练,实际应用中Transformer输出的动作Token经Fast解码后转为动作轨迹。 π0.5:采用内置策略规划器的VLA。类似π0-Fast,将VLM训练为VLA,同时内嵌任务分级模块。
Helix:快慢脑结构,输出200Hz动作序列
架构&输出:采用端到端的快慢脑架构,输出200Hz动作序列。Helix采用一个7B参数量的预训练 VLM作为慢脑,以及一个80M参数量的Transformer模型作为快脑。两个模型解耦,在实际应用中 以不同频率同时处理图像及语言讯息,慢脑负责思考高层目标,并以潜在向量指挥快脑,快脑负 责实时执行和调整动作,并输出200Hz动作序列。同时由于潜在向量的存在,快慢脑可进行梯度 回传,从而两者构成一个整体的端到端模型。 创新点:实现零样本多机器人协同以及拾取能力涌现。实验中,两台Figure 02使用Helix首次实现 了多机器人间的协作任务。同时,Figure发现,Helix涌现了拾取任意物品的能力。
3.未来大模型的发展方向是什么?
模态:融入更多模态,构筑世界模型
当前主流模型仅涵盖三个模态,未来扩展空间大。当前主流的机器人大模型多是VLA,即只包括 视觉、语言和动作三个模态,未来若想加强人形与世界的交互,构筑更真实的世界模型,或将需 要融入如触觉、温度等更多模态。
触觉或为下一个模态,VTLA已有相关研究储备。触觉的引入可助力VLA模型进一步泛化。通过 引入触觉这一关键信息,VLA模型可进一步延申为VTLA模型。目前包括戴盟、帕西尼在内的公 司已有相关VTLA技术储备,预计未来触觉将成为下一个融入模型的模态。
架构演进:引入“世界模型”作为核心推理机制
未来机器人通用大模型的架构演进方向之一,是将“世界模型”引入决策推理流程,作为具身智能的核心 支撑模块。 当前的大模型大多基于感知和语言指令直接生成动作,但缺乏对环境物理规律的建模能力,导 致其泛化性与高阶推理能力受限。世界模型(World Model)本质上是一类可以模拟环境动态的神经网络, 以 Cosmos 为代表的架构能够通过学习状态转移规律,基于当前状态与输入预测未来状态,实现“感知— 建模—预测—决策”的闭环认知。这类机制的引入有望赋予机器人“想象力”,让其不仅能看到当前、听 懂指令,更能推演未来,从而在面对复杂任务、多变环境时具备更强的适应能力与泛化能力。
世界模型:英伟达发布Cosmos世界模型平台
英伟达发布世界模型平台,提供大量仿真数据。25年1月,英伟达发布Cosmos 世界模型平台,上面有一系 列开源、开放权重的视频世界模型,参数量从 4B 到 14B 不等。这些模型的作用非常明确,就是为机器人、 自动驾驶汽车等在物理世界中运行的 AI 系统生成大量照片级真实、基于物理的合成数据,以解决该领域数 据严重不足的问题。Cosmos一共包括四大功能模块:扩散模型、自回归模型、视频分词器,以及视频处理 与编辑流程。
报告节选:



-
标签
- 机器人
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 4 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 5 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 6 房地产行业专题报告:城市更新推动高质量发展.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年上半年小红书六大热门行业消费趋势洞察
- 2 2026年7月A股回调归因与底部布局策略分析
- 3 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
