2025年机械设备行业分析:机器人大脑是商业化焦点,Sim2real或成主流训练方案

  • 来源:国盛证券
  • 发布时间:2025/10/28
  • 浏览次数:159
  • 举报
相关深度报告REPORTS

机械设备行业分析:机器人大脑是商业化焦点,Sim2real或成主流训练方案.pdf

机械设备行业分析:机器人大脑是商业化焦点,Sim2real或成主流训练方案。从LLM到VLM再到VLA等,模型将机器人泛化性、执行动作的精确度、物理感知等性能逐步提高。LLM解决了大规模文本数据训练问题,VLM跨模态突破了文本的限制将图像视频也融入至大模型中,VLA则跨越了图像视频/文本的感知理解与机器人动作之间的鸿沟。早期VLA更多侧重视觉信息的输入,随着越来越多用于人形机器人中,触觉(Touch,通过力/触觉传感器获取的压力/摩擦力/纹理等信息)输入端也被加入到模型中,这可以提升模型的鲁棒性。各类VLA模型的性能也在逐步提升:RT-1发布时只回答了数据集建构和模型设计问题,并没有表现过多的...

LLM/VLM 到 VLA 再到世界模型,人形机器人“大脑”发展迅猛

人形机器人的大脑是其核心控制系统,负责感知、理解、学习和决策等。机器人大脑主 要有高性能计算平台和人工智能算法组成,主要负责处理感知(整合来自视觉、触觉等 各类传感器的数据,形成对周围环境的全面理解)、决策(给出机器人执行任务所需的路 径)、学习(学习新的算法适应新的环境等)。大模型是人形机器人实现高级认知和决策 的关键技术,大模型从神经网络、深度学习以及 LLM 开始发展,其 LLM 的核心是基于 大规模文本数据训练的 Transfomer 架构(采用注意力机制),LLM 通过学习语言的统 计规律与语义关联,实现对自然语言的深度理解、生成和推理。LLM 本身不可以识别图 像,但可以通过与图像编码器等组件结合为多模态模型,GPT 系列、文言一心等均为 LLM 模型。

VLM 是多模态模型,可以同时识别图像和文本,跨模态融合突破了文本的限制。LLM 仅 专注于单一文本模态,输入和输出均为自然语言,训练依赖于海量文本,基于Transformer “仅解码器”或“编码器-解码器”结构,无法直接处理图像、视频等视觉信息。VLM 创 新性的解决了这个问题,支持视觉+语言双模态,输入是图像/视频+文本,输出通常是 文本,VLM 的架构通常由视觉编码器(处理图像,CNN 或者 Vision Transformer)和语 言模型(处理文本,如 Transformer 解码器)共同组成,关键是设计注意力机制、特征 映射等跨模态融合模块,让视觉特征与语言特征能相互理解。

RT-1 是具身智能 VLA 模型早期的重要探索,为后续 VLA 模型诞生奠定了基础。大部 分 VLM 更多做的还是静态图像工作,而人形机器需要的是闭环的动作图像和执行精准的 动作,无法满足人形机器人的控制需求。RT-1 创新性的引入了“预训练”(复用已有通 用模型的预训练参数)和“微调”(在预训练基础上,用机器人专用数据集如“RT-1 的 13 万条操作数据”进一步训练模型)的范式引入了机器人控制领域,将语言和视觉观测 到机器人动作的映射视为一个序列建模问题,并利用 Transformer 学习该映射。但 RT-1 模型并没有表现出过多的泛化性、动作更多的也是以离散指令呈现,也只是回答了数据 集构建和模型设计问题,样本也无法迁移到完全不认识的地方。

Google deepmind 于 2023 年 7 月提出的 RT-2 是全球首个 VLA,标志着 VLA 的范 式正式确立,是人形机器人史上极大的一步。基于强大的 VLM 模型,RT-2 在 RT-1 上进 行了升级,不仅包含了视觉、语言和机器人动作三个维度,还创新性的将机器人动作离 散化为文本 token,与视觉语言数据联合训练,并将这一类模型成为 VLA 模型。RT-2 极 大的提升了机器人的泛化能力和对人类指令的理解能力,但依然存在不足,如动作技能 受限于训练数据中演示过的动作,无法学习分布外的动作,计算成本较高,数据收集成 本高等,成本也在一定程度上限制了模型的进一步优化和拓展。

Magma 是微软研究院 2025 年 2 月联合众多大学发布的多模态 AI 模型,是首个能够 在其所处环境中理解多模态输入并将其与实际情况相联系的基础模型。Magma 只需要 一个描述性任务就可指定计划、执行行动以达成目标。创新的采用了独特的“可标记集” (Set-of-Mark,SoM)和“轨迹标记”(Trace-of-Mark,ToM)技术,通过对视频、图像 等多模态数据训练,能够理解目标物体的物理位置、动作的时间序列逻辑,并在不同环 境中都可完成连贯任务,但其仍需要从已有的机器人视频中训练。

微软研究院 25 年 9 月联合清华大学等机构提出了新型 ViLLA(视觉-语言-潜动作)框 架。Villa-X 的核心设计围绕潜在动作建模与动作整合机制展开,通过潜在动作模型(LAM) 和 Actor 模块(ACT)两个核心组件实现机器人操作策略学习,该框架采用无标注的视频 数据来训练机器人。Villa-X 解决了之前机器人生产的潜在动作可能不符合机器人物理动 力学基础的问题,解决了机器人动作不够精准、动作和视频图像文本之间存在鸿沟、跨 机器人泛化能力不够强等问题。 两个核心组件的功能:1)在 LAM((感知编码器)中引入本体感知前向动力学模块(FDM) 和逆向动力学模型(IDM),前者基于当前帧和潜在动作预测未来帧,确保潜在动作捕捉 到视觉变化,后者以当前机器人状态和潜在动作作为输入,预测未来的机器人本体感知 状态和动作,增强跨机器人泛化能力;2)ACT 是 Villa-X 的“决策大脑”,接收语言指令 和视觉观察,分两步生成最终可执行的机器人动作,从 VLM 中接受任务指令和初始视觉 观察并提出高维特征,ACT-latent 模块以 VLM 的输出为条件,生成一个未来的潜动作序 列。最后 ACT-robot 模块同时接收 VLM 的输出和 ACT-latent 生成的潜动作序列,最终生 成可执行的机器人动作序列。

Google 在近两年发布的 Gemini 系列大模型性能持续优化,2025 年 9 月发布的 Gemini Robotics 1.5 系列更是将 AI 世界带入物理世界。谷歌 2025 年 5 月发布的 Gemini Robotics 大模型以 Gemini 2.0 为基础进化而来,核心目标是将多模态大模型的 能力从虚拟延伸至现实。Gemini 2.0 具备多项机器人相关的关键能力,例如对语义安全 的理解能力,以及处理长上下文信息的能力。Gemini Robotics 大模型进一步升级:不仅 能生成灵活且具备反应性的动作,还可快速适配不同形态的机器人,并借助先进的视觉 空间推理能力,为自身行为提供精准指导。Gemini Robotics 还推出了 On-Device(设备 端)版本,无需依赖网络即可运行,尤其适用于对延迟敏感的应用场景;Gemini Robotics 1.5 系列已经具备思维能力,且可以在不同机器人中直接迁跃而无需调整,擅长在物理环 境中进行规划与逻辑决策,拥有顶尖的空间理解能力。

针对图像视频/文本解耦到机器人精细动作上的鸿沟,业界则采用了多种中介机制进行 尝试:1)RT-1 将“预训练”和“微调”引入机器人控制领域,将语言和视觉到动作映 射为离散指令;2)RT-2 则将动作离散化为文本 token,并于视觉语言一起训练;3)Magma 则采用“可标记集”和“轨迹标记”进行训练则可正确理解动作的时序问题;4)Villa 架 构则引入 LAM 和 ACT 两个核心组件来作为视觉文本和动作的中介渠道。机器人模型终 局形态或为世界模型,即将 AI 世界带入物理世界,使机器人具备思维能力和顶级空间 能力。如微软发布的 Gemini Robotics 1.5 系列模型和宇树科技发布的世界模型 UnifoLMWMA-0。

全球人形机器人模型各异,Tesla optimus 模型拟人化程度高

Tesla optimus 的核心技术在于 AI 集成,其 AI 系统高度借鉴 Tesla FSD 技术,并与 xAI(Tesla 子公司)的 Grok 模型深度融合。Optimus 采用 FSD 为其做双足导航,实 现自主运动和复杂环境交互。FSD 中有较多东西可以直接复用至 Optimus:1)两者共享 底层神经网络结构,采用 MOE 架构作为机器人技术的核心框架,通过场景化参数激活实 现差异化功能;2)Optimus 复用了占用网络模型(Occupancy Network);3)FSD 已经 积累了大量数据,可以直接用于 Optimus 训练;4)FSD 可以更快速、智能的规划出最有 运动路径,提升机器人灵活性和适应性等。 Tesla 的 FSD 纯视觉方案和传统端到端单一神经网络是其技术的核心:1)纯视觉方案: 车辆采用 8 个环绕摄像头,摄像头以一定的帧率采集原始图像,通过时间序列构建环境 模型,该方案模仿人类视觉系统,通过多摄像头立体视觉计算深度信息,利用动态遮挡 推理和时序关联提升距离估算精度;2)端到端神经网络:原始图像输入后,采用 HydraNet 多头网络结构进行多尺度特征提取和融合,通过 BEV 进行空间转换构建网络空间理解能 力,引入时间对齐算法机制让系统具备短时记忆能力,最后采用占用网格预测规划和输 出最后决策。

Tesla 将 xAI 开发的 Grok 大模型用于 Optimus,将有助于机器人更加拟人化。Optimus 借鉴的 FSD 针对机器人形态进行了优化,能够同时处理视觉、触觉、音频和运动等多种 模态的数据,从原始传感器数据直接生成行动指令。此外,Optimus 还是用了 xAI 开发 的 Grok 大模型,Grok 是一种创新的人工智能模型,它将复杂的推理与直观的自然语言 处理相结合,可用于高级推理训练,如自然语言处理和情感互动,能使 Optimus 具备更 自然的语言交互能力,不仅能执行预设指令,更能理解复杂语义,在动态场景中做出更 智能的响应。Tesla 强有力的竞争力除了 AI 算法以外,还包括但不限于拥有巨大的超级 计算集群 Cortex、自研的硬件如 AI5/6 芯片等,我们认为 AI5/6 的芯片决定着 Optimus 后续走向。

Tesla 从模仿学习到视频学习到世界模型,一直做难而正确的事情。最开始的遥操作只 适用于某一些 B 端条件可控的场景,到后来的模仿学习,人形机器人模仿人类的动作仍 存在较大的局限性。而后 Tesla 转向了视频学习,视频来源则为 youtube 等网站的视频, 简单机制可以理解为(起步阶段重点还是第一视角):看到视频中在拿某个物体后,通过 逆向动力学模型得到初始的预测控制指令,如扭矩、速度等,然后再通过强化学习,一 直给奖励函数,让机器人的动作和视频的动作能够一致,这种学习方式可以使得算法在 不同机器人中迁移,且对空间有强感知。为了更进一步让 AI 模型认知道机器人的状态 (比如手脚有多长等),以及做出的任何事情都符合物理学原理,我们认为下一步大模型 架构方向或为世界模型。

智元启元大模型(GO-1)开创性地提出了 Vision-Language-Latent-Action(ViLLA) 架构,该架构由 VLM((多模态大模型)+MoE((混合专家)组成。其中 VLM 借助海量互 联网图文数据获得通用场景感知和语言理解能力,MoE 中的 Latent Planner(隐式规划 器)借助大量跨本体和人类操作视频数据获得通用的动作理解能力,MoE 中的 Action Expert((动作专家)借助百万真机数据获得精细的动作执行能力,通过这种方式,GO-1 可以结合互联网视频和真实人类示范进行学习,增强模型对人类行为的理解,完成小样 本快速泛化,降低了具身智能门槛,并成功部署到智元多款机器人本体,持续进化,将 具身智能推上了一个新台阶。

与 VLA 架构相比,ViLLA 通过预测 Latent Action Tokens,弥合图像-文本输入与机 器人执行动作之间的鸿沟,该模型在真实世界的灵巧操作和长时任务方面表现卓越。在 推理时,VLM、Latent Planner 和 Action Expert 三者协同工作:VLM 接收视觉图像、文 本等多模态信息并感知、理解,随后 Latent Planner 基于 VLM 的中间层输出预测 Latent Action Tokens 作为输出动作的规划链,最后 Action Expert 基于 VLM 的中间层输出以及 Latent Action Tokens 生成最终的精细动作序列。

Helix 是 Figure AI 公司于 2025 年 2 月发布的一款端到端人形机器人 VLA 通用大模 型,其工作机制主要基于“系统 1”与“系统 2”的双层解耦架构,通过神经网络实现, 可直接输出高维连续动作,具体如下:helix 由 S1 和 S2 两个系统组成,系统 2((S2)是 基于互联网预训练的视觉语言模型(VLM),以 7-9Hz 的频率处理场景理解和语义推理; 系统 1(S1)是高速反应式视觉运动策略,以 200Hz 的频率将 S2 的语义分析结果转化 为精确的连续动作。这种解耦架构使得 S2 可以“慢慢思考”高级目标,S1 可以“快执 行”,两者协同工作,让 Helix 既能应对复杂情境的泛化需求,又能实时执行动作。同时, 由于 S1 与 S2 的解耦设计,二者可独立优化,无需重新调整整体模型,降低了模型升级 的复杂性。

Helix 可以通过语言指定机器人获取新技能,而无需像原来那样,随着学术人员写脚本 或者是收集大量数据训练获得。Helix 具备高性价比,不需要大量参数,高效的执行能力, 强大的场景和语言能力,独立优化的灵活性等优点。

宇树科技于 2025 年 9 月推出的 UnifoLM-WMA-0 旨在为通用机器人学习提供统一的 技术基础,核心在于一个能够理解机器人与环境交互物理规律的世界模型。UnifoLMWMA-0 是 Unitree 的开源世界模型-动作架构,涵盖多种类型的机器人实现,专为通用机 器人学习而设计。其核心组件是一个能够理解机器人与环境之间物理交互的世界模型。 这个世界模型提供两项关键功能:1)模拟引擎——作为交互式模拟器运行,生成用于机 器人学习的合成数据;2)策略增强——连接动作头,通过预测未来与世界模型的交互过 程,进一步优化决策性能。

UnifoLM-WMA-0 架构提出了一种嵌入世界模型的策略架构。该框架使世界模型能够 以两种模式运行:1)决策模式:预测未来物理交互的信息,以协助策略生成动作。2) 模拟模式:根据机器人动作生成高保真环境反馈。该模型仍然具有局限性,如仿真数据 与现实之间存在差距无法直接迁移,数据质量和数量也会限制该模型的发挥,以及在复 杂环境中适应性仍然不足。

北京通用智能人工研究院提出首个统一的力位混合控制算法,能够在无需力传感器的条 件下,同时学习位置与力的控制。该算法通过强化学习,训练策略从机器人历史状态中 估计力,并借助位置与速度调整进行补偿,从而模拟多种位置、力指令及外部扰动。该策略可实现位置跟踪、施力、力跟踪和柔顺交互等多种操作行为。此外,力估计模块引 入的接触信息提升了基于轨迹的模仿学习效果,在四项接触丰富的操作任务中,成功率 比仅使用位置控制的策略提高约 39.5%。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至