人形机器人的技术进展如何?

人形机器人的技术进展如何?

最佳答案 匿名用户编辑于2025/02/05 14:39

人形机器人技术高度集成,多角度实现对人模仿 。

从技术角度来看,人形机器人主要由“大脑”、“小脑”和“肢体”三 个部分组成。其中,“大脑”负责实现环境感知、行为控制、人机交互 等任务级能力,目前主要是基于人工智能大模型技术,同时也可通过 云边协同,提高机器人的智能水平。“小脑”负责控制人形机器人的运 动,目前主要基于人工智能、自动控制、机器人操作系统(ROS,Robot Operating System)等技术,实现复杂环境下的运动控制。“肢体”负责 实现高动态、高爆发、高精度运动,集成了人体运动力学、机械结构 设计、新材料、传感器等诸多技术,包括仿人机械臂、灵巧手、腿足 等关键结构,并通过集成传感器和长续航动力单元,实现能源-结构感知一体化。

全球方面,目前美国特斯拉、Figure AI、波士顿动力已成为国外 人形机器人整机产品第一梯队,其他 1X、Digit 等欧美产品为第二梯 队。整体上看,其产品智能化水平和综合性能较高,特斯拉和亚马逊 的产品已步入场景测试阶段。 特斯拉 Optimus 系列机器人。特斯拉公司于 2022 年 10 月正式发 布 Optimus 第一代(Gen 1),使用了与特斯拉电动车相同的 FSD 系 统,具备强大的计算机视觉处理能力。Optimus Gen 1 身高约 173 厘 米,重量约 73 公斤,采用全电驱动,具有行走、挥手和跳舞等功能。 在结构方面,Optimus Gen 1 身体具有 28 个自由度,包括 14 个旋转 自由度和 14 个线性自由度。在此基础上,其灵巧手具有 6 个主动自 由度和 5 个被动自由度。2023 年 12 月,特斯拉发布了 Optimus 第二代(Gen 2),重量减轻到 63 公斤,颈部增加了 2 个自由度,步行速 度提升了 30%,平衡感和身体控制能力得到改善,能够完成非平坦地 形下的行走,包括爬楼梯等复杂动作。精细操作方面,Optimus Gen 2 的所有手指都配备了触觉传感器,能够轻松准确地抓取和放下鸡蛋, 展示出精巧的双手操控能力。

波士顿动力 Atlas 系列机器人。波士顿动力公司于 2013 年发布 的第一代 Atlas 人形机器人由外置电驱动液压动力系统提供动力,高 183 厘米,全身 28 个液压驱动关节,能够实现碎石路面下的稳定行 走。2016 年发布的配备了机载液压动力系统的 Atlas 机器人,能够实 现雪地、山地行走,可在倒地后迅速起身,并具备双臂协同搬运重物 的能力。后续,该系列机器人完成了立定跳跃、跳高、跳转身、后空 翻、慢起手倒立、前滚翻、前空翻、原地 180°空中转体、分腿跳、360° 空中转体等一系列能力。2024 年 4 月,波士顿动力宣布液压版 Atlas 退役,并推出了纯电驱的新款 Atlas 机器人,能够完成稳定的行走、 起身和 180°头部、腰部旋转等动作。

Figure AI 公司系列人形机器人。2023 年 3 月 14 日,Figure AI 发 布的人形机器人 Figure 01,利用 OpenAI 的大型语言模型,可以与人 类进行正常的完整对话,并具备分类识别物品的能力,被认为是世界 上第一个具有商业可行性的自主型人形机器人。2024 年 8 月 6 日 Figure AI 发布的新一代产品 Figure 02,与上一代相比,Figure AI 拥 有 16 个自由度的第四代机械手,负载能力与人类水平相当,可以抓 取 25 公斤的物体,比上一代增加 5 公斤。同时,Figure 02 的机载计算和 AI 推理能力提高了 3 倍,能够完全自主地在现实世界中执行任 务。 相比之下,国内企业采用“整机集成、关键零部件自研”的路线, 快速推进整机产品迭代,产业迅速发展,产品不断涌现。目前,已发 布数十款人形机器人产品,具备较为稳定的行走、跑跳、站起等基本 功能,在技术方面已有一定积累,与国外无明显代际差异。优必选的 Walker S1 在环境感知与物品抓取方面取得了一定进展,已进入比亚 迪工厂实训,与 L4 级无人物流车、无人叉车、工业移动机器人和智 能制造管理系统协同作业。

“大脑”技术路线并行探索,具备初阶人类脑力。 1.大模型是现阶段“大脑”的最佳解决方案 目前人形机器人“大脑”技术以大模型为核心,为人形机器人提供 任务级交互、环境感知、任务规划和决策控制能力。在任务交互方面, 基于大模型的语言/视觉运行处理方式可为人形机器人提供任务级交 互入口。在环境感知方面,大模型通过对多模态信息的统一处理与灵 活转换,推动多模态感知泛化。在任务规划方面,大模型潜在的真实 世界知识学习能力、强大的思考、推理和生成能力为“大脑”的任务规 划提供基础。在决策控制方面,人形机器人基于大模型技术并优化奖 励策略,通过整合环境、运动等多样化信息,实现决策控制功能。从 功能需求角度出发,人形机器人的“大脑”大模型需要具备以下能力: 实时交互能力。人形机器人需要具备与人类实时的任务级交互能 力,快速理解人类通过语言、手势等方式给出的指令,并有效执行。当出现指令理解不清或任务执行完毕后,可以与人类进行进一步的多 轮交互。

多模态感知能力。为了在复杂环境中做出正确决策,人形机器人 需要能够通过视觉、听觉、触觉等多种感官获取信息。大模型需要整 合这些多模态感知数据,以实现对环境的全面理解。 自主可靠决策能力。人形机器人在执行任务时,需要能够理解任 务的复杂性,并将其分解为一系列可执行的子任务。这要求大模型具 备强大的语言理解能力和对物理世界的深刻理解。例如,机器人可能 需要理解“清理房间”这一任务,包括识别哪些物品需要移动,哪些需 要丢弃。 涌现和泛化能力。除了在训练数据上的表现,大模型还应具备超 出训练范围的执行能力。具体表现为人形机器人能够在未见过的新环 境中执行任务,适应新的、未知的情况。面对新挑战时,展现出创新 性的解决方案。

2.人形机器人大模型多技术路线并行探索 从技术路线上看,目前基于大模型的“大脑”技术路线正处在并行 探索阶段,并逐渐向端到端的大模型演进。现阶段主要是 4 条技术路 线,一是 LLM(大语言模型)+VFM(视觉基础模型),实现人机语 言交互、任务理解、推理和规划,目前最为成熟。主要代表是谷歌的 SayCan 模型,通过预训练技能的价值函数对齐(Grounds)大语言模 型或者通过价值函数的训练使大语言模型对用户指令进行推理分解 获得任务步骤。二是 VLM(视觉-语言模型),弥合语言与视觉理解间的差距,实现更准确的任务规划和决策。主要代表是清华大学的 CoPa 模型,利用嵌入在基础模型(比如视觉语言模型的代表 GPT-4V)中 的常识知识为开放世界机器人操控生成一系列的自由度末端执行器 姿势,生成的操控任务分为任务导向抓取和感知运动规划。三是 VLA (视觉-语言-动作模型),在 VLM 基础上增加运动控制,解决机器人 运动轨迹决策问题。主要代表是谷歌的 RT-H 模型,学习语言和运动, 并使用视觉上下文,通过利用语言-视觉-动作结合的多任务数据集学 习更强大和灵活的动作策略。四是多模态大模型,实现对物理世界环 境的全面感知,是未来的主要研究方向。主要代表是麻省理工、IBM 等共同研究的 MultiPLY 模型,将视觉、触觉、语音等 3D 环境的各类 特征作为输入,以形成场景外观的初步印象,并通过多视图关联将印 象中的输出融合到 3D,最终得到以对象为中心的场景特征。 此外,类脑智能和脑机接口等创新技术也为人形机器人“大脑”的 解决方案带来无限可能。类脑智能是人工智能技术的进一步延伸,是 通过对人脑生物结构和思维方式进行直接模拟,使智能体能够像人脑 一样精确高效处理多场景下的复杂任务,是未来有望代替大模型的新 技术路线。脑机接口是在人脑与外部设备间建立连接通路的技术,实 现人脑与外界设备的信息交换。未来有望基于脑机接口实现“大脑”的 “人+机”混合智能。

3.人形机器人“大脑”向更高级的智能化和自主化发展 当前,人形机器人“大脑”刚刚具备初阶人类脑力,仅能完成人的 部分工作,无法形成人类大脑全能力闭环。同时,其情感表现属于模拟层面,不具备情感理解能力。基于大模型的“大脑”技术发展主要受 限于数据和训练平台。数据方面,由于真实数据采集难度大,仿真数 据保真度和规模有限,较难形成“数据飞轮”效应。平台方面,“大脑” 的研究涉及数据采集、模型开发部署和仿真环境测试的整个流水线链 路,需要强大的通用计算平台提供大规模计算支撑和通用服务能力。 人形机器人作为人工智能的前沿应用领域,其发展速度令人瞩目。然 而,要实现真正的智能化和自主化,现有的大模型仍需在多个方面重 点发力。 一是在感知模态维度方面形成突破。当前的人形机器人大模型主 要依赖于视觉或语音感知,这种单一的感知模态在处理复杂环境时显 得力不从心。例如,在嘈杂的环境中,仅凭视觉信息,机器人可能难 以准确识别和响应。为了克服这一局限,未来的大模型需要整合视觉、 听觉、触觉等多种感知模态。多模态感知能够提供更丰富的环境信息, 使机器人在复杂场景中做出更准确的决策。例如,结合听觉和触觉信 息,机器人可以更好地理解人类的指令和情感状态。

二是在指令生成速度与复杂性方面形成突破。现有的大模型在生 成指令时速度较慢,且生成的结果往往过于简单。这在需要快速反应 的场景如紧急救援或复杂操作任务中,可能导致机器人无法及时作出 正确响应。目前主流机器人大模型偏向于任务理解和拆分,对于机器 人运动控制的涉及较少,只是用预设的端到端的训练方式生成了简单 且离散分布的机械臂末端位置和底盘移动指令,未渗透到连续路径和 轨迹规划等更偏机器人领域的内容。三是在泛化能力提升与模型架构优化方面形成突破。泛化能力是 大模型在新环境和新任务中表现的关键。当前的模型在泛化能力上仍 有待提高,尤其是在面对未知环境和任务时,模型的表现往往不尽人 意。为了提高泛化能力,未来的大模型需要在架构、训练方法和数据 集方面进行创新。例如,通过引入元学习、迁移学习等技术,可以使 模型更好地适应新任务。同时,构建更多样化的数据集,也有助于模 型学习到更广泛的知识。

参考报告REPORT

人形机器人产业发展研究报告(2024年) .pdf

人形机器人产业发展研究报告(2024年)。人形机器人作为未来产业的重要赛道,是科技自立自强的标志型成果,是人工智能、机械工程、电子工程等领域融合创新的典范,也是实现新质生产力的最佳手段之一。人形机器人凭借其类人的感知交互能力、肢体结构和运动方式,能够快速融入为人类设计的各种环境,未来有望在简单重复劳动和危险场景中替代人类,在复杂技能场景中辅助人类,在商业和家庭场景中服务人类。可以预见,未来人形机器人的广泛应用将深刻改变社会形态和人们的生产生活方式,已成为全球科技领域的发展热点。业界普遍认为,人形机器人未来有望成为继个人电脑、智能手机、新能源汽车后的新终端,形成新的万亿级市场。本报告从人形机器人...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至