2023年机械设备行业专题研究:人形机器人需要怎样的大模型?
- 来源:华泰证券
- 发布时间:2023/12/05
- 浏览次数:281
- 举报
机械设备行业专题研究:人形机器人需要怎样的大模型?.pdf
机械设备行业专题研究:人形机器人需要怎样的大模型?机器人大模型的最终目标是提高人形机器人在不同场景和任务下执行的成功率。对于限定的应用场景和任务,从决策层、感知层和执行层三个角度出发,大模型需要具备自主可靠决策能力、多模态感知能力和实时精准运控能力;为了拓展到多样复杂的应用场景和任务,大模型还需要具备泛化能力和涌现能力。目前大模型不断迭代,已出现包含多种能力的“全能选手”,但仍存在感知模态不足、实时性差和泛化能力弱等问题。未来需要不断优化训练模型结构、训练方法和数据集,将多模态感知信息纳入模型,同时提高控制指令的生成速度和大模型的泛化和涌现能力。人形机器人长期存在高需求...
人形机器人商业化痛点:通用性受限
高需求+低供给的商业化矛盾长期存在
高需求:人形机器人的潜在应用场景广泛。在工业生产中,人形机器人可应用于汽车、3C 等行业,替代人类完成组装和质检等重复枯燥的任务;在日常生活中,人形机器人可以提 供打扫卫生、做饭、照顾老人和教育小孩等多种服务;此外,人形机器人还可以替代人类 完成灾难救援等危险性任务。目前全球范围内人口老龄化问题正在加剧,劳动力成本不断 提升,未来人形机器人市场空间广阔。
低供给:绝大多数人形机器人未实现商业化落地。早在 1973 年早稻田大学就研发出世界上 第一款全尺寸人形机器人 Wabot-1;同样为了实现人形机器人领域的梦想,本田于 1986 年 开始秘密研发机器人双足结构,经过多次迭代后,本田正式于 2000 年推出 Asimo 机器人, 后由于 Asimo 年租金高达 2000 万日元,难以商业化应用,本田研发团队于 2018 年解散; 波士顿动力 Atlas 也迟迟未实现大规模商业化应用;特斯拉 Optimus 的最新进展是能够依 靠视觉对物体分类并完成瑜伽动作,也未能大规模商业化应用。目前绝大多数人形机器人 并未实现大规模商业化落地。
通用性受限导致商业化落地困难
我们认为通用性受限是人形机器人长期面临高需求和低供给现象的原因。依托于工业机器 人的快速发展,执行类零部件的成本在人形机器人大规模放量后有望显著下降,因此我们 认为硬件成本高昂并不是人形机器人长期面临高需求和低供给现象的原因。早稻田大学 Wabot、本田 Asimo 以及波士顿动力 Atlas 代表了早期各家企业在人形机器人领域的探索。 Wabot 受限于当时的技术水平,运动能力较差;本田 Asimo 运动能力、智能化水平有所提 高,但由于应用场景限制,难以大规模推广;波士顿动力 Atlas 的运动性能进一步提高,但 也未实现大规模应用。我们认为,人形机器人追求极致的运动性能意义有限,其未能大规 模商用的核心原因是通用性受限。 通用性受限体现在目前机器人对用户主体专业要求高和应用场景局限。1)用户主体:传统 人形机器人偏向于是一种可编程的专用设备,需要高级算法工程师进行编码设定才能正常 运控,普通用户难以直接参与。如果普通用户能与人形机器人实现交互,将会大大降低使 用门槛,进而促进人形机器人走向大规模应用;2)应用场景:人形机器人的应用场景不能 仅局限于训练场景,还需要能够在开放式的复杂环境中完成各种任务。早期波士顿动力的 Atlas 虽然能够完成后空翻等高难度动作,但是其在用户主体和应用场景方面均有欠缺,一 方面其需要机器人工程师进行控制,普通人难以直接使用;另一方面,Atlas 最初是面向灾 难救援进行设计,并且存在维护困难、漏液等问题,可靠性较差,应用场景受限。
通用性如何拓宽:大模型充当大脑实现任务级交互
硬件 vs 软件:硬件不是掣肘,软件为发展正循环的第一步
硬件不是掣肘,软件阻碍机器人通用性的提升。2013 年波士顿动力基于早期的 PETMAN 设计了面向灾难救援的 Atlas 人形机器人。经过多次迭代后,Atlas 已经脱离了外接电源, 通过电液混合驱动结合 IMU、编码器、摄像头、激光雷达和力传感器实现了跳越、后空翻 等高难度动作,在运动能力上远超近年来发布的人形机器人。但这些动作都源自提前创建 的行为库。因此我们认为,硬件并不是机器人通用性的掣肘,软件限制了机器人应用场景 的推广,阻碍了其通用性的提高。
软件升级是实现人形机器人发展正循环的第一步。我们认为人形机器人的发展存在正循环, 其包含三个阶段:1)软件升级后,机器人通用性提高,人形机器人实现初步商业化落地; 2)规模化商用后,规模效应下,硬件成本降低,企业投入更多研发资金;3)更多的研发 投入促进软硬件迭代升级,人形机器人性能提升后,将进一步打开应用空间。因此,我们 认为,目前阶段软件升级迫在眉睫,机器人通用性提高后,实现商业化落地,才能真正实 现形机器人发展的“正循环”。

大脑 vs 小脑:大脑负责任务级交互,小脑负责低层级运控
机器人控制软件可分为 5 个层级,任务级为最高层级。机器人控制框架一般采用层级控制 (Hierarchical Structure)方法,根据《Robotics : Modelling, Planning and Control》和 2023 年 8 月珞石机器人 CTO 韩峰涛在专栏文章中的描述,我们将机器人控制层级分为任务级、 技能级、动作级、基元级和伺服级。任务级包括任务定义与描述、任务分解与动作拆分等; 技能级负责将拆分后的动作转化为符号指令;动作级、基元级和伺服级属于传统工业机器 人的范畴,包括控制、执行、反馈等环节。 实现任级级交互可大大提高人形机器人通用性。以“去接一杯水”为例,实现这一动作需 要在不同层级上实现不同的任务。任务级:1)任务定义与描述:去接一杯水;2)任务分 解与动作拆分:把从拿杯子、打开水龙头到接水的过程拆分为一个个的细小动作;技能级: 3)生成符号指令:将一系列动作用计算机编程语言表示;动作级/基元级/伺服级:4)控制 -执行-反馈:根据符号指令完成一系列动作。在传统机器人中,前三步由机器人工程师完成, 只有第四步是机器人自主完成,实现任务级交互后,前三步可由机器人自主完成,用户只 需要发送任务指令即可,用户主体从工程师变为普通用户。同时,传统机器人需要根据不 同场景进行特定编程,实现任务级交互后,人形机器人可以在开放式场景中自主完成各类 任务。
类比人体结构,“大脑”是实现机器人任务级交互的主力军。在人体结构中,大脑主要负责 抽象思维和感知协调,与机器人任务级交互的功能相似;小脑和脑干主要负责维持躯干平 衡、控制姿态和步态,与动作级、基元级和伺服级的功能相似。以智元机器人为例,其 EI-Brain 可分为云端超脑、大脑、小脑、脑干,其中大脑负责完成任务级和技能级的调度,小脑负 责指令级的调度,脑干负责伺服机的调度。
大模型为人形机器人理想大脑,可提升人形机器人通用性
大模型的能力与任务级交互的要求相匹配,为人形机器人理想“大脑”。以 LLM 大语言模 型为例,其具备多个领域的基础知识、强大的内容生成能力、良好的上下文理解、自然语 言连续对话能力和强大的小样本学习能力,可以与任务级交互中的任务描述、任务分解、 运行代码生成和任务过程交互等要求相匹配。我们认为,大模型为人形机器人理想的“大 脑”。
大模型较传统 AI 模型有更强的泛化能力,可提高人形机器人通用性。在算法中,整个世界 及规律犹如一座山脉,而小模型只是其中的一个小山包,无法看到小山包之外的东西。大 模型提供了整个山脉的抽象信息,而不是具体的地理数据,这些抽象信息基于自然语言和 符号进行训练,因此大模型可以解决边角场景、OOD 泛化性问题。以往的 AI 模型多是特 定领域的专用模型,拓展新场景应用需要再经过一边“数据收集-标注-训练-部署-应用”的 流程,很难应用在周围环境频繁变化的场景下。而大模型的出现,让成本较高的垂直领域 AI 开发,变成了“训练大模型+特定任务微调”的形式,大幅提高了开发速度,可提高人形 机器人在不同场景和任务下的执行成功率,从而提高人形机器人的通用性。
大模型终需具备自主可靠决策+多模态感知+实时精准运控能力
机器人大模型的最终目标是提升机器人在不同场景和任务下执行的成功率。人形机器人作 为具身智能的理想载体,不仅需要在“任务层”上将一项具体的任务拆解为一项项具体的 子任务,还需要切实地执行这些子任务,实现与物理世界的交互,因此机器人大模型的执 行成功率是衡量机器人智能化程度的重要指标。
为了提升执行成功率,大模型需要具备以下 3+2 种能力: 对于限定的应用场景和任务,需要具备: 1. 自主可靠决策能力:大模型需要结合任务基础和物理基础,自主地将高层级的任务分解 为可执行/可靠的子任务。任务基础提供了任务的目标和方向,包括大模型对高层级语 言指令的理解,对完成该任务一般步骤的掌握,需要具备强大的语言理解能力和常识积 累;物理基础用于判断完成子任务的可能性,包括大模型对外部环境的感知、对自身状 态的监控和对物理规则的理解,需要具备强大的感知能力和物理理解能力。 2. 多模态感知能力:大模型需要具备丰富的外部感知(视觉、听觉、触觉等)和内部感知 (力矩、IMU 等),以便获取外部环境和自身状态等信息,并基于获取的信息,做出正 确的决策。同时,感知的获取不是静态的,在运控的过程中,需要实时实地获取、理解 和关联这些感知信息,才能更好的完成与环境的物理交互。 3. 实时精准运控能力:大模型需要以任务目标为导向,结合动态反馈的多模态感知信息, 实时精准地完成运动控制。人形机器人运动控制需要具备实时性和精准性,两者共同决 定人形机器人运动控制的效率和质量。实时性是指机器人接收到控制指令后,能够在极 短时间内做出反应并完成动作,例如人形机器人在执行任务时,若遇到障碍物,需要及 时做出规避动作;精准性是指机器人执行动作的精准度,包括位置精度、速度精度和力 矩精度等,需要大模型具备较强的计算能力。
面对多样复杂的应用场景和任务,需要具备: 4. 泛化能力:泛化是指模型在新的对象、背景和环境下的适应能力,例如机器人在一个环 境中学会了如何开门,之后即使门的形状、大小和开门方式不同,也能够完成开门这一 动作。大模型预训练的数据集是在限定场景中收集的,不可能包含现实世界中所有的应 用场景,因此大模型需要具备泛化能力,来面对纷繁复杂的现实世界。 5. 涌现能力:涌现是指模型表现出机器人训练数据之外的任务执行能力,例如在 RT-2 中 符号理解、推理和人类识别三类不在训练数据中的涌现任务,RT-2 也能以较高的正确 率完成。经过多种机器人多场景数据训练的 RT-2-X 涌现能力约为 RT-2 的 3 倍,可以 完成的动作指令从绝对位置(存在于训练数据中)拓展至相对位置(训练数据中未出现)。

目前进展:大模型不断迭代升级,拓宽能力圈
我们按照大模型发布时间,依次对多个主流机器人大模型的能力进行拆解: 1. SayCan:为实现自主可靠决策做出贡献,将 LLMs 引入到机器人决策中,可将高层级 任务拆分为可执行的子任务; 2. Gato:为实现多模态感知做出贡献,将多模态的信息 token 化,输入到 transformer 架 构中; 3. RT-1:为实现实时精准运控做出贡献,基于包含机器人轨迹数据的 transformer 架构, 可以输出离散化的机器人动作 token,同时收集了大量的机器人数据; 4. PaLM-E:将自主可靠决策和多模态感知两种能力相结合,将多模态信息以类似语言序 列的方式,输入到预先训练的 LLMs 中,得到 VLM(视觉语言模型),输入端为多模态 信息,输出端为文本决策; 5. RoboCat:最重要的贡献是可以自主生成训练数据集,其将多模态模型 Gato 与机器人 训练数据集相结合,可以实现自我学习; 6. RT-2:有机结合 5 种能力,将 token 化后的机器人数据输入到 VLM 模型中,得到 VLA (视觉-语言-动作模型),不仅实现了自主可靠决策、多模态感知和实时精准运控能力 的结合,同时展现出泛化能力和涌现能力; 7. RT-X:5 种能力全面提升,在保留 RT-1 和 RT-2 原有架构的基础上,经过多种机器人 多场景数据集的训练,各项能力均有提升。
SayCan:为实现自主可靠决策做出贡献
SayCan 由基于 LLMs 的 Say 和判断可执行性的 Can 组成。2022 年 4 月,谷歌机器人团 队联合 Everyday Robots 开发出用于机器人决策的模型 SayCan。该模型将机器人的决策过 程拆分为两部分——Say 和 Can:1)Say 主要由 LLMs 组成:负责理解高层级任务的含义, 并且将高层级任务分解为子任务;2)Can 由预训练得到的 Affordance 函数构成:结合机 器人的自身状态和周围的环境,将 Say 给出的子任务和预先设定可完成的子任务进行比对, 判断其是否可执行。虽然该模型可以执行子任务,但执行操作是事先编码设定的,主要贡 献在于为人形机器人的决策提供思路,首先基于大语言模型的常识积累,提出解决任务的 一般步骤,其次根据现实条件,判断子任务的可执行性,从而得出自主可靠的决策。
Affordance 函数可以淘汰不可执行的决策,提高自主可靠性。由于 Say 部分只是从语义层 面对抽象指令进行分解,并未考虑现实基础,其分解出的子命令可能在现实中不可执行。在第一步中, 尽管 LLMs 认为“拿取海绵”是正确的动作,但 Affordance 函数根据视觉信息认为这是不 可能一步执行的,因此选择了“寻找海绵”。由此可见,SayCan 大模型可以帮助机器人做 出可靠决策。
SayCan 在真实厨房任务中规划成功率为 81%。SayCan 执行 101 个任务的结果如下:在 模拟厨房的任务中,SayCan 模型的规划成功率为 84%,执行成功率为 74%。真实厨房环 境中,SayCan 的规划成功率相比在模拟厨房中降低 3pct 至 81%,执行成功率降低 14pct 至 60%。此外,SayCan 的规划成功率可以随着 LLMs 的改进而提高。
Gato:为实现多模态感知做出贡献
Gato 将多模态信息 token 化后输入 transformer 架构。2022 年 5 月,Google DeepMind 推出多模态通用智能体 Gato。该模型的基础架构是将文本、图像、关节力矩、按键等信息 序列化为扁平的 token 序列,将其输入到统一的 transformer 框架中处理,可以完成 600 多 个不同的任务,包含离散控制(雅达利、推箱子游戏)、连续控制(机器人控制、机械臂控 制)、NLP 领域的对话,CV 领域的描述生成等。该模型的训练方式是纯监督学习,训练数 据包括文本、图像、本体感知信息、关节力矩、按键等各类模态的离散或连续型的观测、 动作数据,多样化的数据使得 Gato 具备在具体场景中解决复杂问题的能力。
Gato 在模拟任务中表现优异,参数越多性能越好。在 604 个模拟任务中,有 450 多个任 务可以达到专家水平的 50%。研究人员评估了 3 种不同参数的模型:79M 模型、364M 模 型和 1.18B 模型(Gato),实验结果表明,在相等的 token 数下,模型的参数越多,模型性能 越好。

RT-1:为实现实时精准运控做出贡献
RT-1 将机器人轨迹数据输入 transformer 架构,可得到离散化动作 token。其主体包括: 1)卷积神经网络(EfficientNet):通过 ImageNet 预训练得到,用于处理图像和文本,以 提取与任务相关的视觉特征,但其参数较少,严格意义上不属于大模型范畴;2)token 学 习器:计算出嵌入 transformer 中信息的 token;3)transformer:处理输入的 token,并预 测离散化的机器人动作 token。动作包括用于臂(arm)移动的七个维度(x、y、z、滚动、 俯仰、偏航、夹具的打开)、用于基座(base)移动的三个维度(x、y、偏航),以及用于 在三种模式(控制手臂、基座或终止)之间切换的额外离散维度(mode)。RT-1 以 3Hz 速 度执行闭环控制并和命令动作,直到产生终止动作或耗尽预设时间步长。
RT-1 的重要贡献之一是收集了大量的机器人真实数据。Google 依靠自身强大的资金和科 研实力,耗时 17 个月,在 13 台机器人上收集了 13 万条机器人数据,覆盖超过 700 个机 器人相关任务。大量的机器人真实数据,使得 RT-1 在训练完成后具有良好的泛化能力。与 其他基准模型相比,面对未见过的指令、不同干扰对象的数量、不同的背景和环境,装配 了 RT-1 的机器人均能较好地适应。此外,通过将真实数据、模拟环境生成的数据和其他型 号机器人生成的数据相整合,训练出的 RT-1 泛化能力进一步提升。
PaLM-E:将自主可靠决策和多模态感知相结合
PaLM-E 将多模态大模型拓展至机器人领域,可生成决策文本。2023 年 3 月,Google 和 柏林工业大学的研发团队推出通用多模态大模型 PaLM-E。该模型融合了 Google 当时最新 的大型语言模型 PaLM 和最先进的视觉模型 ViT-22B,可以结合传统运控算法执行复杂的 机器人任务。PaLM-E 大模型的输入端是连续的、可感知的数据,包括视觉、连续状态估计 值和文本等多模态信息。多模态信息以类似于语言序列的方式输入到语言模型 PaLM 中, 使其可以理解这些连续数据,从而能够基于现实世界做出合理判断。PaLM-E 是一个仅具有 解码器的语言模型,可以自动地根据前缀或提示生成文本结果。
PaLM-E 拥有强大的正迁移能力和语言能力。研究人员发现,通过混合任务训练得到的 PaLM-E 大模型,在单一任务的表现优于单一任务训练得到的大模型,例如 PALM-E 经过 包含三种抓取任务的数据集训练后,在单一抓取任务中的执行成功率或准确度高于经过单 一抓取任务训练的模型。此外,PaLM-E 中语言模型越大,在进行机器人任务训练中,保持 的语言能力就越强,例如 PaLM-E-562B 基本保留了所有的语言能力。
RoboCat:可以自主生成训练数据集,实现自我学习
RoboCat 将多模态模型 Gato 与机器人数据集相结合。2023 年 6 月,Google DeepMind 推出了 RoboCat,一种可以自我改进、自我提升的用于机器人的 AI 智能体。研究人员将多 模态模型 Gato 与包含各种机器人手臂图像和动作的训练数据集相结合,使得 RoboCat 具 有在模拟环境与物理环境中处理语言、图像和动作等任务的能力。前文提到的 RT-1 和 PaLM-E 所使用的绝大部分机器人数据通过人工示范与人工遥控操作的方式收集而来,所消 耗的时间和人工成本较高。RoboCat 最大的创新点在于可以利用少量人工收集的真实机器 人数据集,自主生成新的训练数据集。 RoboCat 针对每个新任务/机器人的训练周期包括五个阶段,过程中可自主生成训练集: 1)通过人工控制机械臂,收集 100-1000 个新任务/机器人的演示过程; 2)针对该新任务/机器人,创建一个专门的衍生智能体(Agent); 3)衍生智能体(Agent)对该新任务/新机器人进行平均 10000 次练习,生成更多训练数据; 4)将演示数据和自生成数据合并到 RoboCat 已有的训练数据集中; 5)在新的训练数据集上训练得到新版本的 RoboCat。
RoboCat 经过自我学习,执行成功率由 36%提升到 74%。面对一项新任务时,最初版本 的 RoboCat在经过 500次演示训练后,执行成功率仅为 36%;经过自我学习的训练周期后, 执行成功率提升至 74%。此外,根据论文显示,RoboCat 在现实世界中的执行成功率要远 高于传统基于视觉的模型。
RT-2:VLA 模型将 5 种能力有机结合
RT-2 将视觉语言模型和机器人动作相结合。2023 年 7 月,Google DeepMind 发布 RT-2, 并将其定位为新型的视觉语言动作(VLA)模型。RT-2 将 token 化后的机器人数据输入到 VLM 中,实现闭环的机器人控制。该模型兼具视觉语言模型和机器人动作的优势:1)VLM 经过海量互联网数据集的训练后,具备强大的语义推理和视觉解析能力;2)机器人动作数 据的引入使模型能够理解机器人行动,从而根据当前状态预测机器人的下一步动作。
基于原有的 VLM 模型 PaLM-E 和 PaLI-X,RT-2 具备良好的泛化能力和涌现能力。Google 选择了原有的 VLM 模型 PaLM-E 和 PaLI-X,在预训练的基础上进行联合微调,得到实例 化的 RT-2-PaLM-E 和 RT-2-PaLI-X。实例化后进行了超过 6000 次的机器人实验,结果显 示 RT-2 具备:1)较强的泛化能力:面对训练数据中未出现的物体、背景和环境,RT-2 系 列模型能够以远超基准对比模型的成功率完成任务;2)较好的涌现能力:对于符号理解、 推理和人类识别三类不存在于机器人训练数据中的涌现任务,RT-2 系列模型也能以较高的 正确率完成。

RT-X:经过多个数据集训练后,5 种能力全面提升
RT-X 在保持原有架构的基础上,经过多个数据集训练,得到 RT-1-X 和 RT-2-X。2023 年 10 月,Google DeepMind 开放训练数据集 Open X-Embodiment,其包含超过 100 万条真 实的机器人轨迹数据,涵盖 22 种机器人和 527 项技能(160266 项任务)。多样化的数据集 使得 RT-X 模型具备了在多种环境中处理各类任务的能力,机器人能够更灵活地适应不同的 应用场景,例如仓库搬运、防爆救险、家庭护理等。
RT-1-X 在特定任务上的平均性能较 RT-1 和原始模型提高 50%。虽然 RT-1-X 与 RT-1 的 网络架构相同,但因为 RT-1-X 采用了多样化的数据集进行训练,RT-1-X 模型在特定任务 上(如开门)的平均性能比 RT-1 和原始模型提升 50%。
RT-2-X 涌现能力约为 RT-2 模型的 3 倍,泛化能力约为原始模型的 3 倍。1)涌现是指模 型表现出训练数据集之外的执行能力。RT-2-X 涌现能力约为 RT-2 的 3 倍,动作指令从传 统的绝对位置拓展至相对位置。例如,之前机器人只能理解将苹果放在桌子的右上角的绝 对位置指令,如今可以理解将苹果放在可乐和杯子中间的相对位置指令。2)泛化是指模型 在新场景下的适应能力。RT-2-X 的泛化能力约为原始模型的 3 倍,从 27.3%提高至 75.8%。 此外,更高的模型容量和多种机器人数据的融合均可以提升泛化能力。
不足与展望:感知模态+实时性+泛化能力需要进一步提升
未来展望一:现有机器人大模型主要包含视觉感知,多模态感知是未来发展趋势。以学习 雕刻为例,人类如果只进行观摩而不动手实操学习,很难彻底掌握雕刻这门工艺;人形机 器人也一样,它可以通过图像和文字学会雕刻的动作,但是无法仅通过图像修炼成雕刻大 师,需要联合与物理交互相关的感知,不断学习改进。同时,多模态信息可以相互融合和 交叉验证,避免对单一模态信息的过度依赖。根据《What makes multi-modal learning better than single》,在充足的训练数据下,模态的种类越丰富,训练得到的模型预测误差值越小, 表征空间的估计越精确。
未来展望二:大模型指令生成速度慢,生成结果简单,短期仍需依靠传统机器人算法。目 前主流机器人大模型偏向于任务理解和拆分,对于机器人运动控制的涉及较少,只是用端 到端的训练方式生成了简单且离散分布的机械臂末端位置和底盘移动指令,未考虑连续路 径和轨迹规划等更偏机器人领域的内容。以 RT-2 为例,RT-2-PaLI-X-55B 只能做到 1-3Hz 的指令生成速度,在移动马克笔的任务中,因为其运控速度远低于马克笔的滚动速度而失 败;并且其生成的运动指令只是机械臂的末端位置和姿势,未涉及传统机器人运控范畴。 因此,我们认为目前机器人大模型更擅长任务级和技能级的控制,传统机器人算法擅长底 层运控。
未来展望三:未来大模型需依靠预模型架构、方法和数据集方面的改进提高泛化能力。在 RT 系列论文中,RT-2 在未知复杂环境中的执行成功率仅 35%,RT-2-X 较 RT-2 的泛化能 力没有明显提升。根据《Exploring visual pre-training for robot manipulation: Datasets, models and methods》,模型结构、训练方法和数据集对机器人的执行成功率均有影响。近 期预训练数据集迎来新突破,MimicGen 基于 175 个人工示范数据,生成了涵盖 18 个任务 的 5 万多个合成数据;RoboGen 可以无限生成任务、场景和训练数据,实现机器人 7x24 小时全自动技能学习。我们认为,未来随着模型结构、方法和数据集的不断优化,人形机 器人在未知复杂环境中的执行成功率有望提升,进而提升人形机器人的通用性。
编辑:火腿肠- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 5 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 9 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 10 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 1 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 2 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 3 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 4 房地产行业专题报告:城市更新推动高质量发展.pdf
- 5 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 6 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 7 育娲人口智库:中国百年历史人口报告2026.pdf
- 8 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 9 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 10 九思行研:2026年中国液流电池行业发展现状与前景分析报告.pdf
- 1 育娲人口智库:中国百年历史人口报告2026.pdf
- 2 九思行研:2026年中国液流电池行业发展现状与前景分析报告.pdf
- 3 全国OPC发展观察报告2026-新华社中国经济信息社.pdf
- 4 消费再卷县域烟火气里掘金-2026县域经济消费报告-尼尔森IQ.pdf
- 5 2026抗体偶联药物行业图谱-清华五道口.pdf
- 6 清华大学:2026算法推动下新大众文艺发展研究报告.pdf
- 7 九思行研:2026年中国商业航天发展现状与趋势展望报告.pdf
- 8 高聘人才智库抢占AI新生代-2026年名校生求职招聘洞察报告-陌陌.pdf
- 9 绿色算力发展研究报告2026-中国信通院.pdf
- 10 2026年全球智能手机市场洞察研究报告:存储芯片涨价延续,手机厂商如何穿越周期(精华版).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 6 2026年春季港股及海外中资股投资策略:分化与回归
- 7 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 2 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 3 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 4 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 5 2026年7月A股回调归因与底部布局策略分析
- 6 恒生科技指数2026年6月复盘及7月走势展望
- 7 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 8 2026年上半年小红书六大热门行业消费趋势洞察
- 9 2026上半年小红书六大热门行业消费数据洞察
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
