国内外大模型+机器人研究成果梳理

国内外大模型+机器人研究成果梳理

最佳答案 匿名用户编辑于2024/05/11 10:01

大模型掀起了具身智能新兴领域的研究热潮,具身智能或将成为 AI 领域的下一个“北极 星”问题。

1.ChatGPT for Robotics:大模型赋能机器人的初步探索

2023 年 2 月,微软发布了一篇名为《ChatGPT for Robotics: Design Principles and Model Abilities》的技术报告,阐述了 ChatGPT 赋能机器人的方法。 ChatGPT 在机器人领域的应用主要体现在自然语言交互和自动化决策。传统上,机器人 任务需要工程师在循环中编写复杂的代码并不断进行迭代改进,但 ChatGPT 使得机器人 能够基于自然语言指令采取响应行动或是完成自动化决策。接入 ChatGPT 后,工程师只 需构建底层库函数及其描述,机器人就能基于底层函数来编写代码完成相关任务,从而 减轻工程师的工作负担。

报告提出了一种提示工程设计原则和创建高级功能库的策略,使得 ChatGPT 能够适应 不同的机器人任务。其具体步骤如下:(1)定义机器人功能库函数,比如实现检测物体、 移动地盘等功能的函数;(2)编写 Prompt,描述任务目标并明确可用的高级函数;(3) 在仿真环境中运行并评估 ChatGPT 的代码输出,以保证模型能够安全且完整地完成任务; (4)将算法部署至机器人上。

 PaLM-E:具身多模态视觉语言模型,是具身智能领域的一次重大飞跃

2023 年 3 月,Google Robotics 团队和柏林工业大学共同推出了具身多模态视觉语言 模型 (Visual Language Model, VLM)PaLM-E。PaLM-E 结合了 PaLM 大语言模型和 Vision Transformer(ViT)模型,是当时最大规模的视觉语言模型,总参数量高达 5620 亿,在 PaLM 的基础上引入了多模态和具身化的概念,可实际应用于实体机器人,为大 参数视觉与语言多模态模型如何结合具身智能提供了新思路。 PaLM-E 采用端到端训练,具有很强的泛化和迁移能力。其主要架构思想是将连续的、 可感知的观察数据(如图像、语言、状态预测或其他传感器数据等)注入到预训练的大 语言模型的嵌入空间内,使用编码器提取特征,再通过映射器对齐特征,最终得到一系 列相同纬度的 Token,从而实现推理和训练,整个过程并不需要对场景的表示进行任何 预处理。

PaLM-E 在具有挑战性和多样化的移动操作任务中性能表现优异。在引导真实机器人执 行远距离操作任务的测试中,机器人被要求“从抽屉里拿一包薯片”,PaLM-E 指引机器 人找到抽屉,打开抽屉并成功拿出薯片,即便在人为地干扰下依旧能够成功完成任务, 这体现出了 PaLM-E 具有很强的鲁棒性。在引导真实机器人完成桌面操作任务的测试中, 机器人被要求执行一系列任务,如“将绿色圆形移到黄色六边形上”、“将绿色星星移动 到左上角”等,PaLM-E 均能准确识别颜色和形状并成功完成任务指令。

RT-2:全球首个VLA多模态大模型,能够理解视觉输入,机器人模型里程碑

2023 年 7 月,谷歌 DeepMind 推出 Robotics Transformer 2(RT-2),这是全球首个 控制机器人的视觉-语言-动作(Vision-Language-Action,VLA)模型,该模型能够从 网络和机器人数据中学习知识,并将这些知识转化为机器人控制的通用指令。 RT-2 以 PaLI-X 和 PaLM-E 作为支柱,采用视觉语言模型进行机器人控制。RT-2 以视觉 -语言模型(VLMs)为基础,将一个或多个图像作为输入,并生成一系列通常代表自然语言文本的标记。此类 VLM 已在大规模网络数据上成功训练,用以执行视觉回答、图像 字幕或对象识别等任务。同时,RT-2 的泛化和涌现能力进一步提高,超越了其所接触到 的机器人数据的语义和视觉理解,包括解释新命令并通过执行基本推理来响应用户命令。 与之前的基线相比(如 RT-1、VC-1 等),RT-2 的泛化性提高了约 3 倍以上。RT-2 表明 视觉-语言模型(VLMs)可以转变为更强大的视觉-语言-动作(VLA)模型,通过将 VLM 预训练与机器人数据相结合,能够实现机器人的控制,使其完成推理、解决问题、解释 信息并在真实世界中执行各种任务,展现出了构建通用型物理机器人的广阔前景。

VoxPoser:实现零样本机器人任务轨迹规划

2023 年 7 月,斯坦福大学李飞飞团队提出 VoxPoser 智能系统,该系统将大模型接入至 机器人,能够在无需额外数据和训练的情况下将复杂指令转化为具体的行动规划。 VoxPoser 系统流程主要可以为三个步骤。 1)输入:给定环境信息以及需要执行的自然语言指令; 2)处理:该部分由 LLM 和 VLM 两部分组成,其中 LLM 根据输入的信息内容编写代码, 所生成的代码再与 VLM 进行交互,并生成相应指令的操作指示地图(3D Value Map), 该操作指示地图标记了“在哪里行动”以及“如何行动”; 3)控制:将操作指示地图输入至动作规划器中,以合成机器人最终需要执行的操作轨迹。 传统方法需要进行额外的预训练,而 VoxPoser 系统通过大模型指引机器人与环境进行交 互,有效解决了机器人训练数据稀缺的问题,从而实现零样本的日常操作任务轨迹合成。

2.10 Figure 01:能听、能说、能自主决策的人形机器人

2024 年 1 月,Figure 发布视频并宣布:Figure 01 通过学习人类煮咖啡的录像,在 10 小 时内学会制作咖啡的技能,且会自我纠错,比如咖啡胶囊放得不对,它会矫正自己。 2024 年 3 月 14 日,Figure 展示了其全尺寸人形机器人 Figure 01 与 OpenAI 合作的最 新进展。在 OpenAI 的视觉-语言大模型的强大支持之下,Figure 01 在没有任何人类远程 控制的情况下能够进行自主学习和自主决策,理解人类自然语言命令并流畅地完成向人 类递苹果、将黑色塑料袋收拾进筐子里、将杯子和盘子放置在沥水架上等任务。 端到端神经网络+多模态大模型赋能,人形机器人逐步向人类靠近。Figure 的创始人表示, 在本次合作中 OpenAI 负责提供视觉推理和语言理解,而 Figure 的神经网络则提供了快 速、低层次、灵巧的机器人动作。Figure01 的具体技术原理如下:将机器人摄像头捕捉 到的图像以及机载麦克风捕获到的语音等输入到由 OpenAI 训练的多模态大模型中,再 由大模型对这些图像和语音进行处理并通过文本到语音的方式反馈给人类;在此环节中, 大模型负责决定机器人应采取的闭环行为,从而将特定的神经网络权重加载至 GPU 以执 行响应策略并完成给定任务。据 Figure 的工程师介绍,在多模态大模型的加持下 Figure01 目前可以完成描述视觉体验、规划未来行动、反思自身记忆以及阐述推理过程 等任务,且速度愈来愈额逼近人类。

4 月,优必选发布 Walker S 通过百度智能云千帆 AppBuilder 平台接入文心大模型的演 示视频,能根据收集到的空间定位和语义信息,理解任务并规划,再配合其机械臂与灵 巧手的精确操作,端到端地执行任务。WalkerS 在获得人类指令后,自主规划和执行叠 衣服,并递给人类。特斯拉擎天柱此前也完成了一次灵巧叠衣服的任务,不过那仍是人 类远程操作的。未来人形机器人要解决和完成更多任务,依然需要自主规划和实现任务 目标,减少人类的参与或干预。

11 GR00T——通用人形机器人基础模型

2024 年 3 月 19 日,英伟达在 GTC 2024 大会上发布了 GR00T(Generalist Robot 00 Technology)通用人形机器人基础模型,旨在进一步推动机器人和具身智能的突破。 GR00T 可充当机器人的大脑,使其能够学习技能以解决各种任务。GR00T 能够驱使机 器人理解自然语言、视频和人类演示等多模态指令,从而增强学习技能和处理任务的协 调性和灵活性;使其模仿人类动作以更快融入现实世界并于人类进行互动。GR00T 基于 英伟达深度技术堆栈开发,开发者可以在 Isaac Lab 中进行模拟,在 OSMO 上进行训练, 并部署到 Jetson Thor 上。目前,GR00T 已与 1X Technologies、Agility Robotics、 Apptronik、Boston Dynamics、Figure AI、Fourier Intelligence、Sanctuary AI、Unitree Robotics、XPENG Robotics 等公司展开合作。

参考报告REPORT

人工智能专题报告:人形机器人步入软件定义和AI驱动时代.pdf

人工智能专题报告:人形机器人步入软件定义和AI驱动时代。基于对人形机器人发展阶段及核心竞争力的分析,我们认为人形机器人已经跨入了一个全新的软件定义加AI驱动的时代。软件不仅承载着人形机器人的基础操作系统和应用算法,而且通过不断迭代升级,为人形机器人赋予了超越传统机械设备的智能特性。软件和AI不仅开启了人形机器人在各行各业广泛应用的可能性,更定义了人形机器人的功能边界。基于人形机器人所展现出的高度机械化特性以及在视觉感知方面对自动驾驶算法的成功复用,我们认为人形机器人处于由高动态向高度智能化发展的阶段。高动态是指机器人在运动能力上表现优秀,特别是平衡性、越障碍能力等。当前人形机器人机械化程度较高...

其他答案
匿名用户编辑于2024/05/11 09:59

自大模型流行至今,谷歌、微软、英伟达等国外科技巨头等纷纷投入到基于 大模型的具身智能的研究赛道中,相关理论和技术得到持续突破。我们梳理了 2023 年至 今国内外“大模型+机器人”的最新研究成果,从初步技术框架再到具体应用落地,基于大模型的机器人技术路线愈发明晰,通用人形机器人新纪元即将到来。

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至