2023年人工智能行业动态分析-机器人智能化三部曲(二):Meta及微软篇

  • 来源:中信建投证券
  • 发布时间:2023/10/19
  • 浏览次数:511
  • 举报
相关深度报告REPORTS

人工智能行业动态分析-机器人智能化三部曲(二):Meta及微软篇.pdf

人工智能行业动态分析-机器人智能化三部曲(二):Meta及微软篇。核心观点:随着各项人工智能技术的不断发展,具备与物理世界交互潜力的智能机器人成为学界和业界的重要研究赛道。近年来Meta、微软均持续完善其机器人模型领域的布局。2023年8月,Meta推出在少量训练数据情况下便能取得优异表现的MT-ACT模型。2023年2月微软推出基于ChatGPT的机器人控制框架,将ChatGPT的“知识储备”落实到现实场景中。机器人模型发展百家争鸣,值得进一步关注。从R3M到MT-ACT,Meta持续探索如何使用有限的数据集实现更优秀的机器人控制。在2022年3月推出的R3M模型中,...

科技巨头加速布局智能机器人,Meta持续推进机器人模型发展

近年来,Meta一直是AI领域不可忽视的力量,前沿研究如CV领域的SAM模型,NLP领域的LLaMa均是相关领域的最前沿技术之一。在机器人模型领域,Meta也已经展开了较为完善的布局,提出了一些卓有成效的改进策略如数据增强、动作序列生成等,相关模型如 R3M、CACTI、ASC、MT-ACT等,其他领域的核心突破如SAM模型也应用到了其中。本文将回顾Meta近年来在机器人模型领域的核心 进展,梳理其中的发展脉络。

R3M:基于人类视频数据的预训练机器人模型

Meta及斯坦福大学的研究人员在2022年3月推出了基于人类第一视角数据训练的机器人预训练模型R3M。 核心突破:研究了一种在人类视频数据上进行机器人控制模型预训练的方法,提升了机器人控制模型的性能、效率和可用训练数据范围。 通过时间对比学习、视频-语言对齐等方法来充分学习视频中的视觉信息,构建出预训练模型作为后续任务的基础。 训练数据集:使用了Ego4D的人类第一视角视频数据集,包含共3500多小时的数据。数据集中的视频来自全球70多个地方,具体任务包括 有烹饪、社交、组装物品等。每个视频片段由参与者一次佩戴头戴式摄像头长达 10 小时,并拍摄无脚本日常活动收集而来,其中还包含视 频中人物行为的自然语言注释。

CACTI:可扩展的多任务多场景视觉模仿学习框架

Meta、哥伦比亚大学及卡耐基梅隆大学的研究人员在2022年12月推出了可扩展的多任务多场景视觉模仿学习框架CACTI。 阶段1——数据收集: 现实场景,通过人类演示收集了10个任务共1000个片段;模拟场景,通过强化学习智能体收集了18个任务共900个策略。 阶段2——数据扩充: 通过不同的策略对专家示范数据进行增强,进而实现数据集的扩充,例如针对模拟的900个策略共生成了45000个片段。 阶段3——数据压缩: 将扩充后的数据集中的“视觉”数据压缩成向量。 阶段4——训练: 利用上述环节得到的不同任务数据训练出统一的控制策略。

ASC:具备自适应技能协调能力的机器人模型

Meta及Georgia Institute of Technology的研究人员在2023年4月推出了具备自适应技能协调能力的机器人模型ASC。 训练环境:导航任务环境——HM3D,包含1000个真实室内环境的高质量3D扫描,使用了其中800个作为本次的训练数据;拾取/放置任务环 境——ReplicaCAD,包含104中不同布局的公寓,机器人需要将YCB数据集中的13件物品拾取、放置或重新排列到 4 件家具(容器)上。 模型原理:通过强化学习在模拟环境中训练三种基于视觉的技能(导航、拾取、放置),进一步训练一种技能协调策略 以及一种纠正策略,来根据三种不同任务的输入对三种进行进行协调和控制,进而完成较为复杂的下游任务。 技能协调策略&纠正策略:技能协调策略实质是混合专家模型中的门控网络,在ASC中,技能协调策略利用Dagger算法进行预训练,在这一 过程中,定义好的“教师”策略会逐步指导和技能协调策略的行为,而后技能协调策略和纠正策略均通过深度强化学习进行微调。

ACT:具备动作序列生成能力的Transformer架构

Meta、Standford University、UC Berkeley的研究人员推出了可以进行动作序列生成的模型ACT。 核心原理:针对某一时刻的输入生成接下来的若干时刻的动作预测而不是只生成下一时刻动作预测。如下左图所示,来自四个相机的输入经 过encoder处理后,通过decoder得到接下来若干个时刻的动作序列。 若不采用时序组合的方法(如右上图所示),模型在3、4之间需要重新进行推理得到新的4个动作,且需要为3的动作可能存在一定误差,导 致模型的机器人控制出现卡顿和精确度缺乏的情况,而通过时序组合的方式则可以这些来自不同时刻的预测汇总在一起,每一个时刻的输出 都是若干个时刻预测的综合,并且考虑了环境的最新变化,进而实现了更为精确而流畅的机器人控制。

RoboAgent:通过语义增强和动作序列生成提升机器人操控的通用性和效率

Meta及Carnegie Mellon University的研究人员在2023年8月推出了高效的通用机器人模型框架MC-ACT。模型框架:训练过程中,在语义增强阶段利用内绘增强技术使训练数据多样化,在策略学习阶段使用多任务动作分块转化器训练语言条件策 略,将多模式多任务数据纳入单一的多任务机器人控制模型中。推理过程中结合用户的文本输入和摄像头的图像输入对机械臂进行控制。

训练数据:包含通过人类远程操作收集的7500个片段,具体任务包括有拾取、放置、开启、关闭等,其中拾取和放置动作的数据量较大,均 超过了1000条。相较于此前的机器人数据集如RT1,RoboAgent数据集的规模更小但覆盖的任务范围更广。

Meta机器人模型进展总结

Meta的机器人模型与谷歌有所差异,目前的工作中尚未尝试将大语言模型与机器人控制所结合。同时相较于谷歌尝试利用大规模的数据集 提升机器人模型的表现,Meta的相关工作更加关注如何使用小规模的数据实现通用机器人控制模型的构建,也即数据效率方面的提升。 Meta在ASC模型中采用的强化学习与MoE的结合也是值得关注的方向,为强化学习在复杂多任务场景中的进一步发展提供可能。

LATTE:结合预训练模型的机器人轨迹控制模型

Microsoft及Technische Universität München的研究人员在2022年8月推出了基于自然语言的机器人轨迹控制框架LATTE 。模型框架:使用Bert模型处理用户文本指令,使用CLIP模型处理图像输入,并且与用户的文本输入相匹配,进而识别出用户指令中的目标对 象。上述信息与经过Encoder处理的物体姿态信息和航迹信息相结合,通过Decoder生成全新的航迹。

训练数据:每个数据样本都包含基础轨迹和修改后的轨迹(如下左图红色为基础轨迹,蓝色为生成的轨迹)、自然语言输入(包括绝对方向 的变化、速度的变化、相对方向的变化三个方面)、对象姿态和对象图像(来自Bing的图片查询)。

运行结果:航迹可以根据用户指令的要求,实现轨迹、速度方面的变化,如下中图所示,用户要求无人机离“演员”远一些,最终生成的蓝 色轨迹相较于初始的红色轨迹离环境左下角中的“演员”更远,在做出速度方面的要求后,生成的新轨迹也有明显的速度下降。

模型性能:研究人员收集了来自10名参与者的300个数据点,大多数用户都认为数据集中的轨迹及模型中的轨迹正确的反应了语言命令要求 的更改,同时缺少语言模型的输入或2D的轨迹修正都会导致模型效果非常糟糕,反向佐证了这一思路的效果。同时,模型继承了大语言模 型一定的泛化性能,能够在76%的情况下以相当或更好的效果处理未见过的指令输入。

ChatGPT for Robotics

模型具备将对现实世界的知识理解通过机器 人控制转化为现实世界任务完成的能力。 1. 为机械臂排列物体设计了一套课程,并要 求ChatGPT学习物体拾取和物体放置。 2. ChatGPT在用户提问下回答了微软Logo的 特征, 并生成了能够绘制出相应图像的代码 3. ChatGPT在用户的进一步要求下完成了机 器人控制的相关代码,通 过代码控制机器人实现了将颜色方块摆成微软 logo的任务。

报告节选:

编辑:火腿肠
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至