世界模型概念、构建方法及企业研究进展如何?

世界模型概念、构建方法及企业研究进展如何?

最佳答案 匿名用户编辑于2024/06/03 14:12

理解世界,预测未来。

1.世界模型——预测未来的“梦境”。

对于世界模型,最早可以追溯到 20 世纪四 五十年代的心理学研究,认为任何动物可以依靠世界模型预测世界的下一个状态。 谷歌在 2018 年发表了影响深远的论文《World Models》,对世界模型做出了如下描述: 人类通常会以有限的感官所能感知到的事物为基础,在内心建立一个世界模型,我 们所有的行为都基于这个内部的模型来展开。这样的模型不仅能够预测未来,而且 能够根据我们当前的运动行为来预测未来的感官数据,我们能够基于这种预测迅速 采取行动。以棒球为列,棒球运动员只有毫秒级的击球时间,甚至比视觉信号从眼 球传到大脑还短,因此运动员根本无法在挥棒过程中调整和规划路线,之所以能够 提前控制肌肉以正确的方式挥出球棒并击中棒球,得益于他们大脑中的“预测模型”, 这个能够预测未来世界状态,在我们大脑中凭空演示一遍的“梦境”,就被称为世界 模型。之后这篇论文里还构建了一套世界模型的体系,并通过游戏实验发现,如果 让模型在“梦境”中预测未来会发生的事情,那么模型的游戏技能将明显提升。

世界模型也是对物理世界“常识”的理解。另外一个被经常提到的是人工智能 三巨头之一的 Yann Lecun 的“World Model”。在 Yann Lecun 的著名论文《A Path Towards Autonomous Machine Intelligence》中提到,青少年可以在 20 小时练习中学 会开车,而人工智在大量的训练中仍然无法实现良好的自动驾驶,因此动物和人对 世界的理解能力远超当前人工智能和机器学习系统。人类和动物快速学习能力是基 于对于世界的基础认识和常识。在人类最初出生的几天,几周,几个月就会学习了 大量关于世界如何运转的基本知识,如左右眼有视差,物体不会凭空产生、消失、 变形或传送,有些物体的轨迹可预测(如无生命的物体)、有些物体的行为方式有些 不好预测(如风沙、水、风中的树叶等),在此基础之上,又会形成一些如稳定性、 重力、惯性等概念。后续抽象的概念正式基于这样简单的概念建立。有了这些世界 的知识(常识),动物或者人类就可以快速学习新事物,对合理与否进行判断。当然 “具备常识”可以被认为是一种实现的路径,基于对世界更深入的理解,最终更好 的“预测未来”。

2、 世界模型是自动驾驶助推器,助力模型训练、验证测试、甚至推理

世界模型可以有效赋能智驾。在自动驾驶领域,能够准确预测驾驶场景未来的 演变至关重要,通过对场景即将发生的事件进行预判,汽车可以自如的进行规划和 控制做出更明智的决策。怎样构建这样一个可以通过理解世界运行规律进而预测未 来的模型,学界和工业界都进行了不懈的探索。与大语言模型类似,玩家采用自回 归的模型,将数据压缩和提炼,在潜在空间通过无监督的训练构建模型对未来进行 预测,之后通过不同的解码器将预测好的信息解码成为需要的表达方式进而构建世 界模型。从结果来看模型可以通过海量的数据一定程度上总结世界运行的物理规律 并对未来进行一定程度的预测。在自动驾驶领域,世界模型可以用来生成场景,也 可以直接用来做决策规划。具体而言:(1)可以生成诸多逼真的场景,生成稀缺、 难以采集的场景,为模型训练提供足量的数据;(2)同样生成的场景亦可以作为仿 真测试工具对算法进行闭环验证;(3)多模态的世界模型亦可以直接生成驾驶策略 来指导自动驾驶行为。

自动驾驶进入深水区,端到端逐步成为未来方向,世界模型重要性凸显。一方 面,随着自动驾驶走入深水区,玩家对数据的要求日益提升,厂家希望数据能够模 拟复杂交通流、具有丰富的场景、广泛收集各类长尾场景、并且具备 3D 标注信息。 而现实状态下,数据的采集成本居高不下,部分危险的场景如车祸等难以采集,长 尾场景稀缺,同时 3D 标注的成本高昂,因此采用合成数据来助力自动驾驶模型训练 测试成为颇具前景的发展方向,而世界模型恰为良好的场景生成和预测器。另一方 面,随着端到端自动驾驶成为未来的发展方向,开发者需要依靠数据将驾驶知识赋 予模型,数据需求会伴随模型体量的增加而扩大。此外更重要的影响在于,在仿真 和验证环节,传统的模块化算法时代可以对感知和规控模块分别进行验证,感知端 可以进行开环的检测(即将感知的结果和带有标注的真实世界状况直接对比即可, 不需要反馈和迭代),规控环节可以依靠仿真工具,将世界的状况(各类场景)输入, 通过环境的变化来给与模型反馈,进而闭环的(外部环境可以根据智能体的输出变 化而改变,形成反馈)验证规控算法的性能。这其中,感知环节更注重仿真环境的 逼真性,而规控环节更注重逻辑的丰富度。在端到端时代,感知和规控合二为一, 这要求仿真工具既可以逼真的还原外部环境,同时能够给与模型反馈实现闭环测试, 尽管 Nerf、3D 高斯等等算法层出不穷,但能够很好的做到自动驾驶全过程完整的闭 环测试亦难度较高,而世界模型则能够很好的应对类似的场景。

3、 自动驾驶各方势力发力研究世界模型

特斯拉的 World Model: 特斯拉世界模型可预测驾驶场景下的未来发展。特斯拉在 2023CVPR 对其端到 端模型进行了简单的介绍,希望能够构建一个完整的 4D 神经网络,能够理解世界运 行的规律。具体而言,世界模型可以根据过去的视频预测未来场景的演化,形成几 大功能:(1)预测未来;(2)在没有本体实体的情况下帮助网络学习;(3)行动本 身可以作为生成的条件;(4)自车的行为会影响生成的效果,比如左转右转会分别 生成不同的视角。(5)可以用于仿真;(6)可以生成图像、几何空间的信息、语义 信息等;(7)泛化性比较好。 经过训练,模型具备了一定程度对物理世界的理解。特斯拉发现网络可以联合 预测汽车周围 8 个摄像头的信息;同时各个摄像头的颜色保持一致,表明可以更好 地预测传感器的特性;此外尽管开发者没有显式的要求它以三维或者非三维的方式 进行计算,网络即自行理解了三维空间的概念,视频中运动的物体也具有一致性,通过自然语言的提示,模型可改变视角;其可根据要求以相同的起点生成不同的结 局;对视频语料的适应性好,可以通过行驶记录、油管或者自己手机中的数据来训 练这个模型。相比游戏引擎所生成的仿真场景,这样的世界模拟器可以表示一些很 难用显式系统描述的事物,如物体的意图和行为等。

从感知基础模型窥探特斯拉世界模型端倪。特斯拉在 2023 年 CVPR 的演讲中介 绍到了其感知基础模型的构建方式,算法中先将外部的信息经过特征提取网络进行 压缩和特征提取,送入基于 Transformer 的模型,构建对于 4D 的时空环境的理解。 之后根据不同的任务需求,加入不同的解码器或者其他算法模块来实现不同任务, 如自动驾驶加入表面输出、体积网格输出等,供后续的模块使用,机器人也是同样 的道理。并且我们看到特斯拉的模型中不光包含多摄像头视角的视频信息,还包含 里程计、自车轨迹等信息,当然特斯拉也提到,在如何将里程信息和视频信息很好 的融合,以及如何提升模型的时空理解能力方面,亦做了大量工作。而我们看到这 样的基础模型和玩家们构建的世界模型出现了诸多相似之处。

Wayve:GAIA-1

GAIA-1 亦可实现对场景的理解。英国的端到端自动驾驶公司 Wayve.ai 在 2023 年发布了 GAIA-1 模型,它可以依靠视频、文本和动作的输入生成逼真的视频。模型 可以生成分钟级的视频,同时可以生成多种合理的未来,模拟多种场景:如与道路 使用者的交互、自车行为的改变等,同时可依靠文字来对视频中元素进行精细粒度 的控制,帮助自动驾驶模型的训练和仿真。

多模态数据训练后的模型亦呈现出对驾驶场景出人意料的认知。GAIA-1 模型呈 现出一些有趣的特点:(1)学习到了高级结构和场景动态:可以生成连贯的场景, 其中的对象位于合理的位置并且展示出合理的交互状态,如路灯、道路规则、让路 等,表明模型不仅记住统计模式,还理解世界上物体的排列和基本规则。(2)拥有 强泛化性和创造性:可以产生训练集中尚未明确出现的对象和场景。(3)拥有情景 意识:可以根据上下文的信息生成连贯的动作和响应,并展示出对 3D 几何的理解以 及道路使用者决策过程中的因果关系的理解,如可反应道路不平整引起的视角俯仰 等作用。

自回归+扩散模型形成模型的骨架。GAIA-1 的构建采用了自回归的世界模型和 视频扩散模型结合的方式,原理上和大语言模型以及各类视频生成模型相似,采用 向量化的表示,将预测未来转变成预测下一个 Token 的任务。首先采用不同的编码 器将图像、文本、动作编码和压缩变成各类 Token,之后将其送入以 Transformer 为 基础构成的世界模型中来对未来进行预测,最后将预测好的向量送入以扩散模型为 主体的视频解码器将其输出成为视频。

模型架构特殊设计来增强生成视频的帧间一致性。在模型架构方面,GAIA-1 采 用了专门的设计的图像分词器(Image Tokenizer),以保证在对视频信息进行切分的 时候,能够有效压缩原始图像信息减少冗余和噪声,同时能够让压缩后的内容包含 较多的语义信息而非高频像素信号。世界模型方面,采用因果掩码的方式让模型尝 试预测未来。此外在视频解码器方面,GAIA-1 采用视频去噪扩散模型,并让模型在 扩散过程中对帧序列去噪(多帧同步生成),从而提高了视频输出的时间一致性。此 外对视频解码器在多个任务上进行训练如图像生成、视频生成、自回归解码和视频 插值等,因为同时训练会提升单一任务的性能。

Wayve 训练的 GAIA-1 呈现出良好的规模效应和潜力。GAIA-1 在数据方面采用 了 2019-2023 年在英国伦敦收集的 4700 小时,25Hz 的专有驾驶数据,对应大约 4.2 亿张图像。模型总共约 90 亿参数,其中视觉编码器部分(Image tokenizer)拥有 3 亿参数,在 32 张英伟达 A100GPU 上训练了 4 天;世界模型拥有 65 亿参数,在 64 张英伟达 A100 GPU 上训练了 15 天;视频解码器拥有 26 亿参数,在 32 张英伟达 A100 上训练了 15 天。模型显示出显著的规模效应,当将模型的参数量增加,或者 将模型的计算量增加,都可以显著提升模型的性能,表明模型仍然具有较好的潜力。

英伟达: 英伟达的基础模型基于多模态数据训练,可生成逼真且灵活变化的驾驶场景视 频。英伟达在近期 2024 年 GTC 大会上也展示了其在世界模型领域的新进展,通过 将多模态数据(传感器参数、文字如天气等、自车行为、2D/3D 检测框、道路布局 等;Token 化的传感器感知数据)输入模型训练并让模型预测未来驾驶场景,自动驾 驶基础模型可以稳定生成多个摄像头拍摄到的驾驶场景演变,效果逼真。此外通过 语言提示词也可以使得模型呈现的场景灵活变化,如告诉模型视角为前视摄像头, 汽车正行驶在雪天的道路上,两侧道路的树木被雪覆盖,道路上也有雪散落,模型 可以生成逼真的相应驾驶场景。

学术界: 学术界的自动驾驶世界模型方案层出不穷。学术界尤其是 GPT 出现后在 2023 年和 2024 年涌现出一大批关于构建自动驾驶世界模型的方案。AI 创业公司极佳科技 和清华大学联合推出的 DriveDreamer 在架构上和 GAIA-1 类似,但在输入端包含更 多模态的数据如高精地图等,可实现更加深入的理解,更加精确的控制驾驶场景的 生成,同时还增加了 ActionFormer 模块来使得模型可输出控制信号,之后的 DriveDreamer v2 结合了大语言模型和新的架构来增强模型的可塑性和一致性;此外 双方还联合推出 WorldDreamer,采用了新的架构结合 Transformer 和 Diffusion 优势 进行视频生成。旷世科技、早稻田大学、中科大等机构的论文中提出了 ADriver-1 模型,使用多模态大语言模型作为主干网络,以自回归的方式输出控制信号,使用视 频潜在扩散模型来生成未来的视频输出。德国信息技术研究中心和 KTI 推出的 MUVO 模型则包含三个部分,首先将视频、点云信息进行解码压缩以及特征融合, 并和编码过的行为数据一同输入基于 Transformer 构建的世界模型,对未来进行预测, 之后通过不同的解码器分别输出 3D 占用网络、激光雷达点云、图像。中科院自动化 所提出的 DriveWM 采用多图联合建模提升了所生成驾驶场景的质量。

DriveDreamer 构建世界模型可实现未来场景的生成以及驾驶员可能相应产生 的动作。以极佳科技和清华大学联合推出的 DriveDreamer 为例,模型主要采用注意 力机制和 Diffusion 模型构建。可对驾驶场景实现全面的理解,集成了多模态的输入 数据如文本、视频、高精度地图、3D 检测框、驾驶行为等,可以实现可控的驾驶视 频生成和预测未来的驾驶行为。同时 DriveDreamer 还可以与驾驶场景互动,根据输 入的驾驶动作预测不同的未来驾驶视频。

参考报告REPORT

中小盘策略专题:Sora和世界模型殊途同归,自动驾驶行业有望加速.pdf

中小盘策略专题:Sora和世界模型殊途同归,自动驾驶行业有望加速。Sora横空出世,践行规模法则叠加强大工程化能力构筑精品。2024年初,Sora横空出世,凭借惊艳的视频生成效果和分钟级的时长引领市场。Sora生成长达60秒的视频,并且可以通过自然语言、视频、图片作为提示词实现视频生成,相比此前的其他文生视频工具性能优势显著。此外Sora生成的视频还呈现出时间一致性、空间一致性和因果一致性,被OpenAI称为世界模拟器。Sora在数据、算法、算力上均大胆创新,数据方面,采用了特殊的视频编码模式将视频模块化和压缩,构建适用于视频生成模型的时空模块,通过原本具备的大语言模型能力构建高质量的视频文本...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至