「全球首个」多模态世界模型,来了!
来自李飞飞World Labs。

World Labs对这个名为Atlas的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟:
建模世界,移动相机,模拟空间和时间。
就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且空间和时间都能理解。

李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶:
Atlas为从视觉特效到机器人的众多应用场景打开了大门。

飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。

具体来说,Atlas是一个多模态自回归扩散Transformer,它的能力包括:
相机控制生成:仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。

空间重建:Atlas可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式3D表示,其效果超过当前专门针对3D重建训练的最先进模型。

时空模拟:Atlas可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人Real-to-Sim工作流。

图像生成:Atlas可以根据文本生成图片和360°全景图,能够遵循复杂Prompt、准确渲染文字,并生成大量不同的视觉风格。
对于机器人模拟,仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。

技术细节上,Atlas是一个全能模型(omni model)。
它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。
与此同时,空间控制是整个模型的核心。
为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础——多模态自回归扩散 Transformer。
文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,从而形成一个空间上下文。
然后,Atlas会根据这个上下文生成多模态输出。
这样一来,比如把两张毫无关系的参考图片放进同一个上下文中,再分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。

更具体地拆解一下,多模态,指的是Atlas可以原生处理多种不同的数据类型,包括文本、图像、相机位姿、3D深度图等。
视频则被表示为图像序列。
每一张图像和每一幅深度图,都对应一个明确的相机位姿。
自回归,指Atlas操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。
Atlas每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。
这种灵活的设计天然适用于各种不同任务。
每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。
扩散模型,指Atlas是一个Rectified Flow(校正流)模型,通过逐步去噪来生成输出。
扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。
而Transformer不必多说,在世界模型领域,Transformer也被证明是非常稳健的基础架构。
也就是说,Atlas实际上融合了大语言模型和视频模型中的大量思想。
Atlas既可以利用大量原本服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等等。
另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的VAE架构。
研究团队在相机控制生成和3D重建两个关键任务上对这个新一代世界模型进行了定量评估。
在相机控制生成上,结果显示,Atlas优于SOTA视频模型。
并且相机轨迹越复杂,Atlas的优势越大。

在根据稀疏输入视角进行3D重建的任务中,Atlas同样超过了表现最好的专业开源3D重建模型。(分数越低表现越好)

值得一提的是,Atlas从设计之初就为Scaling做好了准备。
李飞飞团队表示,已经看到了非常有利的证据,证明Atlas的能力会随着规模扩大而继续提高。
目前,Atlas正在向部分合作伙伴开放早期访问。
也可以在官网申请访问权限。

李飞飞新世界模型一出,关注的焦点,还是汇聚在具身智能上。
把今年World Labs的动作联系起来,Atlas的意义也更加明朗。
今年6月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器。
并明确指出,「最关键的是模拟器」。
因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。
紧接着,7月21日,World Labs收购机器人仿真公司SceniX。
7月28日,公开Real-to-Sim-to-Real系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。
现在,Atlas来了。
从真实照片/视频,到3D空间,再到机器人传感器视图和可变化的模拟环境,这一条路径被打通了。
World Labs官方表示,接下来,Atlas会成为未来版Marble以及World Labs其他产品的底层模型。
参考链接:
https://www.worldlabs.ai/blog/atlas
文章来自于"量子位",作者 "鱼羊"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0