李飞飞发布:全球首个多模态世界模型

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

李飞飞发布:全球首个多模态世界模型
AI技术研报 2026-09-02 10:07
+6923 阅读

「全球首个」多模态世界模型,来了!


来自李飞飞World Labs。


李飞飞发布:全球首个多模态世界模型


World Labs对这个名为Atlas的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟:


建模世界,移动相机,模拟空间和时间。


就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且空间时间都能理解。


李飞飞发布:全球首个多模态世界模型


李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶:


Atlas为从视觉特效到机器人的众多应用场景打开了大门。


李飞飞发布:全球首个多模态世界模型


飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。


李飞飞发布:全球首个多模态世界模型


具体来说,Atlas是一个多模态自回归扩散Transformer,它的能力包括:


相机控制生成:仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。


李飞飞发布:全球首个多模态世界模型


空间重建:Atlas可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式3D表示,其效果超过当前专门针对3D重建训练的最先进模型。


李飞飞发布:全球首个多模态世界模型


时空模拟:Atlas可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人Real-to-Sim工作流。


李飞飞发布:全球首个多模态世界模型


图像生成:Atlas可以根据文本生成图片和360°全景图,能够遵循复杂Prompt、准确渲染文字,并生成大量不同的视觉风格。


对于机器人模拟,仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。


李飞飞发布:全球首个多模态世界模型


从头训练的多模态世界模型


技术细节上,Atlas是一个全能模型(omni model)


它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。


与此同时,空间控制是整个模型的核心


为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础——多模态自回归扩散 Transformer


文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,从而形成一个空间上下文


然后,Atlas会根据这个上下文生成多模态输出。


这样一来,比如把两张毫无关系的参考图片放进同一个上下文中,再分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。


李飞飞发布:全球首个多模态世界模型


更具体地拆解一下,多模态,指的是Atlas可以原生处理多种不同的数据类型,包括文本、图像、相机位姿、3D深度图等。


视频则被表示为图像序列


每一张图像和每一幅深度图,都对应一个明确的相机位姿。


自回归,指Atlas操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。


Atlas每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。


这种灵活的设计天然适用于各种不同任务。


每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。


扩散模型,指Atlas是一个Rectified Flow(校正流)模型,通过逐步去噪来生成输出。


扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。


Transformer不必多说,在世界模型领域,Transformer也被证明是非常稳健的基础架构。


也就是说,Atlas实际上融合了大语言模型和视频模型中的大量思想。


Atlas既可以利用大量原本服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等等。


另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的VAE架构。


研究团队在相机控制生成和3D重建两个关键任务上对这个新一代世界模型进行了定量评估。


在相机控制生成上,结果显示,Atlas优于SOTA视频模型。


并且相机轨迹越复杂,Atlas的优势越大。


李飞飞发布:全球首个多模态世界模型


在根据稀疏输入视角进行3D重建的任务中,Atlas同样超过了表现最好的专业开源3D重建模型。(分数越低表现越好)


李飞飞发布:全球首个多模态世界模型


值得一提的是,Atlas从设计之初就为Scaling做好了准备。


李飞飞团队表示,已经看到了非常有利的证据,证明Atlas的能力会随着规模扩大而继续提高


目前,Atlas正在向部分合作伙伴开放早期访问。


也可以在官网申请访问权限。


李飞飞发布:全球首个多模态世界模型


具身智能Real-to-Sim的关键一步


李飞飞新世界模型一出,关注的焦点,还是汇聚在具身智能上。


把今年World Labs的动作联系起来,Atlas的意义也更加明朗。


今年6月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器。


并明确指出,「最关键的是模拟器」。


因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。


紧接着,7月21日,World Labs收购机器人仿真公司SceniX。


7月28日,公开Real-to-Sim-to-Real系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。


现在,Atlas来了。


从真实照片/视频,到3D空间,再到机器人传感器视图和可变化的模拟环境,这一条路径被打通了。


World Labs官方表示,接下来,Atlas会成为未来版Marble以及World Labs其他产品的底层模型。


参考链接:

https://www.worldlabs.ai/blog/atlas


文章来自于"量子位",作者 "鱼羊"。

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群