随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
Camera-Controlled Video Diffusion Models 已经能够利用相机参数或几何条件控制视角变化,并生成具有较高视觉质量的视频。然而,这类方法大多依赖隐式的时空表示,缺少显式的 3D geometric grounding。尤其在较大的视角变化下,模型容易出现不合理的几何结构、物体形变以及跨视角空间不一致等问题。
针对这一问题,智象未来 (HiDream.ai) 提出 DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling,并被 ECCV 2026 录用。
DreamWorld 的核心思路是:将 3D Foundation Model 的空间结构先验与 Video Diffusion Model 的高质量生成能力结合起来,并显式地把 Geometry 作为世界生成过程中的中间结构表示。
不同于直接在 RGB 空间中完成所有生成任务,DreamWorld 采用 Geometry-then-Appearance 的两阶段框架:
先生成目标视角对应的几何结构特征,再以这些特征为条件生成最终 RGB 视频。

图 1: DreamWorld 与现有 Camera-Controlled Video Diffusion Models 的概念对比。与缺少显式 3D geometric grounding 的方法不同,DreamWorld 将 geometry 作为中间结构表示,引入 3D Foundation Model 的空间结构先验,以提升跨视角一致性与几何稳定性。

本文核心亮点
几何驱动:将 3D Foundation Model 的空间结构先验引入 Video Diffusion,为 Camera-Controlled World Generation 提供显式的 3D geometric grounding。
结构中间态:将 Geometry 从视频生成中的隐式结果提升为显式的 intermediate structural pivot,先生成目标视角的几何结构表示,再指导最终视频合成。
生成解耦:采用 Geometry-then-Appearance 两阶段框架,将 3D 结构推理与高质量外观生成分开建模,兼顾几何一致性与视觉质量。
效果领先:DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得领先表现。
近年来,视频扩散模型不断扩展生成模型的能力边界。在 Camera-Controlled Video Generation 中,用户可以给定一张初始场景图像,并指定一条相机轨迹,模型再根据相机运动生成对应的新视角视频。这类方法使视频生成模型逐渐具备了 “探索场景” 的能力,也成为 World Modeling 的重要技术路线之一。但问题在于:生成的视频看起来真实,并不意味着背后的 3D 空间一定稳定。
现有方法通常利用相机参数、Plücker embedding,或者由单张图像重建得到的点云投影视图作为生成条件。这些方法已经可以实现较好的 camera control,但视频扩散模型本身仍然主要依赖隐式的时空表征来推断未观测区域的场景结构。
在较大的 viewpoint change 下,这种缺乏显式 3D grounding 的建模方式可能带来:
也就是说,在相机不断移动的过程中,模型不仅需要生成新的图像内容,还要持续推断原本不可见的三维结构。而这正是当前 Camera-Controlled VDM 面临的重要挑战。
DreamWorld 的出发点,是重新思考 Geometry 在 Video Diffusion 中扮演的角色。
在很多已有方法中,Geometry 更像是一个辅助信息:相机参数可以告诉模型 “相机怎么移动”,几何投影可以提供目标视角下的部分可见内容,但最终的结构补全与视觉生成仍然需要由同一个视频模型共同完成。
DreamWorld 则选择了一条不同的路径:不再把 Geometry 只作为辅助条件,而是将其显式建模为生成过程中的 intermediate structural pivot。
换句话说,DreamWorld 不直接从输入图像一步生成最终目标视频,而是将生成过程拆分为两个连续阶段:给定 Input Image 和 Camera Trajectory,模型首先进行 Geometry Generation,生成目标视角对应的结构表示;随后,Appearance Generation 以这些 geometry features 为条件,进一步合成最终的 RGB Video。
第一阶段负责生成目标视角对应的结构表示。第二阶段再基于这些结构表示完成最终的视觉合成。这样,Geometry 不再只是 RGB 生成的隐式副产品,而成为连接 3D 空间结构和高质量视频生成的中间桥梁。

图 2: 直接以 warped partial images 作为条件时,生成结果容易受到结构缺失和投影 artifact 的影响;DreamWorld 则先在 geometry feature space 中完成结构推理,再进行 appearance synthesis,从而获得更加稳定的跨视角结果。
如果要显式建模 Geometry,一个自然的问题是:什么样的表示适合作为视频生成中的几何结构?
DreamWorld 选择预训练 3D Foundation Model 的中间特征作为 geometry representation。相比直接在 RGB pixel space 中进行结构推理,这类特征由大规模 3D /multi-view 数据预训练得到,能够编码与场景空间结构相关的 geometry-aware information。
具体而言,DreamWorld 从 3D Foundation Model 中提取多尺度几何特征,并通过一个轻量级的投影模块将其压缩到适合 Video Diffusion Model 使用的表示空间。随后,这些 geometry features 被作为显式结构条件,用于指导后续的视频生成。
因此,DreamWorld 的关键并不是直接预测某一种显式几何结果,而是将 3D Foundation Model 学到的空间结构先验转化为 Video Diffusion Model 可以利用的中间结构表示,从而连接 3D geometry modeling 与高质量视频生成。
DreamWorld 首先训练一个 Appearance Video Diffusion Model。它的目标并不是独立完成全部场景推理,而是在已经给定 geometry-aware representation 的前提下,生成高质量 RGB 视频。
具体来说,输入视频首先通过预训练 VAE Encoder 得到 latent representation。与此同时,视频会被输入预训练 3D Foundation Model,提取 multi-scale geometric features。但 3D Foundation Model 的 feature space 与 Video Diffusion Model 的 latent space 并不天然一致。
因此,DreamWorld 引入一个轻量级的 MLP-based compression module,将高维 geometry features 映射成更适合 Video Diffusion Model 使用的表示。随后,这些 geometry features 与 noisy video latent 在 channel dimension 上进行拼接,并共同输入 Appearance Video Diffusion Model。
这样,Appearance Model 的任务变得更加明确:在给定结构条件的情况下,专注于生成高质量的视觉内容。
而不是同时承担结构推理和外观生成两个目标。

图 5: DreamWorld 采用 Geometry-then-Appearance 的两阶段生成方式:首先根据输入图像和目标相机轨迹生成目标视角对应的 geometry representations,再将其作为结构条件输入 Appearance Video Diffusion Model,最终生成 RGB 视频。
训练阶段可以从真实视频中提取完整的 geometry features。但在真实推理时,输入只有:一张初始图像;一条用户指定的相机轨迹。因此,一个关键问题是:目标新视角的 geometry features 从哪里来?
DreamWorld 为此进一步设计了 Geometry Video Diffusion Model。首先,模型根据输入图像构建初始场景的点云表示,并按照目标 camera trajectory 将其投影到新的视角。由于输入只有单张图像,这些 warped observations 天然是不完整的:新的视角会暴露原本不可见的区域,同时还会出现遮挡和结构缺失。
DreamWorld 将这些 incomplete warped observations 输入 3D Foundation Model,得到对应的 incomplete geometry features。
随后,Geometry Video Diffusion Model 在 geometry feature space 中进行条件生成:具体而言,Geometry Video Diffusion Model 以 incomplete geometry features 作为条件,在 geometry feature space 中进行条件生成,并预测目标视角对应的 complete geometry features。
训练时,真实目标视频提取出的 geometry features 作为学习目标。通过 feature-level flow matching,Geometry Video Diffusion Model 学习从不完整的结构条件中恢复目标新视角对应的完整 geometry representations。
因此,DreamWorld 并不是直接在 RGB 空间中完成所有缺失区域的补全,而是:先在 Geometry Space 中完成结构生成,再进入 Appearance Space 完成视觉生成。
DreamWorld 的整体推理过程最终形成了一个清晰的两阶段 pipeline。
第一阶段:Geometry Video Diffusion Model: 输入初始 observation 和目标 camera trajectory,生成目标视角对应的 geometry representations。
第二阶段:Appearance Video Diffusion Model: 以第一阶段生成的 geometry representations 作为结构条件,在 VAE latent space 中进行条件去噪,并最终解码为 RGB frames。
因此,整个过程可以概括为:在完整推理过程中,DreamWorld 首先根据 initial observation 和 camera trajectory 进行 point-cloud-based warping,并利用 3D Foundation Model 从这些不完整观测中提取 geometry features。
随后,Geometry Video Diffusion Model 对这些结构特征进行生成式补全,得到目标视角对应的完整 geometry representations;最后,Appearance Video Diffusion Model 以这些结构表示作为条件,生成高质量的 novel-view RGB frames。
这个设计的核心是 Geometry-Appearance Decoupling。
Geometry Stage 主要关注:structural completion;cross-view consistency;camera adherence。
Appearance Stage 则主要关注:texture;visual details;photorealistic rendering。
通过这种 Geometry-then-Appearance 的方式,DreamWorld 将两个不同目标分开建模,使每个阶段可以更加专注于自己的任务。
DreamWorld 在 RealEstate10K、Tanks-and-Temples 以及 WorldScore 上进行了系统评测。
在 Novel View Synthesis 任务上,DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 的 Easy / Hard Set 上均取得领先结果。

表 1: DreamWorld 在 RealEstate10K 和 Tanks-and-Temples 上的 Novel View Synthesis 定量比较结果。*
除了传统的 NVS 指标,我们进一步在 WorldScore 上评估模型的世界生成能力。DreamWorld 获得 75.04 的 Average Score,并在 3D Consistency 和 Photo Consistency 等指标上取得更佳表现。

表 2: DreamWorld 在 WorldScore photorealistic subset 上的定量比较结果。
定性结果进一步展示了不同方法在大视角变化下的表现差异。
现有方法在 novel viewpoints 下可能出现结构缺失、warping artifacts 或局部几何不一致。相比之下,DreamWorld 通过先生成 geometry representations、再进行 appearance synthesis,在复杂场景和较大视角变化下能够保持更加稳定的空间结构和视觉细节。

图 4: DreamWorld 与现有 Camera-Controlled World Generation 方法的定性比较。DreamWorld 在复杂新视角下表现出更好的结构一致性和视觉质量。

DreamWorld 更多结果。
我们进一步通过消融实验验证 DreamWorld 中两个核心设计:Geometry Diffusion 和 Geometry-Appearance Decoupling。
其中,Baseline 直接将 warped partial images 编码到 VAE latent space 作为条件进行视频生成,不引入显式的几何建模;w/o Geometry Diffusion 将条件替换为 3D Foundation Model 提取的 geometry features,但直接使用不完整的几何特征,不进行生成式结构补全;w/o Geo-App Decoupled 则进一步引入显式 geometry modeling,但将 geometry 与 appearance 放在同一个生成目标中联合建模。
相比这些变体,完整的 DreamWorld 同时采用 Geometry Diffusion 对缺失结构进行补全,并通过 Geometry-then-Appearance 的两阶段设计将结构推理与视觉生成解耦,取得了最优表现。

表 3: DreamWorld 核心模块的消融实验。验证了 Geometry Diffusion 与 Geometry-Appearance Decoupling 的有效性。
DreamWorld 从 3D consistency 的角度重新思考 Camera-Controlled Video Generation:与其让 Video Diffusion Model 隐式完成所有空间推理,不如显式引入来自 3D Foundation Model 的结构先验,并将 Geometry 作为连接结构建模与视觉生成的中间表示。
通过 Geometry-then-Appearance 的两阶段框架,DreamWorld 先生成目标视角对应的 geometry representations,再基于这些结构特征完成最终的视频生成,从而在视觉质量、3D 一致性和相机控制之间取得更好的平衡。
文章来自于"机器之心",作者 "机器之心"。