
VAST,香港大学和PICO开源了一个双目世界模型——StereoWorld。
与现有“先生成单目视频,再估计深度、变换视角并修补遮挡”的多阶段方案不同,StereoWorld从生成开始便同时建模左右视图,使视觉外观与双目几何在同一模型中共同演化。
更重要的是,StereoWorld的训练不依赖显式深度监督。模型仅使用RGB双目视频,便能从左右视图之间的视差中学习稳定的几何关系。

近年来,视频生成模型已经能够合成高度逼真的动态画面,进一步加入相机轨迹或动作指令后,模型还可以向前移动、转向或探索新的视角,因此逐渐具备了“世界模型”的雏形。但大多数现有世界模型仍然通过单目RGB视频表示世界。
单张图像并不能唯一确定三维结构,同一个物体究竟是“体积很小但距离很近”,还是“体积很大但距离很远”,在二维画面中可能产生相同的投影。因此,单目模型中的深度通常是隐式且尺度不确定的。当相机持续移动时,这种不确定性还可能不断累积,最终表现为空间结构漂移、物体形状改变,甚至凭空出现原本不存在的内容。
另一类方法会额外生成深度图,构建RGB-D世界模型。但深度图与大规模RGB视频预训练模型之间还存在明显的模态差异;与此同时,由于误差累积,使用单目得到的depth warp后再inpaint得到novel view的方法往往会丢失视频中的细节信息(如下图中的铁丝网)。

双目视觉则提供了另一条路径。人类通过左右眼观察到的细微位置差异感知距离,当相机焦距和双目基线已知时,视差可以直接关联到真实尺度下的深度。因此,双目图像不仅多提供了一张画面,更为模型提供了一个稳定的三维“物理锚点”。
StereoWorld的出发点正是:与其让世界模型在生成完成后再猜测深度,不如让它从一开始就用“双眼”观察和生成世界。
给定单张图像、场景文本描述,以及WASD键控制的平移和上下左右键控制的方向,StereoWorld通过统一建模相机与视频帧RoPE编码的方式,同时生成后续的左眼视频和右眼视频。结果如下:





在最初的双目生成设置中,StereoWorld主要面向标准的校正双目相机:左右相机保持固定的水平基线,并沿着相同轨迹同步运动。在进一步拓展中,研究团队发现,StereoWorld并没有被限制在这一固定相机配置中。得益于统一的Camera-Frame RoPE对相机内外参及相对位姿的显式建模,模型能够进一步支持相对关系随时间变化的双相机轨迹。
在新的Flexible Stereo模式下,左右相机不再需要始终保持固定、平行的水平关系,而可以具有相对独立的运动轨迹。例如:
结果如下:






原始StereoWorld采用双向注意力,一次生成的视频长度受到81帧限制,研究团队进一步将其蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的KV Cache。蒸馏后的模型能够生成约10秒的双目视频,速度从0.25 FPS提升至约3 FPS,速度提升约10倍,为长时、交互式立体世界生成提供了初步基础。下面展示了蒸馏后的模型在长时视频推理的结果:



更进一步,研究团队发现,StereoWorld不仅可以从初始画面出发,同时生成左右两路视频,还可以迁移到另一种推理模式:给定一段完整的左视图视频,以及另一条目标相机轨迹,由模型补全对应的右视图视频。






此次开源版本展现出的灵活双相机控制与跨视图补全能力说明,StereoWorld的双目联合生成学习到的并非某一种固定视差模式,而是相机运动、场景内容与跨视图几何之间更一般的联合分布关系。沿着这一方向,StereoWorld有望能够从双相机扩展到更加自由的多视角配置,比如支持数量不固定的相机或更复杂的相对轨迹;另一方面,view inpainting的能力也有望将大规模单目视频资源转化为可控的立体或多视角内容,并服务于 VR/AR、虚拟摄影和沉浸式内容创作。
*该开源模型主要基于研究团队在CVPR 2026上发表的工作Stereo World Model。
代码:https://github.com/VAST-AI-Research/StereoWorld
项目主页:https://sunyangtian.github.io/StereoWorld-web/
文章来自于"量子位",作者 "StereoWorld 团队"。