具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26
AI技术研报 2026-07-29 13:49
+5117 阅读

大规模视频扩散模型,画面越来越真,却总在“物理定律”上栽跟头。


几何漂移、摄像机轨迹不稳定以及场景结构不连贯等问题,对于要求稳定摄像机运动和连贯世界几何的下游应用来说,是致命的缺陷。


以往为了解决这些问题,研究者们主要采取两种思路:


  • 一种是修改生成器架构,加入额外的模块或几何感知对齐。
  • 一种是采用基于强化学习的后训练对齐。


然而,修改架构可能会破坏互联网规模预训练模型的泛化能力;并且现有的对齐方法不仅局限于静态场景,还依赖于RGB空间的奖励,这需要反复进行VAE解码,导致计算开销昂贵,而且无法泛化到高度动态的真实世界场景中。


最近,来自Google、哥本哈根大学、牛津大学等机构的研究者提出了VGGRPO(Visual Geometry GRPO,收录于ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。


其核心思路是,在隐空间(latent space)中利用4D几何奖励,进行几何感知的视频后训练。


具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26

VGGRPO生成的世界一致视频。左侧为基线模型,右侧为VGGRPO对齐后的模型。VGGRPO在挑战性动态场景中显著减少了几何漂移和结构伪影,生成了更连贯的场景结构和更平滑的摄像机运动。


VGGRPO做了什么?


VGGRPO是一个由隐式几何引导的、基于组的强化学习(GRPO)视频后训练框架。它包含两个紧密耦合的核心组件:隐式几何模型(Latent Geometry Model, LGM)和VGGRPO训练流程。


具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26

VGGRPO方法概览。(a)隐式几何模型训练:通过轻量级连接层将VAE隐变量与几何基础模型对齐,直接从隐空间预测4D场景几何。(b)VGGRPO训练:在隐空间中利用摄像机运动平滑度奖励和几何重投影一致性奖励进行GRPO优化。


首先,VGGRPO构建了一个隐式几何模型(Latent Geometry Model, LGM)。通过一个轻量级的连接层,LGM将视频扩散模型的隐变量(latents)与预训练的几何基础模型“缝合”在一起。这意味着,模型可以直接从隐空间解码出场景几何信息,而无需先将其解码回RGB像素空间。更重要的是,通过采用具备4D重建能力的预训练几何模型,LGM让VGGRPO自然地扩展到了动态场景,突破了以往方法仅限静态场景的瓶颈。


在此基础上,VGGRPO设计了两个关键的奖励机制,在隐空间中进行组相对策略优化(GRPO),彻底免去了昂贵的VAE解码过程。


摄像机运动平滑度奖励(Camera Motion Smoothness Reward):告别抖动的镜头


在生成的视频中,不稳定的摄像机运动往往会导致时间上的扭曲和结构上的伪影。为了鼓励稳定且符合物理规律的摄像机轨迹,VGGRPO基于隐式几何模型预测的摄像机位姿,计算平移和旋转的加速度,对抖动的轨迹进行惩罚。平滑的轨迹奖励接近1,而抖动的运动则会使奖励降低。这一奖励机制促使模型生成更加平滑的镜头运动。


几何重投影一致性奖励(Geometry Reprojection Consistency Reward):跨视角的场景连贯性


仅仅镜头平滑还不够,同一场景在不同视角下必须保持几何上的一致。VGGRPO利用预测的点云、深度、摄像机参数和场景光流,将预测的3D结构重投影到各个视角中,并比较深度图的差异来衡量场景一致性。对于动态场景,它还能利用场景光流过滤掉动态区域,仅聚合静态点来获得稳定的场景表示,强有力地保证了跨视角的几何连贯性。


实验结果


具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26

静态和动态场景的定性比较。


广泛的实验表明,VGGRPO在静态和动态场景基准测试中均取得了显著的提升。VGGRPO在静态和动态场景的几何相关指标上均领先基线方法。在通用视频质量指标上,VGGRPO同样超越基线,表明几何感知后训练没有牺牲预训练模型的生成能力。


具身智能最缺的“空间常识”,被这套隐空间强化学习一次性补全 | ECCV‘26

奖励组件消融实验。


此外,在上图奖励组件消融实验中展示了单独使用摄像机运动奖励(r_motion)可以稳定摄像机轨迹,但几何伪影依然存在(绿圈标注)。加入几何重投影一致性奖励(r_motion+r_geo)后,场景几何得到进一步改善,同时保持了平滑的摄像机运动,验证了两个奖励的互补性。


VGGRPO的意义是什么?


现在的视频生成模型不仅要生成视觉真实的画面,还需要“创造一个符合物理规律的一致世界”


VGGRPO给出的答案是:不需要复杂的架构修改,也不需要昂贵的像素级奖励。通过将几何先验直接引入隐空间,并在4D维度上进行强化学习对齐,它让模型在生成视频时,既能保持镜头的平滑,又能构建出跨视角连贯的物理世界,并适用于动态场景。


对于世界动作模型、具身智能等领域而言,稳定而一致的世界建模能力是模型进行预测、规划与交互的重要基础。VGGRPO为此提供了一种高效、灵活的几何感知后训练范式。


作者介绍


安照崇现为哥本哈根大学博士生,隶属于Pioneer Centre for Artificial Intelligence和ELLIS项目,导师为Serge Belongie教授。他于2023年获得苏黎世联邦理工学院(ETH Zurich)计算机科学硕士学位,导师为Luc Van Gool教授。他的研究方向主要包括视频生成,多模态以及世界模型。


论文链接:https://arxiv.org/pdf/2603.26599


文章来自于"量子位",作者 "VGGRPO团队"。

添加客服微信openai178,进AITNT官方交流群