当机器人拥有多个摄像头,它看到的世界是否仍然保持一致?
头部摄像头看到机器人正在抓取一个物体,腕部摄像头却显示机械臂还没有移动;一个视角中物体已经被放置完成,另一个视角中物体仍停留在原位 —— 这些看似细微的偏差,意味着模型生成的可能不是同一个真实世界。
一个新的问题也随之出现:
如何判断一个世界模型,是否真正理解了机器人所处的世界?
近日,北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起 TriWorldBench Challenge ,正式推出首个面向机器人三视角世界模型的评测榜单。

报名方式 / 网址:https://www.triworldbench.com/
该榜单聚焦机器人操作场景中的 head view(头部视角)、left-wrist view(左腕视角)、right-wrist view(右腕视角)多视角视频生成与理解能力,希望建立更加全面的世界模型评价标准,推动具身世界模型从 “视觉生成” 迈向 “世界理解”。
过去,视频生成模型的评价更多关注:
但对于具身世界模型而言,仅仅生成一段 “看起来真实” 的视频远远不够。
机器人需要面对的是一个动态、连续、具有物理规律的世界。
在真实机器人系统中,一个任务通常由多个摄像头共同观察:
头部摄像头负责提供整体环境信息,帮助机器人理解任务状态;
腕部摄像头贴近操作区域,可以捕捉抓取、接触等细节。
不同视角之间并不是简单的信息重复,而是共同构成机器人对世界的完整认知。
因此,一个真正可靠的具身世界模型,不仅需要生成单个视角下合理的视频,还需要保证:
多个摄像头看到的是同一个世界。
这也成为当前世界模型评测体系中亟待解决的新问题。
针对多视角一致性这一核心挑战,TriWorldBench Challenge 提出了一套面向机器人操作场景的综合评测体系。
相比传统单视角视频评价方式,TriWorldBench 更加关注模型是否具备真实世界理解能力。

01 多视角一致性:三个摄像头是否描述同一个世界?
TriWorldBench 首先关注三路视角之间能否相互对应。
模型生成的头部、左腕和右腕视频,不仅要各自合理,还需要保证:
换句话说,三路视频不能只是分别 “看起来合理”,还需要共同描述一次完整、连贯的机器人操作过程。
02 任务执行能力:机器人是否真的完成了任务?
对于机器人而言,视频生成不是最终目标,完成任务才是核心。
TriWorldBench 进一步评估模型对于机器人操作过程的理解能力,包括:
其中,头部视角主要用于判断任务指令、机械臂轨迹和最终结果;腕部视角则进一步检查抓取是否稳定、是否发生滑移,以及夹爪与物体之间的局部交互是否正常。
这意味着,画面看起来足够清晰、流畅,并不代表机器人真正完成了任务。TriWorldBench 希望让世界模型评价从 “看起来像” 进一步走向 “真正可用”。
03 物理世界理解:模型是否真正理解三维空间?
机器人面对的是三维物理世界。
因此,世界模型不仅需要生成视觉内容,还需要理解:
TriWorldBench 希望通过多视角评测,进一步探索世界模型对于真实环境的理解能力。
对一个榜单来说,排出名次只是第一步。更重要的是,它能否解释模型为什么得分高或低,并把清晰的改进方向反馈给研究者。TriWorldBench 因此没有把三路视频压成一个简单平均分,而是建立了从同步数据、动作状态到多层结果的完整评测链路。
01 从数据到指标:TriWorldBench 如何全面评估模型能力
基准包含 500 个三视角同步 episode,覆盖 50 个机器人操作任务。系统围绕三视角一致性、任务对齐、物理与 3D 一致性、运动质量、时序一致性和视觉质量六个维度,汇总 19 项评测信号,并以 TWB-Score 作为榜单总分。
02 三个视角如何共同判断机器人任务状态
三视角一致性被放在整个体系的中央。每个生成视角先与对应的真值相机进行对照,再通过 head-wrist 语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上相同,而是判断它们能否共同解释同一次操作。
与此同时,指标会被分配到证据最可靠的相机。头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果;腕部视角更适合观察接触、抓取稳定性、滑移和局部几何。这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的失败。
03 STATE 让评测知道何时该动、何时该稳
TriWorldBench 从参考机器人轨迹中构建 STATE 标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止。该动的腕部如果长时间冻结会被扣分,不该动的相机出现多余运动同样会被识别。由此,稳定不再等同于 “全程不动”,运动丰富也不再天然代表模型理解了任务。
04 总分用于排名,细粒度结果用于诊断
画质和美学分数也不会脱离任务单独决定胜负。当头部轨迹错误,或三路视频在机器人和物体状态上发生冲突时,系统会对视觉质量进行任务约束后的修正,避免一段精致但错误的视频凭借 “好看” 获得不合理优势。
在 VLM 语义评测中,评测协议还会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。榜单除了报告 TWB-Score,还保留六大维度、单项指标、逐视角、head-wrist 配对和联合三视角结果。研究团队因此不仅能看到排名,还能判断问题究竟出在任务、运动、画质,还是三个摄像头之间的世界状态没有对上。
这让 TriWorldBench 更像一套面向研发的 “体检报告”:它不只回答谁更强,也帮助解释模型下一步应该改进哪里。
TriWorldBench Challenge 面向全球相关研究团队开放报名。
参与对象包括但不限于:
无论是专注视频生成能力,还是探索机器人交互与空间智能方向的模型,都可以通过统一的数据和评测体系参与挑战。
通过公开榜单,TriWorldBench 希望为不同技术路线提供公平比较的平台,同时推动具身世界模型领域形成更加统一、科学的评价标准。
未来的机器人,不仅需要看到世界,更需要理解世界、预测世界,并在真实环境中完成复杂任务。
TriWorldBench Challenge 希望推动行业共同回答一个关键问题:
一个真正具备智能的世界模型,应该如何被评价?
期待更多研究团队加入 TriWorldBench,共同探索具身世界模型发展的下一阶段。
文章来自于"机器之心",作者 "机器之心"。