让代码接管世界演化,西湖大学发布Code视频世界模型

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

让代码接管世界演化,西湖大学发布Code视频世界模型
AI资讯 2026-09-04 15:49
+8101 阅读

该项目的第一作者是南洋理工大学博士生、西湖大学访问学生陈奕文。指导老师是西湖大学通用人工智能实验室负责人张驰助理教授。


能生成一段逼真的画面,不等于能让一个世界持续运转。真正的开放世界不仅要回答「下一帧是什么」,还要记住屏幕之外发生过什么、规则如何作用,以及一次事件会怎样在很久以后继续改变角色与环境。


近年来,视频世界模型的画质、动作控制和交互速度快速提升,它们已经可以把键盘、鼠标、动作或文本指令转化为连续视觉画面。但现有系统的核心建模对象,往往仍是「接下来应该生成什么观察」。视觉历史能够记录看得见的结果,却很难直接保存世界规则、角色关系、事件历史和屏幕之外持续发展的因果链。


想象一下,游戏中如果玩家刺杀了一座城市的统治者并离开,城市秩序、继承关系、贸易、阵营联盟以及大量非玩家角色的信念和目标,都应该继续变化。等玩家很久以后返回,系统不仅要生成一幅「看起来合理」的城市画面,还要知道玩家离开期间发生了什么、为什么发生,以及这些后果接下来还会如何延伸。


为此,西湖大学 AGI Lab 的研究团队提出 Code World Model。它不再要求视频模型独自从视觉结果中反推所有隐藏机制,而是把「世界如何演化」和「世界如何被看见」拆成两个互补问题:Coding Agent 负责决定世界如何演化,代码负责让规则持续执行,视频模型负责把演化后的状态转化为高保真视觉观察。


让代码接管世界演化,西湖大学发布Code视频世界模型


图 1  Code World Model 概览:Coding Agent 维护规则与状态,Proxy 提供时空约束,视频模型负责高保真视觉实现。该图为论文中的 AI 生成示意图。


  • 论文标题:Code World Model: Coding Agent as World Brain
  • 作者:Yiwen Chen、Guosheng Lin、Chi Zhang
  • 论文:arXiv:2608.25927
  • 项目主页:https://buaacyw.github.io/cwm/
  • GitHub:https://github.com/buaacyw/code-world-model


为什么只学习视频,还不够支撑开放世界


视频记录的是世界演化后的可见结果,却没有直接暴露产生结果的知识、规则和机制。游戏画面尤其如此:每一帧都由固定代码执行后渲染出来,但一旦变成训练视频,真正让世界运转的代码就被丢掉了,模型只能从稀疏的视觉后果中反推碰撞、攻击范围、阵营关系、任务状态等隐藏逻辑。


这种信息缺口在长时间尺度上更加明显。当前视频模型的上下文通常短于一分钟,而角色关系、社会结构和事件后果可能在世界时间里的几天甚至几年中持续演化。许多关键变化又发生在镜头之外。扩大视频训练规模可以增加「见过的结果」,却不会自动提供生成这些结果的白盒机制。


Code World Model 的判断是:开放世界需要两种不同的能力。一种是低频但复杂的推理 —— 理解事件、关联世界知识、规划后果、修改机制;另一种是高频而重复的执行 —— 更新位置、数值、日程、冷却、碰撞和规则。把两者全部塞给同一个视频模型,既低效,也难以保证结果可复现。


核心思路:


代码管「发生什么」


视频模型管「看起来怎样」


让代码接管世界演化,西湖大学发布Code视频世界模型


图 2  方法流程:交互意图进入 Coding Agent,Agent 通过代码更新 World State;世界状态经条件接口交给视频模型,生成视觉世界并形成反馈闭环。


在这一框架里,Coding Agent 是「世界大脑」。它读取当前世界状态,解释新的交互或事件,决定哪些实体和机制需要改变,并选择调用已有代码还是局部改写世界程序。代码则像 Agent 的可执行延伸,在不需要每一步都再次调用大模型的情况下,持续完成密集、确定、可复用的状态更新。


这意味着代码不是开发者预先写死、之后再也不变的游戏逻辑;它也不是一个与 Agent 分离的外部控制器。Agent 可以根据新情况组合、调用或修改代码,改变的不仅是「当前状态」,还包括这个世界今后如何运行。运行结果、测试和新的世界反馈再返回给 Agent,构成持续的 Agent–Code 闭环。


论文进一步把完整世界状态拆成两部分:可执行状态保存程序、实体属性、规则、关系与事件历史;视觉状态保存由视频模型生成、且需要在时间上保持一致的外观和运动信息。两部分由不同机制更新,但彼此耦合:代码确保规则与后果持续存在,视频模型则利用大规模视觉数据中学到的外观、运动与交互先验,把世界状态实现为高质量观察。


Proxy:


给世界状态增加一条可编程的「视觉通道」


确定了世界状态之后,新的问题随之出现:如何把不断变化的状态准确交给视频模型?只用结构化文本最简单,但文本很难以低延迟方式逐帧描述角色位置、遮挡关系、相机轨迹和实体运动;让 Coding Agent 直接建造完整 3D 世界虽然控制更强,却需要高质量资产、动画、材质、灯光与渲染系统,也会过早限定最终画面。


研究团队因此提出 Proxy:一种由世界状态确定性编译得到的粗粒度视觉条件。Proxy 不追求做出一个低配版成片,而只保留当前观察必须遵守的最小状态,例如实体位置、近似尺度、姿态、运动轨迹、空间关系、遮挡和相机运动。简单的人形、线框车辆、低多边形植被或包围盒,都可以成为可调用的基础组件。


结构化文本与 Proxy 分工明确:文本负责身份、外观、动作语义和风格,Proxy 负责逐帧的空间与时间约束。所有控制信号都能追溯到 Coding Agent 和代码维护的世界状态,因此这条「状态 — 条件」通路仍然是可检查、可寻址、可局部修改的白盒系统。


Proxy 的关键不是越精细越好,而是找到「可构建性」和「约束强度」的平衡。过于丰富的 Proxy 会要求 Coding Agent 同时维护大量关节与细节轨迹;过于稀疏又可能不足以约束视频模型。当前实现把 Proxy 的横纵分辨率都设为目标视频的四分之一,因此视觉 token 数量约为目标视频的十六分之一,额外推理负担相对有限。


数据怎么来:


把游戏运行时与真实视频编译到同一接口


让代码接管世界演化,西湖大学发布Code视频世界模型


图 3  游戏数据与真实世界数据中的 RGB–Proxy 对齐示例。相邻 RGB 与 Proxy 来自同一时刻,保留实体位置、场景布局、相机运动与遮挡关系。


要让视频模型读懂 Proxy,训练数据必须同时包含严格对齐的 Proxy 视频和 RGB 目标视频。游戏天然适合这项工作:研究团队在运行 GTA V 时同步记录画面,以及构建 Proxy 所需的相机、实体、场景和交互状态。代码可以从同一次运行记录中反复编译不同覆盖范围、不同信息粒度的 Proxy,而不必重新采集 RGB 视频。


这套接口也为真实视频留下了入口。论文在 KITTI-360 上进行了几何辅助的概念验证:校准相机位姿、语义 3D 重建和物体标注只用于离线编译 Proxy,视频模型最终接收的仍是 RGB 目标、Proxy 视频和结构化文本。对模型而言,相机运动和动作后果已经体现在 Proxy 中,不再需要额外定义独立的动作标签。


用约 5.6 小时游戏视频完成原型验证


当前原型在 MiniMax-H3 Ref2VA 视频模型上进行适配。训练数据来自 157 段游戏过程,总计约 5.6 小时;团队以两秒间隔采样出 9,420 个五秒训练片段。每个 RGB 目标包含 124 帧、分辨率为 1344×768、帧率为 24 FPS;与之对齐的 Proxy 为 336×192,并组合固定对数深度与语义 ID 图。


训练采用 rank-128 LoRA,覆盖 50 个 Transformer block,约 5.96 亿可训练参数,在 8 张 NVIDIA H800 上训练 3 个 epoch。推理时,研究团队使用 GPT-5.6 Sol 作为 Coding Agent;它基于已有的游戏引擎代码、基础玩家控制、碰撞和更新循环,组合、扩展并改写模板来构建目标世界。GPT Image 2 依据首帧 Proxy 和 Agent 编写的文本提示生成外观锚点,完整 Proxy 序列继续控制相机、实体运动和场景布局。


让代码接管世界演化,西湖大学发布Code视频世界模型


图 4  定性结果:每组上排为逐帧 Proxy,下排为视频模型生成的 RGB 观察。示例覆盖角色动作、飞行 / 镜头轨迹及多实体空间关系。


论文给出的定性结果显示,经过小规模 LoRA 适配后,视频模型可以在保持丰富外观与局部动态的同时,跟随 Proxy 指定的角色位置、动作轨迹、场景布局和相机运动。项目页还提供了与动作条件、相机条件视频世界模型的完整时序对比,用于展示 Proxy 在逐帧控制粒度上的差异。需要强调的是,这些比较主要考察控制效果,并未把推理延迟纳入比较。


从「按指令生成」到「在运行中改世界」


项目页最直观的一组演示,是 Coding Agent 对世界状态和操作机制的持续更新:角色可以在海底港口召唤飞行坐骑,在魔法学院执行舞蹈动作,在姜饼村落切换骑乘与移动,也可以在雪夜山村触发新的角色交互。画面的材质和风格由视频模型实现,但角色数量、近似位置、运动状态与关键空间关系仍由 Proxy 逐帧约束。


让代码接管世界演化,西湖大学发布Code视频世界模型


长时生成:


视觉风格可以切换,世界状态仍持续前进


为了生成更长序列,当前系统使用带重叠的 124 帧窗口:相邻窗口重叠 34 帧,每次向前推进 90 帧;前一窗口末尾的 RGB 帧负责局部连续性,同一个首帧外观锚点则帮助维持全局身份和外观。Proxy 条件贯穿完整时间轴,因此即使画面风格发生周期变化,实体轨迹、相机运动和关键空间关系仍有持续的状态来源。


让代码接管世界演化,西湖大学发布Code视频世界模型


图 5  长时生成视频 051 的 Proxy/RGB 对照截图。两分多钟序列中视觉风格发生切换,Proxy 持续提供实体与空间约束。截图直接提取自项目页视频素材。


让代码接管世界演化,西湖大学发布Code视频世界模型


这项工作真正改变了什么


Code World Model 的价值不只在于增加一种视频控制条件,而在于改变了世界模型内部的职责分工。传统视频世界模型倾向于把状态、规则、记忆、视觉预测都压进生成序列;这里则把可执行世界状态提到系统中心,由 Coding Agent 和代码负责因果演化,再把当前需要「看见」的部分选择性编译成条件。


这种分工让高层推理与低层执行解耦:Agent 不必以视频帧率工作,代码也不必具备开放式常识推理;视频模型无须从零学习完整规则,只需把明确的世界状态实现为视觉观察。即使未来语言与视频能力被统一进同一个多模态网络,外部代码维护的持续世界状态仍然需要一种高效、可控的输入接口,Proxy 所讨论的「状态 — 视觉条件」问题依旧存在。


在应用层面,这一范式指向的不只是游戏生成。一个能够保持规则、记住离屏变化并生成高保真观察的开放世界,也可能成为训练和评估智能体的环境,用于具身智能、自动驾驶和长期规划等需要理解、预测并作用于动态环境的任务。


结语:


世界模型的重点,或许不只是「下一帧」


如果说视频生成模型擅长想象「世界看起来是什么样」,Coding Agent 与代码则更适合回答「世界为什么会变成这样,以及接下来应该怎样继续变化」。Code World Model 试图把这两种能力放在同一个闭环里:让知识和规则驱动状态,让状态借助 Proxy 进入视觉空间,再让视频模型把结果实现为丰富、开放的观察。


这项工作仍处在早期,但它提出了一个值得关注的判断:通往开放式世界模型的道路,未必只是继续扩大视频预测模型,也可能需要把可执行代码重新带回世界演化的核心。世界不再只是连续生成的画面,而是一套能够被理解、修改、执行并持续留下后果的运行系统。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群