Code World Model: Coding Agent as World Brain
论文地址:https://arxiv.org/abs/2608.25927
项目页面:https://buaacyw.github.io/cwm/
学术交流:922230617
目录
1. 引言
2. 相关工作
2.1 交互式视频世界模型
2.2 生成式 3D 世界
2.3 代码Agent与世界模型
3. 方法
3.1 Code World Model
3.2 世界状态对视频模型的条件控制
3.3 数据
4. 实验
4.1 实现细节
4.2 结果展示
5. 总结与展望
1. 引言
构建一个能够模拟真实世界演化规律的世界模型(World Model),是通往通用人工智能的关键路径之一。传统的视频世界模型尝试从海量视觉数据中 “看” 出世界如何变化,但它们面临一个根本困境:视频只记录了演化的结果,却丢失了背后的规则、因果和持久状态。
例如,在游戏《上古卷轴》中,如果玩家刺杀了某城市的领主,后续会引发政权更迭、NPC 行为变化等一系列连锁反应。这些效应可能发生在数小时之后,甚至当玩家离开该城市时仍在后台继续演化。视频模型仅凭像素预测,很难推断出这种复杂的因果链条,也无法维护离屏实体的状态。
为此,本文提出Code World Model(CWM),其核心创新是将“世界演化”与“视觉渲染”解耦:
一个代码Agent(Coding Agent)充当 “世界大脑”,负责推理事件后果、维护持久状态,并通过生成可执行代码来驱动世界演化;
一个视频生成模型作为 “视觉后端”,负责将抽象世界状态渲染为高保真、物理合理的视觉观测。
这种分工既保证了逻辑一致性和长期可追溯性,又充分利用了视频模型丰富的视觉先验。
论文的主要贡献包括:
提出 CWM 框架,将代码驱动的世界演化与视频驱动的视觉生成统一起来;
设计Proxy(将世界状态转换为 proxy 视频)作为中间桥梁,以粗粒度的时空约束控制视频生成,无需构建完整 3D 资产;
构建了游戏和真实世界数据的对齐管道,初步验证了框架的可行性。
2. 相关工作
2.1 交互式视频世界模型
近年来,基于扩散 Transformer 的视频生成模型(如 HunyuanVideo、Wan)取得了长足进步,并被用于构建可交互的 “神经游戏引擎”(如 Genie、GameGAN)。它们通过动作或文本条件预测未来帧,但主要依赖视觉历史记忆,缺乏显式的状态管理和因果推理能力。
2.2 生成式 3D 世界
另一类工作(如 WorldGen、HunyuanWorld)致力于生成可探索的显式 3D 场景。它们强调几何一致性和自由视角,但资产制作和渲染成本高昂,且难以覆盖开放世界中的无限变化。
2.3 代码Agent与世界模型
已有研究(如 WorldCoder、Code World Models for General Game Playing)证明 LLM 可以通过编写 Python 程序来模拟环境动态。
本文在此基础上更进一步,将代码作为持续运行、可修改的世界执行引擎,而非仅用于离线建模。
3. 方法
CWM 的整体流程如图 2 所示:代码Agent(Coding Agent)通过读写代码(Code)来更新可执行世界状态 S_t^exe,然后该状态被编译为 Proxy 和提示输入视频模型 G_θ,生成最终观测 O_{t+1}。
其中,A_t 表示动作,T_AC 表示联合 Agent-Code 的转移。
3.1 Code World Model
将完整世界状态分解为:
可执行状态 S_t^exe:包含实体属性、规则、关系、事件历史等,由代码直接操作。
视觉状态 S_t^vis:包含由视频模型生成的外观、运动等信息,需保持跨帧一致性。
更新过程分为两层:
高层推理(稀疏):代码Agent(如 GPT-5.6)负责处理复杂事件(如外交、战术),生成或修改代码。
低层执行(高频):代码循环负责每帧的位置更新、碰撞检测、属性变化等,无需调用大模型。
这种设计大幅提升了运行效率,同时保持了规则的确定性和可修改性。
3.2 世界状态对视频模型的条件控制
如何将精确的时空状态传递给视频模型是核心挑战。纯文本描述不够精确,而完整 3D 重建成本太高。因此论文引入Proxy。
Proxy 是什么?Proxy 是一种粗粒度的、程序化生成的空间表示,包含实体位置、姿态、轨迹、相机运动等关键信息。它由世界状态直接编译而成,例如:
人物用胶囊体或火柴人表示;
车辆用线框表示;
场景用低多边形占位体表示。
Proxy 如何工作?
代码更新状态后,轻量级编译器将状态渲染为 “Proxy 视频”(低分辨率、仅有几何轮廓)。
Proxy 视频与文本描述一同输入视频模型。
视频模型在 Proxy 提供的强时空约束下,利用其生成先验填充纹理、光影、物理细节等。
这样,Proxy 提供了像素级的控制信号(位置、运动轨迹必须准确),而视频模型负责外观逼真度。两者结合,既保证了逻辑精确性,又发挥了生成模型的创造力。
3.3 数据
训练视频模型理解 Proxy,需要大量时空对齐的 (Proxy, 文本, 目标视频)三元组。
游戏数据(如 GTA V):在游戏运行时同步记录 RGB 画面、引擎内部状态(坐标、朝向、碰撞等)。然后程序化生成对应的 Proxy 视频,确保帧级对齐。
真实世界数据(如 KITTI-360):通过 3D 重建和语义分割,即使没有游戏引擎,也能从真实视频中提取相机位姿、物体位置和深度图,进而编译出 Proxy。这大大扩展了数据来源,使模型能学习真实世界的物理和光照。
4. 实验
4.1 实现细节
基础模型:MiniMax-H3 Ref2VA(开源的视频生成模型)。
微调数据:约 5.6 小时的 GTA V 游戏录屏,切分为 9,420 个 5 秒片段(124 帧,1344×768,24fps)。
Proxy 设计:低分辨率(336×192),包含深度图和语义 ID 图。
微调方法:LoRA(秩 128),在所有 50 个 Transformer 块上应用,可训练参数约 596M。
优化器:AdamW,batch大小8,BF16 混合精度,训练 3 个 epoch(共 3,534 步)。
代码Agent:GPT-5.6 Sol,用于推理时生成或修改游戏逻辑。
4.2 结果展示
尽管仅使用了少量GTA V数据进行微调,模型展现出了惊人的泛化能力:
多风格迁移:在 Proxy 骨架控制下,模型能生成 “美少女战士”、“詹姆斯·邦德”、“飞天鳐鱼” 等多种风格角色,且动作轨迹严格遵循 Proxy 的时空约束。
复杂动作跟随:包括行走、摔倒、翻滚、运镜弧线等,Proxy 都能精确引导视频模型生成相应的动态。
高保真细节:生成的画面保留了细腻的纹理、光影和物理交互(如雨水、布料飘动),远超简单渲染。
5. 总结与展望
Code World Model 首次将代码Agent的逻辑推理能力与视频生成模型的视觉表现力深度融合,为构建可推理、可持久化、高保真的开放世界模型开辟了新路径。它的成功验证了 “符号+连接” 混合范式的巨大潜力。
局限性:
- 系统受限于现有的计算预算,训练规模依然较小,导致当前的生成质量(分辨率、保真度)仍有较大的提升空间。此外,目前的原型系统尚未实现自回归的实时生成(即无法像游戏引擎一样以 30 FPS 或 60 FPS 的速度持续无限地生成新帧)。
- 尽管代码Agent(如 GPT-5.6)进展迅猛,但它们目前依然难以可靠地从头实现(from scratch)高度复杂的游戏机制。CWM 为Agent提供了基础的游戏引擎代码(如 GTA V 的基础碰撞、移动循环和场景资源),Agent主要负责调用、组合和局部修改,而非全自动构建。
未来方向:
- 加速视频模型推理,朝实时交互迈进;
提升代码Agent自主构建复杂场景和逻辑的能力,减少人工预设。
这篇论文不仅是一项技术创新,更是一种思路的转变——让 AI 通过编写代码来 “理解” 世界,再通过生成视频来 “呈现” 世界,这或许正是通往通用世界模拟器的正确方向。