综述界定"交互式视频世界模型"= 闭环、逐帧动作条件、多轮交互的视频生成,并把整个领域拆成三个技术瓶颈——动作可控性、长程一致性与记忆、实时响应性——逐一梳理主流做法(动作注入四法、记忆/Forcing/显式 3D 三条一致性路线、蒸馏与缓存加速),最后横向对比四大应用(开放世界、游戏引擎、具身、自动驾驶)的 benchmark 与指标。
被动式视频生成(一次性文本/图像条件、双向时序、无因果)无法满足"人在环路"的交互需求:用户需要在每一轮基于最新输出再下达帧级甚至区域级指令,并要求实时反馈。这引出三个彼此耦合、互相拉扯的难题:
三者存在硬约束:细粒度动作注入 ↔ 长程一致性、长历史条件 ↔ 动作跟随,是全篇反复出现的中心张力。
作为一篇综述,本文的"方法"是一套分类学 + 技术地图,而非单一算法。其核心贡献结构:
核心技术壁垒(THE hardest insight):本综述真正难以替代的洞察是把"长历史↔动作跟随"与"一致性↔实时性"识别为同一族 trade-off,并将各类 Forcing 蒸馏范式(Teacher/Diffusion/Self/Context/Geometry/LIVE)组织成一条统一的"缓解 exposure bias + 因果蒸馏"演化谱系(见 Fig. 8)。这一跨方法的对齐视角,是零散读单篇论文无法自动获得的(详见 §7)。
综述本身不跑实验,而是聚合被引工作的报告数值,横向结论包括:
survey 的整体结构(趋势→三瓶颈→benchmark→未来)如下:

Paper's Figure 1(caption: "Overview of our survey structure ... We also calculate the evolving paper numbers until now."). 图中给出结构树与"论文数量随时间增长"曲线,说明该领域近两年爆发式增长,也界定了本 L2 各节的映射关系。
交互式世界模型区别于被动视频生成的本质在于"闭环 + 多轮 + 帧级动作":

Paper's Figure 2(caption: "Comparison of action controllability between video diffusion models and interactive world models."). 上排是传统扩散模型用一次性指令统辖全部帧;下排是交互式模型逐帧接受指令、每轮基于最新输出继续。这正是 §2 形式化里"history + 当前 action + 当前 condition"递归结构的图示。
从视频扩散模型迈向交互式世界模型需要"建立因果 + 注入动作"两步改造:

Paper's Figure 3(caption: "Transformation from video diffusion models to interactive world models ... requires both causality establishment and action condition."). 图强调把双向时序的一次性生成改成帧级因果自回归,才能让早先帧作为后续帧条件、实现 step-level 交互。
动作注入的四种主流机制(本综述的一个核心分类):

Paper's Figure 5(caption: "(a) Concatenation with visual tokens; (b) Scaling and Shifting; (c) Camera controlled rendering or simulation; (d) Matrix transformation."). 读者应注意:(a) 拼接是最通用做法(Genie/iVideoGPT/Matrix-Game),(c) 把生成重构为"相机控制的渲染/检索"(VMem、SWM),(d) 矩阵变换专用于全景球面世界(IaaW、GenEx)。
无形式化作者证明 — 仅实证/综述性质。本文是 survey/review,作者未提出新定理、未给收敛/样本复杂度界,也未运行自有实验;全部数值均转引自被引工作。全篇仅有两条定义性(非可证明命题的)方程,用于形式化"交互式"这一属性。
理想情况下,本领域缺失但值得拥有的形式化保证包括:(a) 自回归 rollout 的漂移上界随步数 $T$ 的增长率(现只有 "Compounding Errors" 的经验描述);(b) 记忆容量与一致性误差的定量权衡;(c) 历史长度 $L$ 与动作跟随保真度之间 trade-off 的可证明界。这些都停留在定性讨论。
尽管无定理,为对齐算法类笔记的 6 项检查,对两条载重方程做记法与物理意义核验:
记法表
| 符号 | 含义 |
|---|---|
| $\mathcal{S},\mathcal{A},\mathcal{O}$ | 世界状态 / 动作集合 / 视觉观测集合(POMDP) |
| $\mathcal{T}$ | 状态转移 $p(s_{t+1}\mid s_t,a_t)$ |
| $\mathcal{R}$ | 从生成视频中抽取的奖励 |
| $\mathbf{o}_{t+1}$ | 下一时刻观测 |
| $p_\phi$ | 参数为 $\phi$ 的交互式生成世界模型 |
| $\mathcal{H}_t$ | 交互历史 |
| $\mathbf{a}_t,\mathbf{c}_t$ | 当前用户/智能体动作、当前附加条件(文本/图像/编辑控制) |
方程物理意义
闭环递归采样:$\mathbf{o}_{t+1} \sim p_{\phi}(\mathbf{o}_{t+1} \mid \mathcal{H}_{t}, \mathbf{a}_{t}, \mathbf{c}_{t})$。下一观测在完整交互历史 + 当前动作 + 当前条件下被采样,这一条件结构就是"多轮渐进更新"的形式化,区别于一次性被动生成。
交互历史定义:$\mathcal{H}_{t} = \{\mathbf{o}_{1:t}, \mathbf{a}_{1:t-1}, \mathbf{c}_{1:t-1}\}$。历史被定义为过去所有观测、动作、条件的拼接,强制逐轮累积更新。
6 项最小核验
综述聚合被引工作报告的指标。载重表如下。
开放世界 3D 探索横评:

Paper's Table 3(caption: "Comparison of 3D interactive world models for open-world exploration."). WonderFree 在 CLIP score/一致性/IQA/Q-Align/美学分全部第一,WonderTurbo 次之;而相机可控性(CC)与 3D 一致性(3DC)的最高分反而由更早的 Text2Room / LucidDreamer 拿到,说明"感知质量"与"几何/控制"两组指标并非同一方法同时领先。
具身操作横评(WorldArena):

Paper's Table 4(caption: "Comparison of video generation and world models in robotic manipulation on WorldArena."). 关键观察是动作跟随(AF)列普遍偏低(多数 <5),即便画质/指令跟随强的 Veo3.1、Wan2.6 也如此——揭示"视觉可信"与"真正跟随动作"仍有明显 gap,呼应 §8 的反事实推理挑战。
world-action 策略学习横评:

Paper's Table 5(caption: "Comparison of world-action models for robotic policy learning on RobotWin 2.0 and Libero."). LingBot-VA、Fast-WAM 等把机器人控制当作因果世界建模的方法,在 RobotWin 2.0 与 Libero 上均超过传统 VLA 基线 $\pi_0$/$\pi_{0.5}$,支撑"用世界模型直接当策略"这一趋势判断。
游戏引擎能力级对比:

Paper's Table 6(caption: "Comparison of interactive game engines ... T, R, and E are translation-, rotation-, and other interactive related actions."). 沿时间看:分辨率升到 720p–1080p、速度到 24–60 FPS、时长到分钟级/无限、并逐步加入 memory(✓),且模型参数量总体在下降(如 Matrix-Game 2.0 1.3B、Yume-1.5 5B),是"更强能力 + 更小模型"的直接证据。
自动驾驶横评(NuScenes 生成质量):

Paper's Table 8(caption: "Comparison of video generation models and world models on the NuScenes validation set."). DriveLaW(FID 4.6)、OmniNWM(FVD 23.6)在分布/画质指标领先,显示 video-to-planning 与 unified video-action 方向在驾驶域已达到较低 FID/FVD 水平。
| # | 论证步骤(paper-internal) | 依据 |
|---|---|---|
| 1 | 交互性是世界模型的根本属性;人类通过与环境持续交互提升认知——因此机器智能也应支持多轮闭环交互,而非一次性生成 | §1 引言 + Franklin 题词 |
| 2 | 用 POMDP 与递归采样式 $\mathbf{o}_{t+1}\sim p_\phi(\cdot\mid\mathcal{H}_t,\mathbf{a}_t,\mathbf{c}_t)$ 形式化"交互式",据此提炼三大特征:帧级多轮可控、长程一致、实时反馈 | §2.1 定义与方程 (1)(2) |
| 3 | 三特征分别对应三大技术瓶颈章节(§4 可控性 / §5 长程 / §6 实时),且 §4 末尾显式指出"细粒度动作 ↔ 一致性""长历史 ↔ 实时"两组 trade-off 把三章串联 | §4 结尾承接 §5、§6 |
| 4 | 逐瓶颈枚举做法后,用四域 benchmark 横评把"能力—方法"落到具体数值,暴露数据、一致性、物理、接口四类缺口 | §7 Tables 2–8 |
| 5 | 由横评缺口导出五个未解挑战与对应方向(动作标注数据、反事实推理、极长程一致性、物理感知、可直接操作的接口) | §8 |
[实现未公开] — 本文为综述,无自有代码实现;作者维护一个论文清单仓库 https://github.com/liujiuming123/Awesome-Interactive-World-Model(非可运行代码,仅 curated list)。
核心技术壁垒(§2 Q2 对应段落):本综述最难替代的价值不在任何单一方程,而在其把 Fig. 8 中的多种 Forcing/蒸馏范式对齐为一条统一谱系——Teacher Forcing(训练用 GT 上下文,产生 train-inference mismatch)→ Diffusion Forcing(对历史帧加不同噪声缓解 exposure bias)→ Self-Forcing(用自生成 rollout 蒸馏,但误差无界累积)→ LIVE(前向 rollout + 反向 recovery + cycle-consistency)→ Geometry Forcing(对齐预训练几何基础模型的 3D 特征)→ Context Forcing / HY-WorldPlay(解决长上下文有记忆 student 与短上下文无记忆 teacher 的失配)。把"缓解 exposure bias"与"因果蒸馏提速"两条动机合并为同一演化轴,是零散读单篇无法自动获得的洞察。
Forcing/蒸馏谱系(Mermaid 补充结构清晰度,原图为并列子图不含演化箭头):
关键实现细节(易被忽略的 trick):