用一致性模型 (consistency model) 同时做图像解码与潜空间动力学预测,构建 action-conditioned 视频世界模型:单张 RTX 4090 上以 15 FPS 稳定 rollout >10 分钟,FVD 243 远超扩散基线;纯世界模型生成数据训练 IL 策略达到与等量真实数据相当的成功率,且 sim 评测与真实性能强相关。
现有 action-conditioned 视频预测世界模型有两个互斥的失败模式:要么依赖重型网络 + 多步扩散过程 (Cosmos、UVA、Ctrl-World) 而太慢、需企业级 GPU 集群、无法交互;要么在长 horizon 自回归 rollout 中因误差累积而不稳定 (DINO-WM、Dreamer)。这限制了世界模型两个关键机器人应用:可扩展的 IL 训练数据生成、可复现的策略评估。
形式化目标:给定机器人交互数据集 $\mathcal{D}$,每条 episode 为 $\mathcal{E}=\{(o_0,a_0),\dots,(o_T,a_T)\}$,$o_t\in\mathbb{R}^{3\times H\times W}$。学习一个自回归模型 $\hat{o}_t=f(o_{t-N:t-1},a_{t-N:t-1})$,输入 $N$ 步历史观测 + 动作,输出下一帧,最小化 $\|\hat{o}_t-o_t\|_2$。
假设:类马尔可夫 (固定长度 $N$ 上下文窗口即足够表征状态);episode 内 $(o_t,a_t)$ 由真实机器人交互采样;推理时上下文会被自己的预测污染 (非 i.i.d.),这正是稳定性的核心风险来源。
两阶段设计,两个阶段都用一致性模型:
核心技术壁垒:在潜空间用一致性模型做 next-frame 动力学,并且训练时只对最后一帧施加满噪声 (Eq. 4) —— 这把"多模态未来分布的高效表征"和"下一帧监督"统一进单一去噪映射;配合对上下文注入小噪声使 $F_\psi$ 对被自己污染的历史鲁棒,才实现了 >10 分钟不崩溃的自回归稳定性。这是最难复现的一处 (见 §7)。

Paper's Figure 2 (caption: "Method Overview. Model training proceeds in two stages... In Stage 1 we train an autoencoder that maps RGB observations into compact 2D latent representations using a CNN encoder $E_\phi$ and a consistency-model decoder $D_\theta$... In Stage 2 we freeze the autoencoder and train an action-conditioned consistency model $F_\psi$ in latent space... During inference, $F_\psi$ autoregressively predicts future latents, which are decoded by $D_\theta$...").
图中三栏分别是 Stage 1 (自编码器训练)、Stage 2 (冻结 AE + 动作条件动力学)、Inference (自回归潜量移位 + 解码)。读者应注意:编码→潜空间→预测→解码的全链路中,昂贵的生成计算被压到低维潜空间,且推理栏展示了"把噪声潜量拼接到历史潜量末尾、只去噪最后一帧"的关键操作——这正是训练目标 (Eq. 4 只对最后一帧加满噪) 与推理协议对齐的地方。
数据链路可用下面的自回归推理时序图补充说明 (原图为静态多栏图,未含时序展开):
本文无形式化作者证明 — 仅实证。论文没有收敛定理、方差界或样本复杂度界;一致性模型的理论保证来自被引的前作 (Consistency Models、CTM),本文仅复用其训练目标而不重新证明。所提"稳定长 horizon"与"sim-real 相关性"均为经验观察,无解析证明。
尽管如此,方法围绕 5 个 load-bearing 方程组织,下面给出符号表、物理意义与最小检查。
| 符号 | 含义 |
|---|---|
| $o,\;\hat{o}$ | RGB 观测 / 预测帧,$\in\mathbb{R}^{3\times H\times W}$ |
| $E_\phi,\;D_\theta$ | CNN 编码器 / 一致性模型解码器 |
| $z=E_\phi(o)$ | 2D 潜表示 $\in\mathbb{R}^{C\times H'\times W'}$ |
| $F_\psi$ | action-conditioned 潜空间动力学 (一致性模型) |
| $Z$ | 潜时空张量 $\in\mathbb{R}^{C\times T\times H'\times W'}$ |
| $\sigma_t>\sigma_s\geq 0$ | 两个采样噪声尺度 (源 / 目标) |
| $\mathcal{N}(\cdot;\sigma)$ | 尺度 $\sigma$ 的前向加噪算子 |
| $w(\sigma)$ | 噪声相关权重,平衡各尺度学习 |
| $a_{t-N:t-1}$ | 动作历史上下文 |
| Stage | 目的 | 数据 | 时长 | 硬件 |
|---|---|---|---|---|
| Stage 1 | 自编码器 (CNN enc + 一致性 dec) | 每任务 ~600 episodes 真实 play data (每条 200 步) / MuJoCo 10,000 episodes | ~6 h | 1× H200 |
| Stage 2 | action-conditioned 动力学 $F_\psi$ | 同上潜量 | ~12 h | 1× H200 |
| Metric | Ours | DINO-WM | UVA | Dreamer4 | Cosmos |
|---|---|---|---|---|---|
| MSE $\downarrow$ | 0.005 | 0.028 | 0.023 | 0.012 | 0.019 |
| LPIPS $\downarrow$ | 0.051 | 0.270 | 0.272 | 0.163 | 0.224 |
| FID $\downarrow$ | 63.50 | 200.77 | 142.55 | 239.97 | 200.74 |
| PSNR $\uparrow$ | 25.82 | 17.79 | 17.87 | 20.81 | 18.91 |
| SSIM $\uparrow$ | 0.831 | 0.652 | 0.650 | 0.693 | 0.647 |
| UIQI $\uparrow$ | 0.960 | 0.875 | 0.884 | 0.919 | 0.883 |
| FVD $\downarrow$ | 243.20 | 1752.57 | 2213.29 | 1747.26 | 799.34 |
192 步 (19.2 s) rollout、相同初始条件下聚合全部任务;所提方法在全部 7 指标上占优。FVD 相对最强基线 (Cosmos) 仍有 ~3.3× 差距。

Paper's Figure 3 (caption: "Qualitative Comparison of Long-Horizon Action-Conditioned Video Prediction... (a) Intermediate predicted frames for the Pile Sweeping task... where baseline methods exhibit inaccurate dynamics, robot pose drift, accumulated artifacts, or loss of fine-grained details over time. (b) Terminal predicted frames for additional tasks... our model preserves coherent robot–object interactions and maintains stable predictions over extended horizons.").
(a) 展示 Pile Sweeping 中间帧的 rollout 行为,基线出现机器人位姿漂移 / 动力学错误 / 累积伪影;(b) 展示 Box Packing、Rope Routing、T Pushing 等终帧。读者应注意所提方法在长 horizon 后仍保持细粒度物体交互——这正是 Table I 中 FVD/LPIPS 大幅领先的视觉对应。

Paper's Figure 5 (caption: "Imitation Policy Training with Mixtures of Real-World Data and Our World Simulator Data... From left to right, the mixtures range from 100% world simulator data to 100% real-world data... Performance... is observed to be consistently high with comparable task scores, suggesting that data generated by our world simulator is comparable in quality to real-world demonstrations.").
x 轴从 100% 世界模型数据到 100% 真实数据 (固定 100 episodes 总量),y 轴为任务分数 (Beta 均匀先验下的 Bayesian posterior)。DP、ACT 曲线近乎水平即"数据来源不影响成功率";$\pi_{0.5}$ 随真实数据比例上升 (73.1%→88.8%) 是唯一明显斜率——提示更大 VLA 策略对真实数据分布更敏感。

Paper's Figure 6 (caption: "Effect of Data Scaling on Policy Performance. We compare the performance of ACT and DP trained on datasets of varying sizes, ranging from 5 to 100 expert demonstration episodes... Policy performance improves consistently as the number of demonstrations increases across both data sources...").
x 轴 5→100 episodes,两条数据源 (MuJoCo vs 世界模型) 的缩放曲线基本重合,尤其低数据区世界模型数据也能捕获任务结构。读者应注意:这不仅是"终点相当",而是"整条缩放曲线相当",说明缩放规律在世界模型内成立。

Paper's Figure 7 (caption: "Correlation Between Policy Performance in Our World Simulator and the Real World... Each point corresponds to a trained policy evaluated under identical settings in both environments. Strong positive correlations are observed, indicating that evaluation within our world simulator closely reflects relative policy performance in the real world.").
x 轴真实性能、y 轴世界模型性能,每点为一个训练策略 (含中间 checkpoint),误差棒为 Clopper-Pearson 置信区间。四任务均强正相关;除 T pushing 外拟合线有轻微正偏 (sim 略高于 real)。关键读法:即便有 sim-real gap,相对排序被保留——这是"用 sim 选策略"这一实用主张的经验支撑。

Paper's Figure 4 (caption: "Teleoperation Interface for Real-Time Interaction with the World Simulator... The left column shows a user issuing commands through the teleoperation device... The right columns show the corresponding frames generated by the world simulator in real time...").
左列为用户操作运动学遥操作设备,右列为世界模型实时生成的对应帧。案例研究价值在于:操作者在"桌上其实没有 mug 和 plate"的幻觉环境中假装抓取,仍能采集到高质量专家轨迹——直接支撑了 §2 数据生成路径的可行性。
| 步 | 论断 | 内部依据 |
|---|---|---|
| 1 | 把预测搬到低维 2D 潜空间 + 一致性模型少步去噪,可让单帧生成足够快 | §III-B 两阶段设计;一致性解码器 (Eq. 2) 少步重建 |
| 2 | 潜空间 next-frame 动力学 (Eq. 4,只对末帧加满噪) + 上下文注入小噪声,使自回归对被污染历史鲁棒 | §III-B2 Para 14;推理协议 §III-B3 |
| 3 | 步 1+2 合起来产生 15 FPS、>10 分钟稳定、且 FVD/LPIPS 全面超基线的 rollout | §IV-B Table I + Fig 3 |
| 4 | 稳定高保真的交互 rollout 可用作遥操作数据采集器,产出与标准 IL pipeline 兼容的轨迹 | §III-C;Fig 4 遥操作案例 |
| 5 | 步 4 生成的纯合成数据训练 DP/ACT/π 达到与等量真实数据相当的成功率,且缩放曲线一致 | §IV-C Fig 5 / Fig 6 |
| 6 | 同一世界模型让策略在其中 rollout 得到的分数与真实分数强正相关 → 可复现评估 | §IV-D Fig 7 |
[实现未公开] — L1 源为 arxiv HTML render,未包含代码链接或行号可引用的实现;论文提到 "our project website" 有更多视频但未在抓取内容中给出仓库路径。
核心技术壁垒 (最难复现的一处):在潜空间以一致性模型做动力学时只对上下文窗最后一帧施加满噪声 (Eq. 4),把"多模态未来的高效表征"与"next-frame 监督"折叠进单一 CTM 式去噪映射。这不是简单的视频扩散——它决定了训练目标与自回归推理协议 (append 噪声潜量→去噪末帧→滑窗) 的严格对齐;错配噪声调度或对全窗加噪都会破坏长 horizon 稳定性。最接近的开源参照是 Consistency Trajectory Model (CTM) 的训练框架 + Diffusion Forcing 类的部分加噪思想,但两阶段冻结自编码器 + 动作条件潜动力学的组合是本文独有。
关键实现细节 (易被忽略的 1–2 个 trick):
社区复现状态:截至 L1 抓取时无第三方复现报告。当前采用类似 recipe 的生产 / 研究模型:本文将自身定位为面向学术实验室的轻量可及替代 (对比 Cosmos / VEO 等重型闭源方案)。