首个系统梳理 World Action Model (WAM) 的综述:把"预测未来状态 + 生成动作"统一为联合分布 $p(o',a\mid o,l)$,将现有方法切成 Cascaded(先预测后解动作)与 Joint(联合预测)两大范式,并系统整理数据生态与评测协议,指出评测严重解耦、缺乏因果一致性指标。
标准 VLA 模型学的是反应式的观测→动作映射 $p(a\mid o,l)$,不显式建模"环境在干预下如何演化"。这带来两个根本缺陷:(1) 缺乏物理前瞻,泛化到需要预判未来状态的场景时失效;(2) 严格依赖成对 $(o_t,a_t)$ 遥操作轨迹,数据昂贵且稀缺,无法利用互联网规模的无动作标注视频。纯世界模型能吃 $(o_t,o_{t+1})$ 无动作视频却缺乏对物理控制的接地。领域缺一个统一的概念框架,术语(VAM / Video Policy / AWM)互相混淆、文献碎片化。
把世界建模与动作生成统一到单一目标:建模未来状态与动作的联合分布 $p(o',a\mid o,l)$(而非仅动作)。一个模型要称为 WAM 必须满足两条硬性判据:前向预测建模(必须生成/利用未来状态 $o'$ 的可量化表示,可以是显式像素也可以是隐式物理隐空间)与耦合动作生成(动作 $a$ 必须与预期未来状态 $o'$ 对齐,可为联合概率输出或级联/统一隐空间中的策略条件化)。据此把方法二分为 Cascaded(显式因式分解 $p(o',a\mid o,l)=p(a\mid o',o,l)\,p(o'\mid o,l)$,分离训练)与 Joint(直接联合建模,联合训练)。
三大论断:(1) 首个统一 Cascaded vs Joint 的 WAM 系统分类;(2) WAM 的独特优势是统一数据消化——既能用高质量三元组 $(o_t,a_t,o_{t+1})$ 紧耦合表示,又能通过联合训练策略吞入海量无配对(无动作)视频;(3) 当前评测严重解耦:世界建模用 PSNR/FVD 等像素指标(允许悬浮物体/反重力流体拿高分),动作用任务成功率,二者之间缺乏量化"想象未来与生成动作因果一致性"的联合指标。
WAM 的两大范式与其内部细分,浓缩在下面的分类总图与两张结构对比图中。

Paper's Figure 1(caption: "Temporal evolution and taxonomy of representative works on World Action Models (WAMs)...")。 左支是 Joint WAM(紧耦合世界预测与动作生成,分化为 Autoregressive 与 Diffusion-based;连续路线再分 Unified Stream / Multi-Stream 骨干),右支是 Cascaded WAM(世界建模与动作执行解耦,沿 Explicit / Implicit 表示对齐演化)。读者应注意:这些结构策略是"架构耦合方向"上的并行探索,而非严格的时间替代关系。

Paper's Figure 3(caption: "Conceptual definition and comparison of World Action Models (WAMs)...")。 左面板对比 VLA、WAM、WM 的输入-输出形式,凸显 WAM 独有的"联合预测动作与未来观测"能力;右面板界定 WAM 相对 VAM、Video Policy 的概念范围。此图是本综述术语去混淆的锚点。
WAM 的判据把它与相邻概念区分开,其内部方法坐标可用如下 Mermaid 结构树补充(原图为矢量分类,此处补强层级可读性):
Cascaded 与 Joint-Diffusion 的具体结构差异见下两图。

Paper's Figure 5(caption: "Schematic comparison of cascaded WAM structures...")。 1(a) Learned Action:世界模型生成显式像素未来计划,由学习式逆动力学/动作模型映射到动作;1(b) Geometric Extraction:显式视觉计划经几何提取(光流/位姿)转为动作或轨迹,通常无需动作标注;2(a) Latent Representation:中间规划载体是隐空间未来表示而非 RGB 帧,绕开像素解码开销。

Paper's Figure 6(caption: "Taxonomy of the main architectural patterns in the diffusion-based joint WAMs...")。 1(a) Unified Stream:世界与动作融进单个 DiT 主干(未来可显式或隐式建模);2(a) Cross-Attention Coupled:独立 Video/Action DiT 经显式交叉注意力耦合;2(b) Hidden-State Coupling:Video DiT 的中间隐状态条件化 Action DiT;2(c) Shared Representation:视觉与动作先经统一编码器融合再分头解码。这四种模式对应本文对 Joint-Diffusion 分支最细粒度的划分。
WM 如何服务 VLA(外生工具视角,为 §4 的内化架构铺垫)见下图。

Paper's Figure 4(caption: "Schematic overview of world models for VLA learning and evaluation...")。 (a) 模仿学习:生成/过滤训练轨迹;(b) 强化学习:想象交互 + 奖励引导优化;(c) 奖励建模:从学习到的动力学产生奖励信号;(d) 策略评测:作为数据驱动模拟器做虚拟 rollout。此图区分了"WM 作外生工具"与后文"WM 内化进策略"的两个阶段。
无形式化作者证明 — 仅实证(且为综述,无自有实验)。 本文是分类综述,不提出新模型也无收敛/样本复杂度定理。其"形式化"内容仅为对 VLA / WM / WAM 三类目标的概率定义与判据。因此以下用 6 项一致性检查代替定理复核。
| 符号 | 含义 |
|---|---|
| $o$ | 当前观测(视觉 + 本体感 + 其它传感模态) |
| $o'$ | 下一时刻观测(未来状态) |
| $l$ | 语言指令 |
| $a$ | 动作(可为动作 chunk) |
| $\mathcal{D}$ | 数据分布 |
| $p(o',a\mid o,l)$ | WAM 目标:未来状态与动作的联合分布 |
Cascaded 的因式分解为 $p(o',a\mid o,l)=p(a\mid o',o,l)\,p(o'\mid o,l)$;动作条件 WM 写作 $P(o'\mid o,a)$,语言条件 WM 写作 $P(o'\mid o,l)$。
期望但缺失的保证:若能给出"何种耦合机制在匹配 scale/data 下泛化更好"的对照实验或理论刻画,将极大提升本分类的规范性——作者自己也把这列为 §7 首个开放问题。
综述无自有实验,其"数据"是对现有方法与数据集/基准的结构化聚合。载重表格如下。

Paper's Table 1("Comparison of Cascaded World-Action-Model (WAM) methods")。 关键读法:Act. Label 列区分是否需动作标注——几何提取路线(AVDC、NovaFlow、Dream2Flow、RIGVid、LV-P)多为 ✗(无需动作标注)且部分 Zero-shot ✓,而学习式 IDM 路线(UniPi、VLP…)几乎全需动作标注。这直接印证 §5 的"数据消化"论点:几何/零训练路线是绕开昂贵动作标注的现实通道。

Paper's Table 2("...Autoregressive Generation papers...")。 三段式演进一目了然:Explicit-Decoupled(GR-1/GR-MG/GR-2,195M→719M,双头解码)→ Unified-Discrete(CoT-VLA/WorldVLA/RynnVLA-002/$\mathcal{F}_1$,规模跳到 4–7B,把动作与图像全量化进共享词表)→ Predictive-Latent(VLA-JEPA,2B,放弃显式 token 改在冻结目标网络的隐空间自回归)。参数量随"表示统一度"上升而放大,是自回归分支的主轴。

Paper's Table 3("...Diffusion-based Generation papers...")。 这是 Joint 分支最密的一张表:Unified Stream(显式/隐式未来预测,PAD/UWM/DreamZero/Cosmos Policy…)与 Multi-Stream(Cross-Attn / Hidden-State / Shared-Rep)逐行归类。注意骨干高度集中于 Wan2.x、Cosmos-Predict2、CogVideoX 等预训练视频扩散模型,说明当前 Joint-Diffusion WAM 主要是"在视频基座上加动作侧"的改造,而非从零训练。

Paper's Table 4("...robot-centric manipulation datasets...")。 规模轴清晰:从 QT-Opt (580k traj) 到 OXE (1M+ traj / 22 robots) 再到 UnifoLM-WBT (1.89M traj),Modality 列显示从纯 RGB 逐步扩展到 D/P/A/T/PC 多模态。这类严格对齐的 $(o,a,o')$ 三元组是 WAM 学习精确动作条件动力学的不可替代来源。

Paper's Table 9("...evaluation benchmarks for action policy")。 40+ 基准按形态(通用/双臂人形/移动/接触形变/真机)与 Eval. Focus 标签(G/MT/LH/Lang/DS/S2R/Dex/Mem/LL)分组。值得注意的是评测焦点从"能否完成任务"(早期)转向"数据规模如何影响能力"(ManiSkill3/RoboVerse 引入 DS 维度)与鲁棒性/泛化(LIBERO-plus 系列扰动),呼应 §7 的"缺对照实验"批评。
数据地形的两维(迁移难度 × 扩展难度)总览见下。

Paper's Figure 7("...embodied data landscape...mapped across Transfer Difficulty (Y-axis) and Scaling Difficulty (X-axis)")。 该图把四类数据源(机器人遥操作、便携人类演示 UMI、仿真、互联网自我中心视频)放到"越易扩展越难迁移 / 越易迁移越难扩展"的权衡平面上,直观解释为何 WAM 需要混合而非单一数据源。
载重实证锚点(作者反复引用的两个数字):Ctrl-World 仅靠想象轨迹 SFT 就把 $\pi_{0.5}$-DROID 下游成功率提升 44.7%;DreamZero 经算法加速 + CUDA 优化把 WAM 推理推到约 7Hz,仍显著落后非生成式 VLA 的 50Hz 标准——一个数量级的"延迟税"。
| 步骤 | 论点 | 支撑(论文内) |
|---|---|---|
| 1 | 标准 VLA 学反应式 $p(a\mid o,l)$,不建模世界动力学,泛化与数据可扩展性受限 | §1–§2;VLA/WM 目标方程对比 |
| 2 | 把世界建模与动作生成统一为 $p(o',a\mid o,l)$ 并给出两条硬判据,即定义 WAM | §2 判据 + $\mathcal{L}_{\text{WAM}}$ |
| 3 | 依"训练是否解耦"把 WAM 二分为 Cascaded(因式分解、分离训练)与 Joint(联合训练),并按生成模态/条件机制/动作解码细分 | §4;Fig 1/5/6;Table 1/2/3 |
| 4 | WAM 的独特价值是统一数据消化:既吃对齐三元组又吃无动作视频;故需混合四类数据源 | §5;Fig 7;Table 4–7 |
| 5 | 当前评测将世界建模(像素指标)与动作(任务成功率)解耦,缺因果一致性联合指标 | §6;Table 8/9;Wow-wo-val! IDM Turing Test |
| 6 | 由 3–5 的缺口导出六大开放挑战(架构耦合对照、多模态物理状态、数据混合、长时程、推理延迟、评测方法、安全) | §7 |
[实现未公开](本文为综述,无自有代码模型)。相关资源:
https://openmoss.github.io/Awesome-WAMhttps://github.com/OpenMOSS/Awesome-WAM综述所引具体实现分散于各原论文(UniPi、LAPA、DreamZero、UWM、Cosmos Policy 等),本 L2 不逐一定位其 file:line。
核心技术壁垒(§2 Q2 同款,专段说明):可复制的从来不是某个模型,而是把 366 篇碎片文献收敛为"两条判据 + Cascaded/Joint × {生成模态, 条件机制, 动作解码}"正交坐标系的抽象过程。它要求同时对视频生成、扩散/自回归、逆动力学、JEPA 隐预测、具身数据生态与评测指标有全景把握,并从中提炼出跨架构不变量(如"未来预测头在推理时可丢弃而不掉性能"这一反直觉规律的跨方法归纳)。这种"分类学工程"是本文最难被单人快速重建的部分。
关键实现细节(易被忽略的 1–2 个 trick,来自被综述方法):