World Action Models: The Next Frontier in Embodied AI

algorithm 2605.1209
world-modelvlaembodied-airobot-learningsurvey-taxonomy

World Action Models: The Next Frontier in Embodied AI — L2 #

1. TL;DR #

首个系统梳理 World Action Model (WAM) 的综述:把"预测未来状态 + 生成动作"统一为联合分布 $p(o',a\mid o,l)$,将现有方法切成 Cascaded(先预测后解动作)与 Joint(联合预测)两大范式,并系统整理数据生态与评测协议,指出评测严重解耦、缺乏因果一致性指标。


2. Q1 / Q2 / Q3 #

Q1 — 痛点(为什么需要 WAM) #

标准 VLA 模型学的是反应式的观测→动作映射 $p(a\mid o,l)$,不显式建模"环境在干预下如何演化"。这带来两个根本缺陷:(1) 缺乏物理前瞻,泛化到需要预判未来状态的场景时失效;(2) 严格依赖成对 $(o_t,a_t)$ 遥操作轨迹,数据昂贵且稀缺,无法利用互联网规模的无动作标注视频。纯世界模型能吃 $(o_t,o_{t+1})$ 无动作视频却缺乏对物理控制的接地。领域缺一个统一的概念框架,术语(VAM / Video Policy / AWM)互相混淆、文献碎片化。

Q2 — 方法(WAM 如何统一) #

把世界建模与动作生成统一到单一目标:建模未来状态与动作的联合分布 $p(o',a\mid o,l)$(而非仅动作)。一个模型要称为 WAM 必须满足两条硬性判据:前向预测建模(必须生成/利用未来状态 $o'$ 的可量化表示,可以是显式像素也可以是隐式物理隐空间)与耦合动作生成(动作 $a$ 必须与预期未来状态 $o'$ 对齐,可为联合概率输出或级联/统一隐空间中的策略条件化)。据此把方法二分为 Cascaded(显式因式分解 $p(o',a\mid o,l)=p(a\mid o',o,l)\,p(o'\mid o,l)$,分离训练)与 Joint(直接联合建模,联合训练)。

Q3 — 结果(综述给出什么结论) #

三大论断:(1) 首个统一 Cascaded vs Joint 的 WAM 系统分类;(2) WAM 的独特优势是统一数据消化——既能用高质量三元组 $(o_t,a_t,o_{t+1})$ 紧耦合表示,又能通过联合训练策略吞入海量无配对(无动作)视频;(3) 当前评测严重解耦:世界建模用 PSNR/FVD 等像素指标(允许悬浮物体/反重力流体拿高分),动作用任务成功率,二者之间缺乏量化"想象未来与生成动作因果一致性"的联合指标。


3. 架构 / 方法图 #

WAM 的两大范式与其内部细分,浓缩在下面的分类总图与两张结构对比图中。

Figure 1: WAM 时间演化与分类树

Paper's Figure 1(caption: "Temporal evolution and taxonomy of representative works on World Action Models (WAMs)...")。 左支是 Joint WAM(紧耦合世界预测与动作生成,分化为 Autoregressive 与 Diffusion-based;连续路线再分 Unified Stream / Multi-Stream 骨干),右支是 Cascaded WAM(世界建模与动作执行解耦,沿 Explicit / Implicit 表示对齐演化)。读者应注意:这些结构策略是"架构耦合方向"上的并行探索,而非严格的时间替代关系。

Figure 3: WAM 概念定义与对比

Paper's Figure 3(caption: "Conceptual definition and comparison of World Action Models (WAMs)...")。 左面板对比 VLA、WAM、WM 的输入-输出形式,凸显 WAM 独有的"联合预测动作与未来观测"能力;右面板界定 WAM 相对 VAM、Video Policy 的概念范围。此图是本综述术语去混淆的锚点。

WAM 的判据把它与相邻概念区分开,其内部方法坐标可用如下 Mermaid 结构树补充(原图为矢量分类,此处补强层级可读性):

graph TD WAM["WAM: p(o',a|o,l)"] WAM --> C["Cascaded (分离训练)
p(a|o',o,l)·p(o'|o,l)"] WAM --> J["Joint (联合训练)
p(o',a|o,l)"] C --> C1["Explicit: 像素空间规划"] C --> C2["Implicit: 隐空间规划"] C1 --> C1a["Learned Action (IDM)"] C1 --> C1b["Geometric (光流/位姿)"] J --> J1["Autoregressive"] J --> J2["Diffusion (非自回归)"] J1 --> J1a["Explicit-Decoupled 头"] J1 --> J1b["Unified-Discrete token"] J1 --> J1c["Predictive-Latent (JEPA)"] J2 --> J2a["Unified Stream (单 DiT)"] J2 --> J2b["Multi-Stream (多分支/专家)"]

Cascaded 与 Joint-Diffusion 的具体结构差异见下两图。

Figure 5: Cascaded WAM 结构对比

Paper's Figure 5(caption: "Schematic comparison of cascaded WAM structures...")。 1(a) Learned Action:世界模型生成显式像素未来计划,由学习式逆动力学/动作模型映射到动作;1(b) Geometric Extraction:显式视觉计划经几何提取(光流/位姿)转为动作或轨迹,通常无需动作标注;2(a) Latent Representation:中间规划载体是隐空间未来表示而非 RGB 帧,绕开像素解码开销。

Figure 6: Diffusion-based Joint WAM 主要架构模式

Paper's Figure 6(caption: "Taxonomy of the main architectural patterns in the diffusion-based joint WAMs...")。 1(a) Unified Stream:世界与动作融进单个 DiT 主干(未来可显式或隐式建模);2(a) Cross-Attention Coupled:独立 Video/Action DiT 经显式交叉注意力耦合;2(b) Hidden-State Coupling:Video DiT 的中间隐状态条件化 Action DiT;2(c) Shared Representation:视觉与动作先经统一编码器融合再分头解码。这四种模式对应本文对 Joint-Diffusion 分支最细粒度的划分。

WM 如何服务 VLA(外生工具视角,为 §4 的内化架构铺垫)见下图。

Figure 4: World models 服务 VLA 的学习与评测

Paper's Figure 4(caption: "Schematic overview of world models for VLA learning and evaluation...")。 (a) 模仿学习:生成/过滤训练轨迹;(b) 强化学习:想象交互 + 奖励引导优化;(c) 奖励建模:从学习到的动力学产生奖励信号;(d) 策略评测:作为数据驱动模拟器做虚拟 rollout。此图区分了"WM 作外生工具"与后文"WM 内化进策略"的两个阶段。


4. 作者证明 #

无形式化作者证明 — 仅实证(且为综述,无自有实验)。 本文是分类综述,不提出新模型也无收敛/样本复杂度定理。其"形式化"内容仅为对 VLA / WM / WAM 三类目标的概率定义与判据。因此以下用 6 项一致性检查代替定理复核。

Notation #

符号含义
$o$当前观测(视觉 + 本体感 + 其它传感模态)
$o'$下一时刻观测(未来状态)
$l$语言指令
$a$动作(可为动作 chunk)
$\mathcal{D}$数据分布
$p(o',a\mid o,l)$WAM 目标:未来状态与动作的联合分布

三个目标方程的物理意义 #

Cascaded 的因式分解为 $p(o',a\mid o,l)=p(a\mid o',o,l)\,p(o'\mid o,l)$;动作条件 WM 写作 $P(o'\mid o,a)$,语言条件 WM 写作 $P(o'\mid o,l)$。

6 项一致性检查 #

  1. 判据可判定性:两条判据(前向预测 + 耦合动作)能否唯一区分边界样例?作者用 VAM/Video Policy/AWM 三个反例逐一排除——Video Policy 仅继承视频骨干却做 $p(a\mid o)$,因缺"主动预测承诺"被排除,说明判据可操作。✓(但"预测承诺"的判定仍依赖架构解读,存在灰区。)
  2. 因式分解自洽:Cascaded 的 $p(a\mid o',o,l)p(o'\mid o,l)$ 是标准链式法则的合法分解,与 Joint 的联合形式在概率上等价(差别在训练是否解耦),无矛盾。✓
  3. 数据消化论断:Joint 目标在缺 $a$ 时可将动作侧全噪声化并沿用去噪目标(UWM 的做法),从而吞无动作视频——这一论断与联合分布形式一致。✓
  4. 术语选择:WAM vs AWM 的区别被作者明确标注为"层级/品牌"考量而非技术差异,此为诚实披露而非隐藏假设。✓
  5. 评测解耦诊断:作者指出像素指标(PSNR/FVD)与任务成功率各自独立,缺因果一致性度量;Wow-wo-val! 的 IDM Turing Test 提供了该缺口的实证锚点(视觉可信模型执行成功率坍缩至近零)。✓
  6. 分类覆盖度:Table 1/2/3 逐行把 50+ 模型钉入分类,未见"其它/无法归类"桶,说明骨架覆盖了当前文献。✓(覆盖度是相对当前快照,2026 后新工作可能溢出。)
  7. 期望但缺失的保证:若能给出"何种耦合机制在匹配 scale/data 下泛化更好"的对照实验或理论刻画,将极大提升本分类的规范性——作者自己也把这列为 §7 首个开放问题。


    5. 实验与数据 #

    综述无自有实验,其"数据"是对现有方法与数据集/基准的结构化聚合。载重表格如下。

    Table 1: Cascaded WAM 方法对比

    Paper's Table 1("Comparison of Cascaded World-Action-Model (WAM) methods")。 关键读法:Act. Label 列区分是否需动作标注——几何提取路线(AVDC、NovaFlow、Dream2Flow、RIGVid、LV-P)多为 ✗(无需动作标注)且部分 Zero-shot ✓,而学习式 IDM 路线(UniPi、VLP…)几乎全需动作标注。这直接印证 §5 的"数据消化"论点:几何/零训练路线是绕开昂贵动作标注的现实通道。

    Table 2: Autoregressive Joint WAM 汇总

    Paper's Table 2("...Autoregressive Generation papers...")。 三段式演进一目了然:Explicit-Decoupled(GR-1/GR-MG/GR-2,195M→719M,双头解码)→ Unified-Discrete(CoT-VLA/WorldVLA/RynnVLA-002/$\mathcal{F}_1$,规模跳到 4–7B,把动作与图像全量化进共享词表)→ Predictive-Latent(VLA-JEPA,2B,放弃显式 token 改在冻结目标网络的隐空间自回归)。参数量随"表示统一度"上升而放大,是自回归分支的主轴。

    Table 3: Diffusion-based Joint WAM 汇总

    Paper's Table 3("...Diffusion-based Generation papers...")。 这是 Joint 分支最密的一张表:Unified Stream(显式/隐式未来预测,PAD/UWM/DreamZero/Cosmos Policy…)与 Multi-Stream(Cross-Attn / Hidden-State / Shared-Rep)逐行归类。注意骨干高度集中于 Wan2.x、Cosmos-Predict2、CogVideoX 等预训练视频扩散模型,说明当前 Joint-Diffusion WAM 主要是"在视频基座上加动作侧"的改造,而非从零训练。

    Table 4: 机器人遥操作数据集

    Paper's Table 4("...robot-centric manipulation datasets...")。 规模轴清晰:从 QT-Opt (580k traj) 到 OXE (1M+ traj / 22 robots) 再到 UnifoLM-WBT (1.89M traj),Modality 列显示从纯 RGB 逐步扩展到 D/P/A/T/PC 多模态。这类严格对齐的 $(o,a,o')$ 三元组是 WAM 学习精确动作条件动力学的不可替代来源。

    Table 9: 动作策略评测基准

    Paper's Table 9("...evaluation benchmarks for action policy")。 40+ 基准按形态(通用/双臂人形/移动/接触形变/真机)与 Eval. Focus 标签(G/MT/LH/Lang/DS/S2R/Dex/Mem/LL)分组。值得注意的是评测焦点从"能否完成任务"(早期)转向"数据规模如何影响能力"(ManiSkill3/RoboVerse 引入 DS 维度)与鲁棒性/泛化(LIBERO-plus 系列扰动),呼应 §7 的"缺对照实验"批评。

    数据地形的两维(迁移难度 × 扩展难度)总览见下。

    Figure 7: 具身数据地形

    Paper's Figure 7("...embodied data landscape...mapped across Transfer Difficulty (Y-axis) and Scaling Difficulty (X-axis)")。 该图把四类数据源(机器人遥操作、便携人类演示 UMI、仿真、互联网自我中心视频)放到"越易扩展越难迁移 / 越易迁移越难扩展"的权衡平面上,直观解释为何 WAM 需要混合而非单一数据源。

    载重实证锚点(作者反复引用的两个数字):Ctrl-World 仅靠想象轨迹 SFT 就把 $\pi_{0.5}$-DROID 下游成功率提升 44.7%;DreamZero 经算法加速 + CUDA 优化把 WAM 推理推到约 7Hz,仍显著落后非生成式 VLA 的 50Hz 标准——一个数量级的"延迟税"。


    6. 论证链 #

    步骤论点支撑(论文内)
    1标准 VLA 学反应式 $p(a\mid o,l)$,不建模世界动力学,泛化与数据可扩展性受限§1–§2;VLA/WM 目标方程对比
    2把世界建模与动作生成统一为 $p(o',a\mid o,l)$ 并给出两条硬判据,即定义 WAM§2 判据 + $\mathcal{L}_{\text{WAM}}$
    3依"训练是否解耦"把 WAM 二分为 Cascaded(因式分解、分离训练)与 Joint(联合训练),并按生成模态/条件机制/动作解码细分§4;Fig 1/5/6;Table 1/2/3
    4WAM 的独特价值是统一数据消化:既吃对齐三元组又吃无动作视频;故需混合四类数据源§5;Fig 7;Table 4–7
    5当前评测将世界建模(像素指标)与动作(任务成功率)解耦,缺因果一致性联合指标§6;Table 8/9;Wow-wo-val! IDM Turing Test
    6由 3–5 的缺口导出六大开放挑战(架构耦合对照、多模态物理状态、数据混合、长时程、推理延迟、评测方法、安全)§7

    7. 实现 cross-reference #

    [实现未公开](本文为综述,无自有代码模型)。相关资源:

    • 论文主页 / 论文库:https://openmoss.github.io/Awesome-WAM
    • 代码仓库(文献清单):https://github.com/OpenMOSS/Awesome-WAM

    综述所引具体实现分散于各原论文(UniPi、LAPA、DreamZero、UWM、Cosmos Policy 等),本 L2 不逐一定位其 file:line。

    核心技术壁垒(§2 Q2 同款,专段说明):可复制的从来不是某个模型,而是把 366 篇碎片文献收敛为"两条判据 + Cascaded/Joint × {生成模态, 条件机制, 动作解码}"正交坐标系的抽象过程。它要求同时对视频生成、扩散/自回归、逆动力学、JEPA 隐预测、具身数据生态与评测指标有全景把握,并从中提炼出跨架构不变量(如"未来预测头在推理时可丢弃而不掉性能"这一反直觉规律的跨方法归纳)。这种"分类学工程"是本文最难被单人快速重建的部分。

    关键实现细节(易被忽略的 1–2 个 trick,来自被综述方法)

    1. 无动作视频的统一吞入:UWM 通过给世界侧与动作侧分配独立噪声调度,在动作缺失时把动作侧"全噪声化"再沿用标准去噪目标——同一模型据此可在策略推理/前向动力学/逆动力学/纯视频生成间切换而无需改架构。这是"统一数据消化"落地的关键工程手法。
    2. 推理时丢弃未来预测头:Being-H0.7 / Fast-WAM / GigaWorld-Policy 等在训练时用世界分支产生未来表示并蒸馏进隐 query,推理时直接丢弃世界分支,下游控制不掉分——暗示世界建模的收益可能来自训练期辅助梯度而非推理期前瞻,也是缓解"延迟税"的实用技巧。