WSA1: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

algorithm 2607.03941
robot-foundation-modelworld-modelinverse-dynamicsflow-matchingmixture-of-transformers

WSA1 — 3D-Centric World-Spatial-Action Model #

1. TL;DR #

用 Mixture-of-Transformers 把「动作→3D世界预测」(前向模型)与「3D世界→动作」(逆动力学)通过双向注意力耦合进同一隐空间,再加上 3D-grounded 的 2D 视觉想象。仅 6k 小时(其中真机 1k 小时)预训练即达 RoboTwin2.0 hard 93% SR、真机较基线 +20%。

2. Q1 / Q2 / Q3 #

Q1 · 痛点 #

现有机器人基础模型分两派,各自有结构性缺陷:

叠加的第二个痛点是数据:主流模仿学习依赖数万小时、且以真机为主的演示数据,采集昂贵且难扩展,模型学不到可迁移的物理常识。

Q2 · 方法 #

把机器人控制重构为 world-spatial-action 联合学习:在单一共享隐空间内同时学三个互相约束的条件分布(前向 3D 世界模型 + 2D 视觉想象 + 3D 逆动力学),用 MoT 三专家 + 双向因果注意力实现。

核心技术壁垒:让 3D 场景 token $h_g$ 与动作 token $h_{act}$ 之间做全双向注意力(而 $h_v,h_g,h_{act}$ 对当前观测只能单向 attend),从而在同一前向传播里既建模 action→world(前向模型)又建模 world→action(逆动力学)。这个「因果归纳偏置」是 WSA 相对所有单向 VLA/WAM 的唯一本质差异,也是最难复现的一点 —— 它不是加一个 loss,而是靠注意力掩码把两个方向的因果耦合成互约束。

Q3 · 结果 #

3. 架构 / 方法图 #

WSA1 的整体结构是 MoT + 三专家 + 3D-centric 因果注意力:

Figure 3: WSA1 MoT architecture with three experts and bidirectional causal attention

Paper's Figure 3, verbatim (caption: "Overview of WSA1. It adopts a Mixture-of-Transformers structure with three complementary experts: a 2D Spatial Expert for 3D world-aware visual thinking, a 3D Spatial Expert for action-caused 3D world prediction, and a 3D Action Expert for 3D inverse dynamics modeling. A bidirectional causal attention mechanism enforces dependency rules to unify 3D-consistent visual thinking and world–action mutual constraints within a shared latent space.").

读者应重点看注意力的连线方向:预测 token 单向 attend 到观测 token;视觉 token $h_v$ attend 到 3D token $h_g$(把语义预测锚定在几何上);而 $h_g \leftrightarrow h_{act}$ 是双向的 —— 这条双向边就是 WSA 与其他范式的结构差异所在。

范式对比图说明了 WSA 在四类建模中的位置:

Figure 2: four modeling paradigms (2D VLA / 2D WAM / 3D WAM / 3D WSA)

Paper's Figure 2, verbatim (caption: "Prevailing Modeling Paradigms: (a) 2D-centric VLA models unidirectional mappings from visual semantics to physical actions; (b) 2D-centric WAM jointly models 2D visual dynamics and physical actions; (c) 3D-centric WAM jointly models 3D scene geometry and physical actions; (d) Our 3D-centric WSA jointly models 3D world dynamics, physical actions, and their interdependencies.").

前三子图 (a)-(c) 都是单向箭头,只有 (d) 在世界与动作之间画出双向依赖,直观对应 Eq (5) 的前向 + 逆向两项。

三专家分工:

4. 作者证明 #

本文无形式化收敛定理 / 样本复杂度界 —— 仅实证。作者的形式化仅止于「概率因子分解 + 三个 MSE/流匹配损失」,没有给出关于该分解可辨识性或联合优化收敛性的定理。下面给出符号表、方程物理意义与最小检查。

符号表 #

符号含义
$v_t, s_t, l$视觉观测 / 本体感觉 / 语言指令
$\mathbf{O}_t := \{v_t,s_t,l\}$当前 2D 观测
$g_t$当前 3D 观测(深度/几何)
$A_t := (\mathbf{a}_{t+1},\ldots,\mathbf{a}_{t+H})$$H$ 步动作 chunk
$\mathbf{V}_t,\ \mathbf{G}_t$$N$ 个未来 2D subgoal 图 / $K$ 个未来 3D 场景
$f_{2D},f_{3D},f_{act}$三专家
$f_{enc}$预训练 VAE tokenizer(COSMOS)
$f_g$预训练 3D 基础模型(Depth-Anything)
$\omega,\ \tau,\ \hat{A}_t$流匹配噪声 / 插值系数 / 加噪动作

方程物理意义 #

根对象是标准模仿学习目标:

$$\max_{\theta}\mathbb{E}_{(v_{t},s_{t},A_{t},l)\sim\mathcal{D}_{\text{dem}}}\log\pi_{\theta}(A_{t}\mid v_{t},s_{t},l)$$

作者把所有范式都视作从它派生的联合分布。WSA 的核心是把控制拆成三个互约束条件分布(Eq 5):

$$\underbrace{p(g_{t+1:t+K}\mid a_{t+1:t+H},\mathbf{O}_{t})}_{\text{action→3D world (前向)}},\ \underbrace{p(v_{t+1:t+N}\mid g_{t+1:t+K},\mathbf{O}_{t})}_{\text{2D visual thinking}},\ \underbrace{p(a_{t+1:t+H}\mid g_{t+1:t+K},\mathbf{O}_{t})}_{\text{3D inverse dynamics (逆向)}}$$

三项各自对应一个 loss。视觉想象与 3D 世界都用 latent-空间 MSE:

$$\mathcal{L}_{\text{2D}}=\mathbb{E}\left\|f_{2D}(O_{t},G_{t})-f_{enc}(V_{t})\right\|_{2}^{2}$$

$$\mathcal{L}_{\text{3D}}=\mathbb{E}\left\|f_{3D}(O_{t},A_{t})-f_{g}(G_{t})\right\|_{2}^{2}$$

动作用流匹配回归速度场 $\omega-A_t$:

$$\mathcal{L}_{\text{ACT}}=\mathbb{E}\left\|\omega-A_{t}-f_{act}(O_{t},G_{t},\hat{A}_{t})\right\|_{2}^{2}$$

总损失等权相加:

$$\mathcal{L}_{\text{total}}=\mathcal{L}_{\text{2D}}+\mathcal{L}_{\text{3D}}+\mathcal{L}_{\text{ACT}}$$

损失分解含义:$\mathcal{L}_{\text{3D}}$ 是运动控制理论里的「前向内部模型」(动作如何改变环境),$\mathcal{L}_{\text{ACT}}$ 是「逆运动控制」(由目标世界态反推动作),$\mathcal{L}_{\text{2D}}$ 把语义视觉计划锚定在几何上。三者靠双向注意力共享隐空间,构成 world-action 互约束。

最小检查(6) #

  1. 量纲:$\mathcal{L}_{\text{3D}}$ 两侧都是 $f_g(\cdot)$ 的 latent 空间向量,MSE 量纲一致;$\mathcal{L}_{\text{ACT}}$ 目标是流场 $\omega-A_t$,与网络输出同维。✓
  2. 等权合理性存疑:Eq (9) 直接把 latent-token MSE 与流匹配损失等权相加,而二者数值尺度可能差若干数量级;论文未给权重超参也未做敏感性分析,是潜在不稳来源(见惊讶点)。⚠
  3. 条件一致性:Eq (5) 三式的条件集合互相引用未来量($g_{t+1:t+K}$ 既是被预测又被用作条件),训练时靠 teacher-forcing / GT latent 打断循环(Eq 6-8 用的都是 GT 编码 $f_{enc},f_g$),推理时则是链式生成 —— 存在 train/inference 分布错配风险。⚠
  4. 退化情形:若砍掉 $h_g\leftrightarrow h_{act}$ 双向边,模型退化为单向 3D-WAM;消融 Fig 4 的 baseline(60%)与 full(80%)之差即量化了这条边的价值。✓
  5. 人类数据兼容:EgoDex 无动作标签,Table 1 中屏蔽 $\mathcal{L}_{\text{ACT}}$ 仍可算 $\mathcal{L}_{\text{2D}},\mathcal{L}_{\text{3D}}$,分解在缺失一项时仍良定义。✓
  6. 命名 vs 公式:标题的 "Spatial" 对应的其实是 Eq (5) 第二项 2D visual thinking,而非独立的 spatial 变量;三项本质是 World-Model / Visual-Thinking / Inverse-Dynamics,命名略 non-obvious 但不影响正确性。✓
  7. 期望但缺失的保证:一个说明「双向互约束在何种假设下比单向分解可辨识/更低方差」的命题,或至少一个证明联合三损失优化不会互相拉扯的稳定性论证,会大幅增强说服力。

    5. 实验与数据 #

    预训练数据配方是「数据金字塔」的异构混合,总量仅 6k 小时:

    Table 1: pretraining data mixture and per-source loss masking

    Paper's Table 1, verbatim (caption: "Data mixture and training objectives used for pretraining. A checkmark indicates that the corresponding loss is enabled, while '–' indicates that the loss is masked out.").

    注意 EgoDex(human)一行屏蔽了 $\mathcal{L}_{\text{ACT}}$ 却仍参与 2D/3D 损失 —— 无动作标签的人类视频依旧贡献世界建模先验;采样权重上 sim(InternData-A1 0.47)占主导,真机仅 AgiBot 0.17 + RoboChallenge 0.19。

    真机主结果是全文最有说服力的一张表:

    Table 3: real-world results on 7 tabletop tasks (SR / completeness)

    Paper's Table 3, verbatim (caption: "Real-world evaluation results on seven tabletop manipulation tasks. SR denotes the task success rate (%), and C denotes the task progress score (%).").

    WSA1-B/L 平均 SR 77.5 / 80.3,较第二名 $\pi_{0.5}$(54.9)近乎翻倍,且横跨单臂 PiPER 与双臂 Lift2 都领先。唯一张力:Object Organization 上 WSA1-L(77)反低于 WSA1-B(80)并平手 $\pi_{0.5}$,与正文「each task 最高」的表述有出入。

    仿真基准上开源第一:

    Table 4: RoboTwin2.0 hard-setting SR vs closed/open-source models

    Paper's Table 4, verbatim (caption: "RoboTwin2.0 benchmark experimental results. ... Mean success rate SR over 50 manipulation tasks is reported. WSA1 achieves leading performance over open-sourced models.").

    关键读点:WSA1-B(3B, 92.7)超过体量更大的 Motus(8B, 87.0)与 LingBot-VA(7B, 91.5),说明增益来自范式而非参数量;但仍略逊于闭源 MotuBrain(96.1),作者用「competitive」定性。

    消融把增益拆到组件级:

    Figure 4: component ablation on RoboTwin2.0 (baseline / +VT / +3D / full)

    Paper's Figure 4, verbatim (caption: "Investigation of WSA modeling on RoboTwin2.0 Benchmark.").

    baseline VLA 60% → 单加视觉想象 76% / 单加 3D 世界 75% → full WSA 80%:两条支路各自有效且互补(视觉想象利好语义/外观任务,3D 世界利好接触密集/几何任务)。

    预训练阶段的消融进一步说明两阶段都用 WSA 才是最优:

    Figure 5: pretraining-strategy ablation on RoboTwin2.0

    Paper's Figure 5, verbatim (caption: "Ablation studies of WSA pre-training on RoboTwin2.0 Benchmark.").

    无预训练仅后训练 80% → WSA 预训练 + 动作-only 后训练 89% → 两阶段都用 WSA 93%,量化了 6k 小时异构预训练的边际价值(+13 个点)。

    6. 论证链 #

    #论点依据(paper-internal)
    1现有 VLA/WAM 都是单向映射,缺 world-action 互约束§3.1 Eq (2)-(4) 三式条件都是单向;Fig 2 (a)-(c) 单向箭头
    2把控制拆成前向(action→world)+ 逆向(world→action)两个互约束分布可捕捉双向因果§3.1 Eq (5) 三项分解;§3.2 规则 3 的 $h_g\leftrightarrow h_{act}$ 双向注意力
    3该双向机制在同一 MoT 隐空间内可用三个 latent MSE / 流匹配损失联合优化§3.3 Eq (6)-(9),三损失对应三专家
    4联合建模使每个组件独立即有增益、合起来最优§4.4 Fig 4:60%→76%/75%→80%
    5异构小规模(6k h)预训练 + 两阶段 WSA 即达 SOTA,验证数据高效性§4.4 Fig 5:80%→89%→93%;§4.2 Table 3;§4.3 Table 4

    7. 实现 cross-reference #

    [实现未公开] —— L1 未记录开源代码仓库或 file:line。

    最接近的开源参考:动作专家的流匹配 + 扩散 transformer 部分与 $\pi_0$ / $\pi_{0.5}$(openpi 系列)同构,可作为 $\mathcal{L}_{\text{ACT}}$ 与 $f_{act}$ 的复现底座;MoT 三专家 co-learning 结构最接近 Motus。所需外部权重:Qwen3-VL-2B / Wan2.2-5B(backbone)、COSMOS VAE($f_{enc}$)、Depth-Anything 3($f_g$)。

    核心技术壁垒(§2 呼应):整个方法的不可替代性集中在 §3.2 因果注意力规则 3 —— $h_g$ 与 $h_{act}$ 的全双向注意力掩码。复现者最容易犯的错是把它做成两个独立的前向/逆向头(那就退化为单向 WAM,消融里对应 75-76% 而非 80%);双向必须在同一 attention block 内共享 KV,才能让 action→world 与 world→action 互为约束。

    关键实现细节(易漏的 1-2 个 trick):

    1. 2D/3D 专家都在 latent token 空间做 MSE(对齐 COSMOS VAE 与 Depth-Anything 编码),而非 RGB/深度像素回归 —— 直接回归像素会淹没在冗余信息里。
    2. 人类数据 loss 屏蔽:EgoDex 无动作标签时把 $\mathcal{L}_{\text{ACT}}$ 置 "–",仍保留 2D/3D 损失(Table 1),这是让无动作视频参与世界建模的关键掩码技巧。