用 Mixture-of-Transformers 把「动作→3D世界预测」(前向模型)与「3D世界→动作」(逆动力学)通过双向注意力耦合进同一隐空间,再加上 3D-grounded 的 2D 视觉想象。仅 6k 小时(其中真机 1k 小时)预训练即达 RoboTwin2.0 hard 93% SR、真机较基线 +20%。
现有机器人基础模型分两派,各自有结构性缺陷:
叠加的第二个痛点是数据:主流模仿学习依赖数万小时、且以真机为主的演示数据,采集昂贵且难扩展,模型学不到可迁移的物理常识。
把机器人控制重构为 world-spatial-action 联合学习:在单一共享隐空间内同时学三个互相约束的条件分布(前向 3D 世界模型 + 2D 视觉想象 + 3D 逆动力学),用 MoT 三专家 + 双向因果注意力实现。
核心技术壁垒:让 3D 场景 token $h_g$ 与动作 token $h_{act}$ 之间做全双向注意力(而 $h_v,h_g,h_{act}$ 对当前观测只能单向 attend),从而在同一前向传播里既建模 action→world(前向模型)又建模 world→action(逆动力学)。这个「因果归纳偏置」是 WSA 相对所有单向 VLA/WAM 的唯一本质差异,也是最难复现的一点 —— 它不是加一个 loss,而是靠注意力掩码把两个方向的因果耦合成互约束。
WSA1 的整体结构是 MoT + 三专家 + 3D-centric 因果注意力:

Paper's Figure 3, verbatim (caption: "Overview of WSA1. It adopts a Mixture-of-Transformers structure with three complementary experts: a 2D Spatial Expert for 3D world-aware visual thinking, a 3D Spatial Expert for action-caused 3D world prediction, and a 3D Action Expert for 3D inverse dynamics modeling. A bidirectional causal attention mechanism enforces dependency rules to unify 3D-consistent visual thinking and world–action mutual constraints within a shared latent space.").
读者应重点看注意力的连线方向:预测 token 单向 attend 到观测 token;视觉 token $h_v$ attend 到 3D token $h_g$(把语义预测锚定在几何上);而 $h_g \leftrightarrow h_{act}$ 是双向的 —— 这条双向边就是 WSA 与其他范式的结构差异所在。
范式对比图说明了 WSA 在四类建模中的位置:

Paper's Figure 2, verbatim (caption: "Prevailing Modeling Paradigms: (a) 2D-centric VLA models unidirectional mappings from visual semantics to physical actions; (b) 2D-centric WAM jointly models 2D visual dynamics and physical actions; (c) 3D-centric WAM jointly models 3D scene geometry and physical actions; (d) Our 3D-centric WSA jointly models 3D world dynamics, physical actions, and their interdependencies.").
前三子图 (a)-(c) 都是单向箭头,只有 (d) 在世界与动作之间画出双向依赖,直观对应 Eq (5) 的前向 + 逆向两项。
三专家分工:
本文无形式化收敛定理 / 样本复杂度界 —— 仅实证。作者的形式化仅止于「概率因子分解 + 三个 MSE/流匹配损失」,没有给出关于该分解可辨识性或联合优化收敛性的定理。下面给出符号表、方程物理意义与最小检查。
| 符号 | 含义 |
|---|---|
| $v_t, s_t, l$ | 视觉观测 / 本体感觉 / 语言指令 |
| $\mathbf{O}_t := \{v_t,s_t,l\}$ | 当前 2D 观测 |
| $g_t$ | 当前 3D 观测(深度/几何) |
| $A_t := (\mathbf{a}_{t+1},\ldots,\mathbf{a}_{t+H})$ | $H$ 步动作 chunk |
| $\mathbf{V}_t,\ \mathbf{G}_t$ | $N$ 个未来 2D subgoal 图 / $K$ 个未来 3D 场景 |
| $f_{2D},f_{3D},f_{act}$ | 三专家 |
| $f_{enc}$ | 预训练 VAE tokenizer(COSMOS) |
| $f_g$ | 预训练 3D 基础模型(Depth-Anything) |
| $\omega,\ \tau,\ \hat{A}_t$ | 流匹配噪声 / 插值系数 / 加噪动作 |
根对象是标准模仿学习目标:
$$\max_{\theta}\mathbb{E}_{(v_{t},s_{t},A_{t},l)\sim\mathcal{D}_{\text{dem}}}\log\pi_{\theta}(A_{t}\mid v_{t},s_{t},l)$$
作者把所有范式都视作从它派生的联合分布。WSA 的核心是把控制拆成三个互约束条件分布(Eq 5):
$$\underbrace{p(g_{t+1:t+K}\mid a_{t+1:t+H},\mathbf{O}_{t})}_{\text{action→3D world (前向)}},\ \underbrace{p(v_{t+1:t+N}\mid g_{t+1:t+K},\mathbf{O}_{t})}_{\text{2D visual thinking}},\ \underbrace{p(a_{t+1:t+H}\mid g_{t+1:t+K},\mathbf{O}_{t})}_{\text{3D inverse dynamics (逆向)}}$$
三项各自对应一个 loss。视觉想象与 3D 世界都用 latent-空间 MSE:
$$\mathcal{L}_{\text{2D}}=\mathbb{E}\left\|f_{2D}(O_{t},G_{t})-f_{enc}(V_{t})\right\|_{2}^{2}$$
$$\mathcal{L}_{\text{3D}}=\mathbb{E}\left\|f_{3D}(O_{t},A_{t})-f_{g}(G_{t})\right\|_{2}^{2}$$
动作用流匹配回归速度场 $\omega-A_t$:
$$\mathcal{L}_{\text{ACT}}=\mathbb{E}\left\|\omega-A_{t}-f_{act}(O_{t},G_{t},\hat{A}_{t})\right\|_{2}^{2}$$
总损失等权相加:
$$\mathcal{L}_{\text{total}}=\mathcal{L}_{\text{2D}}+\mathcal{L}_{\text{3D}}+\mathcal{L}_{\text{ACT}}$$
损失分解含义:$\mathcal{L}_{\text{3D}}$ 是运动控制理论里的「前向内部模型」(动作如何改变环境),$\mathcal{L}_{\text{ACT}}$ 是「逆运动控制」(由目标世界态反推动作),$\mathcal{L}_{\text{2D}}$ 把语义视觉计划锚定在几何上。三者靠双向注意力共享隐空间,构成 world-action 互约束。
期望但缺失的保证:一个说明「双向互约束在何种假设下比单向分解可辨识/更低方差」的命题,或至少一个证明联合三损失优化不会互相拉扯的稳定性论证,会大幅增强说服力。
预训练数据配方是「数据金字塔」的异构混合,总量仅 6k 小时:

Paper's Table 1, verbatim (caption: "Data mixture and training objectives used for pretraining. A checkmark indicates that the corresponding loss is enabled, while '–' indicates that the loss is masked out.").
注意 EgoDex(human)一行屏蔽了 $\mathcal{L}_{\text{ACT}}$ 却仍参与 2D/3D 损失 —— 无动作标签的人类视频依旧贡献世界建模先验;采样权重上 sim(InternData-A1 0.47)占主导,真机仅 AgiBot 0.17 + RoboChallenge 0.19。
真机主结果是全文最有说服力的一张表:

Paper's Table 3, verbatim (caption: "Real-world evaluation results on seven tabletop manipulation tasks. SR denotes the task success rate (%), and C denotes the task progress score (%).").
WSA1-B/L 平均 SR 77.5 / 80.3,较第二名 $\pi_{0.5}$(54.9)近乎翻倍,且横跨单臂 PiPER 与双臂 Lift2 都领先。唯一张力:Object Organization 上 WSA1-L(77)反低于 WSA1-B(80)并平手 $\pi_{0.5}$,与正文「each task 最高」的表述有出入。
仿真基准上开源第一:

Paper's Table 4, verbatim (caption: "RoboTwin2.0 benchmark experimental results. ... Mean success rate SR over 50 manipulation tasks is reported. WSA1 achieves leading performance over open-sourced models.").
关键读点:WSA1-B(3B, 92.7)超过体量更大的 Motus(8B, 87.0)与 LingBot-VA(7B, 91.5),说明增益来自范式而非参数量;但仍略逊于闭源 MotuBrain(96.1),作者用「competitive」定性。
消融把增益拆到组件级:

Paper's Figure 4, verbatim (caption: "Investigation of WSA modeling on RoboTwin2.0 Benchmark.").
baseline VLA 60% → 单加视觉想象 76% / 单加 3D 世界 75% → full WSA 80%:两条支路各自有效且互补(视觉想象利好语义/外观任务,3D 世界利好接触密集/几何任务)。
预训练阶段的消融进一步说明两阶段都用 WSA 才是最优:

Paper's Figure 5, verbatim (caption: "Ablation studies of WSA pre-training on RoboTwin2.0 Benchmark.").
无预训练仅后训练 80% → WSA 预训练 + 动作-only 后训练 89% → 两阶段都用 WSA 93%,量化了 6k 小时异构预训练的边际价值(+13 个点)。
| # | 论点 | 依据(paper-internal) |
|---|---|---|
| 1 | 现有 VLA/WAM 都是单向映射,缺 world-action 互约束 | §3.1 Eq (2)-(4) 三式条件都是单向;Fig 2 (a)-(c) 单向箭头 |
| 2 | 把控制拆成前向(action→world)+ 逆向(world→action)两个互约束分布可捕捉双向因果 | §3.1 Eq (5) 三项分解;§3.2 规则 3 的 $h_g\leftrightarrow h_{act}$ 双向注意力 |
| 3 | 该双向机制在同一 MoT 隐空间内可用三个 latent MSE / 流匹配损失联合优化 | §3.3 Eq (6)-(9),三损失对应三专家 |
| 4 | 联合建模使每个组件独立即有增益、合起来最优 | §4.4 Fig 4:60%→76%/75%→80% |
| 5 | 异构小规模(6k h)预训练 + 两阶段 WSA 即达 SOTA,验证数据高效性 | §4.4 Fig 5:80%→89%→93%;§4.2 Table 3;§4.3 Table 4 |
[实现未公开] —— L1 未记录开源代码仓库或 file:line。
最接近的开源参考:动作专家的流匹配 + 扩散 transformer 部分与 $\pi_0$ / $\pi_{0.5}$(openpi 系列)同构,可作为 $\mathcal{L}_{\text{ACT}}$ 与 $f_{act}$ 的复现底座;MoT 三专家 co-learning 结构最接近 Motus。所需外部权重:Qwen3-VL-2B / Wan2.2-5B(backbone)、COSMOS VAE($f_{enc}$)、Depth-Anything 3($f_g$)。
核心技术壁垒(§2 呼应):整个方法的不可替代性集中在 §3.2 因果注意力规则 3 —— $h_g$ 与 $h_{act}$ 的全双向注意力掩码。复现者最容易犯的错是把它做成两个独立的前向/逆向头(那就退化为单向 WAM,消融里对应 75-76% 而非 80%);双向必须在同一 attention block 内共享 KV,才能让 action→world 与 world→action 互为约束。
关键实现细节(易漏的 1-2 个 trick):