一个统一的世界-动作模型,用 UniDiffuser + 三流 MoT 把视频与动作放进同一生成框架,5 种推理模式共享一套权重。靠相对末端执行器动作表示做跨本体迁移(50–100 条轨迹),并以推理栈实现 54.4× 加速 / 11 Hz。RoboTwin 2.0 达 95.8%/96.1%,WorldArena EWMScore 63.77 第一。
VLA 策略从静态图文预训练继承语义先验,但缺乏对细粒度世界动力学的建模,退化为对行为的表面模仿而非对物理时序的理解。为引入视频先验,早期用两阶段 VGM+IDM:视频扩散模型先预测未来帧,逆动力学模型再从帧推动作——但视频预测误差会随时间累积,污染下游动作精度。后续的世界-动作模型(WAM)把视觉动力学与动作预测放进同一联合目标,规避级联误差,但如何在一个统一训练配方下吸收大规模异构多模态数据(无动作标注的纯视频、无任务语言的交互数据、跨本体机器人轨迹)仍是核心难点。
在前作 Motus 基础上,MotuBrain 保留 UniDiffuser 连续多模态建模 + Mixture-of-Transformers,用一个模型支持五种条件分布(VLA / WM / IDM / VGM / 联合视频-动作预测)。四项工程性扩展:(1) 通过 3D RoPE 的视角相关空间偏移支持任意数量相机视图的统一多视角表示;(2) 独立文本流把高层语义与低层控制更紧耦合;(3) 跨本体的统一相对末端执行器动作表示;(4) 面向长程实机控制的后训练与部署配方(自回归扩散 rollout、V2A 非对称依赖的纯动作推理、实时分块闭环执行)。
核心技术壁垒:把 V2A 式非对称注意力(动作可看视频/语言,视频永不看动作)与 UniDiffuser 的独立时间步采样耦合起来,从而在联合去噪一个很短的前缀后,可以冻结视频流、缓存其 KV、只继续更新动作流——这既是训练目标又是推理调度,是让大型 WAM 达到实时控制频率却"无损"的关键(详见 §7)。
RoboTwin 2.0:clean 95.8% / randomized 96.1%,两个设置均排第一,是唯一 randomized 平均 >95% 的模型;50 个任务中 clean 24 个 / randomized 25 个满分,19 个双满分。WorldArena:EWMScore 63.77 居首,领先最强视频基线 Wan2.6(59.80)约 4 分,Motion Quality 维度第一。推理栈相对朴素基线 54.4× 端到端加速、11 Hz,且被验证"基本无损"(成功率波动亚个百分点)。实机:仅 50–100 条同本体轨迹即可迁移到新人形本体,长程家务任务(做关东煮 98.54、调鸡尾酒 97.34、插花 83.30)表现稳定。

Paper's Figure 1, verbatim (caption: "Overview of MotuBrain's architecture. MotuBrain builds on a unified video-action backbone and adopts a three-stream Mixture-of-Transformers architecture with text, video, and action streams. It further uses an H-bridge attention design to balance cross-modal interaction and efficiency, while supporting flexible multiview inputs through view-dependent 3D RoPE offsets.").
图 1 展示了三条独立参数流(文本 / 视频 / 动作):文本流只作为条件分支参与注意力、不带输出头;视频流与动作流都用 flow matching 预测各自的速度场。读者应重点注意 H-bridge 设计——全量视频-动作联合注意力只加在中间 50% 层,底部与顶部各 25% 层做解耦注意力(视频与动作独立处理、不做联合),在浅/深层保留模态专属表征,只在中间层做语义对齐与策略接地。多视角则通过 3D RoPE 只在空间维加视角偏移、时间维不变,把不同视图映射到共享空间位置的不同区域,无需改动 backbone 即可支持任意视图数。
统一生成框架把五种任务写成同一 (视频, 动作) 联合分布在不同条件化下的条件分布:
$$\text{VLA: } p(\bm{a}_{t+1:t+k}\mid\bm{o}_{t},\ell);\quad \text{WM: } p(\bm{o}_{t+1:t+k}\mid\bm{o}_{t},\bm{a}_{t+1:t+k});\quad \text{IDM: } p(\bm{a}_{t+1:t+k}\mid\bm{o}_{t:t+k});\quad \text{VGM: } p(\bm{o}_{t+1:t+k}\mid\bm{o}_{t},\ell);\quad \text{Joint: } p(\bm{o}_{t+1:t+k},\bm{a}_{t+1:t+k}\mid\bm{o}_{t},\ell)$$
其中 $\bm{a}$ 为动作、$\bm{o}$ 为观测(视频)、$\ell$ 为语言指令、$t$ 为当前步、$k$ 为预测视界。UniDiffuser 通过选择哪些变量被条件化、哪些被生成,让同一模型实例化任意一种模式。
训练/后训练四种注意力掩码见图 2:

Paper's Figure 2, verbatim (caption: "Attention masks used in all training stages and post-training modes. (a) Stage-1 pre-training updates only the video branch. (b) Stage-2 pre-training uses full joint attention over language, conditioned video, video, and action tokens. (c) Non-autoregressive post-training disables video-to-action attention. (d) Autoregressive post-training applies a causal mask over temporally ordered video and action tokens.").
图 2 把四个训练阶段的注意力连接方式并列:(a) 一阶段只更新视频分支;(b) 二阶段全联合注意力;(c) 非自回归后训练关闭视频→动作注意力(即 V2A 式非对称依赖);(d) 自回归后训练在时序排列的视频/动作 token 上加块因果掩码。读者应注意 (c)(d) 都体现"动作看视频、视频不看动作"的不对称性——这是后面纯动作推理加速的训练侧根据。
本文无形式化作者证明 — 仅实证。全文没有收敛定理、方差/样本复杂度界或命题证明;所有主张(无损加速、跨本体迁移、任务多样性优于数据复制)都靠 RoboTwin 2.0 / WorldArena / 实机三套基准的经验数字支撑。若要形式化,理想的保证会是:(a) V2A 冻结视频流的纯动作后缀在何种条件下与全联合去噪等价的误差界;(b) 相对 EEF 表示在何种本体差异下保持动作分布不变的等变性证明。以下按算法类别列出可核验的关键"方程物理意义"检查(≥6 项):
RoboTwin 2.0 平均结果与消融。多任务训练用 2,500 条 clean(每任务 50)+ 25,000 条重度随机化(每任务 500)演示,视频降采样至 5 Hz、动作 10 Hz。

Paper's Table 3 (caption: "Robotwin 2.0 Results. ... MotuBrain-Non-AR represents non-autoregressive mode.").
表 3 是核心消融链:从 MotuBrain-Non-AR w/o Pretrain, HBridge(89.1/88.8)逐步加回预训练与 AR,到完整 MotuBrain(95.8/96.1)。读者应注意两点——预训练带来的增益(w/o Pretrain 91.5→完整)显著,且完整 MotuBrain 是唯一 randomized 平均 >95% 的条目,超过所有 VLA 与 WAM 基线(LingBot-VA 92.9/91.5、Fast-WAM 91.9/91.8)。

Paper's Table 4 (caption: "Per-task success rates on RoboTwin under clean and randomized evaluation settings.").
表 4 的逐任务分解显示增益集中在多阶段/接触密集/精细空间排布任务(Handover Block、Open Microwave、Press Stapler、Turn Switch、Blocks Ranking Size、Place Can Basket),说明优势来自准确的时序建模与稳定的接触控制;少数任务仍落后(如 Hanging Mug clean 55 对 Fast-WAM 58),并非全面碾压。

Paper's Figure 3 (caption: "Task scaling results. ... MotuBrain shows a clear upward trend ... and consistently stronger scaling behavior than conventional VLA baselines.").
图 3 的任务缩放曲线中 MotuBrain-Non-AR 上升最陡(约 74→92),而 Pi0.5 随任务数增加反而下降——支撑"更多任务暴露更多可复用世界知识、VLA 基线有更强任务干扰"的论点。

Paper's Figure 4 (caption: "Data scaling results. ... MotuBrain continues to benefit from additional training data ...").
图 4 显示数据缩放下 MotuBrain 仍持续获益且始终高于 Motus 与 Pi0.5;与图 3 对比,作者据此论证"提升任务多样性比对固定任务集单纯堆数据更有效"(任务缩放曲线更陡)。
WorldArena 世界模型评测(同一 backbone 以 FDM 前向动力学模式运行)。

Paper's Table 5 (caption: "Per-metric WorldArena results and overall EWMScore comparison. ... EWMScore is the arithmetic mean of all 16 normalized metrics, scaled to [0,100].").
表 5 揭示一个反直觉现象:MotuBrain 的 Photometric Consistency(0.0574)与 Action Following(0.0203)几乎垫底、Image Quality 也不占优,但凭 Motion Quality 三项全场第一(Dynamic Degree 0.5148、Flow Score 0.4911、Motion Smoothness 0.8566)拿下最高聚合 EWMScore 63.77。这说明其领先完全由"运动量大、平滑、且集中在本体与被操作物"驱动,而非整体视觉打磨。结合 §3.1 的 95.8% 控制成功率,作者论证它同时跨过了 WorldArena 原研究报告的感知-功能鸿沟(EWMScore 与控制成功仅弱相关 $r=0.36$)。
推理加速累积表。

Paper's Table 2 (caption: "Cumulative speedup from inference optimizations. Each row applies the listed technique on top of all preceding ones. ...").
表 2 是 54.4× 头条数字的来源,逐行叠加:噪声采样把步数 50→30(1.69×)、torch.compile(5.00×)、FP8(5.57×)、DiT cache(跳变到 24.5×)、V2A 纯动作(54.4×,11.11 Hz)。读者应注意 DiT cache 单项就贡献了从 5.57× 到 24.5× 的 ~4.4× 跳跃,是全栈中最主导的一步,而非各步均匀分摊。
| # | 论证步骤(paper-internal) | 依据 |
|---|---|---|
| 1 | VLA 只有静态图文先验、缺世界动力学;VGM+IDM 两阶段会累积视频预测误差 | §1 para 1/3(论述) |
| 2 | 因此把视觉动力学与动作放进同一 UniDiffuser + 三流 MoT 联合目标(WAM),并用相对 EEF 表示统一跨本体动作 | §2.1、§2.2 Eq 2/4 |
| 3 | 该统一模型能吸收异构数据(纯视频/无语言交互/跨本体轨迹),从而在同数据设置下比 VLA 更强、任务缩放更陡 | §3.1 Fig 3/4、Table 3 消融 |
| 4 | 同一 backbone 在 FDM 模式下的世界预测(EWMScore 63.77 第一)与控制成功率(95.8%)同时最高,跨过感知-功能鸿沟 | §3.2 Table 5、Fig 5 |
| 5 | V2A 非对称注意力 + 独立时间步采样使纯动作推理可行,叠加 DiT cache/FP8/compile 得 54.4× 且亚个百分点无损 | §2.3 para 4、§2.4.1 Table 2 |
| 6 | 实时分块闭环 + RTC 式融合(Eq 12–15)消除块边界不连续,使 50–100 条轨迹迁移的新本体可稳定长程执行 | §2.4.2、§3.3 实机分数 |
[实现未公开](论文无开源代码链接;项目页 https://www.shengshu.com/en/motubrain 仅展示 demo)。可参照的开放组件:UniDiffuser 生成公式(bao2023transformer)、H-bridge 注意力(wang2025hbridge)、RTC 实时分块(black2025real)、DreamZero 式 DiT 缓存与动作平滑(ye2026world)、LingBot-VA 噪声条件策略(li2026causal)。前作 Motus(bi2025motus)是最近的开放参考起点。
核心技术壁垒(复现最难点):V2A 非对称注意力必须与 UniDiffuser 的独立时间步采样协同——训练时视频用 $\mathrm{timeshift}=6$、动作用 $\mathrm{timeshift}=1$(§2.2/§2.4.1),使动作能在噪声视觉条件下仍准确预测;推理时才能在联合去噪 $N$ 步前缀后冻结视频流、构建其 per-layer KV 缓存,让后续步只更新动作查询去 attend 缓存的视频/文本 KV(Eq 9 调度)。缺少配套的时间步采样与 V2A 训练掩码,直接照搬"冻结视频"会破坏注意力语义、掉成功率——这正是作者能宣称加速"无损"的隐藏前提。
关键实现细节(易漏的两处 trick):