ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

model 2607.00678
world-action-modelmobile-manipulationlatent-actionflow-matchingmixture-of-transformers

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model — L2 #

1. TL;DR #

ABot-M0.5 是一个面向移动操作 (mobile manipulation) 的 World Action Model。核心论点:移动操作失败不是模型规模不够,而是三处结构性错位——时间粒度、动作空间、训练-推理一致性。三个对应机制:帧级 latent action 桥接粗视频与细控制;dual-level MoT 解耦 mobility/manipulation 子空间;Dream Forcing 用自梦视频训练逆动力学。RoboCasa365 平均 40.4%(SOTA)。

2. Q1 / Q2 / Q3 #

Q1 — 痛点 (What structural problem) #

现有 embodied 方法在移动操作上崩溃。作者把根因明确从"规模不足"改写为"结构错位":> "The central limitation is not merely insufficient model scale, but a structural mismatch between current world-action learning methods and the requirements of mobile manipulation." 具体三处错位:

  1. 时间粒度错位:现有 WAM 在时间压缩的 video chunk 上建模未来,但机器人动作要逐帧生成。抓取闭合 (grasp closure)、接触起始 (contact onset)、精细对齐这类发生在极短窗口的动态在粗 chunk 中被抹平。
  2. 动作结构错位:base movement 是低频、平滑、全局的;arm manipulation 是高频、局部、接触敏感的。塞进单一纠缠动作空间会造成梯度互相干扰,牺牲各自的专精化。
  3. rollout 条件错位:训练时逆动力学以 ground-truth 未来观测为条件,推理时只能以模型自己预测的(含噪声、漂移、幻觉的)未来为条件——这是 world-action 学习中的 exposure bias,长程 rollout 中误差累积。
  4. 作者用 Fig 1 概览把整个方法与三处错位的对应关系一次性给出。

    Figure 1: ABot-M0.5 overview — 3-stage pipeline, Video→LatentAction→Action, dual-level architecture, benchmark results

    Paper's Figure 1, verbatim (caption: "Overview of ABot-M0.5. ... Top: The 3-stage training pipeline (Pretrain, SFT1, SFT2). ... Left & Center: ... a Video → Latent Action → Action pipeline for temporal alignment, and ... a dual-level architecture to decouple different action spaces. Right: ... state-of-the-art performance on both simulation benchmarks (radar chart) and real-world mobile manipulation tasks (bar charts).").

    这张图是全文的骨架:上方三阶段训练 (Pretrain/SFT1/SFT2) 中 SFT2 即 Dream-Forcing 阶段;左中把"三级级联 + 动作解耦"两个架构机制并列;右侧的雷达图/柱状图预告了实验优势;底部真机执行序列用蓝/绿区分导航段与操作段。读者应注意:三处错位 (§2) 与三个机制 (§3) 是严格 1:1 对应的。

    Q2 — 方法 (Core mechanism) #

    把直接 video→action 映射分解为三级级联 $z_{t+1}\rightarrow m_t\rightarrow a_t$(世界建模 → 动作抽象 → 控制生成),三级全部用 Conditional Flow Matching (CFM) 统一目标训练。三个机制填补三处错位:

    1. Intermediate Latent Action:从帧对 $(I_t,I_{t+1})$ 用冻结编码器 $E_m$ 提取 $m_t=E_m(I_t,I_{t+1})$,作为 embodiment-agnostic 的中间"运动意图"空间,只依赖视觉状态转移,可从无动作标注视频学习。
    2. Dual-level MoT (D-MoT):第一层解耦三个 modality token 流(video/latent-action/action),各自独立投影+timestep+head,共享 attention trunk;第二层在 action 流内把 $a_t$ 严格通道级劈成 $a_t^{\mathrm{move}}$ 与 $a_t^{\mathrm{manip}}$ 两个子塔,各带独立 FFN 与 head,但通过 joint attention 保持协调。
    3. Dream Forcing:训练逆动力学时把 GT 未来条件 $z_{t+1},m_t$ 替换为模型自梦的 $\hat{z}_{t+1},\hat{m}_t$,让 action predictor 见到它推理时会遇到的同类不完美视觉状态。
    4. 核心技术壁垒:Dream Forcing 的两阶段前向 (two-phase forward) 训练机制。它需要在训练循环内、每步都廉价地生成自梦条件——作者借助闭环机器人设定(历史 chunk 始终被真实观测 grounding,只需梦最新一个未来 chunk)+ 单次并行前向 + few-step denoising(follow Self Forcing),才把"用模型自己预测训练逆动力学"这件在视频生成里需要昂贵序列 rollout 的事变得可训练。这是全文最难复制的一处工程-算法耦合(详见 §7)。

      Q3 — 结果 (Headline results) #

      • RoboCasa365 (pretraining) 平均 40.4%(+Condensed Memory 达 46.6%),显著超过 Qwen-RobotManip 35.9%、RLDX-1 33.2%;Composite-Seen 由 27.5% 提升到 38.3%。
      • RoboCasa365 (Target 100%) 平均 54.2%,超 Lingbot-VA 45.1%;Target 10% 低数据下 30.1% vs GR00T-N1.5 21.0%。
      • RoboTwin 2.0 平均 94.10(SOTA);LIBERO 平均 99.4(SOTA);LIBERO-Plus WAM 类别 Total 83.4(WAM SOTA,但全类别 Qwen-RobotManip-Context 91.4 更高)。
      • 真机 Peg Cylinder 成功率 70% / process 96%,均高于 $\pi_{0.5}$ (50%/90%) 与 Fast-WAM (30%/77%)。
      • 消融关键点:Dream Forcing 仅 +5k 步就把 67.55%→70.56% (+3.01%),而继续 teacher forcing 反而退化到 66.78%(+10k 才恢复到 68.90%)。

      3. 架构 / 方法图 #

      模型建立在 Wan2.2 5B 视频扩散 backbone 上。整体是三条 token 流的非对称级联:video latent 流 $X^z$、latent action 流 $X^m$、executable action 流 $X^a$,通过 D-MoT 联合处理。

      Figure 2: Overall architecture — asymmetric cascade of a dual-level MoT

      Paper's Figure 2, verbatim (caption: "Overall architecture of ABot-M0.5. The model jointly predicts future video latents, frame-level latent actions, and executable actions through a structured, asymmetric cascade design of a dual-level MoT. The Action-Decoupled MoT disentangled action into mobile and manipulation and predict together.").

      Fig 2 展示了三级级联与非对称信息流:video latent token 被屏蔽不能 attend latent action token(未来运动在视频预测时本就未知),而 action token 显式 attend latent action token,保证最终控制落地在细粒度运动意图上。这正是把 Eq (4) 的 $z_{t+1}\rightarrow m_t\rightarrow a_t$ 用 attention mask 实例化。

      三条 token 流拼接为 $X_t=[X_{t+1}^{z}, X_t^{m}, X_t^{a}]$。级联的三级用不断扩大的感受野条件化:$z_{t+1}$ 只看历史,$m_t$ 加入预测的 $z_{\leq t+1}$,$a_t$ 再加入 $m_{\leq t}$。级联的物理含义 (Eq 7):

      $$\text{Context}\xrightarrow{\text{World Modeling}}z_{t+1}\xrightarrow{\text{Motion Abstraction}}m_{t}\xrightarrow{\text{Control Decoding}}a_{t}.$$

      D-MoT 第二层(动作解耦)是本文架构的独特处:

      Figure 3: Dual-level Mixture-of-Transformers — mobility & manipulation sub-towers with shared attention

      Paper's Figure 3, verbatim (caption: "Dual-level Mixture-of-Transformers. The architecture disentangles modality-specific representations and heterogeneous action subspaces while preserving coordinated reasoning through shared attention. We omit the video and latent action expert for clarity.").

      Fig 3 显示 action 流内部严格 channel-to-subtower 分配:mobility 子塔与 manipulation 子塔各有独立 FFN 与 prediction head(避免高频操作信号淹没低频移动信号导致的梯度干扰),但两者在每层通过 joint self-attention 交换信息(base 重定位会直接影响抓取可行性)。即"FFN 分支特化 + attention 跨子空间协调"。

      下图给出三条流 + 双子塔的 token/依赖结构(原文无对应流程图,此处 Mermaid 补充结构清晰度):

      flowchart TB subgraph Perc[Perception] VAE[3D VAE] --> Z["video latent z_t+1"] TXT[UMT5 text enc] --> L[language l] Em["frozen E_m (ALAM)"] --> M["latent action m_t"] end Z --> XZ[X^z stream] M --> XM[X^m stream] XZ -. masked from m .-> XM subgraph DMoT[D-MoT joint attention trunk] XZ --> ATT[shared self-attention] XM --> ATT XA[X^a stream] --> ATT ATT --> HZ[z head] ATT --> HM[m head] ATT --> MOVE["move sub-tower FFN+head"] ATT --> MANIP["manip sub-tower FFN+head"] end XM -. a attends m .-> XA MOVE --> AMOVE["a_t^move"] MANIP --> AMANIP["a_t^manip"]

      4. 作者证明 #

      本文无形式化收敛/最优性定理——所有目标都是 CFM 回归损失,正确性靠实证。但作者给出了完整的推导性符号体系与损失构造,可做以下最少检查。

      符号表 (paper Table 1) #

      SymbolMeaningSymbolMeaning
      $t$Time step$z_{t+1}$Video latent
      $I_t$Raw frame$o_t$Multi-view observation
      $m_t$Frame-level latent action$a_t$Executable robot action
      $a_t^{\mathrm{move}}$Mobility action$a_t^{\mathrm{manip}}$Manipulation action
      $H$Prediction horizon$N_c$Number of cameras
      $\tau$Diffusion step $\in[0,1]$$\hat{z},\hat{m},\hat{a}$Dreamed latents
      $l$Language instruction$\tilde{z},\tilde{m},\tilde{a}$Noisy latents

      方程物理意义 #

      • Eq (5) 世界建模 CFM:$\mathcal{L}_{z}=\mathbb{E}\big[\|v_\theta^z(z_{t+1}^\tau; z_{只含历史,使训练信息流严格镜像推理时的自回归顺序。
      • Eq (9) latent action CFM:条件扩展为 $z_{\leq t+1},m_{
      • Eqs (11)-(12) 双分支动作 CFM:move 分支条件里带 manip 的噪声动作 $a_t^{\mathrm{manip},\tau}$,反之亦然——FFN 解耦但 attention 通过对方噪声 token 耦合。
      • Eq (15)/(24) Dream Forcing:$a_t\sim p_a(\cdot\mid\hat{z}_{t+1},z_{\leq t},\hat{m}_t,m_{

      6 项最小检查 #

      1. 量纲/目标一致性:三级损失都是 $\|v_\theta-(\text{clean}-\epsilon)\|_2^2$ 的 flow-matching velocity 回归,目标向 clean 样本方向指——self-consistent。✓
      2. 条件感受野单调扩张:$z$ 用 history-only → $m$ 加 $z_{\leq t+1}$ → $a$ 加 $m_{\leq t}$ (Eqs 20-22),与因果级联一致,无未来泄漏。✓
      3. 共享 timestep 合法性:Eq (10) 两分支独立采噪 $\epsilon^{\mathrm{move}},\epsilon^{\mathrm{manip}}$ 但共享 $\tau$——推理时可并行联合去噪,无需分别调度。✓
      4. latent action 可从无动作视频学习:Eq (8) $m_t=E_m(I_t,I_{t+1})$ 仅是帧对函数,不含控制标签,逻辑自洽。✓
      5. ALAM 代数约束:Eq (17) 加性 $\|m_i^k-(m_i^j+m_j^k)\|^2$、Eq (18) 反演 $\|m_i^j+m_j^i\|^2$,构成向量空间结构(长转移可分解、正反互逆)。✓
      6. SFT2 = SFT1 仅换 action 项:Eq (27) 中只有 $\mathcal{L}_a\to\tilde{\mathcal{L}}_a$(dream-forced),video/latent-action 损失保持 teacher-forced——消融隔离干净。✓
      7. LLM-specific: 参数/容量核算 #

        [论文未披露] — 本文未提供 per-module 参数拆解表、scaling-law 拟合指数、或 KV-cache bytes/token 的首原理核算。已知仅:backbone 为 Wan2.2 5B,文本编码器 UMT5,感知端 3D VAE。无法从源重建参数分解或验证总量。

        5. 实验与数据 #

        移动操作主结果 (RoboCasa365) #

        Table 2: RoboCasa365 (pretraining) results

        Paper's Table 2 — ABot-M0.5 (Ours) 平均 40.4%(Atomic-Seen 75.9%, Composite-Seen 38.3%),+Condensed Memory 达 46.6%。

        Table 2 是主战场结果:ABot-M0.5 在平均、Atomic-Seen、Composite-Seen 三列全面领先。读者应注意两个"暗点":(a) Composite-Unseen 仅 2.7%,远低于 Qwen-RobotManip 的 14.9%——这是全文最反直觉处,因为论文主打长程/composite 优势却在最难的泛化列崩塌;(b) 打破记录的 "+Condensed Memory" 组件被明确推迟到 future work,其 46.6% 是一个从未被描述的组件产生的数字。

        Table 3: RoboCasa365 (Target) results, seen/unseen

        Paper's Table 3 — Target 100% 平均 54.2%(超 Lingbot-VA 45.1%);Target 10% 低数据下 30.1% vs GR00T-N1.5 21.0%。

        Table 3 显示在 fine-tuned Target 设定下优势更清晰,且在仅 10% 数据时仍保持 +9pt 领先,支撑"pretraining 提供可迁移先验、样本高效"的论点。

        纯操作泛化 (RoboTwin 2.0 / LIBERO-Plus) #

        Table 4: RoboTwin 2.0 results, clean & randomized

        Paper's Table 4 — ABot-M0.5 Clean 94.00 / Randomized 94.20 / Average 94.10,均居榜首。

        Table 4 证明优势不限于 mobility-heavy 设定:即使无移动,latent action 抽象仍改善细粒度控制,rollout 对齐训练提升视觉扰动鲁棒性。

        Table 6: Zero-shot LIBERO-Plus robustness across perturbations

        Paper's Table 6 — ABot-M0.5 在 WAM 类别 Total 83.4(WAM SOTA),Robot 列 87.4 领先。

        Table 6 是最诚实的一张:ABot-M0.5 的 SOTA 声明被明确限定在 WAM 类别内。它在 Noise (75.5 vs ImageWAM 93.8)、Camera (70.5)、Light 等列输给多个 WAM,而全类别第一是纯 VLA 的 Qwen-RobotManip-Context (91.4)。这说明 WAM 对视觉扰动仍敏感。

        消融 (三条对齐原则) #

        Table 8: Dream Forcing vs continued teacher forcing

        Paper's Table 8 — SFT1 base 67.55%;+DF 5k 步→70.56% (+3.01%);继续 teacher forcing 反退化至 66.78% (+5k),+10k 仅恢复到 68.90%。

        Table 8 是 Dream Forcing 的核心证据:同一 50k warm-start 出发,DF 用一半算力 (5k) 就超过 teacher forcing 用 10k 的效果,且标准训练在 +5k 时主动退化——强烈说明 train-test gap 是真实瓶颈而非正则化不足。

        Figure 10: Training dynamics — action-decoupled vs modality-level MoT

        Paper's Figure 10 — action-decoupled MoT (0.48) 收敛更快且优于 modality-level baseline (0.34)。

        Fig 10 支撑动作解耦论点:解耦后收敛更快,说明确实减少了跨动作空间的梯度干扰。(注意:0.48/0.34 无单位、"selected subset" 未命名,指标定义留白。)

        其余关键消融:latent-action 结构上 3-Stage Separate (94.0%) > 2-Stage Channel Concat (91.06%) > Baseline 直接 video→action (87.60%)(Table 7);且 conditioning dropout $p_{\mathrm{drop}}=0.2$ 反而伤害 (91.06% vs 94.0% at 0),因为级联推理时 latent action 总是可得,dropout 制造了训练-推理不一致。Pretraining 效应:预训练+SFT 在 Target 10% 达 49.0%,而 Wan2.2 直接 SFT 仅 17.8%(-31.2pt)。

        6. 论证链 #

        #步骤论文内部依据
        1移动操作要求三级空间桥接:粗未来视频 latent → 细异构可执行动作,直接映射因粒度/语义鸿沟而困难§2.1 Eqs (1)-(3),定义三级 bridging hierarchy
        2现有 WAM 恰在三处与该结构错位:时间粒度、动作结构、rollout 条件§2.2 三个 bottleneck 子块,每个 1:1 映射一个机制
        3引入帧级 latent action $m_t=E_m(I_t,I_{t+1})$ 作 bridging space,用 CFM 级联训练,对齐时间粒度§3.2 Eqs (7)-(9);消融 Table 7 (94.0 vs 87.6 baseline)
        4用 dual-level MoT 分别解耦 modality 与 move/manip 子空间,消除梯度干扰同时保 attention 协调§3.3 Eqs (10)-(13);Fig 10 (0.48 vs 0.34,更快收敛)
        5用 Dream Forcing 把逆动力学条件从 GT 换成自梦 $\hat{z},\hat{m}$,对齐训练-推理,two-phase 前向使之可训练§3.4 Eqs (14)-(15);Table 8 (+3.01% with half compute)
        6三机制经渐进训练 (Pretrain→SFT1 teacher-forced→SFT2 dream-forced) 组合,得长程稳定性§4.4 Eqs (20)-(28);主结果 Tables 2-6 全面 SOTA/WAM-SOTA

        7. 实现 cross-reference #

        本文为 model release 类论文,但 [实现未公开] — arxiv 2607.00678(AMAP CV Lab / Alibaba)未在源中给出官方代码仓库、HuggingFace 权重或 config.json。因此下列架构维度只能从论文文本确认,无法做 file:line 级代码交叉验证;模型架构细节图 (§Appendix) 因代码不可得而标注为 N/A。

        核心技术壁垒(§2 Q2 展开):Dream Forcing 的两阶段前向能被训练,依赖三个耦合技巧,缺一即退回昂贵或失配:

        1. 闭环只梦最新 chunk:不同于视频生成需序列 rollout 多个未来 chunk,机器人闭环中历史 chunk 持续被真实观测 grounding,故只需梦最新一个未来 chunk(§3.4 Phase A)。
        2. 单次并行前向生成整批梦 latent:避免耗时序列 rollout(§3.4 Phase A)。
        3. few-step denoising (follow Self Forcing):标准多步扩散采样在训练中 on-the-fly 生成过于昂贵,用少步去噪保训练效率(§3.4,cites huang2026self)。
        4. 关键实现细节(易漏的 1-2 处技巧)

          1. Efficient Structured Attention:把结构化稀疏 attention mask 重写为一组 dense 子问题,用 variable-length FlashAttention 单 kernel 执行,与原 mask 数学等价但 GPU 高效——声称长序列 forward-backward 约 5× 加速(§4.5,无表/图佐证,仅 "approximately",难审计)。
          2. Offset-Based Latent Augmentation:允许 latent 切分起始 offset $s\in\{0,\dots,H-1\}$ 变化 (Eq 29),使有效切分数 ×H,提升时间多样性与对微小时序变化的鲁棒性——一个几乎零成本的数据增强 (§4.5)。
          3. Fixed semantic slot allocation:4 个固定语义视频槽(前 2 第三人称全局、后 2 腕部细节),多视图随机采样填槽做 view-level 增强,少视图零填充并在 attention 中 mask(§4.2)。
          4. LLM-specific: 训练配方 itemization #

            StageGoalData (tokens + mix)LR scheduleContextTechniques
            Pretrain (World Model)action-unconditioned AR 未来视频预测OXE / OXE-AugE / Agibot-Beta / RoboCOIN / RoboMind / Galaxea / InternData-A1 (+RoboNet/Bridge V2/DROID);token 量 [论文未披露][论文未披露]4 语义视频槽,多视图full-param FT from Wan2.2 5B;padded-view mask (Eq 16)
            Pretrain (Latent Action)自监督学 $E_m$大规模帧对视频(无需动作标签)[论文未披露]三元组 $(o_i,o_j,o_k)$ALAM 框架 (Fig 6);VQ+rec+perc+加性+反演 5 项损失 (Eq 19);训后只留 encoder
            SFT1 (teacher-forced)稳定 world+inverse-dynamics 联合学习下游 target 数据[论文未披露]GT 未来条件联合 $\mathcal{L}_z+\mathcal{L}_m+\mathcal{L}_a$ (Eq 23);~50k 步
            SFT2 (Dream Forcing)对齐推理条件同 SFT1[论文未披露]自梦 $\hat{z},\hat{m}$two-phase 前向;action 损失换 dream-forced (Eqs 25-28);+5k 步
            Post-train (quant/RLHF)[论文未披露][论文未披露][论文未披露]无量化/RL 后训练描述

            单一最难复制的训练技巧:Dream Forcing 的 SFT1→SFT2 交接——warm-start 必须先在 teacher forcing 下稳定 world model(否则早期预测噪声污染动作学习),再切换 dream 条件;切换过早或全程 dream 都会退化(Table 8 显示时序敏感)。

            §8/§9 Serving & Open questions #

            • Serving [论文未披露]:未给推理硬件、KV-cache bytes/token、prefill/decode 瓶颈或 128K 并发分析。仅 future work 提及"边缘设备实时执行"与"硬件感知加速"。
            • Open questions(本文特有):(1) 三级级联 + Dream Forcing 的优势在何种模型/数据规模饱和或反转?作者列 WAM scaling law 为 future work。(2) latent action 的 embodiment-agnostic 假设能否迁移到更异构形态或非机器人模态?(3) Composite-Unseen 上的崩塌 (2.7%) 说明该架构对未见任务组合的泛化仍是开放弱点。

            Appendix: 模型架构细节图(代码驱动) #

            代码来源:[代码未公开] — arxiv 2607.00678 无可访问官方推理/训练代码仓库

            因参考代码不可得,无法从代码提取维度确认的 Mermaid 架构图。按 model-release 触发条件的 6 类图状态如下:

            编号名称状态
            A1Top-LevelN/A — 代码未公开;概念级见 §3 Fig 2 + Mermaid
            A2BlockN/A — 代码未公开(Wan2.2 5B DiT block,维度未确认)
            A3主 Attention 变体N/A — 代码未公开;论文未给 head 数/RoPE base/KV shape
            A4辅 Attention 变体N/A — 模型仅使用单一 joint self-attention(无第二 attention 变体)
            A5选择/索引机制N/A — 无 Indexer/Router(D-MoT 为静态 channel-to-subtower 分配,非动态路由)
            A6残差/连接机制N/A — 标准 DiT 残差;无 mHC/highway 等非标准连接

            维度数字(backbone 5B、4 视频槽、move/manip 双子塔)仅从论文文本得到,未经代码/config.json 确认。若后续官方开源,须回填 A1-A3 的实测维度。