ABot-M0.5 是一个面向移动操作 (mobile manipulation) 的 World Action Model。核心论点:移动操作失败不是模型规模不够,而是三处结构性错位——时间粒度、动作空间、训练-推理一致性。三个对应机制:帧级 latent action 桥接粗视频与细控制;dual-level MoT 解耦 mobility/manipulation 子空间;Dream Forcing 用自梦视频训练逆动力学。RoboCasa365 平均 40.4%(SOTA)。
现有 embodied 方法在移动操作上崩溃。作者把根因明确从"规模不足"改写为"结构错位":> "The central limitation is not merely insufficient model scale, but a structural mismatch between current world-action learning methods and the requirements of mobile manipulation." 具体三处错位:
作者用 Fig 1 概览把整个方法与三处错位的对应关系一次性给出。

Paper's Figure 1, verbatim (caption: "Overview of ABot-M0.5. ... Top: The 3-stage training pipeline (Pretrain, SFT1, SFT2). ... Left & Center: ... a Video → Latent Action → Action pipeline for temporal alignment, and ... a dual-level architecture to decouple different action spaces. Right: ... state-of-the-art performance on both simulation benchmarks (radar chart) and real-world mobile manipulation tasks (bar charts).").
这张图是全文的骨架:上方三阶段训练 (Pretrain/SFT1/SFT2) 中 SFT2 即 Dream-Forcing 阶段;左中把"三级级联 + 动作解耦"两个架构机制并列;右侧的雷达图/柱状图预告了实验优势;底部真机执行序列用蓝/绿区分导航段与操作段。读者应注意:三处错位 (§2) 与三个机制 (§3) 是严格 1:1 对应的。
把直接 video→action 映射分解为三级级联 $z_{t+1}\rightarrow m_t\rightarrow a_t$(世界建模 → 动作抽象 → 控制生成),三级全部用 Conditional Flow Matching (CFM) 统一目标训练。三个机制填补三处错位:
核心技术壁垒:Dream Forcing 的两阶段前向 (two-phase forward) 训练机制。它需要在训练循环内、每步都廉价地生成自梦条件——作者借助闭环机器人设定(历史 chunk 始终被真实观测 grounding,只需梦最新一个未来 chunk)+ 单次并行前向 + few-step denoising(follow Self Forcing),才把"用模型自己预测训练逆动力学"这件在视频生成里需要昂贵序列 rollout 的事变得可训练。这是全文最难复制的一处工程-算法耦合(详见 §7)。
模型建立在 Wan2.2 5B 视频扩散 backbone 上。整体是三条 token 流的非对称级联:video latent 流 $X^z$、latent action 流 $X^m$、executable action 流 $X^a$,通过 D-MoT 联合处理。

Paper's Figure 2, verbatim (caption: "Overall architecture of ABot-M0.5. The model jointly predicts future video latents, frame-level latent actions, and executable actions through a structured, asymmetric cascade design of a dual-level MoT. The Action-Decoupled MoT disentangled action into mobile and manipulation and predict together.").
Fig 2 展示了三级级联与非对称信息流:video latent token 被屏蔽不能 attend latent action token(未来运动在视频预测时本就未知),而 action token 显式 attend latent action token,保证最终控制落地在细粒度运动意图上。这正是把 Eq (4) 的 $z_{t+1}\rightarrow m_t\rightarrow a_t$ 用 attention mask 实例化。
三条 token 流拼接为 $X_t=[X_{t+1}^{z}, X_t^{m}, X_t^{a}]$。级联的三级用不断扩大的感受野条件化:$z_{t+1}$ 只看历史,$m_t$ 加入预测的 $z_{\leq t+1}$,$a_t$ 再加入 $m_{\leq t}$。级联的物理含义 (Eq 7):
$$\text{Context}\xrightarrow{\text{World Modeling}}z_{t+1}\xrightarrow{\text{Motion Abstraction}}m_{t}\xrightarrow{\text{Control Decoding}}a_{t}.$$
D-MoT 第二层(动作解耦)是本文架构的独特处:

Paper's Figure 3, verbatim (caption: "Dual-level Mixture-of-Transformers. The architecture disentangles modality-specific representations and heterogeneous action subspaces while preserving coordinated reasoning through shared attention. We omit the video and latent action expert for clarity.").
Fig 3 显示 action 流内部严格 channel-to-subtower 分配:mobility 子塔与 manipulation 子塔各有独立 FFN 与 prediction head(避免高频操作信号淹没低频移动信号导致的梯度干扰),但两者在每层通过 joint self-attention 交换信息(base 重定位会直接影响抓取可行性)。即"FFN 分支特化 + attention 跨子空间协调"。
下图给出三条流 + 双子塔的 token/依赖结构(原文无对应流程图,此处 Mermaid 补充结构清晰度):
本文无形式化收敛/最优性定理——所有目标都是 CFM 回归损失,正确性靠实证。但作者给出了完整的推导性符号体系与损失构造,可做以下最少检查。
| Symbol | Meaning | Symbol | Meaning |
|---|---|---|---|
| $t$ | Time step | $z_{t+1}$ | Video latent |
| $I_t$ | Raw frame | $o_t$ | Multi-view observation |
| $m_t$ | Frame-level latent action | $a_t$ | Executable robot action |
| $a_t^{\mathrm{move}}$ | Mobility action | $a_t^{\mathrm{manip}}$ | Manipulation action |
| $H$ | Prediction horizon | $N_c$ | Number of cameras |
| $\tau$ | Diffusion step $\in[0,1]$ | $\hat{z},\hat{m},\hat{a}$ | Dreamed latents |
| $l$ | Language instruction | $\tilde{z},\tilde{m},\tilde{a}$ | Noisy latents |
[论文未披露] — 本文未提供 per-module 参数拆解表、scaling-law 拟合指数、或 KV-cache bytes/token 的首原理核算。已知仅:backbone 为 Wan2.2 5B,文本编码器 UMT5,感知端 3D VAE。无法从源重建参数分解或验证总量。

Paper's Table 2 — ABot-M0.5 (Ours) 平均 40.4%(Atomic-Seen 75.9%, Composite-Seen 38.3%),+Condensed Memory 达 46.6%。
Table 2 是主战场结果:ABot-M0.5 在平均、Atomic-Seen、Composite-Seen 三列全面领先。读者应注意两个"暗点":(a) Composite-Unseen 仅 2.7%,远低于 Qwen-RobotManip 的 14.9%——这是全文最反直觉处,因为论文主打长程/composite 优势却在最难的泛化列崩塌;(b) 打破记录的 "+Condensed Memory" 组件被明确推迟到 future work,其 46.6% 是一个从未被描述的组件产生的数字。

Paper's Table 3 — Target 100% 平均 54.2%(超 Lingbot-VA 45.1%);Target 10% 低数据下 30.1% vs GR00T-N1.5 21.0%。
Table 3 显示在 fine-tuned Target 设定下优势更清晰,且在仅 10% 数据时仍保持 +9pt 领先,支撑"pretraining 提供可迁移先验、样本高效"的论点。

Paper's Table 4 — ABot-M0.5 Clean 94.00 / Randomized 94.20 / Average 94.10,均居榜首。
Table 4 证明优势不限于 mobility-heavy 设定:即使无移动,latent action 抽象仍改善细粒度控制,rollout 对齐训练提升视觉扰动鲁棒性。

Paper's Table 6 — ABot-M0.5 在 WAM 类别 Total 83.4(WAM SOTA),Robot 列 87.4 领先。
Table 6 是最诚实的一张:ABot-M0.5 的 SOTA 声明被明确限定在 WAM 类别内。它在 Noise (75.5 vs ImageWAM 93.8)、Camera (70.5)、Light 等列输给多个 WAM,而全类别第一是纯 VLA 的 Qwen-RobotManip-Context (91.4)。这说明 WAM 对视觉扰动仍敏感。

Paper's Table 8 — SFT1 base 67.55%;+DF 5k 步→70.56% (+3.01%);继续 teacher forcing 反退化至 66.78% (+5k),+10k 仅恢复到 68.90%。
Table 8 是 Dream Forcing 的核心证据:同一 50k warm-start 出发,DF 用一半算力 (5k) 就超过 teacher forcing 用 10k 的效果,且标准训练在 +5k 时主动退化——强烈说明 train-test gap 是真实瓶颈而非正则化不足。

Paper's Figure 10 — action-decoupled MoT (0.48) 收敛更快且优于 modality-level baseline (0.34)。
Fig 10 支撑动作解耦论点:解耦后收敛更快,说明确实减少了跨动作空间的梯度干扰。(注意:0.48/0.34 无单位、"selected subset" 未命名,指标定义留白。)
其余关键消融:latent-action 结构上 3-Stage Separate (94.0%) > 2-Stage Channel Concat (91.06%) > Baseline 直接 video→action (87.60%)(Table 7);且 conditioning dropout $p_{\mathrm{drop}}=0.2$ 反而伤害 (91.06% vs 94.0% at 0),因为级联推理时 latent action 总是可得,dropout 制造了训练-推理不一致。Pretraining 效应:预训练+SFT 在 Target 10% 达 49.0%,而 Wan2.2 直接 SFT 仅 17.8%(-31.2pt)。
| # | 步骤 | 论文内部依据 |
|---|---|---|
| 1 | 移动操作要求三级空间桥接:粗未来视频 latent → 细异构可执行动作,直接映射因粒度/语义鸿沟而困难 | §2.1 Eqs (1)-(3),定义三级 bridging hierarchy |
| 2 | 现有 WAM 恰在三处与该结构错位:时间粒度、动作结构、rollout 条件 | §2.2 三个 bottleneck 子块,每个 1:1 映射一个机制 |
| 3 | 引入帧级 latent action $m_t=E_m(I_t,I_{t+1})$ 作 bridging space,用 CFM 级联训练,对齐时间粒度 | §3.2 Eqs (7)-(9);消融 Table 7 (94.0 vs 87.6 baseline) |
| 4 | 用 dual-level MoT 分别解耦 modality 与 move/manip 子空间,消除梯度干扰同时保 attention 协调 | §3.3 Eqs (10)-(13);Fig 10 (0.48 vs 0.34,更快收敛) |
| 5 | 用 Dream Forcing 把逆动力学条件从 GT 换成自梦 $\hat{z},\hat{m}$,对齐训练-推理,two-phase 前向使之可训练 | §3.4 Eqs (14)-(15);Table 8 (+3.01% with half compute) |
| 6 | 三机制经渐进训练 (Pretrain→SFT1 teacher-forced→SFT2 dream-forced) 组合,得长程稳定性 | §4.4 Eqs (20)-(28);主结果 Tables 2-6 全面 SOTA/WAM-SOTA |
本文为 model release 类论文,但 [实现未公开] — arxiv 2607.00678(AMAP CV Lab / Alibaba)未在源中给出官方代码仓库、HuggingFace 权重或 config.json。因此下列架构维度只能从论文文本确认,无法做 file:line 级代码交叉验证;模型架构细节图 (§Appendix) 因代码不可得而标注为 N/A。
核心技术壁垒(§2 Q2 展开):Dream Forcing 的两阶段前向能被训练,依赖三个耦合技巧,缺一即退回昂贵或失配:
关键实现细节(易漏的 1-2 处技巧):
| Stage | Goal | Data (tokens + mix) | LR schedule | Context | Techniques |
|---|---|---|---|---|---|
| Pretrain (World Model) | action-unconditioned AR 未来视频预测 | OXE / OXE-AugE / Agibot-Beta / RoboCOIN / RoboMind / Galaxea / InternData-A1 (+RoboNet/Bridge V2/DROID);token 量 [论文未披露] | [论文未披露] | 4 语义视频槽,多视图 | full-param FT from Wan2.2 5B;padded-view mask (Eq 16) |
| Pretrain (Latent Action) | 自监督学 $E_m$ | 大规模帧对视频(无需动作标签) | [论文未披露] | 三元组 $(o_i,o_j,o_k)$ | ALAM 框架 (Fig 6);VQ+rec+perc+加性+反演 5 项损失 (Eq 19);训后只留 encoder |
| SFT1 (teacher-forced) | 稳定 world+inverse-dynamics 联合学习 | 下游 target 数据 | [论文未披露] | GT 未来条件 | 联合 $\mathcal{L}_z+\mathcal{L}_m+\mathcal{L}_a$ (Eq 23);~50k 步 |
| SFT2 (Dream Forcing) | 对齐推理条件 | 同 SFT1 | [论文未披露] | 自梦 $\hat{z},\hat{m}$ | two-phase 前向;action 损失换 dream-forced (Eqs 25-28);+5k 步 |
| Post-train (quant/RLHF) | 无 | [论文未披露] | [论文未披露] | [论文未披露] | 无量化/RL 后训练描述 |
单一最难复制的训练技巧:Dream Forcing 的 SFT1→SFT2 交接——warm-start 必须先在 teacher forcing 下稳定 world model(否则早期预测噪声污染动作学习),再切换 dream 条件;切换过早或全程 dream 都会退化(Table 8 显示时序敏感)。
代码来源:[代码未公开] — arxiv 2607.00678 无可访问官方推理/训练代码仓库
因参考代码不可得,无法从代码提取维度确认的 Mermaid 架构图。按 model-release 触发条件的 6 类图状态如下:
| 编号 | 名称 | 状态 |
|---|---|---|
| A1 | Top-Level | N/A — 代码未公开;概念级见 §3 Fig 2 + Mermaid |
| A2 | Block | N/A — 代码未公开(Wan2.2 5B DiT block,维度未确认) |
| A3 | 主 Attention 变体 | N/A — 代码未公开;论文未给 head 数/RoPE base/KV shape |
| A4 | 辅 Attention 变体 | N/A — 模型仅使用单一 joint self-attention(无第二 attention 变体) |
| A5 | 选择/索引机制 | N/A — 无 Indexer/Router(D-MoT 为静态 channel-to-subtower 分配,非动态路由) |
| A6 | 残差/连接机制 | N/A — 标准 DiT 残差;无 mHC/highway 等非标准连接 |
维度数字(backbone 5B、4 视频槽、move/manip 双子塔)仅从论文文本得到,未经代码/config.json 确认。若后续官方开源,须回填 A1-A3 的实测维度。