LingBot-VA 把机器人操控重构成"先预测未来视频、再逆动力学解码动作"的自回归扩散世界模型:视频/动作 token 交织成单一因果序列,用双流 MoT(视频流从 Wan2.2-5B 初始化, 动作流窄 4×)联合训练,靠 KV-cache 维持长程记忆、部分去噪+异步执行做实时闭环。RoboTwin 2.0 92.9%/91.6%,LIBERO 98.5%,50 演示即可适配。
主流 VLA 采用前馈反应式映射 $a_t \sim \pi_\theta(\cdot \mid o_t)$,要用一张网络、一份"观测-动作"监督信号,同时学会视觉理解、物理动力学和电机控制。作者称之为表征纠缠 (representation entanglement):把从高维视觉语义到低维电机指令的异构知识压进同一表征空间,导致样本效率低、泛化差。已有把世界模型引入策略的尝试有三类通病:(1) 反应性缺口——chunk / 开环生成一次滚出长片段而不吸收实时反馈;(2) 长程记忆有限——分块生成不持久缓存历史时会跨段不一致;(3) 因果性破坏——段内双向注意力让未来 token 影响过去预测,违背"现在只依赖过去"的物理因果。
不学 $\pi(a_t \mid o_t)$,而是走世界建模视角:先预测视觉世界如何演化,再据此推断动作。核心是把视频与动作 token 交织进一条自回归序列 $[z_t, a_{t,1}, \dots, a_{t,\tau}, z_{t+1}, \dots]$,用带共享注意力的 Mixture-of-Transformers联合处理,在连续潜空间上通过 flow matching 逐块去噪生成。由此获得三点:反应式 AR 环(每步据最新真实观测重校准)、KV-cache 持久上下文(缓存交织的视频-动作轨迹抑制漂移)、因果一致性(因果掩码保证视觉与动作都只由前序状态决定)。
核心技术壁垒:并非"用世界模型 + IDM"这一范式(多篇先行工作已有),而是让一个从视频扩散骨干继承的自回归模型在部分去噪(只积分到 $s\!\approx\!0.5$)的含噪视觉潜表征上,仍能通过异步 + FDM-grounded 缓存维持闭环稳定。视频生成模型天然偏好时间平滑,在异步流水线里会"续写"自己幻觉的 $\hat z_t$ 而忽略真实反馈 $z_{t-1}$,导致开环退化——作者用前向动力学(FDM)接地步强制模型在预测 $z_{t+1}$ 前用真实反馈重新"想象" $z_t$,这才是最难复现的一环(详见 §7)。
RoboTwin 2.0(50 任务)平均成功率 92.9%(Easy)/91.6%(Hard),在 Horizon=3 长程任务上比次优分别 +8.2%/+9.1%;LIBERO 平均 98.5%(LIBERO-Long 98.5%、Object 99.6%);真实机器人 6 任务全面 SOTA,仅用 50 演示 + 500 步微调;异步比同步快 2×且成功率相当;10 演示低数据下比 π0.5 高 +15.6%(Make Breakfast)/+10.3%(RoboTwin)。

Paper's Figure 2, framework overview(caption: "LingBot-VA is conditioned by autoregressive diffusion for unified video-action world modeling... dual-stream Mixture-of-Transformers (MoT) architecture that interleaves video and action tokens within a single sequence. At each autoregressive step, the video stream (initialized from Wan2.2-5B) first predicts future latent visual states via flow matching. Then the action stream decodes corresponding actions through inverse dynamics conditioning on the predicted visual transitions.").
该图是全篇载重架构图:视频流(宽 $d_v=3072$)先做 flow-matching 预测未来潜视觉状态,动作流(窄 $d_a=768$,同深度)随后以逆动力学在预测的视觉过渡上解码动作,二者在每层通过跨模态注意力融合。读者应注意"视频先行、动作跟随"的两阶段依赖——这正是把视觉动力学与动作控制解耦以缓解 Q1 纠缠问题的结构体现。

Paper's Figure 3(caption: "Teacher Forcing Attention Mask: Causal attention mask for unified video-action pretraining. Each token can only attend to preceding tokens in the temporal sequence.").
此图展示交织序列 $z_0, a_{0,1}, a_{0,2}, z_1, \dots$ 上的因果三角掩码,及其含噪变体 $z^{(s)}, a^{(s)}$。它把 §2 的"因果一致性"落到实处:训练时用 teacher forcing 以真值 token 为上下文,推理时机器人天然取回真实观测,训练/部署分布一致——这是作者论证 AR 优于 chunk 双向注意力的关键机制图。
以下 Mermaid 概括单个自回归步的数据流(原文无对应流程图,补充结构清晰度):
本文无形式化收敛/复杂度定理 — 仅实证。其"证明"是把生成式 flow matching 机制严格重述为视频/动作两个 flow-matching 损失,并给出物理解释。下表列关键记号:
| 记号 | 含义 | 出处 |
|---|---|---|
| $v_s, v_\theta, v_\psi$ | 速度场;视频流/动作流参数化速度网络 | Eq.1–2, 11–12 |
| $x^{(s)}, z^{(s)}, a^{(s)}$ | flow 时间 $s\in[0,1]$ 下的粒子/视频潜/动作状态 | Eq.1,4 |
| $\epsilon$ | 高斯噪声源 $\mathcal{N}(0,I)$ | Eq.1 |
$z_t = E(o_t\mid o_{| 因果视频 VAE 编码;$N=192$ 空间 token | §3.2/§4 | |
| $K$ | chunk 大小(每步帧数),部署 $K=4$ | Eq.7 |
| $\tau=4$ | 时间下采样倍率;每帧配 $\tau$ 个动作 | §3.3 |
| $\tilde z_{\le t}$ | 含噪历史增强 | Eq.10 |
| $\alpha=d_v/d_a$ | 动作网络初始化缩放因子(保方差) | §3.3 |
| $\lambda$ | 逆动力学损失权重(=1) | §3.3 |
方程物理意义(核心几条):
6 项最小检查:
| Stage | Purpose | Data | Steps/Tokens | LR | Batch/Seq | Special technique |
|---|---|---|---|---|---|---|
| Pretrain | 学物理先验+动作接地 | ~16K h 聚合公开数据(Agibot/RoboMind/InternData-A1/OXE/UMI/RoboCOIN) | 1.4T tokens | 1e-4 cosine+warmup | pack≤10K tok | bf16, gradclip 2.0, CFG dropout 0.1, uniform SNR, $K\in[1,4]$ |
| Post-train (通用) | 适配新平台 | 50 demos | 3K steps | 1e-5 | — | 或 1e-4/1K(略逊) |
| Real-world 微调 | 6 真实任务 | 50 demos | 500 steps | 1e-4 | seq 150,000 | — |
| RoboTwin | 多任务 | 2.5K(clean)+25K(randomized) | 50K steps | 1e-5 | — | 50→12.5Hz 视频, 动作 50Hz |
| LIBERO | 4 suite×10 task×50 demo | 500/suite | 4K steps | 1e-5 | seq 1e5 | 过滤失败演示 |
关键超参:$\lambda=1$、$p=0.5$、$s_{aug}\sim U[0.5,1]$、视频 CFG 5.0 / 动作 CFG 1.0、视频 3 步 Euler(到 $s{=}0.6$) / 动作 10 步(到 $s{=}1$)。模型 5.3B(动作流仅 ~350M,$d_v{=}3072$/30 层,$d_a{=}768$)。GPU 小时/MFU [论文未披露]。

Paper's Table 1(RoboTwin 2.0, Easy vs Hard, 50 tasks; 括号内为对次优的增益).
这是最载重的结果表:Ours 平均 92.93/91.55 显著超过 π0(65.92/58.40)、π0.5(82.74/76.76)、X-VLA(72.80/72.84)、Motus(88.66/87.02)。读者应注意 Horizon 越长优势越大(Blocks Ranking Size Easy 94 vs π0 的 14),印证 AR 长程记忆;也应注意 Ours 的败点 Hanging Mug(40/28)、Turn Switch(44/45,明显输给 Motus 84/78)。

Paper's Table 2(LIBERO: Spatial/Object/Goal/Long/Avg, baselines adopted from X-VLA[92]).
LIBERO 上 Ours 平均 98.5%(Spatial 98.5、Object 99.6、Long 98.5),略超此前最强 X-VLA(98.1);尤其 LIBERO-Long 从多数基线的 85–94% 拉到 98.5,再次支撑长程记忆论点。(注:L1 标注 LIBERO-Goal 的 Ours 值在抓取表体中未显式打印。)

Paper's Table 3(RoboTwin 2.0 Easy 消融).
消融表揭示壁垒所在:FDM-grounded Async(90.4) vs Naive Async(74.3),且在 Horizon=3 上 Naive 崩到 32.9(FDM 85.6)——单一缓存设计带来 >50 点差;WAN 直接微调仅 80.6,证明 LingBot-VA 预训练的价值。

Paper's Figure 7(Copy Init / Random Init / Share Weights 三曲线, Training Loss / Grad Norm / Validation Loss).
Copy Init($\alpha$ 缩放插值视频权重)收敛最平滑、loss 最低;Random Init 梯度范数高、震荡;Share Weights 稳定但次优。这直接支撑 §3.3 的初始化设计与 §4 检查 4。

Paper's Figure 8(Make Breakfast 各数据量下 LingBot-VA vs π0.5).
低数据(10 demos)下 progress score 比 π0.5 高 15.6%;作者归因于视频生成骨干提供的物理动力学先验作为隐式正则,π0.5 缺此结构化先验故需更多演示。
| 步骤 | 论点 | 论文内依据 |
|---|---|---|
| 1 | 反应式 VLA 因表征纠缠而样本效率低、泛化差;chunk 世界模型有反应性缺口/记忆有限/破坏因果(Q1) | §1、§3.2 对 UniSim/UVA/UWM 的定性分析 |
| 2 | 故改用两阶段世界建模:先 $p_\theta$ 预测视觉,再 $g_\psi$ 逆动力学解码(Eq.6→Eq.7–9) | §3.2 公式推演 |
| 3 | 用交织视频-动作序列 + 因果 MoT + KV-cache 落地,得持久记忆/因果一致/效率三优势 | §3.3 架构、Fig.2–3 |
| 4 | teacher forcing + 含噪历史增强(Eq.10)使动作可从半去噪潜表征解码,推理去噪步减半 | §3.3、Algorithm 1 视频积到 $s{=}0.5$ |
| 5 | 异步流水线重叠计算与执行;naive 异步开环退化,需 FDM 接地(Eq.13)重锚真实反馈 | §3.4、Fig.4、Tab.3 |
| 6 | 实验证成:RoboTwin/LIBERO SOTA、长程增益、2× 加速、50 演示适配、样本效率与泛化更强 | Tab.1–3、Fig.5–10 |
代码与模型作者声明公开(Abstract: "The code and model are made publicly available"),但 L1 抓取文本未给出具体仓库/文件路径,故本节实现锚点为 [实现未公开具体路径](论文承诺开源,链接未在抓取正文出现)。
核心技术壁垒(§2 Q2 展开)——FDM-grounded 异步闭环:难点不在异步本身,而在识别出"视频生成器时间平滑偏好会让它续写幻觉 $\hat z_t$、忽略真实反馈 $z_{t-1}$,从而在 Horizon 增大时开环崩溃"(Tab.3 Naive Async H=3 仅 32.9%)。解法是在预测 $z_{t+1}$ 前插入一个 FDM 前向传递:用最近真实反馈 $z_{t-1}$ 与动作 $a_t$ 重新"想象" $z_t$ 并缓存该"反馈接地"预测而非陈旧 forecast(Eq.13 后训练)。复现者若照搬 KV-cache 天真异步会得到看似能跑、长程即溃的系统——这一步是把 AR 世界模型从 demo 变成鲁棒闭环控制的隐性关键。
关键实现细节(易漏):