PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

algorithm 2606.18375
world-modelmulti-view-consistencyflow-matchingrepresentation-alignmentrobotic-manipulation

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation — L2 #

1. TL;DR #

多视角机器人操作世界模型缺乏跨视角 3D 一致性。作者诊断出两个缺陷:无显式跨视角通信路径、无 3D 几何先验,并主张二者必须共存。方案 = 通信路径(Geo-RoPE + 跨视角注意力)+ 几何目标(Latent 3D-REPA)。WorldArena 第 1、AgiBot-Challenge2026 第 2;消融显示超可加耦合。


2. Q1 / Q2 / Q3 #

Q1 — 痛点 #

世界基础模型(WFM)已成为物理环境的强模拟器,但绝大多数在单视角设定下工作,缺乏机器人操作所需的多视角 3D 一致性。机器人操作本质是多视角的(egocentric、eye-to-hand、wrist),模拟器必须在每个时间步维持严格的跨视角几何一致。现有多视角世界模型只是把各视角 token 拼接(concatenate),逼迫模型隐式发现对应关系,产生三类失效:跨视角物体漂移、深度不一致、纹理错位。作者把这些失效根因追溯到两个基础性缺陷:(1) 没有专门的视角间通信机制;(2) 没有 3D 几何先验

Q2 — 方法 #

在 DiT + flow matching 骨干上叠加两根技术支柱、三个组件:

  1. Geometry-Aware Cross-View Attention(CVA) — 一个专门的、在每个时间步跨所有视角做注意力的块,提供显式通信路径(Eq. 7)。
  2. Geometric RoPE(Geo-RoPE) — 把射线方向(逐像素变化)和相机位姿(视角内共享)分别注入注意力的位置编码,将几何偏置写入通信路径(Eq. 4–6)。
  3. Latent 3D-REPA — 用冻结的 Depth Anything 3 抽取几何特征,通过关系(token 相似度)蒸馏而非绝对向量对齐,为生成过程提供几何监督目标(Eq. 8–11)。
  4. 必要且充分性论证:通信但无几何 → 塌缩为纹理捷径;几何但无通路 → 约束无法传播。因此两者互补且缺一不可。

    核心技术壁垒:不是任何单个模块,而是 CVA 通信路径与 Latent 3D-REPA 几何目标之间的耦合——把 relational(相似度矩阵)而非绝对特征的几何监督,专门施加在一个具备几何位置编码的跨视角注意力通道上,使得几何约束能够沿显式通路传播。消融中 2.64 的联合增益超过 0.93+0.72=1.65 的可加期望,正是这一耦合的实证印记(见 §7)。

    Q3 — 结果 #

    • WorldArena(动作条件):EWMScore 70.67,排名第 1,领先第二名 +2.41;Motion Quality 79.66 为全场最高。
    • AgiBot-Challenge2026:总排名第 2,Scene Consistency 0.9041 为最佳。
    • 文本条件多视角生成(AgiBot-World):7 项指标中 6 项最优;MEt3R 14.20(最低,几何一致性最佳)。
    • 消融:CVA 与 REPA 联合使用增益超可加,支撑"两支柱耦合"论点。

    3. 架构 / 方法图 #

    Figure 2: PAIWorld 方法总览——DiT flow matching 骨干 + 两支柱三组件

    Paper's Figure 2, verbatim (caption: "Overview of the PAIWorld framework..."). 该图展示核心架构:在 DiT flow matching 骨干上,CVA 与 Geo-RoPE 构成"通信路径"支柱,Latent 3D-REPA(以冻结 DA3 为几何教师)构成"几何目标"支柱。读者应注意三个组件如何插入既有 DiT 块,以及 REPA 分支只在训练期激活。

    Figure 1: PAIWorld 作为多视角 3D 一致的世界模型骨干

    Paper's Figure 1, verbatim (caption: "PAIWorld is a 3D-consistent multi-view world foundation model for robotic manipulation..."). 概念总览图说明模型如何在生成/动作/规划/后训练下游任务中维持跨视角一致,使想象出的 rollout 物理合理。

    通信路径的机制视图(原文未提供独立流程图,此处补一张序列图以厘清一次前向中几何信息的注入顺序):

    sequenceDiagram participant Z as 各视角 latent Z_t^v participant G as Geo-RoPE (ray+pose) participant C as Cross-View Attention participant D as DA3 (frozen) Z->>G: W_Q/W_K 投影后加几何位置编码 G->>C: 带几何偏置的 Q̃/K̃ C->>C: 跨所有视角 softmax + gate 残差 C->>Z: 更新后 Ẑ_t^v Z-->>D: 训练期抽取几何特征做关系蒸馏

    4. 作者证明 #

    本文 无形式化作者证明 — 仅实证。没有收敛定理、方差界或样本复杂度界;"必要且充分"是概念论证(通信无几何塌缩为捷径、几何无通路无法传播)加消融实证,而非形式化命题。以下对载重方程做物理意义梳理与最小检查。

    Notation 表 #

    符号含义
    $I_t^v$视角 $v$ 在时刻 $t$ 的图像
    $\mathbf{K}^v,\mathbf{R}^v,\mathbf{t}^v$视角 $v$ 的内参 / 旋转 / 平移
    $\mathbf{z}_0,\mathbf{z}_s$数据 latent / flow 时刻 $s$ 的插值 latent
    $u_\theta$速度场预测器
    $\mathbf{d}^v(h,w)$像素 $(h,w)$ 的世界系射线方向
    $\mathbf{e}^v$12 维位姿描述子
    $\mathbf{Z}_t^v$视角 $v$ 时刻 $t$ 的 token 特征
    $\mathbf{S}(\mathbf{F})_{i,a}$token $i$ 对锚点 $a$ 的余弦相似度
    $\lambda$REPA 权重(=0.5)

    载重方程与物理意义 #

    • 条件生成目标:$p_\theta(\{I_{t_0+1:T}^v\} \mid \{I_{1:t_0}^v\}, \{\mathbf{K}^v,\mathbf{R}^v,\mathbf{t}^v\}, c)$ —— 学习在历史、相机几何与条件下的多视角未来生成。
    • Flow 插值路径:$\mathbf{z}_s = (1-s)\mathbf{z}_0 + s\boldsymbol{\epsilon},\ \boldsymbol{\epsilon}\sim\mathcal{N}(\mathbf{0},\mathbf{I})$ —— 从数据 latent 到高斯噪声的线性传输。
    • Flow matching 损失:$\mathcal{L}_{\text{diff}} = \mathbb{E}_{s,\boldsymbol{\epsilon}}[\|u_\theta(\mathbf{z}_s,s) - (\boldsymbol{\epsilon} - \mathbf{z}_0)\|_2^2]$ —— 训练向量场沿 flow 轨迹指向数据分布。
    • 世界系射线:$\mathbf{d}^v(h,w) = \text{normalize}((\mathbf{R}^v)^\top (\mathbf{K}^v)^{-1}(h+0.5, w+0.5, 1)^\top)$ —— 反投影像素并旋转到世界系。
    • 12 维位姿:$\mathbf{e}^v = [\text{yaw},\text{pitch},\text{roll},\ \mathbf{t}^v,\ -(\mathbf{R}^v)^\top\mathbf{t}^v,\ (\mathbf{R}^v)^\top\mathbf{e}_z]$ —— 欧拉角+平移+相机位置+光轴,编码视角身份与朝向。
    • 关系相似度算子:$\mathbf{S}(\mathbf{F})_{i,a} = \frac{\mathbf{f}_i^\top \mathbf{f}_a}{\|\mathbf{f}_i\|\,\|\mathbf{f}_a\|},\ a\in\mathcal{A}$ —— 用采样锚点近似 token 关系图,成本降至 $O(MK)$。

    Loss 分解 #

    总目标 $\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{diff}} + \lambda\cdot\mathcal{L}_{\text{REPA}}$,其中 $\mathcal{L}_{\text{REPA}} = \mathcal{L}_{\text{spatial}} + \mathcal{L}_{\text{temporal}}$:

    • $\mathcal{L}_{\text{diff}}$ 强制生成保真(flow matching 回归)。
    • $\mathcal{L}_{\text{spatial}} = \text{SmoothL1}(\mathbf{S}_{\text{intra}}^{\text{DiT}}, \mathbf{S}_{\text{intra}}^{\text{DA3}})$ 对齐视角内帧的 token 关系结构。
    • $\mathcal{L}_{\text{temporal}} = \text{SmoothL1}(\mathbf{S}_{\text{inter}}^{\text{DiT}}, \mathbf{S}_{\text{inter}}^{\text{DA3}})$ 对齐跨帧/跨视角的关系结构。
    • 蒸馏对象是相似度矩阵(相对结构)而非绝对特征向量,避免强行匹配 DA3 的特征坐标系。

    6 项最小检查 #

    1. 量纲一致性:$\mathcal{L}_{\text{diff}}$ 为 L2 平方(latent 单位²),REPA 为无量纲相似度上的 SmoothL1;$\lambda=0.5$ 起量级平衡作用 —— 合理。
    2. 退化情形:$\lambda\to0$ 时退回纯 flow matching WFM(即消融表 CVA-only / 全无 行),符合消融基线。
    3. 对称性:Geo-RoPE 把 ray(逐像素)与 pose(视角内共享)解耦到两个子空间 $d_r=d_p=d/2$,位姿变换对同视角所有 token 一致 —— 与"视角内共享"直觉相符。
    4. 初始化一致:CVA 用 AdaLN-Zero 使 gate=0,前向初始等价于无 CVA 的骨干 → 训练起点不破坏预训练权重。
    5. 成本可控:锚点采样把关系监督从全对全 $O(M^2)$ 降到 $O(MK)$,$K=|\mathcal{A}|\ll M$ —— 可扩展。
    6. 边界情形:单视角 $V=1$ 时跨视角注意力退化为自注意力,Geo-RoPE 仍提供射线编码 —— 框架不崩溃但收益消失,与"多视角才需要"的动机自洽。
    7. 期望但缺失的保证:若能给出"关系蒸馏收敛到与 DA3 几何一致的表征"或跨视角一致性的可证明上界,会大幅增强"充分性"主张;本文仅以消融的超可加间隙作为经验替代。


      5. 实验与数据 #

      WorldArena 动作条件基准(Table 1) #

      Table 1: WorldArena 动作条件基准

      Paper's Table 1, verbatim. PAIWorld EWMScore 70.67 居首,领先第二名 GenieEnvisioner-Sim2.0-2B(68.26)达 +2.41;Motion Quality 79.66 为全场最高。值得注意的是它在 3D Accuracy(91.58)等单项并非最高,说明综合 EWMScore 的领先来自运动与可控性的均衡,而非单点碾压。

      Figure 3: WorldArena 定性 rollout

      Paper's Figure 3, verbatim (caption: "Qualitative results on the WorldArena benchmark..."). 展示物理合理的动力学 rollout,用于佐证 Motion Quality 的定量领先。

      AgiBot-Challenge2026(Table 2) #

      Table 2: AgiBot-Challenge2026 基准

      Paper's Table 2, verbatim. 总排名第 2(EWMScore 0.8245),但 Scene Consistency 0.9041 为所有队伍最佳,直接支撑"跨视角一致性"的核心卖点;PSNR/nDTW 与冠军队伍差距很小。

      文本条件多视角生成(Table 3) #

      Table 3: AgiBot-World 文本条件基准

      Paper's Table 3, verbatim. 7 项中 6 项最优:MEt3R 14.20(最低,几何一致最佳)、SSIM 0.7683、LPIPS 0.1844、FID 45.04、FVD 175.78 均领先基线(Genie-Envisioner / Cosmos-Predict2 / Wan2.1)。读者应注意在追求几何一致的同时,感知质量指标也同步领先,说明在此设定下几何约束未牺牲画质。

      消融(Table 4)—— 核心证据 #

      Table 4: CVA / REPA 消融

      Paper's Table 4, verbatim. 这是全文最载重的一张表。单独 CVA 给出 $\Delta=0.93$,单独 REPA 给出 $\Delta=0.72$,二者可加期望为 1.65;但联合达到 $\Delta=2.64$,超可加。这一间隙(2.64 > 1.65)是"通信路径与几何目标必须耦合"论点的直接实证,也是本文最关键的实验读数。

      学习/敏感性观察:论文以固定 $\lambda=0.5$ 报告,未披露对 $\lambda$、锚点数 $K$ 的敏感性扫描,也未报告学习曲线形态或过优化信号(如纹理捷径塌缩的定量诊断),此为可复现性上的空白。


      6. 论证链 #

      论断段内依据
      1多视角机器人操作要求每个时间步的严格跨视角 3D 一致(§1 Para 2)。三类相机(ego/eye-to-hand/wrist)本质多视角。
      2现有方法只做 token 拼接,逼迫隐式对应,导致漂移/深度/纹理失效(§1 Para 3、Abstract Para 2)。失效模式枚举。
      3根因是两个缺陷:无通信路径 + 无几何先验,且二者作用在不同层级须共存(§1 Para 4–5)。概念论证:通信无几何塌缩为捷径;几何无通路无法传播。
      4据此设计三组件:CVA + Geo-RoPE 建路径,Latent 3D-REPA 供几何目标(§3.3–3.5, Eq. 4–11)。载重方程实例化两支柱。
      5联合训练目标 $\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{diff}} + 0.5\,\mathcal{L}_{\text{REPA}}$(§3.7, Eq. 12)。生成与几何对齐同时优化。
      6消融显示 CVA+REPA 联合增益 2.64 超过可加期望 1.65(§4.4, Table 4)。支撑步 3 的"必须共存"主张。
      7端到端在 WorldArena 第 1、AgiBot-Challenge2026 第 2、文本条件 6/7 最优(§4.2–4.3)。Table 1/2/3。

      7. 实现 cross-reference #

      [实现未公开] —— L1 未记录开源代码库或 file:line;论文报告在 Cosmos-Predict2.5 DiT 骨干(~14B)上实现,但未给出仓库链接。最接近的开放参考为 Cosmos-Predict2(骨干)、Depth Anything 3(几何教师)、以及 REPA 表征对齐的开源实现。

      核心技术壁垒(§2 Q2 呼应):最难复制的不是任一模块,而是把 relational(相似度矩阵)几何监督专门施加在具备几何位置编码(Geo-RoPE)的跨视角注意力通道上,使几何约束沿显式通路传播。复制单个 CVA 或单个 REPA 都只能拿到 ~0.7–0.9 的 $\Delta$(消融行),真正的 2.64 增益依赖二者的精确耦合与训练期同步激活——这在 L1 中无代码级细节可对照,是重实现的最大风险点。

      关键实现细节(易漏)

      1. AdaLN-Zero gate=0 初始化(§3.7 Para 2):CVA 块以 gate=0 起步,前向初始等价于冻结骨干,避免破坏 14B 预训练权重——若初始化非零,训练早期极易发散。这是插件式接入大 WFM 的关键稳定技巧。
      2. 锚点采样降成本(§3.5, Eq. 8):关系监督用采样锚点集 $\mathcal{A}$ 把 $O(M^2)$ 降到 $O(MK)$;锚点数 $K$ 的选择直接影响几何监督的方差与训练成本,论文未披露具体 $K$,实现时需自行调参。
      3. 训练配方与规模(§4.1):

        StagePurposeDataStepsLRBatchSpecial
        Pretrain/融合多视角一致世界模型2.5M clips(AgiBot 35% / RoboMIND 20% / Galaxea 15% / RoboTwin 15% / RoboCOIN 15%)30kwarmup 3k → $3\times10^{-5}$,cosine 衰减[论文未披露]200×H200,~7 天,$\lambda=0.5$,DA3 冻结,CVA gate=0

        GPU 时约 200 GPU × 7 天 ≈ 33.6k H200·天(MFU [论文未披露]);关键超参 $\lambda=0.5$ 已披露,锚点数 $K$、batch、梯度裁剪 / ZeRO 阶段 [论文未披露]。