Target: WSA1, a 3D-centric World-Spatial-Action robot foundation model that couples a forward model (action→3D world) and an inverse model (3D world→action) through bidirectional attention inside a Mixture-of-Transformers shared latent space [2607.03941].
本篇被放进了一个 异构的 algorithm cluster——8 个 peer 覆盖 model-based RL、attention 量化、GPU 通信、
可解释性、长上下文评测、多模态生成、优化器。诚实地讲,只有一个 peer 与 WSA1 机制同源,其余按
"共享抽象主题"由近到远排列:
A 类 — 机制同源 (world model / 前向-逆向动力学):
状态转移,并在 world model 想象出的 潜在轨迹上训练 actor-critic
[2301.04104]。RSSM 的六组件里 dynamics 预测器 $p_\phi(\hat z_t\mid h_t)$ 正是 WSA1
$\mathcal{L}_{\text{3D}}$ 的 RL 版对应物 [2301.04104]。二者共享"forward internal
model"这条运动控制理论血脉 [2607.03941]。关键差异见 §2。
B 类 — 共享"latent-space 联合建模 / 多分支解耦"抽象:
Thinker 的 hidden state(而非 discrete token)作为 conditioning [2503.20215]。这与
WSA1 让三专家在 shared latent space 里通过注意力耦合、动作专家 attend 到 3D latent(而非重建像素)
是同一"用中间隐表示而非离散输出做跨模块桥接"的设计哲学 [2607.03941]。二者都用
flow-matching / DiT 生成连续信号(WSA1 生成动作,Omni 生成语音波形)。
C 类 — 共享"注意力作为语义/几何锚点"洞察(弱相关):
[2502.01563]。与 WSA1 的关联在于:两者都主张 attention 的特定结构/连线承载特定语义功能
——WSA1 的 $h_g\leftrightarrow h_{act}$ 双向边被声称是 world-action 互约束的唯一载体
[2607.03941] (可攻击面 §3 会挑战此声明的因果强度)。
[2502.05167]。与本篇仅在"注意力承载能力有上限"这一抽象层面相关,是 WSA1 长程 3D 因果链
能否 scale 的一个警示性参照(见 §5)。
D 类 — 主题极远(仅同属 algorithm 类,几乎无机制交集):
[2410.02367] [2505.11594]。仅作为"若 WSA1 要 real-time 部署,MoT 三专家的
注意力可用这类 kernel 加速"的工程参照。
仅系统层可能相关(大规模预训练的通信优化)。
唯一实质连接是 "数据合成/异构数据配方是能力来源" 这一方法论主张(见 §4)。
结论:真正可做 delta 分析的是 DreamerV3(§2 主线),其余作为方法论/工程侧参照。
| 维度 | DreamerV3 | WSA1 | delta 性质 |
|---|---|---|---|
| World model 方向性 | 单向前向:$p_\phi(\hat z_t\mid h_t)$ 只预测下一潜在态,动作由 imagination 里的 actor 产出 [2301.04104] | 双向:显式同时建模 action→world($\mathcal{L}_{\text{3D}}$)与 world→action($\mathcal{L}_{\text{ACT}}$),靠 $h_g\leftrightarrow h_{act}$ 注意力互约束 [2607.03941] | new — 把逆动力学显式拉进同一 latent space |
| 学习范式 | model-based RL(奖励驱动,想象空间 actor-critic) [2301.04104] | 模仿学习(标准 MLE + flow-matching,无奖励) [2607.03941] | contradictory/正交 — 完全不同的监督信号来源 |
| 表示空间 | 从零学的离散 RSSM latent($z_t$ softmax + 直通梯度) [2301.04104] | 借来的 latent:2D 用 COSMOS VAE、3D 用 Depth-Anything 编码做 MSE 目标 [2607.03941] | incremental — 用预训练几何/视觉 foundation model 供 latent target |
| 鲁棒性来源 | 一整套 量纲无关变换(symlog / twohot / free-bits / 百分位归一)驯服跨域尺度 [2301.04104] | 无任何 loss 加权:三损失等权直加 $\mathcal{L}_{\text{total}}=\mathcal{L}_{\text{2D}}+\mathcal{L}_{\text{3D}}+\mathcal{L}_{\text{ACT}}$ [2607.03941] | contradictory — DreamerV3 的核心教训(尺度必须驯服)WSA1 完全没继承(见可攻击面) |
| 泛化证据 | 8 大类 150+ 任务、固定超参跨域、首采 Minecraft 钻石 [2301.04104] | 真机 7 任务 +20%、RoboTwin2.0 hard 93% 开源第一 [2607.03941] | 各自领域内的 SOTA,不可直接比 |
核心 delta 一句话:DreamerV3 用单向 forward world model + 想象空间 RL 达到跨域鲁棒;WSA1 把
forward+inverse 双向耦合进一个模仿学习框架,并用外部 foundation model 提供 latent 目标——用注意力
掩码换取了 DreamerV3 用 RL 想象 rollout 才能得到的"闭环因果"。
两者都做"hidden-state bridging":Omni 让 Talker 消费 Thinker 的 3584-dim hidden 而非 token
[2503.20215];WSA1 让 3D-AE 消费 3D-SE 的场景 latent $h_g$ 而非重建的
深度像素 [2607.03941]。delta:Omni 的桥接是单向 gradient flow
(Thinker→Talker),WSA1 的 $h_g\leftrightarrow h_{act}$ 是双向——这是 WSA1 相对"标准解耦多专家"架构的
增量。二者都用 flow-matching/DiT 输出连续信号,收敛于同一"用 DiT 做连续控制/生成头"的趋势。
WSA1 主张"data diversity 是数据高效预训练的关键",用 6k 小时异构金字塔(sim/human/real)
[2607.03941];K2 用 rephrasing ablation 证明"10 种改写 × 1 epoch > 原始 × 10 epoch"
即 多样性 > 重复 [2507.20534]。两篇在不同模态上独立得出同一结论,互为佐证——
这是本 cluster 里最强的一条跨论文一致性证据。
攻击 1 — "双向注意力是 world-action 互约束的唯一/关键载体"这一因果声明过强。
本篇把 $h_g\leftrightarrow h_{act}$ 双向边称作"the key to modeling world-action interdependence"
[2607.03941],但消融只给了 baseline 60% → full 80% 的聚合数字
[2607.03941],从未做一个"单向 3D-WAM(砍掉反向边)"的对照。单加视觉想象=76%、
单加 3D 世界=75%,full=80% [2607.03941]——full 相对两条单支路只涨 4-5 个点,
完全可能来自多任务正则化而非"双向因果"。对照 Massive Values 的做法 [2502.01563]:
它用 prefilling-only disruption 精确隔离出"是这个通道而非别的"的因果性;WSA1 缺这种隔离实验,
因果声明因此是关联而非因果。
攻击 2 — 三损失等权直加缺乏合理性论证,且违背 cluster 内的已知教训。
$\mathcal{L}_{\text{total}}$ 把 latent-token MSE 与 flow-matching loss 无权重直加
[2607.03941],而 L2 自身的"最小检查 (2)"已标注这两者数值尺度可能差数量级 ⚠
[2607.03941]。DreamerV3 的整篇核心恰恰是:跨目标的尺度差异会让固定配置失效,
必须用 symlog/twohot/百分位归一化把每个目标做量纲无关变换 [2301.04104]。WSA1
把三个尺度迥异的目标直接相加却没做任何归一,也没给敏感性分析——按 DreamerV3 的经验这是一个明确的
未被验证的稳定性风险,尤其在从零/异构预训练阶段。
攻击 3 — "each task 最高 SR"的表述与自己的表格矛盾。
正文称 WSA1 "achieving the highest success rate on each task" [2607.03941],
但 L2 已抓到:Table 3 Object Organization 上 WSA1-L(77)≤ WSA1-B(80)且平手 $\pi_{0.5}$(77),
Table 5 多处输给基线(Move Stapler Pad、Hanging Mug、Open Microwave randomized)
[2607.03941]。这是过度绝对化的表述,不影响整体领先结论但削弱可信度。
攻击 4 — train/inference 分布错配未被处理。
Eq (5) 三式互相引用未来量($g_{t+1:t+K}$ 既被预测又被当条件),训练时用 GT latent 打断循环(teacher-forcing),
推理时是链式生成 [2607.03941]。NoLiMa 的教训 [2502.05167] 提醒:
当模型必须沿一条链传播信息(这里是 3D 世界预测链),链越长注意力越易稀释、误差越易累积。WSA1
没有报告推理时 3D 预测误差随 horizon $K$ 的衰减曲线,长程闭环的可靠性缺乏证据。
攻击 5 — 数据高效性主张的对照不公平。
"6k 小时即 SOTA"对比的是"数万小时"的 RFM [2607.03941],但 WSA1 的 latent 目标来自
已在海量数据上预训练的 COSMOS VAE、Depth-Anything、Qwen3-VL/Wan2.2 [2607.03941]。
真实的"数据摄入"包含这些 backbone 的预训练语料;把"数据高效"仅按机器人小时数计,隐藏了 foundation
model 的先验成本。
范式坐标:WSA1 处在 world-model 谱系从 RL(DreamerV3)→ 模仿学习(WSA1) 的迁移点上,并进一步从
"单向 forward model"推进到"forward+inverse 双向耦合"。它把 DreamerV3 的"想象空间训练"思想
[2301.04104] 用注意力掩码在一次前向传播内静态实现,免去了 RL 的想象 rollout——
代价是失去了 RL 的奖励驱动探索,换来了模仿学习的样本效率与稳定性。
在 cluster 中的独特性:它是唯一把"world model"作为行为生成器的内在约束而非仅仅"预测器/评测靶"
的论文。DreamerV3 的 world model 服务于 RL 想象;Massive Values / NoLiMa 是分析/评测注意力;
Sage 系列是加速注意力;Omni 是解耦生成。WSA1 独占"用双向注意力把感知世界模型与动作生成焊在一起"这个生态位。
采纳证据 — 弱且间接:
Sage 系列 pip install sageattention 已集成进 ComfyUI/diffusers [2410.02367];
Qwen2.5-Omni 权重 Apache 2.0 + transformers 原生 [2503.20215];
Massive Values 代码开源 [2502.01563]。
flow-matching 动作专家 + Motus 系 MoT co-learning)存在 [2607.03941],
但核心双向注意力掩码若被复现者误做成两个独立前向/逆向头就会退化为单向 WAM——采纳门槛集中在这一点。
方向 1 — 把 DreamerV3 的量纲无关变换移植到 WSA1 的三损失。
针对可攻击面 §3 攻击 2:用 symlog / 目标尺度归一 [2301.04104] 替换 WSA1 的裸等权
$\mathcal{L}_{\text{total}}$ [2607.03941],或至少做一次 loss 权重敏感性分析。这是一个
技术上立即可做的 hybrid:WSA1 的三个 latent-MSE/flow-matching 目标正好是 DreamerV3 尺度问题的典型场景。
方向 2 — RL 想象 rollout × 双向因果注意力。
DreamerV3 在想象轨迹上训 actor-critic [2301.04104];WSA1 是纯模仿。一个 hybrid 是
在 WSA1 的双向 latent world model 上再加一层想象空间 RL fine-tuning——用 WSA1 的 3D world model
做 DreamerV3 式的 rollout,用稀疏任务奖励纠正模仿学习的 compounding error。这直接结合两篇的互补优势
(WSA1 的双向因果 + DreamerV3 的奖励驱动闭环)。
方向 3 — 用 Massive Values 的 disruption 探针做 WSA1 注意力的因果审计。
把 [2502.01563] 的 selective-disruption 方法搬到 WSA1:选择性破坏 $h_g\leftrightarrow h_{act}$
的某个方向(只砍 world→action 或只砍 action→world),观察哪类任务崩溃。这能把 §3 攻击 1 里缺失的
因果隔离实验补上,验证"双向"是否真的双向必要。
方向 4 — 长程 3D 因果链的 NoLiMa 式压力测试。
借 NoLiMa 的思路 [2502.05167] 系统扫描 horizon $K$,测 WSA1 的 3D 预测误差与闭环 SR
随 $K$ 的衰减,定位其"effective planning horizon"——补上 §3 攻击 4 缺失的长程证据。
方向 5 — real-time 部署:三专家注意力 × FP4/INT8 量化。
WSA1 是 3B/6B MoT,闭环控制需低延迟。SageAttention3 的 microscaling FP4 attention
[2505.11594] 与 SageAttention 的 smooth-K INT8 [2410.02367] 是现成的
即插即用加速后端;把它们用于 WSA1 三专家的注意力(尤其 2D-SE 的 VLM backbone)是一个纯工程但技术可解的
方向,可让 6B 变体上机器人实时闭环。
knowledge/L1/paper/2607.03941.md, L2: knowledge/L2/paper/2607.03941.md