world-model

Cross-category topic | 12 sources

1. 主题缘起 #

该主题的历史起点是 DreamerV3:它用 RSSM 潜在世界模型在“想象轨迹”里训练 actor-critic,并以一组量纲无关变换(symlog、symexp twohot、KL free bits、百分位回报归一化)让一套固定超参跨 150+ 任务成立,首次确立了“世界模型是控制的操作性基础设施”这一范式。 [2301.04104] [2301.04104]

进入 2026 年,这条路线从“抽象潜在空间的想象”整体迁移到“像素级视频预测即世界模型”,并把动作生成直接架在预训练视频扩散骨干之上。触发原因有二:视频扩散模型已内含大规模时空/物理先验,可被复用为机器人策略的先验;反应式 VLA 因“表征纠缠”在长时程与样本效率上受限,促使研究者改走“先建模世界如何演化、再推断动作”的世界建模视角。 [2601.21998] [2602.15922] [2601.16163]

由此涌现出一个共享的世界-动作因子化模板:把联合分布拆成“未来预测项 × 逆动力学项” $p(a,o_T\mid o)=p(o_T\mid o)\,p(a\mid o,o_T)$,动作从想象出的未来里读出。DreamZero、LaWAM、τ₀-WM、Fast-WAM 都建立在这一模板的不同实例上,区别只在“未来在什么空间表示、以及是否在推理时真的生成它”。 [2602.15922] [2606.15768] [2606.01027] [2603.16666]

主题横跨三个层次:模型方法本体(几何一致、长程记忆、动作接口),把世界模型折叠进单一生成骨干的具身智能体设计,以及一篇把整个交互式视频世界模型领域拆成三大瓶颈的综述作为地图。 [2606.18375] [2601.16163] [2606.01164]

2. 覆盖的 category 分布 #

categorypaper countrepresentative
algorithm10[2301.04104], [2606.16533], [2606.18375], [2602.15922]
model1[2607.00678]
agent1[2601.16163]

该分布说明主题已经越过“单一模型方法”,向“可部署系统”与“具身智能体内核”外溢:绝大多数工作是算法/方法本体,但 ABot-M0.5 作为一个移动操作 model release 强调架构与训练配方,Cosmos Policy 则把 policy/world model/value 折叠进同一生成模型、并加入 best-of-N 规划闭环,属于智能体内核层。 [2607.00678] [2601.16163]

3. 时间线 #

4. Evolution timeline (技术谱系) #

flowchart TB A[DreamerV3
latent RSSM + 想象训练
量纲无关稳健性] --> B{世界模型表示空间之争} B -->|抽象潜在空间| L[Kairos 混合线性注意力
收缩 gated-delta 记忆] B -->|冻结特征潜空间| LW[LaWAM
复用 LAM 解码器为世界模型] B -->|像素级视频扩散| V[video-diffusion WAM 主干] V --> WAMfac["世界-动作因子化
p(o_T|o)·p(a|o,o_T)"] WAMfac --> DZ[DreamZero
联合去噪 video+action
GT-KV 注入] WAMfac --> LB[LingBot-VA
交织自回归 + 双流 MoT
FDM 接地异步] WAMfac --> TAU[τ0-WM
VAM 生成 + ACVS 评估
test-time rectify] WAMfac --> FW[Fast-WAM
删除测试时想象分支] V --> GEO[PAIWorld
多视角几何闭合分支
CVA/Geo-RoPE/REPA] V --> CM[Interactive Sim
一致性模型潜动力学
生成式模拟器/评估器] A --> CP[Cosmos Policy
latent frame injection
policy+WM+value 折叠] DZ --> ABOT[ABot-M0.5
z->m->a 级联
Dream Forcing] LB --> ABOT DZ --> TTA[训练-推理对齐分支] LB --> TTA ABOT --> TTA SURV[交互式视频世界模型综述
动作可控/长程一致/实时性] -.地图.-> V SURV -.地图.-> GEO

上述谱系显示:DreamerV3 的“潜在世界模型 + 想象训练”是共同祖先,此后分岔出抽象潜空间(Kairos 收缩记忆、LaWAM 复用 LAM 解码器)与像素级视频扩散两大主干;后者又以世界-动作因子化为汇流点,进一步长出几何闭合(PAIWorld)、生成式模拟器(Interactive Sim)与训练-推理对齐(DreamZero/LingBot-VA/ABot-M0.5)三支。 [2301.04104] [2606.16533] [2606.15768] [2606.18375]

一个关键分叉点在“测试时是否真的生成未来”:DreamZero 生成但用真实观测回填,LingBot-VA 部分去噪 + FDM 接地,τ₀-WM 显式想象并评估-修正,而 Fast-WAM 直接删掉推理时的未来生成分支。 [2602.15922] [2601.21998] [2606.01027] [2603.16666]

另一个汇流点是训练目标:几乎所有 2026 年的分支都用 flow matching 作为统一的视频/动作生成目标,从 DreamerV3 的 RL 目标切换为生成式回归目标。 [2602.15922] [2606.16533] [2607.00678] [2606.18375]

5. 技术线交错 #

算法选择约束系统与部署:像素级视频想象是主要延迟来源,因此每个像素级 WAM 都被迫配一套推理压缩手段——DreamZero 用 DiT caching + NVFP4 + Flash 解耦噪声调度堆到 38×,LingBot-VA 用部分去噪(只积到 $s\!\approx\!0.5$)+ 异步流水线,τ₀-WM 用 KV-cache/fused-QKV 在单张 RTX 5090 上 140–220ms。 [2602.15922] [2601.21998] [2606.01027]

表示空间反过来决定长程能力的实现层级:Kairos 把全局位置从 RoPE 剥离交给线性注意力路径、用固定大小收缩记忆做常数内存 rollout,是架构层面的长程解法;LingBot-VA 则把长程押在 KV-cache + teacher forcing 上,是序列条件层面的解法。 [2606.16533] [2601.21998]

训练目标与推理结构的错配是反复出现的失效源:ABot-M0.5 明确把移动操作失败归为时间粒度、动作结构、rollout 条件三处结构错位,用 Dream Forcing 让逆动力学在自梦(而非 GT)未来上训练;LingBot-VA 发现天真异步会让视频生成器“续写幻觉”忽略真实反馈,需 FDM 接地重锚。二者是同一“训练用 GT、推理用自预测”的暴露偏差在不同机制上的显现。 [2607.00678] [2601.21998]

模型方法与几何/多视角需求的耦合:机器人本质是多视角的,PAIWorld 论证只做 token 拼接会逼迫隐式对应、产生跨视角漂移,必须同时提供显式通信路径与几何先验,使几何约束沿具备几何位置编码的注意力通道传播。 [2606.18375] [2606.18375]

智能体内核层把世界模型变成测试时算力分配问题:Cosmos Policy 在动作提案空间做一步 lookahead 的 best-of-N 搜索,τ₀-WM 用便宜的 RCS 筛 + 昂贵的 ACVS rollout 修正做 coarse-to-fine,两者都把“想象力”当成一个可调度的推理接口而非固定前向。 [2601.16163] [2606.01027]

6. 共识与分歧 #

共识 1:世界建模/视频预测目标本身承载了大部分对下游控制有用的信号,优于纯反应式映射。DreamerV3 的消融显示性能主要来自世界模型的无监督重构信号;Kairos 加入视频生成目标使动作预测涨 +23.2;Fast-WAM 删除视频协同训练在真机叠毛巾上崩到 10%;Cosmos Policy 去掉未来状态监督断崖式下跌。 [2301.04104] [2606.16533] [2603.16666] [2601.16163]

共识 2:flow matching 已成为像素级 WAM 事实上的统一生成目标,DreamZero、Kairos、ABot-M0.5、PAIWorld、τ₀-WM 均以其组织视频与动作损失。 [2602.15922] [2606.16533] [2607.00678] [2606.18375] [2606.01027]

共识 3:训练与部署不可分离,推理侧的延迟/记忆/一致性会反向决定模型的实际效果上限,因此每篇像素级 WAM 都把可部署性当作一等约束。 [2601.21998] [2606.15768] [2606.01164]

分歧 1(最核心):测试时的未来想象是否必要。Fast-WAM 通过受控变体证明“价值在训练目标而非测试时想象”,推理时删除未来分支只掉 ≤1–2 点;而 τ₀-WM 与 Cosmos Policy 恰恰把部署期的想象-评估当作核心收益来源(RCS+LAR、best-of-N);LaWAM 走中间态,用单次潜解码替代迭代像素想象;DreamZero 则保留想象但靠 GT-KV 注入止住其误差。 [2603.16666] [2606.01027] [2601.16163] [2606.15768] [2602.15922]

分歧 2:世界应在什么空间被建模。DreamerV3/Kairos/LaWAM 押注紧凑潜空间(省算力、易长程),DreamZero/LingBot-VA/PAIWorld/Interactive Sim/τ₀-WM 押注像素级视频(继承 web 视频先验、可人类遥操作/可几何监督)。这直接决定了想象的成本与可利用的先验。 [2301.04104] [2606.16533] [2602.15922] [2603.08546]

分歧 3:理论解释强度。Kairos 给出 bounded-window 的信息论下界(必要性)与混合分解的收缩性上界(充分性)两条定理;其余各篇一律“无形式化作者证明,仅实证”,DreamZero/LaWAM/Fast-WAM 均自承缺少“想象/子目标误差 → 动作误差”的可证明 bound。 [2606.16533] [2602.15922] [2606.15768] [2603.16666]

7. Open challenges (根本性困难) #

困难 1:几何一致、长时一致与动作可执行性的统一目标缺可验证闭式框架。 各篇分别给出局部最优路径——PAIWorld 靠几何监督、Kairos 靠收缩记忆、ABot-M0.5 靠三级级联——但没有单一可训练指标能同时约束三者并稳定训练;即便 Kairos 有收缩性定理,它证明的是视觉连续性而非语义级长程检索。这需要模型方法与部署协同联合攻关,难度时间量级在数年。 [2606.18375] [2606.16533] [2607.00678]

困难 2:长程记忆的“收缩即遗忘”悖论。 固定大小收缩记忆($\rho<1$)能给出有界误差并常数内存 rollout,但收缩性本身意味着远处信息被几何遗忘——这对平滑视觉一致性是优点,对“精确回溯久远事件”可能是结构性缺陷;而 KV-cache 路线又面临注意力随上下文变长而稀释的风险。两条路线都未在长程潜在检索任务上做压力测试。 [2606.16533] [2601.21998]

困难 3:测试时验证的可靠性。 τ₀-WM 的 RCS 度量的是“与学到的动作流形一致”,但一致 ≠ 正确——多模态分布里一个自洽却错误的候选完全可能得高分,$\gamma$ 阈值纯经验设定,缺一个把分布内一致性桥接到真实成功率的保证。这是把世界模型当评估器/规划器这一整支路线的共性风险。 [2606.01027] [2601.16163]

困难 4:向未见任务组合的泛化。 即便主结果 SOTA,ABot-M0.5 在最难的 Composite-Unseen 列崩到 2.7%,恰在其主打的长程/组合优势处失效;这说明当前世界-动作模型的泛化边界仍不清晰,且往往被聚合均分掩盖。 [2607.00678]

困难 5:可复现性与证据审计不足。 除 DreamerV3 官方开源可单卡复现、Cosmos Policy 在 NVIDIA 官方开源外,DreamZero 之外的多数工作实现未公开或仅承诺开源,且最难复制的往往正是文字难以传达的一处耦合(Fast-WAM 的结构化注意力掩码、Interactive Sim 的末帧满噪调度、ABot 的 Dream Forcing 两阶段前向),使方法可迁移边界与 SOTA 宣称都待外部验证。 [2301.04104] [2601.16163] [2603.16666] [2607.00678]

8. 成熟度判断 #

该主题整体处于“研究前沿向早期工程迁移”阶段,尚未进入可标准化的大规模生产状态:结果多来自 4–50 个任务的仿真基准与有限真机验证,缺跨层统一评测标准。 [2606.16533] [2607.00678] [2606.01164]

加速信号包括:向消费级硬件下沉的部署证据在积累——τ₀-WM 单张 RTX 5090 140–220ms、Interactive Sim 单张 4090 15 FPS、Kairos 480P 在 A800 实时、DreamZero 38× 加速到 7Hz、LaWAM/Fast-WAM 双双压到 ~190ms;同时“视频目标 grounds 动作”“世界模型作策略”的增益证据已在多篇独立复现。 [2606.01027] [2603.08546] [2606.16533] [2606.15768]

放缓信号包括:跨方法评测标准未统一、动态/未见场景泛化不足、绝大多数工作实现未公开或未被第三方复现、且理论保证普遍缺失。 [2606.01164] [2603.16666] [2607.00678]

趋势判断为“加速但分叉”:短期内潜空间与像素级两条主干、以及“想象必要 vs 不必要”两派会继续并进;中期可能在“单次前向的低延迟接口”(LaWAM/Fast-WAM)与“测试时想象-评估接口”(τ₀-WM/Cosmos Policy)之间收敛出自适应方案。 [2606.15768] [2603.16666] [2606.01027] [2601.16163]

9. 邻接 topic #

world-model-agent(新建邻接主题,承接 world-model × agent 连接):本主题聚焦世界模型方法本体;世界模型一旦上线,其价值会强依赖智能体运行时——决策层的 best-of-N/规划搜索会生成天然的 fan-out 负载,需要 program-level 调度、KV/latent 复用与多轮缓存来吸收。Cosmos Policy 的“观测→提案→想象→评分→执行”状态机与 τ₀-WM 的部署期评估-修正循环是这一交界的直接样本,建议在 world-model-agent 主题下展开世界模型与 agent 调度/serving 的耦合分析。 [2601.16163] [2606.01027]

multi-view-consistency:与本主题存在包含关系,PAIWorld 的跨视角几何闭合可能在后续拆分为“视觉几何一致”子主题。 [2606.18375]

interactive-video-generation / generative-simulators:Interactive Sim 与综述界定的“交互式视频世界模型”指向“生成式神经模拟器取代手工物理引擎”这一相邻方向,边界在“世界模型作数据/评估基础设施”处与本主题模糊。 [2603.08546] [2606.01164]

efficient-long-context-attention:Kairos 的混合线性注意力/收缩记忆与该主题在长程序列建模上深度耦合,后续可能形成联合主题。 [2606.16533]

10. 参考 #

EntityCategoriesRole in topicKey contribution
[2301.04104]algorithm历史范式基线latent RSSM 世界模型 + 想象训练 + 固定超参跨域稳健性
[2606.16533]algorithm长程记忆主干混合线性注意力 + 可证明收缩 gated-delta 记忆,学-维持-运行栈
[2606.18375]algorithm几何一致主干跨视角注意力 + Geo-RoPE + Latent 3D-REPA,多视角 3D 闭合
[2607.00678]model移动操作与对齐z->m->a 级联 + dual-level MoT + Dream Forcing
[2602.15922]algorithm零样本策略联合去噪 video+action + GT-KV 注入 + Flash 解耦噪声调度
[2606.15768]algorithm低延迟潜世界模型复用 LAM 前向解码器为世界模型,单次潜解码替代像素想象
[2606.01027]algorithm生成+评估双接口共享骨干的 VAM/ACVS + 异构 mask 数据 + 部署期评估-修正
[2603.08546]algorithm生成式模拟器/评估一致性模型潜动力学,纯 WM 数据训 IL、sim-real 强相关
[2606.01164]algorithm领域地图(综述)三大瓶颈分类学 + Forcing/蒸馏谱系 + 四域 benchmark
[2601.16163]agent具身智能体内核latent frame injection 折叠 policy/WM/value + best-of-N 规划
[2601.21998]algorithm因果自回归 WAM交织视频-动作 + 双流 MoT + KV-cache + FDM 接地异步
[2603.16666]algorithm反命题(想象不必要)保留视频协同训练但删除测试时想象分支,190ms on-par