world-model-agent

Cross-category topic | 12 sources

1. 主题缘起 #

这个主题追问一件事:当一个模型学会"预测世界的下一步",它离"成为一个会行动的 agent"还有多远?答案在 2026 年集中显形——世界模型不再只是被动的动力学预测器,而是被直接当成 agent 的模拟器、策略与规划器:先在脑中"想象"未来,再把想象读成动作。DreamZero 把世界动作模型明确定位为 zero-shot 策略,动作直接从"想象出的未来视频计划"里读出,无需任何 test-time 搜索 [2602.15922];Cosmos Policy 把 policy / world model / value function 折叠进单一预训练生成模型,直接重写 agent 的内部大脑 [2601.16163]。这是一条"预见 → 行动"的主线。

但一个会想象的 agent 必须跑在某个基座上。世界模型驱动的 agent 恰恰是极重的负载来源:best-of-N 规划是天然的 fan-out DAG [2601.16163],像素级视频去噪是主导运行时成本 [2603.16666],闭环控制对每轮延迟极端敏感 [2602.15922]。与此同时,另一批工作把"agent serving"从"把每次 LLM 调用当独立请求"推进到"感知整个 workflow 结构"的调度基座——Halo 把批量 agentic workflow 合并成暴露共享计算的 consolidated DAG [2509.02121],Scepsy 把问题上移到"决定 GPU 布局本身" [2604.15186]。因此本主题跨越两个 category:算法侧的世界模型–策略(algorithm)与运行侧的 agent 服务基座(agent),并主张后者正是前者部署时的天然归宿。

2. 覆盖的 category 分布 #

categorypaper countrepresentative
algorithm7DreamZero [2602.15922]、τ₀-WM [2606.01027]、Fast-WAM [2603.16666]、LaWAM [2606.15768]、LingBot-VA [2601.21998]、ABot-M0.5 [2607.00678]、交互式视频世界模型综述 [2606.01164]
agent5Cosmos Policy [2601.16163]、Pancake [2602.21477]、Helium [2603.16104]、Halo [2509.02121]、Scepsy [2604.15186]

algorithm 侧的 7 篇是"世界模型如何变成动作"的不同答卷;agent 侧含一个特例——Cosmos Policy 虽挂 agent 标签,却是把生成模型改造成具身大脑,落在两侧的接缝上 [2601.16163];其余 4 篇 agent-serving 论文构成"这些会想象的 agent 跑在哪里"的基座层。

3. 时间线 #

4. Evolution timeline (技术谱系) #

两条谱系各自演化,最终在"会想象的 agent 需要基座"处交汇:

flowchart TD D3["DreamerV3
潜空间想象 + actor-critic (RL)"]:::alg subgraph WM["世界模型 → 动作 (algorithm)"] D3 --> PIX["像素/视频世界模型分支"] PIX --> DZ["DreamZero
WAM=zero-shot 策略, 无 test-time 搜索"]:::alg PIX --> LV["LingBot-VA
预测视频→逆动力学解码动作"]:::alg PIX --> ABOT["ABot-M0.5
Dream Forcing 训练期对齐"]:::alg D3 --> TTS["部署期想象=推理接口分支"] TTS --> TAU["τ₀-WM
world-model-as-test-time-evaluator"]:::alg TTS --> COS["Cosmos Policy
policy/WM/value 折进单模型 + best-of-N"]:::agt PIX --> RETR["想象=训练脚手架分支"] RETR --> FWAM["Fast-WAM
test-time 删想象, 只留训练目标"]:::alg RETR --> LAW["LaWAM
单步潜解码, 最便宜 WM 接口"]:::alg PIX --> SURV["交互式视频世界模型综述
三瓶颈 + POMDP 统一命名"]:::alg end subgraph SERV["agent 服务基座 (agent)"] AUTELLIX["Autellix (program-level 调度基线)"] --> HALO["Halo
批量 consolidated DAG + placement"]:::agt HALO --> HELIUM["Helium
编译期 query optimizer, 精确复用"]:::agt HALO --> SCEPSY["Scepsy
多异构 LLM 的 GPU 分配层"]:::agt KVC["KV-cache 系 (TokenCake/Continuum)"] --> PANCAKE["Pancake
agent 记忆 ANN 索引层"]:::agt end COS -. "best-of-N = fan-out DAG 负载" .-> HALO DZ -. "闭环<200ms 目标 → 延迟压力" .-> SCEPSY TAU -. "candidate rollout 评估 → 算力分配" .-> HELIUM ABOT -. "长时程记忆/条件缓存" .-> PANCAKE classDef alg fill:#e8f0ff,stroke:#3b6; classDef agt fill:#fff0e8,stroke:#b63;

分叉点:DreamerV3 的"潜空间想象"分叉出像素/视频世界模型(DreamZero / LingBot-VA / ABot-M0.5)与部署期想象即推理接口(τ₀-WM / Cosmos Policy)两支 [2606.01027]。收敛点:Fast-WAM 与 LaWAM 从相反方向汇合到"想象很贵、能省则省"——一个在训练后删掉 test-time 想象 [2603.16666],一个把迭代像素 rollout 压成单步潜解码 [2606.15768]。跨谱系的虚线才是本主题的主张:决策层制造的负载正好是服务层的调度对象 [2601.16163] [2509.02121]

5. 技术线交错 #

(1) 决策层制造负载 → 服务层吸收负载(本主题最强的交错)。 Cosmos Policy 的 8 路 best-of-N 规划是一个标准 fan-out/fan-in DAG,恰是 Halo consolidated DAG 与 program-level 调度器的调度对象;二者不矛盾,而是上下游关系,但此前无人把它们接起来 [2601.16163] [2509.02121]。同理 Scepsy 的分数 GPU 分配层正是为"一个 workflow 里多个异构模型(如策略模型 + world-model 评估器 + value ensemble)"设计的资源布局器 [2604.15186]——而 Cosmos Policy 的规划恰恰同时用 world model 3× + value 5× ensemble [2601.16163]

(2) 世界模型的延迟结构决定了它需要哪种服务优化。 当想象是"昂贵的像素/视频去噪"时(DreamZero 需 2× GB200 才 7Hz [2602.15922]、Fast-WAM 的 IDM 变体 810ms [2603.16666]),算法侧要么删想象(Fast-WAM)、要么压成潜解码(LaWAM),要么下沉到消费级硬件(τ₀-WM 单卡 5090 [2606.01027])。这与服务侧"KV 迁移比重算快一个数量级"这一物理事实互补 [2509.02121]:serving 层能吸收的负载类型(可复用 prefix、可迁移 KV、可 overlap 的 CPU 工作),反过来约束了世界模型该把哪部分算力外置。

(3) 长时程记忆:算法侧押 KV-cache,服务侧管 KV-cache。 LingBot-VA 与 ABot-M0.5 都把长时程能力押在 KV-cache / 条件缓存上 [2601.21998] [2607.00678];而 Pancake / Helium / Continuum 系正是"KV 与外部记忆索引什么时候留在 GPU"的管理者——Pancake 把 agent 记忆 ANN 索引当作可缓存资源 [2602.21477],Helium 用 TRT 统一 prefix 层级与依赖 DAG [2603.16104]。会想象的 agent 的"记忆宣称"能否兑现,一半取决于服务层的记忆生命周期管理。

(4) test-time compute 分配是两侧共同的旋钮。 τ₀-WM 把"LLM 推理时花算力选更好答案"的 best-of-N / self-consistency 思路搬到连续动作空间 [2606.01027],Cosmos Policy 对所有状态用固定 N=8 [2601.16163]。这种"何时该花更多算力想象"的决定,恰好是 Scepsy / Helium 这类分配/调度层的输入信号——固定 N 是浪费,自适应预算需要服务层与决策层协同。

6. 共识与分歧 #

共识。

分歧。

7. Open challenges (根本性困难) #

8. 成熟度判断 #

整体:research-frontier,且正在加速。 证据:

9. 邻接 topic #

10. 参考 #

EntityCategoriesRole in topicKey contribution
[2602.15922] · [2602.15922]algorithmWM→动作旗舰世界动作模型即 zero-shot 策略,动作从想象视频读出,38× 推理栈跑 7Hz 闭环
[2606.01027] · [2606.01027]algorithm部署期想象接口world-model-as-test-time-evaluator(RCS 便宜筛 + LAR 昂贵修正),单卡 5090 部署
[2601.16163] · [2601.16163]agent统一大脑 + 负载源policy/WM/value 折进单模型 + best-of-N 规划;best-of-N=fan-out DAG 接上服务层
[2603.16666]algorithm反命题想象是训练脚手架、test-time 删掉未来视频生成(810→190ms)
[2606.15768]algorithm效率重构复用被弃的潜动作解码器当非迭代世界模型,单步潜解码降 24× 延迟
[2601.21998]algorithm视频-策略预测视频→逆动力学解码动作,KV-cache 承载长时程记忆
[2607.00678] · [2607.00678]algorithm训练期对齐Dream Forcing 把生成 rollout 的 exposure bias 关进训练循环;serving 留白
[2606.01164]algorithm命名者用 POMDP 统一交互式视频世界模型,点名三大瓶颈与漂移无界困难
[2509.02121] · [2509.02121]agent批量调度基座consolidated batch DAG + makespan placement,吸收 fan-out 负载
[2602.21477] · [2602.21477]agent记忆索引层把 agent 记忆 ANN 索引当被管理资源,hybrid graph 粗搜索降 >20×
[2603.16104] · [2603.16104]agent查询优化层编译期 query optimizer:CSE 剪枝 + TRT 统一 prefix/依赖 + 精确复用
[2604.15186] · [2604.15186]agent分配层多异构 LLM 的分数 GPU 分配,把稳态统计变成 GPU 布局
[2301.04104]algorithm共同祖先DreamerV3:潜空间想象 + actor-critic,两条谱系的历史基线