Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

agent 2601.16163 — Cross-paper Synthesis

Cosmos Policy — L3 相关论文综合 #

1. 相关论文 #

本篇 (Cosmos Policy [2601.16163]) 与 8 个 peer 都挂在

category: agent 下,但它在这个 cluster 里是范式上的异类:它是

embodied visuomotor policy(视频扩散模型微调成机器人策略),而 8 个 peer

里有 6 个是 LLM-agent serving 基础设施、1 个是 model routing

1 个是 agent 互操作协议综述。因此"相关"必须分层理解,否则会误把它们放进

同一张对比表。

Peer一句话定位与本篇的真实关联轴
2502.13965 Autellix [2502.13965]program-level LAS 调度器agent loop 抽象:都把一个 task 建模为多 step 的 DAG/turn 序列
2511.02230 Continuum [2511.02230]multi-turn KV-cache TTL 调度多轮/chunk 执行的延迟结构;对 tool-call 间隙建模
2510.18586 TokenCake [2510.18586]KV-cache-centric multi-agent servingtool-call idle window;空间/时间调度
2509.02121 Halo [2509.02121]batch agentic workflow 查询优化DAG/placement 优化;把结构显式化换效率
2510.12872 KVCOMM [2510.12872]训练无关跨上下文 KV 复用无架构改动复用已有表征(与本篇"零架构改动"精神呼应)
2511.00739 CPU-centric [2511.00739]agentic AI 的 CPU 瓶颈刻画端到端 latency 拆解方法论
2406.18665 RouteLLM [2406.18665]强弱模型路由test-time compute 分配(路由 ≈ 廉价的 best-of-N 前身)
2505.02279 互操作协议综述 [2505.02279]MCP/ACP/A2A/ANP 定性对比仅共享 "agent" 标签;几乎无技术交集

最强的三条关联轴

  1. agent loop 的形式化——本篇的"观测→提案→想象→评分→执行"best-of-N 状态机
  2. [2601.16163] 与 Autellix 对 MCTS/ReAct

    DAG 的刻画 [2502.13965] 是同一抽象在不同层面的投影:本篇是

    决策层 的一步 lookahead 搜索,Autellix 是 serving 层 对搜索树的调度。

  3. "零架构改动 + 复用已有能力"—— 本篇 latent frame injection 复用视频 DiT
  4. [2601.16163],KVCOMM 复用已算好的 KV 而不重训

    [2510.12872] 是同一工程哲学的两个实例。

  5. test-time compute 的分配——本篇 best-of-N 规划 (+12.5 分)
  6. [2601.16163] 与 RouteLLM 的 per-query 强弱路由

    [2406.18665] 都在回答"何时该花更多算力",只是本篇在动作空间搜索、

    RouteLLM 在模型选择上。

    2. 本篇 vs 相关论文的 delta #

    新颖点(相对整个 cluster)

    • 唯一一篇把 policy / world model / value function 折叠进单一预训练生成模型
    • 的工作 [2601.16163]。所有 serving peer(Autellix/Continuum/

      TokenCake/Halo)都假设 agent 逻辑是外部黑盒,只优化其执行;本篇则重写了 agent

      内部——把规划做进模型 forward。

    • latent frame injection 是 cluster 里最独特的技术:把标量/低维模态广播复制填满
    • 图像 latent volume、用未改动的 DiT 去噪、取平均恢复

      [2601.16163]。没有任何 peer 有类似"用图像 latent 形状承载非图像模态"

      的编码 trick。

    增量点(站在别人肩上)

    • best-of-N 一步 lookahead + majority-mean 聚合
    • [2601.16163] 是经典 model-based planning 的直接沿用,

      Autellix 早已把 MCTS 这类更深的搜索树当作一等公民调度对象

      [2502.13965]。本篇的规划深度(=1)在搜索复杂度上远低于 peer 服务的

      workload。

    • dual deployment(原 checkpoint 当 policy、rollout 精炼 checkpoint 当 planner)
    • [2601.16163] 在 RouteLLM 的"多模型分工"

      框架下可视为一个退化版路由 [2406.18665]

    矛盾/张力点

    • 本篇宣称 best-of-8 规划全流程 4.9s(8 GPU 并行)且承认 ~5s 延迟限制动态任务
    • [2601.16163]。而整个 serving cluster 的全部存在意义就是把 agent

      的 per-turn 延迟压到亚秒——Continuum 把多轮排队气泡从 58.2% 压到近零

      [2511.02230],Autellix 在相同延迟下拿 4–15× 吞吐

      [2502.13965]。**本篇的规划机制正是这些 serving 论文要解决的

      latency 病症的一个新来源**:8 路并行 best-of-N 是一个天然的 fan-out DAG,恰是

      Autellix/Halo/TokenCake 的调度目标。二者不矛盾,而是"决策层制造负载 → serving 层

      吸收负载"的上下游关系,本 cluster 从未有人把它们接起来(见 §5)。

    3. 可攻击面 #

    攻击 1 — "SOTA" 的适用范围被均分掩盖。 本篇的 93.6% ALOHA 全量均分

    [2601.16163] 靠 in-distribution 拉高;纯 OOD 均分

    89.3 反而落后 π0.5 的 92.5,"put candies in bowl" OOD 仅 74.0 < 90.0

    [2601.16163]。这与 RouteLLM 的教训同构——RouteLLM

    在训练分布(Arena 对话)内很强,但在 OOD 的 GSM8K/MMLU 上不加增强就退化到 random

    以下 [2406.18665]共同根因:两者都学到了

    分布内的"难度/成功"信号,OOD 泛化都靠额外数据(本篇靠 rollout 精炼、RouteLLM 靠

    judge 增强)补救。本篇未像 RouteLLM 那样系统扫 OOD,可攻击点是"视频先验能否泛化到

    未见物体/布局"缺乏 RouteLLM 级别的 transfer 实验。

    攻击 2 — 规划收益 +12.5 分缺乏理论界。 本篇明确"无形式化作者证明,仅实证"

    [2601.16163],best-of-N 相对直接策略的提升本可在 world model /

    value 误差假设下给出 regret 型界,但没给。这是整个 cluster 的通病:Autellix

    [2502.13965]、Continuum [2511.02230] 都承认

    可以形式化为 competitive ratio 却止于实证。本篇比它们更弱一层——serving 论文至少能

    借用 LAS 在 DHR 分布下的已知最优性 [2502.13965],本篇的规划则完全

    依赖 world model 准不准,而 Figure 6 显示 base checkpoint 的 world model 预测不出

    "丢滑块" [2601.16163]——即规划质量强依赖 rollout 数据覆盖,

    分布外无保证。

    攻击 3 — 单步 lookahead 是刻意省算力的妥协。 深度=1、不可撤销、执行完整 chunk

    不做 receding-horizon [2601.16163]。Autellix 服务的

    MCTS 是数十到数百 call 的深搜 [2502.13965],说明"更深搜索"在 agent

    社区是常态。本篇用 depth-1 换 4.9s 延迟,可攻击点是:若换更深搜索,延迟会爆炸到

    serving 层完全无法承受,说明该方法的规划能力上限被算力硬约束死。

    攻击 4 — 数据效率的对比基线可能不公平。 RoboCasa 50 条示范超过竞品 300–3000+

    [2601.16163],但这建立在竞品未用同等预训练 backbone

    的前提上。RouteLLM 同样展示了"小数据 + 好先验"胜过"大数据 + 弱结构"(1500 golden

    样本即把 MMLU CPT 从 50%→35% [2406.18665]),提醒读者:数据效率的

    惊艳往往是 backbone 先验在做功,而非方法本身——本篇消融 from-scratch 掉 3.9–18.7 分

    [2601.16163] 恰好自证了这点。

    4. 生态位 #

    • 范式定位:本篇处于 "video-as-policy / world-model-as-agent" 的前沿,代表
    • embodied agent 从 "VLA(视觉-语言-动作)" 向 "video-diffusion-as-unified-brain"

      的迁移 [2601.16163]。这与本 cluster 的 LLM-agent serving 主线是

      正交的两个宇宙:serving cluster 假设"大脑是 LLM,且是外部服务",本篇则重造大脑。

    • 采用证据:代码/模型/数据已在 NVIDIA 官方开源
    • [2601.16163]开源,含训练与评测脚本),采用门槛

      比多数只发论文的 serving peer 低——Autellix [2502.13965]

      TokenCake [2510.18586]、KVCOMM

      [2510.12872]未公开代码。cluster 内只有

      Continuum [2511.02230](基于 vLLM 的插件)、RouteLLM

      [2406.18665]、Halo(demo 仓库

      [2509.02121])开源。

    • paradigm-shift 论断:本篇挑战"机器人策略需要动作数据大规模预训练"的假设——它未经
    • 动作预训练却击败经此预训练的 π0.5/OpenVLA-OFT+

      [2601.16163]。这一"视频先验替代动作数据预训练"的主张,

      若成立,会像 CPU-centric 论文对"agentic 优化 = GPU 优化"的挑战

      [2511.00739] 一样,重定向整个子领域的注意力。

    5. 未探索方向 #

    从这个(虽松散但互补的)cluster 里能挤出几条真实的 hybrid 方向:

    1. best-of-N 规划 × program-level 调度(本篇 × Autellix/Halo/TokenCake):
    2. 本篇的 8 路 best-of-N [2601.16163] 是一个标准的

      fan-out/fan-in DAG,正是 Autellix ATLAS [2502.13965] 和 Halo

      consolidated DAG [2509.02121] 的调度对象。把

      embodied 规划的搜索树喂给 program-level 调度器,可能把 4.9s 规划延迟压到能支撑动态

      任务的水平——cluster 里没人做过 "embodied planner 作为 serving workload"。

      1. KV/latent 复用迁移到 world-model rollout(本篇 × KVCOMM):本篇 world model
      2. 对 N 个 action 提案独立预测未来帧 [2601.16163]

        这 N 个 forward 共享大量上下文(同一 $s$)。KVCOMM 的跨上下文 KV 偏移近似

        [2510.12872] 原理上可迁移到扩散模型的跨提案 latent 复用,

        削减 best-of-N 的冗余算力——但扩散模型的双向 attention 与 KVCOMM 的 causal RoPE

        假设不兼容,是技术上"可做但需改造"的空白。

        1. 自适应规划预算(本篇 × RouteLLM):本篇对所有状态用固定 N=8
        2. [2601.16163],浪费算力在"简单状态"上。RouteLLM 的

          per-query 难度预测 [2406.18665] 可移植成 per-state 规划预算控制器——

          value 方差大/多模态高的状态才触发 best-of-N,其余走直接策略。cluster 里 test-time

          compute 分配还没人做进 embedded 决策层。

          1. CPU 侧 world-model / value 卸载(本篇 × CPU-centric):本篇规划的 world model
          2. 3× + value 5× ensemble [2601.16163] 全在

            GPU 上串行。CPU-centric 论文的 COMB CPU/GPU 重叠思想

            [2511.00739] 提示:ensemble 聚合(majority-mean)

            这类轻量 CPU 工作可与 GPU 去噪重叠——一个技术上直接、cluster 未探索的流水线优化。

            1. 多轮 latent 缓存 TTL(本篇 × Continuum):本篇 chunk 执行完才 requery、无
            2. receding-horizon [2601.16163]。若改成

              receding-horizon,相邻 chunk 的观测 latent 高度重叠,可套用 Continuum 的 TTL pin

              机制 [2511.02230] 决定何时保留观测

              latent,在"重规划频率"与"显存占用"之间取平衡。

              (注:2505.02279 互操作协议综述 [2505.02279] 与本篇技术交集过弱,

              未纳入 hybrid 方向;仅作为"同 category 但异范式"的边界样本保留在 §1。)