本篇 (Cosmos Policy [2601.16163]) 与 8 个 peer 都挂在
category: agent 下,但它在这个 cluster 里是范式上的异类:它是
embodied visuomotor policy(视频扩散模型微调成机器人策略),而 8 个 peer
里有 6 个是 LLM-agent serving 基础设施、1 个是 model routing、
1 个是 agent 互操作协议综述。因此"相关"必须分层理解,否则会误把它们放进
同一张对比表。
| Peer | 一句话定位 | 与本篇的真实关联轴 |
|---|---|---|
| 2502.13965 Autellix [2502.13965] | program-level LAS 调度器 | agent loop 抽象:都把一个 task 建模为多 step 的 DAG/turn 序列 |
| 2511.02230 Continuum [2511.02230] | multi-turn KV-cache TTL 调度 | 多轮/chunk 执行的延迟结构;对 tool-call 间隙建模 |
| 2510.18586 TokenCake [2510.18586] | KV-cache-centric multi-agent serving | tool-call idle window;空间/时间调度 |
| 2509.02121 Halo [2509.02121] | batch agentic workflow 查询优化 | DAG/placement 优化;把结构显式化换效率 |
| 2510.12872 KVCOMM [2510.12872] | 训练无关跨上下文 KV 复用 | 无架构改动复用已有表征(与本篇"零架构改动"精神呼应) |
| 2511.00739 CPU-centric [2511.00739] | agentic AI 的 CPU 瓶颈刻画 | 端到端 latency 拆解方法论 |
| 2406.18665 RouteLLM [2406.18665] | 强弱模型路由 | test-time compute 分配(路由 ≈ 廉价的 best-of-N 前身) |
| 2505.02279 互操作协议综述 [2505.02279] | MCP/ACP/A2A/ANP 定性对比 | 仅共享 "agent" 标签;几乎无技术交集 |
最强的三条关联轴:
[2601.16163] 与 Autellix 对 MCTS/ReAct
DAG 的刻画 [2502.13965] 是同一抽象在不同层面的投影:本篇是
决策层 的一步 lookahead 搜索,Autellix 是 serving 层 对搜索树的调度。
[2601.16163],KVCOMM 复用已算好的 KV 而不重训
[2510.12872] 是同一工程哲学的两个实例。
[2601.16163] 与 RouteLLM 的 per-query 强弱路由
[2406.18665] 都在回答"何时该花更多算力",只是本篇在动作空间搜索、
RouteLLM 在模型选择上。
新颖点(相对整个 cluster):
的工作 [2601.16163]。所有 serving peer(Autellix/Continuum/
TokenCake/Halo)都假设 agent 逻辑是外部黑盒,只优化其执行;本篇则重写了 agent
的内部——把规划做进模型 forward。
图像 latent volume、用未改动的 DiT 去噪、取平均恢复
[2601.16163]。没有任何 peer 有类似"用图像 latent 形状承载非图像模态"
的编码 trick。
增量点(站在别人肩上):
[2601.16163] 是经典 model-based planning 的直接沿用,
Autellix 早已把 MCTS 这类更深的搜索树当作一等公民调度对象
[2502.13965]。本篇的规划深度(=1)在搜索复杂度上远低于 peer 服务的
workload。
[2601.16163] 在 RouteLLM 的"多模型分工"
框架下可视为一个退化版路由 [2406.18665]。
矛盾/张力点:
[2601.16163]。而整个 serving cluster 的全部存在意义就是把 agent
的 per-turn 延迟压到亚秒——Continuum 把多轮排队气泡从 58.2% 压到近零
[2511.02230],Autellix 在相同延迟下拿 4–15× 吞吐
[2502.13965]。**本篇的规划机制正是这些 serving 论文要解决的
latency 病症的一个新来源**:8 路并行 best-of-N 是一个天然的 fan-out DAG,恰是
Autellix/Halo/TokenCake 的调度目标。二者不矛盾,而是"决策层制造负载 → serving 层
吸收负载"的上下游关系,本 cluster 从未有人把它们接起来(见 §5)。
攻击 1 — "SOTA" 的适用范围被均分掩盖。 本篇的 93.6% ALOHA 全量均分
[2601.16163] 靠 in-distribution 拉高;纯 OOD 均分
89.3 反而落后 π0.5 的 92.5,"put candies in bowl" OOD 仅 74.0 < 90.0
[2601.16163]。这与 RouteLLM 的教训同构——RouteLLM
在训练分布(Arena 对话)内很强,但在 OOD 的 GSM8K/MMLU 上不加增强就退化到 random
以下 [2406.18665]。共同根因:两者都学到了
分布内的"难度/成功"信号,OOD 泛化都靠额外数据(本篇靠 rollout 精炼、RouteLLM 靠
judge 增强)补救。本篇未像 RouteLLM 那样系统扫 OOD,可攻击点是"视频先验能否泛化到
未见物体/布局"缺乏 RouteLLM 级别的 transfer 实验。
攻击 2 — 规划收益 +12.5 分缺乏理论界。 本篇明确"无形式化作者证明,仅实证"
[2601.16163],best-of-N 相对直接策略的提升本可在 world model /
value 误差假设下给出 regret 型界,但没给。这是整个 cluster 的通病:Autellix
[2502.13965]、Continuum [2511.02230] 都承认
可以形式化为 competitive ratio 却止于实证。本篇比它们更弱一层——serving 论文至少能
借用 LAS 在 DHR 分布下的已知最优性 [2502.13965],本篇的规划则完全
依赖 world model 准不准,而 Figure 6 显示 base checkpoint 的 world model 预测不出
"丢滑块" [2601.16163]——即规划质量强依赖 rollout 数据覆盖,
分布外无保证。
攻击 3 — 单步 lookahead 是刻意省算力的妥协。 深度=1、不可撤销、执行完整 chunk
不做 receding-horizon [2601.16163]。Autellix 服务的
MCTS 是数十到数百 call 的深搜 [2502.13965],说明"更深搜索"在 agent
社区是常态。本篇用 depth-1 换 4.9s 延迟,可攻击点是:若换更深搜索,延迟会爆炸到
serving 层完全无法承受,说明该方法的规划能力上限被算力硬约束死。
攻击 4 — 数据效率的对比基线可能不公平。 RoboCasa 50 条示范超过竞品 300–3000+
[2601.16163],但这建立在竞品未用同等预训练 backbone
的前提上。RouteLLM 同样展示了"小数据 + 好先验"胜过"大数据 + 弱结构"(1500 golden
样本即把 MMLU CPT 从 50%→35% [2406.18665]),提醒读者:数据效率的
惊艳往往是 backbone 先验在做功,而非方法本身——本篇消融 from-scratch 掉 3.9–18.7 分
[2601.16163] 恰好自证了这点。
embodied agent 从 "VLA(视觉-语言-动作)" 向 "video-diffusion-as-unified-brain"
的迁移 [2601.16163]。这与本 cluster 的 LLM-agent serving 主线是
正交的两个宇宙:serving cluster 假设"大脑是 LLM,且是外部服务",本篇则重造大脑。
[2601.16163](开源,含训练与评测脚本),采用门槛
比多数只发论文的 serving peer 低——Autellix [2502.13965]、
TokenCake [2510.18586]、KVCOMM
[2510.12872] 均未公开代码。cluster 内只有
Continuum [2511.02230](基于 vLLM 的插件)、RouteLLM
[2406.18665]、Halo(demo 仓库
[2509.02121])开源。
动作预训练却击败经此预训练的 π0.5/OpenVLA-OFT+
[2601.16163]。这一"视频先验替代动作数据预训练"的主张,
若成立,会像 CPU-centric 论文对"agentic 优化 = GPU 优化"的挑战
[2511.00739] 一样,重定向整个子领域的注意力。
从这个(虽松散但互补的)cluster 里能挤出几条真实的 hybrid 方向:
本篇的 8 路 best-of-N [2601.16163] 是一个标准的
fan-out/fan-in DAG,正是 Autellix ATLAS [2502.13965] 和 Halo
consolidated DAG [2509.02121] 的调度对象。把
embodied 规划的搜索树喂给 program-level 调度器,可能把 4.9s 规划延迟压到能支撑动态
任务的水平——cluster 里没人做过 "embodied planner 作为 serving workload"。
对 N 个 action 提案独立预测未来帧 [2601.16163],
这 N 个 forward 共享大量上下文(同一 $s$)。KVCOMM 的跨上下文 KV 偏移近似
[2510.12872] 原理上可迁移到扩散模型的跨提案 latent 复用,
削减 best-of-N 的冗余算力——但扩散模型的双向 attention 与 KVCOMM 的 causal RoPE
假设不兼容,是技术上"可做但需改造"的空白。
[2601.16163],浪费算力在"简单状态"上。RouteLLM 的
per-query 难度预测 [2406.18665] 可移植成 per-state 规划预算控制器——
value 方差大/多模态高的状态才触发 best-of-N,其余走直接策略。cluster 里 test-time
compute 分配还没人做进 embedded 决策层。
3× + value 5× ensemble [2601.16163] 全在
GPU 上串行。CPU-centric 论文的 COMB CPU/GPU 重叠思想
[2511.00739] 提示:ensemble 聚合(majority-mean)
这类轻量 CPU 工作可与 GPU 去噪重叠——一个技术上直接、cluster 未探索的流水线优化。
receding-horizon [2601.16163]。若改成
receding-horizon,相邻 chunk 的观测 latent 高度重叠,可套用 Continuum 的 TTL pin
机制 [2511.02230] 决定何时保留观测
latent,在"重规划频率"与"显存占用"之间取平衡。
(注:2505.02279 互操作协议综述 [2505.02279] 与本篇技术交集过弱,
未纳入 hybrid 方向;仅作为"同 category 但异范式"的边界样本保留在 §1。)