| Entity | 关系类型 | 关联理由 |
|---|---|---|
| DualPath (2602.21548) | KV-cache 基础设施 | 同为 agentic workload 下的 KV-cache 传输/管理优化;DualPath 解决存储→GPU 的带宽瓶颈,GLM 解决 GPU 内的 eviction 语义问题 |
| PPD (2603.13358) | Multi-turn 路由 | PPD 优化多轮对话中的 append-prefill 路由,GLM 优化单 query 内多 agent 的 KV 复用——两者都面对"历史 KV 在 decode 节点积累"的场景 |
| MFS (2603.17456) | 网络调度 | MFS 用 RMLQ 管理 PD 分离中三阶段通信的优先级,GLM 用四级优先级管理 KV-cache eviction——都是基于语义的多级优先级队列设计 |
| TensorHub (2604.09107) | RDMA 基础设施 | 正交:TensorHub 面向 RL training 权重传输,GLM 面向 online serving 的 KV 管理;但两者都利用"引用而非拷贝"的思路减少数据搬运 |
| PrfaaS (2604.15039) | 跨 DC serving | PrfaaS 通过 hybrid attention 降低跨 DC KV 吞吐需求,GLM 通过 vertex chunk 提升本地 KV 命中率——两者是同一 pipeline 的不同环节 |
| ZeRO-Prefill (2605.02960) | MoE prefill 优化 | ZeRO-Prefill 消除 MoE prefill 通信冗余,GLM 消除 Graph-CoT 推理中的 token 冗余——都是通过"反转传统数据流方向"实现加速 |
| TileRT (tilert-speed-scaling-law) | 执行引擎 | TileRT 用 persistent kernel 消除 BS≈1 的 inter-kernel overhead,GLM 用 pipelined execution 消除 retrieval-decode 序列化——都是把"串行等待"变成"overlap" |
| KVServe (kvserve) | KV 压缩 | KVServe 压缩 PD 间 KV 传输体积,GLM 的 vertex-centric chunk 本质上也是一种"聚合→复用"的 KV 压缩策略,只是手段不同(量化 vs 结构化复用) |
GLM 的核心 delta 是在 agent 语义层面重新定义 KV-cache 管理策略——其他论文要么只做 serving 层优化(DualPath、MFS、KVServe),要么只做 application 层优化(PPD 的路由决策),而 GLM 把两层绑定:agent 边界 = cache priority 边界 [2511.01633]。
| 维度 | GLM | DualPath | PPD | MFS | KVServe |
|---|---|---|---|---|---|
| 优化对象 | 单 query 内多 agent 的 KV 复用 | 跨节点 KV 加载带宽 | 多轮 Turn 2+ 路由决策 | 网络 flow 优先级 | KV 传输体积 |
| KV 管理粒度 | Vertex chunk(语义级) | Layer block(传输级) | Request(粗粒度) | Flow(网络级) | Per-head(精度级) |
| 核心机制 | 四级语义优先级 eviction | Dual-path + VL QoS | Scoring function | RMLQ + MLU promote | Analytical model + bandit |
| 工作负载 | Graph-CoT 多跳推理 | Agentic RL rollout | Multi-turn chat | MoE disaggregated | Cross-node PD |
| 改 serving 引擎? | 是(vLLM fork, 3K Python) | 是(5K 行内部 framework) | 是(vLLM disaggregated) | 是(NCCL+Mooncake adapter) | 否(external connector) |
相对于 DualPath 的 delta:DualPath 假设 KV-cache 在存储中已经存在(命中率 98.7%),优化的是"如何更快地把 KV 从 storage 搬到 GPU" [2602.21548]。GLM 的场景恰好相反——Graph-CoT 的 KV 命中率只有 61%(vLLM 默认 LRU),优化的是"如何让正确的 KV 留在 GPU 上不被错误驱逐" [2511.01633]。两者是同一 pipeline 不同瓶颈点的互补解。
相对于 PPD 的 delta:PPD 的 append-prefill 干扰仅 2% TPOT degradation 这一发现 [2603.13358],证明了"短 prefill 可在 decode 节点安全执行"。GLM 的 R-Agent/A-Agent 每轮也是短 prefill(每 call 769–991 tokens),但 GLM 把问题从"路由到哪个节点"上升到"在同一节点内如何排列不同 agent 的 KV 优先级"。PPD 是 inter-node 优化,GLM 是 intra-node 优化。
相对于 ZeRO-Prefill 的 delta:ZeRO-Prefill 反转了 MoE 的数据流方向(activation→expert 变成 expert→activation),GLM 反转了 Graph-CoT 的推理模式(monolithic prompt 变成 specialized agents)[2605.02960]。两者都通过"反转假设"获得了系统性收益,但 ZeRO-Prefill 是纯 compute/comm 优化(对 accuracy 中立),GLM 的反转同时提升了 accuracy(R-L +38%)——这是 GLM 独有的"accuracy + efficiency 双赢"特征 [2511.01633]。
相对于 TileRT 的 delta:TileRT 追求的是 BS≈1 下逼近硬件带宽上限(~1000 tok/s 理论 vs 几十 tok/s 实际),是"从 10× gap 中榨汁" [tilert-speed-scaling-law]。GLM 追求的是多 agent 场景下的 throughput 与 accuracy 同时提升,是"把错误的系统设计换成对的"。两者的优化层次完全不同:TileRT 在 kernel/compiler 级别,GLM 在 scheduler/cache-policy 级别。
GLM 的 pipelined execution 依赖一个观察性假设:A-Agent 生成的代码段中 RetrieveNode() 几乎一定出现在第一行 [2511.01633]。论文未做分布统计,仅为定性观察。
攻击:用更大/更自由的 backbone(如 GPT-4o 或更强 coding model)替换 Qwen3-235B-A22B,生成的 Python snippet 可能把条件判断、变量声明放在 RetrieveNode() 之前。此时 pipeline 触发点后移,overlap 收益从 47.8% 降到未知值。若 backbone 生成的代码先做复杂的前置处理再检索,pipelining 的"确定性 overlap"假设完全失效。
与 PrfaaS 对比:PrfaaS 的 layer-wise prefill pipelining 是结构性保证的(每层 KV 算完必须发出),不依赖 LLM 生成行为的统计特性 [2604.15039]。GLM 的 pipeline 信号来自 LLM 输出的 token 流——这是一个非确定性信号源,鲁棒性本质上弱于结构性信号。
Vertex chunk 复用假设图访问有幂律性——热门节点被反复查询 [2511.01633]。但 Legal 域(84M 节点 / 114M 边)上 GLM 延迟仍为 5.9s(其他域 2.8–3.4s),暗示长尾图上 chunk 复用率低。
攻击:构造均匀访问模式(如随机 multi-hop query over uniform graph),vertex-centric hit rate 将趋近 0,退化为无缓存状态。此时 GLM 的 +17.7% hit rate 增益消失,吞吐 +41.6% 变为 ~0%。论文的 GRBench 5 个领域恰好都有一定的热门节点集中度——这是有利于 GLM 的 benchmark 选择偏差。
与 DualPath 对比:DualPath 的收益不依赖访问模式——它解决的是物理带宽瓶颈(SNIC 饱和),不管什么 query 只要有 KV reuse 就受益 [2602.21548]。GLM 的收益本质上是内容相关的——只在图访问有局部性时有效。
GLM 把所有 KV block 分为 4 个离散优先级(P-I/II/III/IV),但实际 agent 工作负载中"重要性"是连续谱:两个不同 query 的 notebook 可能有不同复用概率,但都被归入 P-II [2511.01633]。
攻击:在高并发(>100 concurrent queries)下,P-II 级别内部的 LRU 会把"高复用概率 notebook"和"低复用概率 notebook"混在一起,误驱逐仍会发生。四级分类本质上是 LRU 的"粗粒度语义标签",不是 true priority——MFS 的 MLU 连续量化紧迫度的方式更精细 [2603.17456]。
GLM 消灭了 step-limit-exceeded(37%→4%)和 unexpected-output(41%→2%),但代价是 code-execution error 从 2% 涨到 48% [2511.01633]。论文的 fault tolerance(捕获 exception→回喂 LLM 自纠)是 retry-based 的,没有收敛性保证。
攻击:对于需要多次 retry 的 query,每次 retry 消耗额外 LLM call + retrieval round。在最坏情况下,retry 可能指数级放大延迟,把 GLM 的 2.8–5.9s 延迟吹到 >30s(回退到 Graph-CoT baseline 水平)。论文的 Table 5 只报告了聚合错误分布,未报告 retry 次数分布和 tail latency。
GLM 占据了一个独特的生态位——多 agent 推理架构与 LLM serving 引擎的 co-design。在此之前:
GLM 是第一个把"agent 如何拆"和"cache 如何管"统一设计的系统 [2511.01633]。
与 DualPath/TensorHub 对比:DualPath 和 TensorHub 都有明确的"已部署于 DeepSeek/ByteDance 生产"声明 [2602.21548] [2604.09107],GLM 仅为学术原型。这限制了 GLM 的短期产业影响力,但其思想(agent boundary = cache priority boundary)已被明确为 vLLM/SGLang 路线图的参考方向。
GLM 不是 vLLM/SGLang 的竞品,而是"multi-agent serving"这一新 workload category 的 reference design。其核心思想可被上游吸收为:
GLM 的四级优先级只在 GPU HBM 内生效。当结合 DualPath 的 SSD→DRAM→HBM 三层存储路径时 [2602.21548],vertex chunk 的优先级应该传播到 offload 层——P-I(agent prefix)永不落盘,P-II(notebook)在 DRAM 保留,P-III(历史 notebook)允许落 SSD 但 prefetch 优先。这需要把 GLM 的单层优先级扩展为跨存储层的分层 eviction policy——DualPath 的 CNIC-centric data path 恰好可以为这种分层传输提供 QoS 隔离。
KVServe 证明了 per-head hybrid precision 可以实现 10× KV 压缩且保持 accuracy [kvserve]。GLM 的 vertex chunk 在跨 query 复用时需要持久驻留 HBM——如果对 P-III 级的 chunk 做 KVServe 式压缩存储、访问时解压,可以在相同 HBM 预算下存储 5–10× 更多的 chunk,大幅提升长尾图的 hit rate。Controller 的 analytical model 可以结合 GLM 的访问频率预测(哪些 vertex 是热门的)做 adaptive compression。
GLM 当前假设所有 agent 在同一 serving 实例上执行。但如果把 C-Agent/R-Agent/A-Agent 分布到不同节点(类似 PPD 的 P-D 分离),可以利用 PPD 的 "append-prefill 干扰极低" 发现 [2603.13358]——R-Agent 和 A-Agent 的短 prefix 可以在 decode 节点本地执行,只把长 notebook 的 KV 保留在 "notebook 节点"。这构成一种 "agent-disaggregated serving" 架构,每个 agent 类型有最优的节点类型。
ZeRO-Prefill 的饱和阈值 T 保证了 compute window 覆盖 AllGather [2605.02960]。GLM 可以借鉴类似思路——定义一个 "retrieval overlap 阈值":只要 A-Agent 的 decode token 数 ≥ T_retrieval(从 RetrieveNode 延迟标定),pipelining 保证成立。当 T_retrieval 不满足时(backbone 生成极短代码),系统应 fallback 到同步模式而非赌 overlap。这把 GLM §5.3 的"观察性假设"升级为 ZeRO-Prefill 式的"物理量保证"。
MFS 的 RMLQ 展示了"初始低优先级、条件性提升"比"初始高优先级、条件性降级"更优的调度哲学 [2603.17456]。GLM 当前的 P-IV(最先驱逐)是一种"初始低优先级"设计,但 P-II→P-III 的降级缺乏 MFS 式的量化紧迫度指标。如果为每个 notebook chunk 计算类似 MLU 的"复用紧迫度"(= 剩余 R-Agent 步数 × chunk 命中概率 / 可用 KV 空间),可以实现更精细的 within-priority 调度,尤其在高并发下减少 P-II 内部的误驱逐。