本综述(2024-12)构建了 KV cache 管理的 token/model/system 三层 taxonomy [2412.19442],覆盖 100+ 方法。此后 6 个月内,8 篇工作在该 taxonomy 的不同象限产生了重大进展:
| 论文 | 定位 | 与 taxonomy 的映射 |
|---|---|---|
| Continuum (2511.02230) | Agent 多轮 KV TTL 调度 | System-level → Scheduling |
| SAGA (2605.00528) | 工作流级 KV 驱逐 + 分布式调度 | System-level → Scheduling + Memory Mgmt |
| SideQuest (2602.22603) | 语义驱动 KV 驱逐 | Token-level → Selection(但超越 attention score) |
| PBKV (2605.06472) | GNN 预测多 agent KV 管理 | System-level → Scheduling(预测增强) |
| DualPath (2602.21548) | 双路径 KV 加载通路 | System-level → Hardware-aware |
| KVServe (code) | Service-aware KV 压缩 | Token-level → Quantization + System-level |
| PrfaaS (2604.15039) | 跨 DC Prefill-as-a-Service | System-level → Hardware-aware + Scheduling |
| DeepSeek-V4 (deepseek-v4) | CSA+HCA 压缩注意力 | Model-level → Architecture |
这些后续工作共同暴露了综述 taxonomy 的一个结构性缺陷:workload-awareness 不是正交的第四维度,而是贯穿三层的必要条件。综述将调度归入 system-level [2412.19442],但 Continuum/SAGA/PBKV 证明调度策略必须深度耦合 token-level 语义(哪些 KV 有价值)和 model-level 架构特征(MLA/GQA 的 KV 结构)。
综述在 system-level scheduling 部分覆盖了 RadixAttention 和 FastServe [2412.19442],但这些方法假设单轮请求独立。Continuum 揭示了 agent workload 的根本不同:tool call 间隙仅 ~1s 但被当作请求结束驱逐 KV,per-turn queueing delay 累积占总延迟 58.2% [2511.02230]。SAGA 进一步将工作流建模为 DAG,以 AEG 预测复用概率,实现 1.31× Bélády-optimal competitive ratio [2605.00528]。PBKV 则用 GNN 做多步预测,以 Lipschitz 退化保证确保预测错误时不会比 LRU 更差 [2605.06472]。
Delta: 综述的 scheduling 讨论停留在"prefix-aware 避免重复计算"层面,而 2025-2026 的工作将其推进到"跨轮/跨 agent 的 KV 生命周期管理"——核心转变是从"cache or not"到"cache for how long and at what cost"。
综述对 token-level selection 方法的分类基于 attention score 代理(H2O/StreamingLLM/SnapKV)[2412.19442]。SideQuest 打破了这一假设:让 LRM 自身判断 tool response 是否过期,用并行辅助线程做语义推理 eviction,实现 56-65% peak token 降幅且 non-completion rate 近零 [2602.22603]。关键发现是 agentic 上下文中 token utility 是非单调的——heuristic 方法在此场景下导致 60%+ non-completion rate [2602.22603]。
Delta: 综述将 selection 归类为"基于注意力稀疏性"的统一框架,但 SideQuest 证明对 multi-turn agent workload,语义理解 >> 统计代理。
综述覆盖了 MLA/GQA/CLA 等 model-level grouping/sharing 方案 [2412.19442],但 DeepSeek-V4 将这条路线推向极致:CSA(4× 序列压缩 + sparse top-k)和 HCA(128× 序列压缩 + dense attend)的 interleave 实现 KV cache 仅为 V3.2 的 10%(V4-Pro)和 7%(V4-Flash)[deepseek-v4]。这已超出综述讨论的"per-head KV 减少"范式,进入"序列维度压缩 + 选择性丢弃"的新领域。
Delta: 综述将 model-level 方法定义为"需要重训"的代价,但 V4 展示了当压缩比足够极端(128×)时,模型架构本身成为最有效的 KV cache 管理机制。
综述覆盖了 PagedAttention/vTensor 等内存管理 [2412.19442],但 DualPath 和 PrfaaS 揭示了一个全新瓶颈层:网络/存储带宽。DualPath 发现 PD 分离架构下 PE SNIC 持续饱和而 DE SNIC 空闲,通过双路径 KV 加载实现 1.87× 吞吐提升 [2602.21548]。PrfaaS 进一步将 PD 分离扩展到跨 DC Ethernet,配合混合注意力将 KV throughput 降至 ~3 Gbps 使跨 DC 传输可行 [2604.15039]。KVServe 则在传输层做 service-aware 压缩,最高 10× KV 压缩比 [kvserve]。
Delta: 综述的 system-level 讨论局限于单机 GPU 内存管理。2026 年的实践表明 KV cache 已从"内存问题"演变为"分布式数据流问题"——涉及 RDMA、InfiniBand QoS、跨 DC routing 等网络层面的优化。
综述声称 token/model/system 三层"正交可组合" [2412.19442]。但后续工作证明三层之间存在强耦合:
三层"正交"的假设使得综述未能识别跨层集成的最佳实践模式。
综述的核心假设是"注意力具有内在稀疏性" [2412.19442]——Figure 4 展示大部分 attention weight 集中在少数 token 上。但 SideQuest 的实验表明,在 agentic 长推理场景下 token utility 是非单调的——某个 tool response 在第 t 轮看似无用,到第 t+n 轮合成答案时可能重新变关键 [2602.22603]。
矛盾根源: 综述的实验基础是 single-turn QA/摘要任务,attention 模式相对静态。Agent workload 引入了跨轮的动态依赖关系,静态 attention score 无法捕获这种时序演化。Continuum 的 memoryfulness factor η 量化了这种效应 [2511.02230]。
综述汇总的 23 个 benchmark [2412.19442] 全部面向单轮 QA/摘要/检索任务。但 2025-2026 的 KV cache 优化工作几乎全部以 agent benchmark 为评估主线:SWE-bench(SAGA/Continuum/DualPath)、WebArena(SAGA)、BFCL(Continuum)、FRAMES/BrowseComp(SideQuest)。
综述自身未做实验也是一个结构性弱点——无法验证其 taxonomy 下不同方法组合的交互效应。
综述将 eviction 策略归类为"永久驱逐"和"非永久"两支 [2412.19442],但未量化错误 eviction 的严重性。SideQuest 的实验揭示 heuristic eviction 在 BrowseComp 上导致 60%+ non-completion rate(模型输出不可解析)[2602.22603]。PBKV 的 Lipschitz 退化保证 [2605.06472] 是第一个在 KV eviction 中提供形式化鲁棒性保证的工作——这正是综述未能预见的需求。
综述发表时(2024-12),KV cache 研究以压缩率为核心指标——INT4 量化 4×、MLKV 跨层共享 ~100×、MLA latent compression 等。到 2026 年中,焦点已转向生命周期管理:
综述作为 taxonomy 基准 仍有价值——后续所有论文都在其框架内定位自己。但作为 方法论指南 已经过时——它推荐的"跨层级集成"方向虽然正确 [2412.19442],但具体路径(agent-aware scheduling + semantic eviction + architecture co-design)远超其预见。
综述在 survey 赛道 中仍是 KV cache 领域最完整的参考(100+ 方法、23 benchmarks)。但其时效性约束明显——2025-2026 年出现的 agent-aware 范式、disaggregated serving、architecture-level compression(V4 CSA/HCA)均未覆盖。
基于综述的 taxonomy gap 和后续工作的进展,以下方向尚未被充分探索:
Continuum 用 cost-benefit model 计算最优 TTL [2511.02230],SideQuest 用 LRM 做语义 eviction [2602.22603]。两者正交且互补:TTL 管理"何时释放",semantic eviction 管理"释放什么"。将 SideQuest 的辅助线程输出作为 Continuum TTL 决策的信号源(semantic-aware benefit estimation),或用 PBKV 的 GNN predictor [2605.06472] 同时输出"which KV to keep"和"for how long"。
DeepSeek-V4 的异构 KV cache 布局(State Cache + Classical KV Cache)[deepseek-v4] 打破了 PagedAttention 的均匀 block 假设。DualPath [2602.21548] 和 PrfaaS [2604.15039] 的 KV 传输优化假设 KV 是 dense tensor——CSA/HCA 的压缩 KV 需要全新的传输和缓存策略。如何为 V4 风格的压缩注意力设计原生支持的 serving 框架,是 system-level 最迫切的开放问题。
SAGA 的 AEG 假设同一 session 内的 agent 共用上下文 [2605.00528]。但 multi-model multi-agent 场景(一个 router model 调度多个 specialist model)中,不同模型的 KV cache 格式不兼容(MLA vs GQA vs CSA)。KVServe 的模块化压缩 pipeline [kvserve] 提供了 KV 格式转换的工程参考,但缺乏 cross-architecture KV 语义映射的理论基础。
PBKV 提供了单一策略的 Lipschitz 退化保证 [2605.06472]。但实际系统需要组合多种策略(如 TTL + score-driven eviction + lifecycle-aware retirement)。组合策略的 competitive ratio 如何推导?是否存在类似 algorithms-with-predictions 框架下的通用组合定理?这连接了在线算法理论和系统实践。
PrfaaS 展示了混合注意力将 $\Phi_{\text{kv}}$ 从 ~60 Gbps 降到 ~3 Gbps 使跨 DC 传输可行 [2604.15039]。KVServe 在传输层进一步做 service-aware 压缩 [kvserve]。将两者统一——模型架构(compression ratio m)和 serving 策略(quantization bits, codec choice)联合优化以匹配目标网络带宽——是一个同时涉及 model-level 和 system-level 的跨层设计问题。DualPath 的 Eq.9 约束 [2602.21548] 提供了带宽分析的数学框架,可作为联合优化的约束条件。