基于 9 篇论文综合,2026-05-26
2025–2026 年 LLM agent 处于从"单轮推理优化"到"多轮工作流系统工程"的关键跃迁期。生产系统以 Claude Code 为代表(极简 while-loop + 98.4% 确定性基础设施)[2604.14228],但其多轮 serving 的效率痛点正催生一个新兴研究集群:agent-aware KV cache 管理成为最活跃方向,5 篇论文(Continuum、SideQuest、CMV、SAGA、PBKV)分别从 TTL 机制、模型驱动淘汰、会话裁剪、工作流图预测、GNN 预测等角度攻击同一瓶颈——多轮 tool-call 间隙中 KV cache 的不当驱逐导致延迟膨胀 1.5–6×。与此同时,投机性工具执行(PASTE)和 CPU 侧瓶颈刻画(2511.00739)从执行层面补充了系统级优化视角,而 scheduler-theoretic 形式化(SGH)则为运行时架构提供了理论坐标系。
| 维度 | 轴 | 说明 |
|---|---|---|
| 优化层次 (Layer) | KV-Cache 管理 · 调度与执行 · 架构与形式化 | 系统栈中的操作位置 |
| 工作负载范围 (Scope) | 单 agent 多轮 · 多 agent 工作流 · 跨会话持久化 | 管理对象的粒度 |
| 决策机制 (Mechanism) | 统计/启发式 · 模型驱动 · 结构化预测 · 确定性规则 | 如何做出缓存/调度/执行决策 |
| 论文 | Layer | Scope | Mechanism |
|---|---|---|---|
| Continuum (2511.02230) | KV-Cache 管理 | 单 agent 多轮 | 统计模型 (TTL cost-benefit) |
| SideQuest (2602.22603) | KV-Cache 管理 | 单 agent 长 horizon | 模型驱动 (辅助 LRM 线程) |
| CMV (2602.22402) | KV-Cache 管理 | 跨会话持久化 | 确定性规则 (三遍裁剪) |
| SAGA (2605.00528) | KV-Cache 管理 + 调度 | 多 agent 工作流 (集群) | 结构化预测 (AEG DAG) |
| PBKV (2605.06472) | KV-Cache 管理 | 多 agent 工作流 | 结构化预测 (GraphSAGE) |
| CPU-Centric (2511.00739) | 调度与执行 | 单 agent serving | 统计 (throughput gain ratio) |
| PASTE (2603.18897) | 调度与执行 | 单 agent session | 统计 (pattern mining) |
| Claude Code (2604.14228) | 架构与形式化 | 跨会话持久化 | 确定性规则 (5 层 compaction) |
| SGH (2604.11378) | 架构与形式化 | 单 agent 运行时 | 确定性规则 (static DAG) |
核心洞察:agent workload 中 tool-call 间隙极短(平均 925ms–1923ms),但现有引擎的 end-of-turn eviction 导致下一轮必须重入队列,per-turn queueing delay 累积可占总延迟 58.2% [2511.02230]。
分支 A1:TTL 机制(Continuum)
为每个 tool-call 计算最优 KV 保留时间 $\tau^*$,平衡 reload 成本 + 排队延迟 vs 显存占用。memoryfulness factor $\eta$ 量化维持程序顺序的收益 [2511.02230]。效果:1.12–3.66× 延迟降低,真实 SWE-agent 8.18× [2511.02230]。
分支 A2:模型驱动语义淘汰(SideQuest)
让 LRM 自身判断哪些 tool response 已过期。并行辅助线程以触发短语切换到"记忆管理"模式,输出结构化删除命令 [2602.22603]。56–65% 峰值 token 降幅,non-completion rate 近零(vs heuristic 60%+)[2602.22603]。
分支 A3:会话级 context 裁剪(CMV)
面向跨会话 context 复用而非 serving 吞吐。DAG 版本控制 + 三遍流式裁剪保留对话结构、剥离机械性 tool 输出,均值 20% 缩减 [2602.22402]。
分支 A4:工作流图驱动集群调度(SAGA)
Agent Execution Graph 形式化工作流为 DAG,WA-LRU 评分融合 AEG 预测的复用概率,达到 Bélády 最优的 1.31× competitive ratio [2605.00528]。配合 session-affinity 路由和 Agent Fair Share 公平调度,集群 TCT 降低 1.64× [2605.00528]。
分支 A5:GNN 多步预测驱动(PBKV)
GraphSAGE 融合拓扑、历史前缀和 prefill 语义信号,$K$-step 联合预测 agent 调用分布。分层淘汰(退役缓存确定性淘汰 + 评分驱动概率淘汰)+ 保守预取,Lipschitz 退化保证 [2605.06472]。命中率 27%→69%,延迟 1.85× 加速 [2605.06472]。
分支 B1:CPU 侧瓶颈与调度(2511.00739)
工具执行占 E2E 延迟 35%–88%。COMB 微批重叠降低 3.9× 服务延迟(P50),MAS 异构调度保护少数请求类型尾延迟 2.37×/2.49× [2511.00739]。
分支 B2:投机性工具执行(PASTE)
Pattern Tuple $(C, T, f, p)$ 解耦 tool-call 的控制流与数据流,在 LLM"思考"时投机执行下一个 tool。E2E 延迟降低 48.5%,tool stall 减少 67% [2603.18897]。
分支 C1:生产系统逆向工程(Claude Code)
源码级识别 5 values → 13 principles → 实现选择映射。核心范式:"1.6% 决策逻辑 + 98.4% 确定性基础设施" [2604.14228]。
分支 C2:Scheduler-Theoretic 理论框架(SGH)
Agent Loop 本质是 $|\mathcal{U}| \leq 1$ 的 single-ready-unit scheduler。Structured Graph Harness 用静态 DAG + 三级 recovery + plan versioning 实现有界终止和条件正确性 [2604.11378]。
| 论文 | 优化目标 | 核心机制 | 主要指标 | 工作负载 | 硬件 | 代码开源 | 可复现性 |
|---|---|---|---|---|---|---|---|
| Continuum (2511.02230) | 多轮延迟 | KV TTL + program FCFS | 1.12–3.66× 延迟↓, 8.18×(real) | SWE-Bench, BFCL, OpenHands | H100 | 开源 (vllm-continuum) | 可复现 |
| SideQuest (2602.22603) | Token/KV 压缩 | 辅助 LRM 线程语义淘汰 | 56–65% token↓, +83.9% 吞吐 | FRAMES, BrowseComp | H100 | 未公开 | 不可 |
| CMV (2602.22402) | 会话 context 复用 | DAG 版本控制 + 三遍裁剪 | 均值 20% token↓, 10 轮 break-even | 76 Claude Code 会话 | N/A (客户端) | 开源 (claude-code-cmv) | 部分 |
| SAGA (2605.00528) | 集群 TCT | AEG + WA-LRU + session-affinity + AFS | 1.64× TCT↓, 1.31× vs Bélády | SWE-Bench, WebArena | 64×A100 | 未公开 | 不可 |
| PBKV (2605.06472) | 缓存命中率/延迟 | GraphSAGE 预测 + 分层淘汰 | 2.55× 命中率↑, 1.85× 延迟↓ | HoVer, SWE-Bench, FinanceBench | 8×A6000 | 未公开 | 不可 |
| CPU-Centric (2511.00739) | CPU-GPU 平衡 | COMB 微批 + MAS 异构队列 | 3.9× P50↓, 2.49× P90↓ | 5 种 agentic workload | GNR+RTX6000, Grace+H200 | 未公开 | 部分 |
| PASTE (2603.18897) | Tool stall 隐藏 | Pattern mining + 投机执行 | 48.5% E2E↓, 1.8× tool 吞吐 | DeepResearchBench, SWE-bench | 32×A100 | 未公开 | 不可 |
| Claude Code (2604.14228) | 架构分析 | 源码逆向工程 | 定性 (1.6% vs 98.4% 比例) | Claude Code v2.1.88 | N/A | 分析对象开源 | N/A |
| SGH (2604.11378) | 形式化框架 | Scheduler 五元组 + 静态 DAG | 理论 (有界终止证明) | 无实验 | N/A | 未公开 | 不可 |
| 论文 | Strength | Weakness | Best-for |
|---|---|---|---|
| Continuum | 简洁的 cost-benefit 模型;模块化插件式实现;改善随 turn 数放大 | 无形式化 competitive ratio;仅 ReAct 范式 | 高 turn 数 coding/tool-calling agent,vLLM 部署 |
| SideQuest | 语义级淘汰精度远超 heuristic;消除 non-completion 崩溃;仅 215 样本训练 | 单模型 (gpt-oss-20b);辅助线程 GPU 开销未量化;未开源 | 长 horizon deep research agent,显存受限单卡 |
| CMV | 跨会话 context 复用独特价值;确定性保证 API 正确性 | 单用户验证 (n=1);无 benchmark 评估;主价值(branching)未量化 | 长期 coding agent session 管理,手动触发 |
| SAGA | 集群级完整解决方案;Lyapunov 公平性证明;接近 Bélády 最优 | 高实现复杂度 (8.5K+1.2K LOC);~30% 吞吐损失;未开源 | 多租户 GPU 集群部署大规模 agent workload |
| PBKV | Lipschitz 退化保证;跨工作流聚合;动态+静态工作流均适用 | 仅 A6000 验证;预测器需 per-workload 训练 (1K traces);未开源 | 动态多 agent 工作流(含重试循环/条件分支) |
| CPU-Centric | 首次系统性 CPU 瓶颈刻画;COMB/MAS 通用性强 | 仅 ≤32B SLM;$B_{cap}$ 静态配置;未涉及 multi-turn KV | CPU-heavy tool workload 的初始部署调优 |
| PASTE | 48.5% 延迟降低;资源开销极低;无侵入 middleware | Top-1 准确率仅 27.8%;pattern pool 冷启动问题;side-effect policy 需手动 | 模式稳定的 ReAct agent(coding, research) |
| Claude Code | 唯一源码级生产系统分析;完整 values→principles→impl 映射 | 静态快照 (v2.1.88);无量化实验;逆向工程认知局限 | 理解生产 agent 设计决策,启发新系统设计 |
| SGH | 统一 scheduler 理论框架;有界终止+条件正确性证明 | 纯 position paper 无实验;静态 DAG 不适合 exploratory 任务 | 需要可审计性/有界终止的工程流程 agent |
Continuum 的 TTL 机制量化了这一 trade-off:$\tau^*$ 在 "命中概率 × (reload 成本 + 排队延迟)" 与 "显存占用阻塞代价" 之间取最优 [2511.02230]。SAGA 的 WA-LRU 类似但融合了工作流级预测 [2605.00528]。SideQuest 通过语义理解将此 trade-off 从"统计猜测"提升为"有根据的判断",但代价是额外的辅助线程 GPU 开销 [2602.22603]。PBKV 的 Lipschitz 界 $\mathcal{R}(B) \leq \frac{1}{2(1-\gamma)} \sum \epsilon_c^\gamma$ 首次将此 trade-off 的遗憾正式约束 [2605.06472]。
数值参照:SAGA 实测 GPU 利用率从 42% 提升至 71%(+29pp),同时 TCT 降低 1.64× [2605.00528];Continuum 的 TTL 过期后自动驱逐限制了最坏情况下的显存占用 [2511.02230]。
PBKV 的分层设计正式化了此轴:退役缓存淘汰提供 prediction-free 基线(单独贡献 1.66× 命中率提升),评分驱动淘汰的收益随预测精度连续增加但不断崖式下降 [2605.06472]。SAGA 的 AEG 在无 framework hints 时仍达 87% accuracy,但 TCT 退化 15.6% [2605.00528]。PASTE 的 Top-1 准确率仅 27.8%,但通过多候选投机达到 93.8% overall hit rate——tradeoff 是用资源换覆盖率 [2603.18897]。SideQuest 通过模型自身做预测避免了统计方法的 distribution shift 问题,但引入了对 LRM 能力的强依赖 [2602.22603]。
Agent Loop($|\mathcal{U}|=1$, non-det)拥有最大灵活性但无结构化保证 [2604.11378]。SGH($|\mathcal{U}| \geq 1$, det)通过静态 DAG 获得并行+有界终止,但放弃动态拓扑 [2604.11378]。Claude Code 选 Agent Loop + maximal harness 中间路线:不约束推理但用 7 层安全管道兜底 [2604.14228]。量化参照:SGH 作者自估 60%–70% 任务实际是线性链 [2604.11378];Claude Code 27% 任务属"无此工具就不会尝试"的质变工作 [2604.14228]。
当 CPU 工具执行占 E2E 延迟 88% 时,GPU kernel 优化上限仅 12% [2511.00739]。KV cache 优化(轴 1-2)攻击 GPU 侧;COMB/MAS 攻击 CPU-GPU 调度 [2511.00739];PASTE 通过时间重叠同时减少两侧 stall [2603.18897]。GPU 越强(H200/B200),CPU 瓶颈越突出——Toolformer 推理占比从 Sys1 88% 降至 Sys2 77% [2511.00739]。
Continuum 声称 TTL 应由 cost-benefit 模型决定,tool call 在 TTL 内返回则 KV 被保留 [2511.02230]。但 SideQuest 的核心论点是 token 重要性非单调——某些 tool response 在第 $t$ 轮看似无用但到第 $t+n$ 轮可能重新变关键 [2602.22603]。两者冲突的根源在于:Continuum 假设 KV 的价值可由时间维度(tool latency CDF)近似,SideQuest 认为必须由语义维度(内容是否仍被需要)决定。
矛盾根源:实验 workload 不同。Continuum 的 SWE-Bench/BFCL 是 function-calling agent(context 增长温和,6–11 turns),SideQuest 的 FRAMES/BrowseComp 是 deep research agent(高达 80+ turns,context 120K+ tokens)。在短 horizon + 规律 tool call 场景下时间维度足够;在长 horizon + 非单调 utility 场景下语义维度不可或缺。两者在各自 workload 内都正确。
SAGA 用 Agent Execution Graph(DAG)预测 KV 复用,假设工作流模式可被建模为有向图 [2605.00528]。但 PBKV 明确批评"静态 DAG 假设无法处理运行时条件分支和重试循环",因为真实工作流中 agent 调用序列取决于上下文 [2605.06472]。PBKV 的 GNN 多步预测在动态工作流上命中率 69% vs KVFlow(静态距离)的 39.87% [2605.06472]。
矛盾根源:SAGA 的 AEG 实际上支持backward retry edges 和 transition probabilities(不是纯静态 DAG),能覆盖部分动态性 [2605.00528]。PBKV 的批评更准确地针对 KVFlow 而非 SAGA。但 SAGA 的 competitive ratio 1.31× 是在 SWE-bench(相对结构化的 coding agent)上测得,对高度动态的重试密集型工作流是否仍接近最优未经验证。
SGH 论证 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),认为只有显式 DAG 才能根本解决 [2604.11378]。但 Claude Code 的生产成功恰恰建立在 Agent Loop 之上,通过 5 层 compaction + 7 层安全 + append-only transcript 实现了高度的 production readiness [2604.14228]。
矛盾根源:对 LLM 判断力的信任程度不同。SGH 假设 LLM 决策"不可检查"(non-det $\mathcal{P}$);Claude Code 假设 frontier 模型有"good judgment"并用确定性 harness 兜底。Claude Code 的 93% approval rate 恰恰暴露了 Agent Loop 的脆弱性——一旦模型犯错,唯一防线是人类审批,而 approval fatigue 使其无效 [2604.14228]。SGH 的"有界终止"保证在 Agent Loop 中不存在等价物。
基于 Taxonomy 网格(Layer × Scope × Mechanism),以下组合是技术上可做但尚无人做的空白:
| # | Gap 描述 | 空白位置 (Layer × Scope × Mechanism) | 技术可行性依据 |
|---|---|---|---|
| 1 | 跨 turn KV 管理 + CPU 调度联合优化 | KV-Cache × 单 agent 多轮 × 统计模型 | Continuum 做了 KV TTL、COMB 做了 CPU 调度,但两者完全独立。联合优化(TTL 到期时考虑 CPU 工具队列状态)可进一步减少排队气泡。 |
| 2 | 模型驱动淘汰在集群级部署 | KV-Cache × 多 agent 工作流 × 模型驱动 | SideQuest 在单卡证明了语义淘汰的优越性,SAGA 在 64-GPU 集群部署了统计方法。将辅助 LRM 线程推广到分布式环境需要解决 fork 成本和通信开销。 |
| 3 | Pattern-based 投机执行 + 工作流预测联合 | 调度 × 多 agent 工作流 × 结构化预测 | PASTE 的 pattern mining 和 PBKV 的 GraphSAGE 预测独立运作。pattern 预测可同时指导投机执行和缓存预取决策。 |
| 4 | 动态自适应 $B_{cap}$/TTL/K 参数 | 调度 × 单 agent × 统计模型 | COMB 的 $B_{cap}$、Continuum 的 TTL、PBKV 的 $K$ 都是静态或半静态。基于实时 workload 反馈的控制器(类似 TCP congestion control)技术上直接可做。 |
| 5 | SGH 形式化的实验验证 | 架构 × 单 agent × 确定性规则 | 论文已设计完整 7 组对照 protocol (G0–G6) [2604.11378],缺的只是实现和实验。 |
| 6 | 会话级 context 管理的自动化触发 | KV-Cache × 跨会话 × 模型驱动 | CMV 依赖手动 snapshot/branch/trim。自动检测 context 膨胀并触发裁剪(类似 GC)技术上可由 budget reduction 阈值实现。 |
选 Continuum — 模块化 vLLM 插件、已开源、改善随 turn 数放大(5× turns → 3.7×)[2511.02230]。如果 turn 数 ≤5,改善有限(1.6×),此时应评估是否值得集成。
选 SideQuest — 56–65% 峰值 token 降幅 + 近零 non-completion rate 的组合在此场景无竞争者 [2602.22603]。注意需要 LoRA 微调辅助线程(215 traces),且当前仅在 gpt-oss-20b 验证。
选 SAGA 设计思路 — workflow-as-unit 调度 + AFS 公平性是集群场景的核心需求(SLO attainment 67.3% → 99.2%)[2605.00528]。注意未开源,需自研且接受 ~30% 吞吐 tradeoff。
选 PBKV 设计思路 — 分层淘汰的"确定性护栏 + 概率系统"在预测不准确时退化至生命周期感知而非 LRU,稳健性最优 [2605.06472]。需 ~1K 训练轨迹进行 predictor 训练。
先做 COMB 微批调度,再叠加 PASTE 投机执行 — COMB 在 serving 层面降低 CPU over-subscription(3.9× P50)[2511.00739],PASTE 在 session 层面通过 pattern-based speculation 进一步隐藏 tool stall(48.5% E2E↓)[2603.18897]。两者在不同层次操作,收益可叠加。
考虑 SGH 的三级 recovery + plan versioning 原则 — 借鉴其 "planning/execution/recovery 三层分离" 和 "跳级禁止" 的设计理念 [2604.11378]。注意这仍是 position paper 无实验验证,建议作为设计指导而非直接复用。
| ID | 标题 | 子主题 | 日期 |
|---|---|---|---|
| [ref:2511.02230] | Continuum: KV Cache TTL for Multi-Turn Agent Serving | KV TTL, program-FCFS | 2025-11 |
| [ref:2602.22402] | CMV: DAG State Management and Structurally Lossless Trimming | 会话裁剪, DAG 版本控制 | 2026-02 |
| [ref:2602.22603] | SideQuest: Model-Driven KV Cache Management | 辅助 LRM 线程, 语义淘汰 | 2026-02 |
| [ref:2604.14228] | Dive into Claude Code: Design Space of AI Agent Systems | 生产架构分析, 安全 | 2026-04 |
| [ref:2605.00528] | SAGA: Workflow-Atomic Scheduling for Agent Inference | AEG, WA-LRU, AFS 公平 | 2026-05 |
| [ref:2605.06472] | PBKV: Prediction-Based KV-Cache for Dynamic Workflows | GraphSAGE 预测, 分层淘汰 | 2026-05 |
| [ref:2511.00739] | CPU-Centric Perspective on Agentic AI Execution | CPU 瓶颈, COMB, MAS | 2025-11 |
| [ref:2603.18897] | PASTE: Pattern-Aware Speculative Tool Execution | 投机执行, pattern mining | 2026-03 |
| [ref:2604.11378] | From Agent Loops to Structured Graphs (SGH) | Scheduler 理论, 静态 DAG | 2026-04 |