agent Survey

9 papers

Agent 类别综述 #

基于 9 篇论文综合,2026-05-26

§1 现状快照 #

2025–2026 年 LLM agent 处于从"单轮推理优化"到"多轮工作流系统工程"的关键跃迁期。生产系统以 Claude Code 为代表(极简 while-loop + 98.4% 确定性基础设施)[2604.14228],但其多轮 serving 的效率痛点正催生一个新兴研究集群:agent-aware KV cache 管理成为最活跃方向,5 篇论文(Continuum、SideQuest、CMV、SAGA、PBKV)分别从 TTL 机制、模型驱动淘汰、会话裁剪、工作流图预测、GNN 预测等角度攻击同一瓶颈——多轮 tool-call 间隙中 KV cache 的不当驱逐导致延迟膨胀 1.5–6×。与此同时,投机性工具执行(PASTE)和 CPU 侧瓶颈刻画(2511.00739)从执行层面补充了系统级优化视角,而 scheduler-theoretic 形式化(SGH)则为运行时架构提供了理论坐标系。


§2 Taxonomy #

维度定义 #

维度说明
优化层次 (Layer)KV-Cache 管理 · 调度与执行 · 架构与形式化系统栈中的操作位置
工作负载范围 (Scope)单 agent 多轮 · 多 agent 工作流 · 跨会话持久化管理对象的粒度
决策机制 (Mechanism)统计/启发式 · 模型驱动 · 结构化预测 · 确定性规则如何做出缓存/调度/执行决策

论文在 Taxonomy 中的位置 #

论文LayerScopeMechanism
Continuum (2511.02230)KV-Cache 管理单 agent 多轮统计模型 (TTL cost-benefit)
SideQuest (2602.22603)KV-Cache 管理单 agent 长 horizon模型驱动 (辅助 LRM 线程)
CMV (2602.22402)KV-Cache 管理跨会话持久化确定性规则 (三遍裁剪)
SAGA (2605.00528)KV-Cache 管理 + 调度多 agent 工作流 (集群)结构化预测 (AEG DAG)
PBKV (2605.06472)KV-Cache 管理多 agent 工作流结构化预测 (GraphSAGE)
CPU-Centric (2511.00739)调度与执行单 agent serving统计 (throughput gain ratio)
PASTE (2603.18897)调度与执行单 agent session统计 (pattern mining)
Claude Code (2604.14228)架构与形式化跨会话持久化确定性规则 (5 层 compaction)
SGH (2604.11378)架构与形式化单 agent 运行时确定性规则 (static DAG)

§3 主线与分支 #

主线 A:Agent-Aware KV Cache 管理(5 篇) #

核心洞察:agent workload 中 tool-call 间隙极短(平均 925ms–1923ms),但现有引擎的 end-of-turn eviction 导致下一轮必须重入队列,per-turn queueing delay 累积可占总延迟 58.2% [2511.02230]

分支 A1:TTL 机制(Continuum)

为每个 tool-call 计算最优 KV 保留时间 $\tau^*$,平衡 reload 成本 + 排队延迟 vs 显存占用。memoryfulness factor $\eta$ 量化维持程序顺序的收益 [2511.02230]。效果:1.12–3.66× 延迟降低,真实 SWE-agent 8.18× [2511.02230]

分支 A2:模型驱动语义淘汰(SideQuest)

让 LRM 自身判断哪些 tool response 已过期。并行辅助线程以触发短语切换到"记忆管理"模式,输出结构化删除命令 [2602.22603]。56–65% 峰值 token 降幅,non-completion rate 近零(vs heuristic 60%+)[2602.22603]

分支 A3:会话级 context 裁剪(CMV)

面向跨会话 context 复用而非 serving 吞吐。DAG 版本控制 + 三遍流式裁剪保留对话结构、剥离机械性 tool 输出,均值 20% 缩减 [2602.22402]

分支 A4:工作流图驱动集群调度(SAGA)

Agent Execution Graph 形式化工作流为 DAG,WA-LRU 评分融合 AEG 预测的复用概率,达到 Bélády 最优的 1.31× competitive ratio [2605.00528]。配合 session-affinity 路由和 Agent Fair Share 公平调度,集群 TCT 降低 1.64× [2605.00528]

分支 A5:GNN 多步预测驱动(PBKV)

GraphSAGE 融合拓扑、历史前缀和 prefill 语义信号,$K$-step 联合预测 agent 调用分布。分层淘汰(退役缓存确定性淘汰 + 评分驱动概率淘汰)+ 保守预取,Lipschitz 退化保证 [2605.06472]。命中率 27%→69%,延迟 1.85× 加速 [2605.06472]

主线 B:Agent 执行效率优化(2 篇) #

分支 B1:CPU 侧瓶颈与调度(2511.00739)

工具执行占 E2E 延迟 35%–88%。COMB 微批重叠降低 3.9× 服务延迟(P50),MAS 异构调度保护少数请求类型尾延迟 2.37×/2.49× [2511.00739]

分支 B2:投机性工具执行(PASTE)

Pattern Tuple $(C, T, f, p)$ 解耦 tool-call 的控制流与数据流,在 LLM"思考"时投机执行下一个 tool。E2E 延迟降低 48.5%,tool stall 减少 67% [2603.18897]

主线 C:Agent 架构与运行时形式化(2 篇) #

分支 C1:生产系统逆向工程(Claude Code)

源码级识别 5 values → 13 principles → 实现选择映射。核心范式:"1.6% 决策逻辑 + 98.4% 确定性基础设施" [2604.14228]

分支 C2:Scheduler-Theoretic 理论框架(SGH)

Agent Loop 本质是 $|\mathcal{U}| \leq 1$ 的 single-ready-unit scheduler。Structured Graph Harness 用静态 DAG + 三级 recovery + plan versioning 实现有界终止和条件正确性 [2604.11378]


§4 跨论文对比表 #

论文优化目标核心机制主要指标工作负载硬件代码开源可复现性
Continuum (2511.02230)多轮延迟KV TTL + program FCFS1.12–3.66× 延迟↓, 8.18×(real)SWE-Bench, BFCL, OpenHandsH100开源 (vllm-continuum)可复现
SideQuest (2602.22603)Token/KV 压缩辅助 LRM 线程语义淘汰56–65% token↓, +83.9% 吞吐FRAMES, BrowseCompH100未公开不可
CMV (2602.22402)会话 context 复用DAG 版本控制 + 三遍裁剪均值 20% token↓, 10 轮 break-even76 Claude Code 会话N/A (客户端)开源 (claude-code-cmv)部分
SAGA (2605.00528)集群 TCTAEG + WA-LRU + session-affinity + AFS1.64× TCT↓, 1.31× vs BéládySWE-Bench, WebArena64×A100未公开不可
PBKV (2605.06472)缓存命中率/延迟GraphSAGE 预测 + 分层淘汰2.55× 命中率↑, 1.85× 延迟↓HoVer, SWE-Bench, FinanceBench8×A6000未公开不可
CPU-Centric (2511.00739)CPU-GPU 平衡COMB 微批 + MAS 异构队列3.9× P50↓, 2.49× P90↓5 种 agentic workloadGNR+RTX6000, Grace+H200未公开部分
PASTE (2603.18897)Tool stall 隐藏Pattern mining + 投机执行48.5% E2E↓, 1.8× tool 吞吐DeepResearchBench, SWE-bench32×A100未公开不可
Claude Code (2604.14228)架构分析源码逆向工程定性 (1.6% vs 98.4% 比例)Claude Code v2.1.88N/A分析对象开源N/A
SGH (2604.11378)形式化框架Scheduler 五元组 + 静态 DAG理论 (有界终止证明)无实验N/A未公开不可

§5 Strength-Weakness Matrix #

论文StrengthWeaknessBest-for
Continuum简洁的 cost-benefit 模型;模块化插件式实现;改善随 turn 数放大无形式化 competitive ratio;仅 ReAct 范式高 turn 数 coding/tool-calling agent,vLLM 部署
SideQuest语义级淘汰精度远超 heuristic;消除 non-completion 崩溃;仅 215 样本训练单模型 (gpt-oss-20b);辅助线程 GPU 开销未量化;未开源长 horizon deep research agent,显存受限单卡
CMV跨会话 context 复用独特价值;确定性保证 API 正确性单用户验证 (n=1);无 benchmark 评估;主价值(branching)未量化长期 coding agent session 管理,手动触发
SAGA集群级完整解决方案;Lyapunov 公平性证明;接近 Bélády 最优高实现复杂度 (8.5K+1.2K LOC);~30% 吞吐损失;未开源多租户 GPU 集群部署大规模 agent workload
PBKVLipschitz 退化保证;跨工作流聚合;动态+静态工作流均适用仅 A6000 验证;预测器需 per-workload 训练 (1K traces);未开源动态多 agent 工作流(含重试循环/条件分支)
CPU-Centric首次系统性 CPU 瓶颈刻画;COMB/MAS 通用性强仅 ≤32B SLM;$B_{cap}$ 静态配置;未涉及 multi-turn KVCPU-heavy tool workload 的初始部署调优
PASTE48.5% 延迟降低;资源开销极低;无侵入 middlewareTop-1 准确率仅 27.8%;pattern pool 冷启动问题;side-effect policy 需手动模式稳定的 ReAct agent(coding, research)
Claude Code唯一源码级生产系统分析;完整 values→principles→impl 映射静态快照 (v2.1.88);无量化实验;逆向工程认知局限理解生产 agent 设计决策,启发新系统设计
SGH统一 scheduler 理论框架;有界终止+条件正确性证明纯 position paper 无实验;静态 DAG 不适合 exploratory 任务需要可审计性/有界终止的工程流程 agent

§6 核心 Trade-off 轴 #

轴 1:缓存保留激进度 vs 显存利用率 #

Continuum 的 TTL 机制量化了这一 trade-off:$\tau^*$ 在 "命中概率 × (reload 成本 + 排队延迟)" 与 "显存占用阻塞代价" 之间取最优 [2511.02230]。SAGA 的 WA-LRU 类似但融合了工作流级预测 [2605.00528]。SideQuest 通过语义理解将此 trade-off 从"统计猜测"提升为"有根据的判断",但代价是额外的辅助线程 GPU 开销 [2602.22603]。PBKV 的 Lipschitz 界 $\mathcal{R}(B) \leq \frac{1}{2(1-\gamma)} \sum \epsilon_c^\gamma$ 首次将此 trade-off 的遗憾正式约束 [2605.06472]

数值参照:SAGA 实测 GPU 利用率从 42% 提升至 71%(+29pp),同时 TCT 降低 1.64× [2605.00528];Continuum 的 TTL 过期后自动驱逐限制了最坏情况下的显存占用 [2511.02230]

轴 2:预测精度 vs 鲁棒性 #

PBKV 的分层设计正式化了此轴:退役缓存淘汰提供 prediction-free 基线(单独贡献 1.66× 命中率提升),评分驱动淘汰的收益随预测精度连续增加但不断崖式下降 [2605.06472]。SAGA 的 AEG 在无 framework hints 时仍达 87% accuracy,但 TCT 退化 15.6% [2605.00528]。PASTE 的 Top-1 准确率仅 27.8%,但通过多候选投机达到 93.8% overall hit rate——tradeoff 是用资源换覆盖率 [2603.18897]。SideQuest 通过模型自身做预测避免了统计方法的 distribution shift 问题,但引入了对 LRM 能力的强依赖 [2602.22603]

轴 3:表达力 vs 可控性 #

Agent Loop($|\mathcal{U}|=1$, non-det)拥有最大灵活性但无结构化保证 [2604.11378]。SGH($|\mathcal{U}| \geq 1$, det)通过静态 DAG 获得并行+有界终止,但放弃动态拓扑 [2604.11378]。Claude Code 选 Agent Loop + maximal harness 中间路线:不约束推理但用 7 层安全管道兜底 [2604.14228]。量化参照:SGH 作者自估 60%–70% 任务实际是线性链 [2604.11378];Claude Code 27% 任务属"无此工具就不会尝试"的质变工作 [2604.14228]

轴 4:GPU 侧优化 vs CPU-GPU 协同 #

当 CPU 工具执行占 E2E 延迟 88% 时,GPU kernel 优化上限仅 12% [2511.00739]。KV cache 优化(轴 1-2)攻击 GPU 侧;COMB/MAS 攻击 CPU-GPU 调度 [2511.00739];PASTE 通过时间重叠同时减少两侧 stall [2603.18897]。GPU 越强(H200/B200),CPU 瓶颈越突出——Toolformer 推理占比从 Sys1 88% 降至 Sys2 77% [2511.00739]


§7 冲突与调和 #

冲突 1:KV cache 应该保留多久? #

Continuum 声称 TTL 应由 cost-benefit 模型决定,tool call 在 TTL 内返回则 KV 被保留 [2511.02230]。但 SideQuest 的核心论点是 token 重要性非单调——某些 tool response 在第 $t$ 轮看似无用但到第 $t+n$ 轮可能重新变关键 [2602.22603]。两者冲突的根源在于:Continuum 假设 KV 的价值可由时间维度(tool latency CDF)近似,SideQuest 认为必须由语义维度(内容是否仍被需要)决定。

矛盾根源:实验 workload 不同。Continuum 的 SWE-Bench/BFCL 是 function-calling agent(context 增长温和,6–11 turns),SideQuest 的 FRAMES/BrowseComp 是 deep research agent(高达 80+ turns,context 120K+ tokens)。在短 horizon + 规律 tool call 场景下时间维度足够;在长 horizon + 非单调 utility 场景下语义维度不可或缺。两者在各自 workload 内都正确。

冲突 2:静态 DAG vs 动态工作流——谁更适合 KV 管理? #

SAGA 用 Agent Execution Graph(DAG)预测 KV 复用,假设工作流模式可被建模为有向图 [2605.00528]。但 PBKV 明确批评"静态 DAG 假设无法处理运行时条件分支和重试循环",因为真实工作流中 agent 调用序列取决于上下文 [2605.06472]。PBKV 的 GNN 多步预测在动态工作流上命中率 69% vs KVFlow(静态距离)的 39.87% [2605.06472]

矛盾根源:SAGA 的 AEG 实际上支持backward retry edges 和 transition probabilities(不是纯静态 DAG),能覆盖部分动态性 [2605.00528]。PBKV 的批评更准确地针对 KVFlow 而非 SAGA。但 SAGA 的 competitive ratio 1.31× 是在 SWE-bench(相对结构化的 coding agent)上测得,对高度动态的重试密集型工作流是否仍接近最优未经验证。

冲突 3:Agent Loop 是否"够用"? #

SGH 论证 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),认为只有显式 DAG 才能根本解决 [2604.11378]。但 Claude Code 的生产成功恰恰建立在 Agent Loop 之上,通过 5 层 compaction + 7 层安全 + append-only transcript 实现了高度的 production readiness [2604.14228]

矛盾根源:对 LLM 判断力的信任程度不同。SGH 假设 LLM 决策"不可检查"(non-det $\mathcal{P}$);Claude Code 假设 frontier 模型有"good judgment"并用确定性 harness 兜底。Claude Code 的 93% approval rate 恰恰暴露了 Agent Loop 的脆弱性——一旦模型犯错,唯一防线是人类审批,而 approval fatigue 使其无效 [2604.14228]。SGH 的"有界终止"保证在 Agent Loop 中不存在等价物。


§8 Gaps #

基于 Taxonomy 网格(Layer × Scope × Mechanism),以下组合是技术上可做但尚无人做的空白:

#Gap 描述空白位置 (Layer × Scope × Mechanism)技术可行性依据
1跨 turn KV 管理 + CPU 调度联合优化KV-Cache × 单 agent 多轮 × 统计模型Continuum 做了 KV TTL、COMB 做了 CPU 调度,但两者完全独立。联合优化(TTL 到期时考虑 CPU 工具队列状态)可进一步减少排队气泡。
2模型驱动淘汰在集群级部署KV-Cache × 多 agent 工作流 × 模型驱动SideQuest 在单卡证明了语义淘汰的优越性,SAGA 在 64-GPU 集群部署了统计方法。将辅助 LRM 线程推广到分布式环境需要解决 fork 成本和通信开销。
3Pattern-based 投机执行 + 工作流预测联合调度 × 多 agent 工作流 × 结构化预测PASTE 的 pattern mining 和 PBKV 的 GraphSAGE 预测独立运作。pattern 预测可同时指导投机执行和缓存预取决策。
4动态自适应 $B_{cap}$/TTL/K 参数调度 × 单 agent × 统计模型COMB 的 $B_{cap}$、Continuum 的 TTL、PBKV 的 $K$ 都是静态或半静态。基于实时 workload 反馈的控制器(类似 TCP congestion control)技术上直接可做。
5SGH 形式化的实验验证架构 × 单 agent × 确定性规则论文已设计完整 7 组对照 protocol (G0–G6) [2604.11378],缺的只是实现和实验。
6会话级 context 管理的自动化触发KV-Cache × 跨会话 × 模型驱动CMV 依赖手动 snapshot/branch/trim。自动检测 context 膨胀并触发裁剪(类似 GC)技术上可由 budget reduction 阈值实现。

§9 Practical Recommendation #

场景 1:单 agent coding/tool-calling,已有 vLLM 部署 #

选 Continuum — 模块化 vLLM 插件、已开源、改善随 turn 数放大(5× turns → 3.7×)[2511.02230]。如果 turn 数 ≤5,改善有限(1.6×),此时应评估是否值得集成。

场景 2:长 horizon deep research agent,单 GPU 显存紧张 #

选 SideQuest — 56–65% 峰值 token 降幅 + 近零 non-completion rate 的组合在此场景无竞争者 [2602.22603]。注意需要 LoRA 微调辅助线程(215 traces),且当前仅在 gpt-oss-20b 验证。

场景 3:多租户 GPU 集群部署大规模 agent workload #

选 SAGA 设计思路 — workflow-as-unit 调度 + AFS 公平性是集群场景的核心需求(SLO attainment 67.3% → 99.2%)[2605.00528]。注意未开源,需自研且接受 ~30% 吞吐 tradeoff。

场景 4:动态多 agent 工作流(含重试循环/条件分支) #

选 PBKV 设计思路 — 分层淘汰的"确定性护栏 + 概率系统"在预测不准确时退化至生命周期感知而非 LRU,稳健性最优 [2605.06472]。需 ~1K 训练轨迹进行 predictor 训练。

场景 5:CPU-heavy 工具主导延迟(RAG 检索 >50% E2E) #

先做 COMB 微批调度,再叠加 PASTE 投机执行 — COMB 在 serving 层面降低 CPU over-subscription(3.9× P50)[2511.00739],PASTE 在 session 层面通过 pattern-based speculation 进一步隐藏 tool stall(48.5% E2E↓)[2603.18897]。两者在不同层次操作,收益可叠加。

场景 6:需要可审计性/有界终止保证的合规场景 #

考虑 SGH 的三级 recovery + plan versioning 原则 — 借鉴其 "planning/execution/recovery 三层分离" 和 "跳级禁止" 的设计理念 [2604.11378]。注意这仍是 position paper 无实验验证,建议作为设计指导而非直接复用。


§10 参考 #

ID标题子主题日期
[ref:2511.02230]Continuum: KV Cache TTL for Multi-Turn Agent ServingKV TTL, program-FCFS2025-11
[ref:2602.22402]CMV: DAG State Management and Structurally Lossless Trimming会话裁剪, DAG 版本控制2026-02
[ref:2602.22603]SideQuest: Model-Driven KV Cache Management辅助 LRM 线程, 语义淘汰2026-02
[ref:2604.14228]Dive into Claude Code: Design Space of AI Agent Systems生产架构分析, 安全2026-04
[ref:2605.00528]SAGA: Workflow-Atomic Scheduling for Agent InferenceAEG, WA-LRU, AFS 公平2026-05
[ref:2605.06472]PBKV: Prediction-Based KV-Cache for Dynamic WorkflowsGraphSAGE 预测, 分层淘汰2026-05
[ref:2511.00739]CPU-Centric Perspective on Agentic AI ExecutionCPU 瓶颈, COMB, MAS2025-11
[ref:2603.18897]PASTE: Pattern-Aware Speculative Tool Execution投机执行, pattern mining2026-03
[ref:2604.11378]From Agent Loops to Structured Graphs (SGH)Scheduler 理论, 静态 DAG2026-04

Papers in agent (70)

2303.11366 · Synthesis
2308.08155 · Synthesis
2310.0677
2606.00866 · Synthesis
2604.11462 · Synthesis
2607.08716 · Synthesis
2607.00151 · Synthesis
2607.08565 · Synthesis
2601.16163 · Synthesis
2509.02121 · Synthesis
2602.13692 · Synthesis
2602.21477 · Synthesis
2603.13605 · Synthesis
2603.16104 · Synthesis
2603.22206 · Synthesis
2604.06370 · Synthesis
2604.15186 · Synthesis
2605.00528 · Synthesis
2605.06472 · Synthesis
2605.16637 · Synthesis
2606.01839 · Synthesis
2606.09916 · Synthesis
2606.12950 · Synthesis
2606.16824 · Synthesis
2510.12872 · Synthesis
2510.18586 · Synthesis
2606.01065 · Synthesis
2512.24601 · Synthesis
2603.28052 · Synthesis
2605.19932 · Synthesis
2605.13360 · Synthesis
2605.22154 · Synthesis
2512.23343 · Synthesis
2601.07470 · Synthesis
2602.02474 · Synthesis
2602.12430 · Synthesis
2603.22455 · Synthesis
2603.29919 · Synthesis
2604.15877 · Synthesis
2604.24026 · Synthesis
2605.07358 · Synthesis
2605.10923 · Synthesis
2605.19362 · Synthesis
2605.19576 · Synthesis
2605.21463 · Synthesis
2605.27366 · Synthesis
2605.27955 · Synthesis
2605.29794 · Synthesis
2406.18665 · Synthesis
2512.15834 · Synthesis
2512.24077 · Synthesis
2601.04861 · Synthesis
2601.19793 · Synthesis
2602.22302 · Synthesis
2603.00195 · Synthesis
2603.02240 · Synthesis
2603.02601 · Synthesis
2603.14588 · Synthesis
2604.06296 · Synthesis
2505.02279 · Synthesis
2604.06392 · Synthesis
2502.13965 · Synthesis
2603.04428 · Synthesis
2602.22603 · Synthesis
2604.14228 · Synthesis
2604.11378 · Synthesis
2603.18897 · Synthesis
2602.22402 · Synthesis
2511.00739 · Synthesis
2511.02230 · Synthesis