PASTE 与以下 agent 类论文构成系统级关联,形成围绕 agent serving 延迟优化 的论文簇:
| 论文 | 关联类型 | 关联原因 |
|---|---|---|
| Continuum (2511.02230) | 互补 | 同样关注 agent tool-call 间隙的延迟优化,但攻击不同瓶颈:Continuum 优化 KV cache 驱逐引起的排队延迟,PASTE 优化 tool 执行本身的等待时间 |
| SAGA (2605.00528) | 互补/竞争 | SAGA 的 workflow-aware 调度也对 tool-call 间隙做 KV cache retention + 预测性 prefetch,但粒度是 GPU 集群级别;PASTE 在单 agent 的 tool 执行层做投机,两者可叠加 |
| PBKV (2605.06472) | 互补/引用 | PBKV 明确 cite PASTE,用 GraphSAGE 预测 agent 调用序列驱动 KV-Cache 淘汰;PASTE 的 pattern mining 预测 tool 类型驱动投机执行——同一预测信号,不同消费方 |
| CPU-Centric (2511.00739) | 验证 | CPU-Centric 刻画了 tool 执行占 E2E 延迟 35-88% 的瓶颈,PASTE 的 profiling 数据(35-61%)在同一范围内相互验证 |
| SGH (2604.11378) | 理论框架 | SGH 将 agent 执行统一为 scheduler 模型,PASTE 的投机执行本质上是在 scheduler 的 ready-set 上做 speculative expansion |
| Claude Code Analysis (2604.14228) | 生态对照 | 揭示生产级 agent 的 98.4% 确定性基础设施 + 1.6% LLM 决策的范式,PASTE 作为 middleware 正是属于这 98.4% 确定性基础设施层 |
| SideQuest (2602.22603) | 正交 | SideQuest 优化 KV cache 内的 token 级 eviction,PASTE 优化 tool 调用级别的执行顺序——不同抽象层级 |
| CMV (2602.22402) | 正交 | CMV 管理跨会话的 context 持久化与裁剪,PASTE 管理会话内的 tool 执行时序——不同时间尺度 |
核心论文簇结构:PASTE + Continuum + SAGA + PBKV 形成 "agent tool-call gap optimization" 的四面攻击——PASTE 攻 tool 执行时间,Continuum 攻排队延迟,SAGA 攻 GPU cache 利用率,PBKV 攻 cache 淘汰决策。
PASTE 是唯一一篇攻击 tool 执行等待时间本身(而非 KV cache 管理或排队调度)的工作。其核心 delta:
| 维度 | PASTE | Continuum | SAGA | PBKV |
|---|---|---|---|---|
| 优化目标 | Tool 执行延迟隐藏 | KV cache 排队延迟 | 集群级 cache + 路由 | 缓存淘汰决策 |
| 预测对象 | 下一个 tool 类型 + 参数 | Tool 返回时间 | AEG successor + reuse | K-step agent 分布 |
| 预测方法 | PrefixSpan 频繁序列挖掘 | Per-tool 历史统计 | AEG 转移概率 | GraphSAGE + attention |
| 执行策略 | 提前投机执行 tool | 保留 KV cache 等 tool 返回 | 保留 cache + affinity 路由 | 优先淘汰低分 cache |
| 资源开销 | 0.02 core-sec/s + 2.6 MB | GPU 显存 pin | 集群级 coordinator | <2.3ms CPU |
| 正确性保证 | Promotion/preemption | TTL 过期 fallback | LRU fallback | Lipschitz 退化 |
关键区分:Continuum/SAGA/PBKV 都假设 tool 执行是不可加速的外部黑盒,只优化 "等待期间的资源管理"。PASTE 打破这个假设——通过投机执行将 tool 工作与 LLM 思考重叠,直接 消除等待时间 [2603.18897]。
PASTE 的 Top-1 准确率最低,但通过多候选投机 + 资源控制仍然实现了最高的延迟收益——设计哲学上的差异:PBKV/SAGA 追求精确预测,PASTE 追求低成本多候选覆盖。
CPU-Centric [2511.00739] 刻画了 tool 执行占 E2E 延迟 82-88%(RAG)/ 48-55%(Web-Agent)/ 25-65%(SWE-Agent)。PASTE 报告 35-61% [2603.18897]。范围交叠但不完全一致:
矛盾根源:CPU-Centric 的 profiling 包含了 tool 调用的全部 CPU 时间(包括 orchestrator overhead),而 PASTE 只计 tool execution time(不含调度开销)。此外 CPU-Centric 使用 ≤32B SLM,LLM 推理时间更短,tool 时间占比自然更高。两者在各自定义下均正确,但 PASTE 的 35-61% 是保守估计。
SGH [2604.11378] 将 agent 执行建模为 scheduler $(\mathcal{S}, \mathcal{U}, \mathcal{P}, \mathcal{O}, \Delta)$,核心概念是 ready-set 基数 $|\mathcal{U}|$。PASTE 的投机执行可以用 SGH 语言描述为:在 $|\mathcal{U}|=1$(ReAct loop)的约束下,通过 speculation 创造虚拟的 $|\mathcal{U}|>1$——投机 tool 是 "虚拟 ready node",promotion 成功时变为真正的 executed node。SGH 通过静态 DAG 获得确定性并行,PASTE 通过统计预测获得概率性并行——两种 $|\mathcal{U}|$ 扩张策略。
Claude Code 的架构解剖 [2604.14228] 揭示 5 层上下文压缩管道是生产 agent 最复杂的工程。PASTE 作为 tool-serving middleware 完全不触碰 context 管理——它在 agent loop 外部运行,不增加 context token,不修改 agent 逻辑。这意味着 PASTE 可以无缝叠加在 Claude Code 这类 production agent 的 tool dispatch 层。
PASTE 的核心论证依赖 "agent tool 调用存在稳定控制流模式"(55% edit→test, 51% search→fetch)[2603.18897]。但这些统计来自 SWE-bench 和 MetaGPT 这类结构化 benchmark。
攻击: 在生产环境中,用户行为多样性远高于 benchmark。Claude Code Analysis 报告 54 个 built-in tools + 动态 MCP tools [2604.14228],组合空间远大于 PASTE 评估的 3 种 agent。当 tool 集合从 5-10 扩展到 50+,PrefixSpan 挖掘的频繁序列数量可能爆炸,而每个 pattern 的 confidence $p$ 会稀释。PASTE 未报告 pattern pool 规模增长对预测质量的影响。
PASTE 声称 "95% 的 URL 参数可从 search 结果推导" [2603.18897],但这只是 URL 参数。对于 coding agent 的 tool 参数(代码 snippet、文件路径、git commit hash),符号推导函数 $f$ 的 3 种变换(field lookup, index+fallback, string normalization)可能严重不足。
攻击: SAGA 通过 AEG 仅预测工具类型而不预测参数 [2605.00528],PBKV 同样只预测 agent 调用分布 [2605.06472]——它们通过只做 cache 管理回避了参数推导问题。PASTE 必须推导参数才能真正执行 tool,这是更强的要求。论文未报告 $f$ 在非 URL 参数上的 coverage rate——如果 coverage 只有 50%,实际可投机的 tool 调用大幅缩减。
PASTE 报告 602/20000(~3%)投机操作被检测为有副作用并阻止 [2603.18897]。但 side-effect policy 是用户定义的——Claude Code Analysis 明确指出 side-effect 分类在现实中模糊("run_shell 可以 read-only 也可以 rm -rf")[2604.11378]。
攻击: 如果 policy 漏标一个有副作用的 tool 为 safe,投机执行可能产生不可逆的环境变更。在 coding agent 场景下,投机执行一个 file_editor 然后发现 LLM 实际想调用 grep——文件已被修改。SGH 通过 side-effect level 分类 + human-in-the-loop 解决此问题 [2604.11378],PASTE 没有等价的人工确认机制。
PASTE 在 5-100 并发 session 范围内测试 [2603.18897]。但 SAGA 报告在 64-GPU 集群上 10 tenants 混合负载的场景 [2605.00528],CPU-Centric 报告 CPU 在 BS=128 时 over-subscription [2511.00739]。
攻击: PASTE 的投机执行增加 CPU 负载(0.02 core-sec per second latency reduction),但 CPU-Centric 已证明 CPU 在 agent workload 中容易饱和。在 100+ 并发 session × 多候选投机的场景下,CPU 可能成为新瓶颈——PASTE 的 slack resource 假设可能不成立。
Claude Code Analysis 指出 OpenAI parallel tool calls 让 LLM 在一次推理中发出多个并行 tool calls [2604.14228]。PASTE 自身也承认:如果 agent 架构允许并行 tool use,投机执行的 overlap 空间被压缩 [2603.18897]。
攻击: 2026 年 parallel tool use 正在成为标准(Anthropic, OpenAI, Google 均支持)。如果 agent 在一轮推理中同时发出 3 个 tool calls,PASTE 的投机窗口(LLM 思考时间)不再存在——tool 已经被 LLM 自己并行化了。PASTE 的价值窗口可能随 parallel tool use 普及而收窄。
PASTE(2026-03)处于 agent serving 优化从 "KV cache 管理" 向 "全栈执行优化" 扩展的转折点:
PASTE 的范式贡献:将 speculative decoding 的 "投机+验证" 范式从 token 生成层扩展到 tool 执行层。正如 speculative decoding 用小模型预测大模型 output,PASTE 用 pattern matching 预测 tool calls——但代价更低(不需要额外模型推理)、验证更简单(tool 结果直接比较)。
PASTE 代表 agent serving 的一个新范式:从资源管理(cache/memory/scheduling)转向执行时间隐藏(speculative overlap)。前者(Continuum/SAGA/PBKV/SideQuest)假设 tool 执行是不可改变的黑盒,只优化等待期间的资源分配;后者(PASTE)将 tool 执行纳入可管理的范畴,通过时间重叠直接消除等待。
PASTE 用 PrefixSpan 挖掘频繁序列 [2603.18897],PBKV 用 GraphSAGE 做多步预测 [2605.06472]。两者可融合:用 GNN 编码 agent 调用图的拓扑先验 + 用 PrefixSpan 提取的 pattern 作为 feature,同时输出 tool 类型预测 和 符号值映射函数 $f$ 的选择——解决 PASTE 当前 $f$ 只有 3 种硬编码变换的限制。
PASTE 投机执行 tool 期间,LLM 仍在生成——此时 Continuum 的 TTL 机制可以更精确地设置:如果 PASTE 预测 tool 即将被调用,TTL 应该被延长(高概率很快回来);如果 PASTE 无匹配 pattern,TTL 可以缩短(不确定何时返回)。将 PASTE 的 pattern confidence $p$ 作为 Continuum TTL 计算的输入信号 [2511.02230],可以实现两层优化的协同。
CPU-Centric 的 COMB 需要选择微批上限 $B_{cap}$ [2511.00739],PASTE 需要选择投机预算 $B$。两者共享 CPU 资源:COMB 约束 authoritative tool 的并发数,PASTE 约束 speculative tool 的并发数。联合调度器可以动态分配 CPU cores 在 authoritative vs speculative 之间——当 pattern confidence 高时分配更多 cores 给投机,当 CPU 饱和时收缩投机预算。
SGH 的静态 DAG 提供了比 PrefixSpan 更强的先验——如果 planner 已经生成了 execution graph [2604.11378],PASTE 不需要从 trace 学习 pattern,可以直接从 DAG 的 successor set 推导投机候选。这消除了 pattern mining 的冷启动问题,也让 $f$(参数推导)可以从 DAG 节点的 contract schema 中自动合成。
SideQuest 证明 LRM 自身可以做语义级别的 "什么可以删" 判断 [2602.22603]。同样的思路可以应用到 PASTE 的 side-effect policy:用一个轻量辅助线程(类似 SideQuest 的并行辅助线程)对投机候选做 side-effect 推理,替代当前的人工 policy 定义。微调数据可以从历史 tool 调用 trace 中用 hindsight 标注生成。