2025–2026 年,LLM 的主流使用模式正从单请求问答向多轮自主工具调用剧烈迁移。以 Cursor、Claude Code、Windsurf、Cline 为代表的编程 agent 成为最显著的工作负载形态——它们运行 12+ 小时的连续 session、在单次任务中产生 4000+ 工具调用、消耗 100K–262K tokens 的上下文窗口 [kimi-k2-6] [2604.14228]。这一转变引发了贯穿 model、framework、agent、code 四个领域的系统性重构需求。
应用层驱动的基础设施危机。对 Claude Code 512K 行源码的逆向分析首次揭示了生产级编程 agent 的核心范式——1.6% 决策逻辑 + 98.4% 确定性基础设施 [2604.14228]。极简的 while-loop + AsyncGenerator 架构的成功证明:agent 的核心瓶颈不在"如何让 LLM 决策更好",而在"如何让基础设施高效支撑 LLM 决策" [2604.14228]。Claude Code 的 5 层渐进式上下文压缩管道(budget reduction → snip → microcompact → context collapse → auto-compact)暴露了编程 agent 对 serving 层的深层需求:prompt cache awareness、超长上下文(200K–1M tokens)、streaming tool dispatch、abort/recovery semantics [2604.14228]。
CPU 侧工具执行被发现是隐藏的主导瓶颈。在 agent 领域,CPU 侧工具执行占端到端延迟高达 88% [2511.00739],file read/write、shell exec、web search 等 CPU-bound 操作使得 GPU kernel 优化的边际收益上限仅 12% [2511.00739]。投机性工具执行方案将延迟降低 48.5% [2603.18897],但更深层的问题在于 KV cache 管理——end-of-turn eviction 导致 per-turn queueing delay 累积占总延迟 58.2% [2511.02230],标准 LRU 在 agent 工作流中命中率仅 27–28% [2605.06472],启发式剪枝更导致模型崩溃(non-completion rate 60%+)[2602.22603]。
投机执行(speculative execution)成为 idle-time 利用的系统范式。当 35%–88% 的端到端延迟锁定在 CPU 侧工具执行时 [2511.00739],2025–2026 年涌现出三种互补的投机方案攻击同一物理瓶颈:PASTE 在 middleware 层用历史模式投机预测下一个 tool call(48.5% E2E 降低)[2603.18897];IdleSpec 在推理策略层将 idle time 重定义为额外的 test-time compute budget——通过 Thompson 采样在 progressive/recovery 双策略间切换做投机规划,准确率提升 +5.1% 且延迟开销接近零 [2605.22154];Speculative Interaction Agents 在 agent 本体层借鉴硬件投机执行思想——async I/O + safe/unsafe 工具分类 + commit-point 语义将 3B 边缘模型延迟降低 1.6–2.2× [2605.13360]。三者分别从 middleware、推理策略、agent 架构三个层次构成 "agent 投机执行" 方法三角 [2605.22154] [2605.13360]。
编程 agent 的工作负载特征与现有基础设施的根本错配。当前 serving 系统为 chatbot(短 session、独立请求、LRU-friendly 缓存)优化。编程 agent 则要求:session affinity(12h+ session 跨越数千轮 tool call)、KV persistence(工具返回后 KV 必须保留而非驱逐)、workflow atomicity(整个编程任务而非单次请求是调度原子)、bursty tool calls(文件操作/编译/测试 在 CPU 侧产生极端长尾延迟——cd 命令最慢 10% 占 94.1% 总延迟)[2511.02230]。SAGA 测量显示 38% 的集群执行时间花在重新生成被驱逐的 KV cache 上,GPU 利用率仅 42% [2605.00528]。
Framework 层正经历从请求级调度到程序级编排的范式转变。PD 分离架构的存储带宽瓶颈在 agentic workload 下尤其严重——KV cache 命中率高达 98.7%,prefill 从计算密集退化为 I/O 密集 [2602.21548]。ThunderAgent 发现朴素 PD 分离在 agent 场景下退化(更低并发就触发 thrashing)[2602.13692]。Halo 首次将数据库批查询优化引入 agentic workflow [2509.02121],GLM 的 multi-agent serving 达到 15.1× 吞吐提升 [2511.01633]。vLLM Semantic Router 通过 20+ 异构信号类型上的布尔表达式树决策实现模型集群间的实时 per-request 智能路由 [vllm-project-semantic-router]。
Model 层的两条架构路线同时为 agent serving 开辟空间。DeepSeek-V4 的 hybrid CSA+HCA attention 将 1M 上下文下 KV cache 压至 V3.2 的 10%,单 token 推理 FLOPs 仅 27% [deepseek-v4]。Kimi K2.6 将单次 rollout 推到 4000+ 工具调用、12–13 小时连续执行 [kimi-k2-6]。Kimi Linear 的 KDA 线性注意力将 decode 吞吐提升 75%、KV cache 减少 75% [2510.26692]——直接降低编程 agent 的 per-session 内存占用。
Code 层提供了可落地的开发范式。OpenAI Agents SDK 和 Hermes Agent 分别代表"声明式编排"和"自我进化闭环"两条工程路线 [openai-openai-agents-python] [NousResearch-hermes-agent]。CMV 的 DAG 版本控制 + 三遍裁剪则代表了一种新兴的客户端 context 管理范式——将 serving 层无法感知的会话级优化下沉到 agent 本地 [2602.22402]。
外层优化(outer-loop optimization)兴起为消除人工 harness 工程的新范式。当编程 agent 的性能高度依赖于"包裹固定 LLM 的 harness 代码"(决定存什么/取什么/怎么呈现给模型)时——仅改 harness 就能在同一 benchmark 上造成最高 6× 性能差,但 harness 至今基本靠人手工设计 [2603.28052]。Meta-Harness 把 harness 优化形式化为"冻结模型权重、在代码空间 argmax 期望 reward"的问题,用一个 coding-agent proposer 通过文件系统读取全部历史候选的源码、分数、执行 trace 来逐轮提出新 harness [2603.28052]——它比 SOTA 上下文管理系统 ACE 高 7.7 分且 context token 少 4×,并在 TerminalBench-2 上超过手工 harness [2603.28052]。这与 AgentOpt 的客户端模型组合优化 [2604.06296] 共同确立了"对冻结基座做外层搜索"作为独立于 serving 层的优化范式——前者搜 harness 代码(白盒),后者搜模型组合配置(黑盒)[2603.28052]。
四个领域的技术演进共同指向:agentic workload 不是 LLM serving 的一种特殊模式,而是需要从模型训练、推理引擎、缓存策略、路由策略、调度策略到应用框架全栈重新设计的新系统范式。编程 agent 作为当前最具规模的 agentic workload,正在反向驱动整个基础设施栈的演进方向。
| Category | Count | Representative |
|---|---|---|
| framework | 14 | ThunderAgent (program-aware scheduling), DualPath (storage bandwidth), Concur (AIMD admission), SAGA (workflow-atomic), Semantic Router (signal-driven routing), PPD (dynamic PD routing) |
| agent | 24 | Continuum (KV TTL), SideQuest (semantic eviction), PBKV (GNN prediction), PASTE (speculative tool exec), IdleSpec (idle-time speculative planning), Speculative Interaction Agents (async I/O + commit-point), Claude Code architecture, CMV (client-side context management), Qualixar OS (maximalist orchestration), Agent Interop Survey (protocol taxonomy), PrefillShare (cross-model KV sharing), AgentAssert (behavioral contracts), SkillFortify (supply-chain security), AgentAssay (stochastic testing), SLM-v2/v3 (agent memory), AgentOpt (client-side optimization), Meta-Harness (outer-loop harness search), RouteLLM/OI-MAS/CASTER (model routing) |
| model | 5 | Kimi K2/K2.5/K2.6 (agentic MoE), DeepSeek-V4 (compressed attention), Kimi Linear (KDA) |
| code | 2 | OpenAI Agents SDK (declarative orchestration), Hermes Agent (self-improving loop) |
Framework 类占比最高(14/47),反映 2025–2026 年 agentic 系统优化的主战场在推理基础设施层——不仅包括 KV cache 管理和调度策略,还延伸到 PD 分离路由、模型集群级的智能路由、和批量查询优化 [framework]。Agent 类(24/47)从瓶颈刻画跃迁到成熟的方案集群并显著扩展覆盖面:5 篇论文攻击同一 KV cache 管理问题,同时新增多个独立维度——Qualixar OS 代表 maximalist orchestration 极端 [2604.06392],Agent Interop Survey 首次引入协议层分析 [2505.02279],PrefillShare 开辟了训练时干预消除 serving 层限制的新范式 [2602.12029]。新增三大维度:(1) Agent Safety & Governance——AgentAssert 的行为合约验证 [2602.22302]、SkillFortify 的供应链安全形式化扫描 [2603.00195]、AgentAssay 的随机测试框架 [2603.02601];(2) Agent Memory——SLM-v2 的 Bayesian 信任防御 [2603.02240] 和 SLM-v3 的 Fisher 信息几何检索 [2603.14588];(3) Model Routing——RouteLLM 的偏好数据路由 [2406.18665]、OI-MAS 的置信感知多尺度路由 [2601.04861]、CASTER 的双分支神经路由 [2601.19793]、AgentOpt 的组合级客户端优化 [2604.06296]。新增 Outer-loop / Harness 优化 维度:Meta-Harness 把"包裹冻结 LLM 的 harness 代码"本身当作搜索目标,用 coding-agent proposer 通过文件系统对全部历史诊断经验做选择性、非 Markov 的访问 [2603.28052]——与 AgentOpt 同属"对冻结基座做外层优化",但 Meta-Harness 是白盒代码搜索、AgentOpt 是黑盒配置搜索 [2603.28052]。Claude Code 分析和 CMV 代表应用层 context 管理维度 [agent] [2604.14228]。新增 Speculative Execution 维度:IdleSpec 将 idle time 从系统开销重新定义为 test-time compute budget(精度优化)[2605.22154],Speculative Interaction Agents 将硬件投机执行迁移到 agent 工具调用(延迟优化)[2605.13360]——两者与 PASTE 的 pattern-aware 投机构成方法三角,标志着 idle-time 利用从单一延迟优化扩展为精度-延迟双目标优化。Model 类(5/46)代表从架构和训练双侧为 agentic 能力做端到端适配。Code 类(2/46)提供可落地的开发框架 [code]。
| 时间 | 实体 | 贡献 | ||
|---|---|---|---|---|
| 2024-06 | RouteLLM | 首个基于人类偏好数据(Chatbot Arena 80K 对战)的轻量级 LLM 路由器,MF 路由器实现 >2× 成本节约同时保持 >95% 强模型质量,跨模型族零样本迁移 [2406.18665] | ||
| 2025-04 | DynaServe | 统一 colocation/disaggregation,micro-request 量化延迟-吞吐 trade-off [2504.09285] | ||
| 2025-04 | JITServe | GMAX 算法提供 1/8.55 常数竞争比,首次证明 SJF/EDF 无常数竞争比 [2504.20068] | ||
| 2025-05 | Agent Interop Survey | 首篇 4-protocol 全景对比(MCP→ACP→A2A→ANP),提出四阶段成熟度路线图,识别协议组合为根本未解难题 [2505.02279] | ||
| 2025-05 | HexGen-Flow | 首个 SLO-aware 两层调度器,SLO 预算沿 workflow DAG 反向传播 [2505.05286] | ||
| 2025-07 | KVFlow | 首个 workflow-aware KV cache 驱逐策略,用 steps-to-execution 替代 LRU [2507.07400] | ||
| 2025-07 | Kimi K2 | 开源 1T MoE + MLA agentic 旗舰模型,MuonClip 解决大规模训练稳定性 [2507.20534] | ||
| 2025-09 | Halo | 数据库批查询优化引入 agentic workflow,DAG 合并 + epoch DP 求解,占据 agent-serving 独特的 "plan layer" [2509.02121] | ||
| 2025-09 | Semantic Router | vLLM 生态首个系统级智能路由器,信号驱动的 mixture-of-models 路由 [vllm-project-semantic-router] | ||
| 2025-11 | CPU-Centric Profiling | 首次系统刻画 agentic workload 的 CPU 侧瓶颈,tool 执行占延迟 88% [2511.00739] | ||
| 2025-11 | Continuum | KV cache TTL 机制 + program-level FCFS,首个将 agent 工具调用延迟 CDF 引入缓存决策 [2511.02230] | ||
| 2025-11 | GLM | Multi-agent Graph-CoT + prefix caching 联合优化,15.1× 吞吐 [2511.01633] | ||
| 2026-01 | Sutradhara | 提出 orchestrator-engine co-design 的 5 API,打破 orchestrator-engine 黑箱 [2601.12967] | ||
| 2026-01 | OI-MAS | 层级化 conductor 联合路由 agent role 和 model scale,置信感知 RL:高置信放大成本惩罚、低置信允许升级,+7.68% 准确率 + 79.78% 成本削减 [2601.04861] | ||
| 2026-01 | CASTER | 双分支神经路由器(语义 + 结构元特征),per-step 难度预测 + on-policy 负反馈自改进,72.4% 成本削减同时匹配强模型质量,Pareto 优于 FrugalGPT [2601.19793] | ||
| 2026-01 | Concur | 发现 middle-phase thrashing 并将 KV cache 类比为共享带宽资源,用 AIMD 做 agent-level 准入控制 [2601.22705] | ||
| 2026-02 | Kimi K2.5 | 复用 K2 主干接入多模态,Agent Swarm 100 sub-agent × 1500 steps [2602.02276] | ||
| 2026-02 | PrefillShare | 首篇通过训练时干预(cache-conditioned fine-tuning)实现跨模型 KV cache 共享,将 N 模型的 KV 冗余从 O(N) 降至 O(1),代表 "training for shared inference" 新范式 [2602.12029] | ||
| 2026-02 | DualPath | 双路径 KV 加载 + CNIC 流量隔离,解决 PD 分离架构下 agentic 推理的存储 I/O 瓶颈,1152 GPU 近线性扩展 [2602.21548] | ||
| 2026-02 | ThunderAgent | Agentic Program 一等调度单元,证明指数衰减函数的缓存价值是唯一满足时间同质性的最优形式 [2602.13692] | ||
| 2026-02 | Pancake | 多 agent 长期记忆的多层级 ANN 索引,记忆操作开销从 82% 压至 3.2% [2602.21477] | ||
| 2026-02 | SideQuest | LRM 自身作为 KV cache GC——首次用 LLM 语义推理驱动 token 级淘汰,达 56–65% token 降幅 [2602.22603] | ||
| 2026-02 | CMV | DAG 版本控制 + 三遍裁剪,代表客户端 context 管理的新范式,会话级 context 复用均值 20% 缩减 [2602.22402] | ||
| 2026-02 | AgentAssert | Design-by-Contract 引入 AI agent:六元组合约 + $(p,\delta,k)$-满足 + Ornstein–Uhlenbeck 漂移界 + JSD 分布漂移前导指标,<10 ms 执行开销,1,980 session 验证 [2602.22302] | ||
| 2026-03 | PPD | 发现 append-prefill 仅 2% TPOT 干扰(vs full prefill 48%),Turn 2+ 动态路由避免 75% KV 传输 [2603.13358] | ||
| 2026-03 | PASTE | Pattern-aware speculative tool execution,E2E 延迟降低 48.5% [2603.18897] | ||
| 2026-03 | SkillFortify | 首个 agent skill 供应链形式化安全框架:Dolev-Yao 攻击模型 + 抽象解释可靠性分析(0% FPR)+ SAT 依赖解析 + 信任代数,96.95% F1,540 skills 1.378s [2603.00195] | ||
| 2026-03 | SLM-v2 | 本地优先多 agent 记忆系统,Bayesian 信任评分(trust gap = 0.90)防御 OWASP ASI06 记忆投毒,sleeper agent 信任衰减 72%,零云依赖 [2603.02240] | ||
| 2026-03 | AgentAssay | 三值随机判决(Pass/Fail/Inconclusive)+ SPRT 78% 试验缩减 + 行为指纹检测传统测试完全不可见的回归(86% power vs 0%),7,605 trials 验证 [2603.02601] | ||
| 2026-03 | SLM-v3 | Fisher 信息加权检索(Theorem 6.1, Čencov 唯一性)+ Poincaré ball Riemannian Langevin 生命周期 + Sheaf 上同调矛盾检测,LoCoMo +12.7 pp,零 LLM 模式 [2603.14588] | ||
| 2026-03 | Helium | 数据库查询优化思路重构 agentic workflow,Templated Radix Tree 做 plan-level 优化 [2603.16104] | ||
| 2026-03 | Meta-Harness | 把 harness 代码当搜索目标的 outer-loop 系统——coding-agent proposer 经文件系统读取全部历史候选源码+分数+trace,比 ACE 高 7.7 分且 context token 少 4×,TerminalBench-2 超手工 harness(Opus #2 / Haiku #1)[2603.28052] [2603.28052] | ||
| 2026-04 | DeepSeek-V4 | CSA+HCA 将 1M 下 KV cache 压至 10%、FLOPs 压至 27%,从模型侧降低 agent per-session 内存需求 [deepseek-v4] | ||
| 2026-04 | SGH Framework | Scheduler 理论统一 Agent Loop 和 graph executor,证明 Agent Loop 本质是 $\ | \mathcal{U}\ | =1$ 单就绪单元调度器 [2604.11378] |
| 2026-04 | Claude Code Analysis | 首次源码级生产 agent 架构剖析,揭示 "1.6% 决策 + 98.4% 基础设施" 范式和 5 层 context compaction [2604.14228] | ||
| 2026-04 | TokenDance | Multi-agent All-Gather round 级 KV 去重,测得 91–97% 块级重叠,2.7× 并发提升 [2604.03143] | ||
| 2026-04 | Scepsy | Aggregate LLM Pipeline 用相对份额稳定性驱动多 LLM GPU 分配 [2604.15186] | ||
| 2026-04 | Qualixar OS | 首个 maximalist agent orchestration OS——12 种拓扑 + Forge 自动团队设计 + 三层模型路由 + 8 模块质量保障,与 Claude Code 极简范式形成哲学级对立 [2604.06392] | ||
| 2026-04 | Kimi K2.6 | 长程 agentic RL 达 4000+ tool calls / 12h,Agent Swarm 扩到 300 sub-agent,INT4 将 1T MoE 拉到单 8×H200 [kimi-k2-6] | ||
| 2026-04 | AgentOpt | 客户端模型组合优化:Matrix UCB-E 在 pipeline 级搜索最优 model assignment,Opus 作为 planner 反而最差(绕过 solver),13–32× 成本差异 at matched quality,62–76% 预算节约 [2604.06296] | ||
| 2026-04 | Agents SDK + Hermes | 声明式编排(Guardrails + Handoffs + 7 Sandbox)和自进化闭环(Skill auto-create/patch)两条路线并行成熟 [openai-openai-agents-python] [NousResearch-hermes-agent] | ||
| 2026-05 | SAGA | Workflow-atomic scheduling + AEG 预测,达 Bélády 最优 1.31×,64-GPU 集群验证 SLO attainment 99.2% [2605.00528] | ||
| 2026-05 | PBKV | GraphSAGE 多步预测 + 分层淘汰(确定性护栏 + 概率系统),命中率 27%→69%,Lipschitz 退化保证 [2605.06472] | ||
| 2026-05 | IdleSpec | Thompson 采样投机规划——工具执行 idle time 期间生成 progressive/recovery 双策略 plan candidates 作为 reference 聚合,GAIA+FRAMES +5.1% 准确率,MLE-Bench +9.1% medal 率,延迟开销 ~0 [2605.22154] | ||
| 2026-05 | Speculative Interaction Agents | 硬件投机执行迁移到 agent——将推理与用户输入流/工具响应流解耦(async I/O),safe/unsafe 工具分类 + DAG commit-point 语义,clock-based SI-SFT 训练 3B 边缘模型达 1.6–2.2× 延迟降低 [2605.13360] |
关键谱系路径:
编程 agent(Cursor、Claude Code、Windsurf、Cline)已成为最具规模的 agentic workload,其特征对基础设施提出了系统性挑战:
cd 命令最慢 10% 占 94.1% 总延迟 [2511.02230]——这使得标准的 TTFT/TPOT SLO 定义失效。CPU-Centric Profiling 发现 CPU 并行化饱和点在 BS=128 [2511.00739]。cache_deleted_input_tokens 返回值深度耦合——compaction 本身需要考虑 prompt cache 的经济学 [2604.14228] [2604.14228]。编程 agent 的模式驱动了调度范式的根本变革:
DeepSeek-V4 的 CSA+HCA 将 1M 下 KV cache 压至 V3.2 的 10% [deepseek-v4]——若应用于 agent serving 可直接将 per-agent 的 GPU 内存占用降低一个数量级。Kimi Linear 的 KDA 层以 fixed-size recurrent state(128×128/head)替代累积 KV [2510.26692],从根本上消除了 KV cache 随 turn 数线性增长的问题。这对 Continuum/SAGA/PBKV 的 cache 管理策略构成"上游问题消失"的挑战——当 KDA 的 O(1) KV 取代 MLA 的 O(n) KV 时,精细的缓存管理策略是否仍有必要 [model]?
然而模型侧压缩的落地存在时间差。V4 的 CSA+HCA 仅验证文本模态 [model],K2.6 的 MLA 仍是 O(n)。在模型侧完全解决 KV 问题之前(预估 2–3 年),serving 层的 agent-aware KV 管理仍是必要的过渡方案。
2025-11 至 2026-05 的 8 个月内,5 篇论文从不同信息源攻击同一问题——agent 多轮推理中的 KV cache 管理 [agent]:
| 方案 | 淘汰决策信号 | 信号类型 | 运行时开销 |
|---|---|---|---|
| Continuum | tool call 延迟分布 + 显存占比 | serving 指标 | ≈0(TTL 计时器) |
| SideQuest | LLM 对 tool response 语义有效性的推理 | 模型语义 | ~110–140 token/次 |
| SAGA | AEG 后继节点转移概率 × token 重叠度 | 工作流结构 | 12.3 + 3.1 ms/轮 |
| PBKV | GraphSAGE 拓扑嵌入 + 前缀注意力 + 语义信号 | GNN 预测 | ~350K 参数,1.18 ms |
| CMV | message 类型(user/assistant vs tool_result/base64) | 结构启发式 | 零(离线裁剪) |
这一集群的谱系关系为 [2602.22603]:
统计代理 ← ← ← → → → 语义理解
H₂O/SnapKV Continuum SAGA/PBKV CMV/5-layer SideQuest
(attention) (TTL+cost) (AEG+GNN) (structure) (LLM reasoning)
五种方案在 serving 栈的不同层次操作且可组合:SAGA 管集群级 workflow 调度,Continuum 管 turn 间 KV 保留,SideQuest 管单 session 内 token 级语义淘汰,CMV 管跨会话客户端裁剪,PBKV 管动态工作流的预测驱动缓存 [2602.22603]。
2026 年 5 月,投机执行作为一个独立的 agent 优化方向达到临界密度。三种方案从不同层次攻击同一物理瓶颈——工具执行期间的 idle time(81%–92.6% 的 agent 运行时间)[2605.22154] [2511.00739]:
| 方案 | 投机对象 | 优化目标 | 模型修改 | 正确性机制 | 延迟效果 | 精度效果 |
|---|---|---|---|---|---|---|
| PASTE | 下一个 tool call + 参数 | 延迟 | 无 | Preemption + 副作用 policy | -48.5% E2E | 不变 |
| IdleSpec | Future plan candidates | 精度 | 无(prompt-only) | Reference-based aggregation(soft) | ~0 开销 | +5.1% avg |
| Speculative Interaction | Tool call 本身 | 延迟 | 必须(SI-SFT) | Safe/unsafe + commit-point + DAG | 1.6–2.2× 降低 | -0.6–1.7pp |
[2603.18897] [2605.22154] [2605.13360]
三者的核心差异在于 observation uncertainty 的处理方式 [2605.22154]:
与 serving 基础设施的正交性。IdleSpec 和 Speculative Interaction 均可与 serving 层优化叠加使用 [2605.22154]。IdleSpec 的兼容性实验已部分验证:叠加在 Sequential Revision 上提升 27.9→32.2,叠加在 Planning 上提升 32.2→35.3 [2605.22154]。但在多租户环境中,idle-time drafting 的额外 LLM 请求会占用 batch 槽位和 KV-cache 容量——正是 ThunderAgent 试图解决的问题 [2605.22154]。PASTE 明确用 slack 资源做投机并用 preemption 保护 authoritative 请求 [2603.18897],而 IdleSpec 缺乏类似的资源管理机制。Speculative Interaction 则需要 serving framework 支持 interruptible streaming(基于 vLLM 实现)[2605.13360]。
精度-延迟 trade-off 的 Pareto 前沿。IdleSpec 和 Speculative Interaction 的优化目标正交——前者提升精度不增延迟,后者降低延迟微损精度 [2605.22154]。两者的组合定义了一个二维 Pareto 前沿:在 idle time 前半段做 speculative tool call(延迟优化),后半段做 speculative planning(精度优化)[2605.22154]。但 benchmark 不重叠——IdleSpec 验证于 GAIA/FRAMES/MLE-Bench,Speculative Interaction 验证于 HotpotQA/TinyAgent [2605.22154]——使得 Pareto 分析目前无法进行。
边缘部署与实时场景的特殊需求。Speculative Interaction 面向实时 voice agent(<1s 响应延迟目标)[2605.13360],其 clock-based SI-SFT 训练使 3B 边缘模型(Qwen2.5-3B / Llama-3.2-3B)理解异步中断语义——normal SFT 用于 SI format 时准确率崩溃至 33.4% [2605.13360]。但该方法在自然语音数据上严重退化(延迟从 9.3s 增至 14.3s,准确率从 22.0 降至 13.6)[2605.13360],暴露了 clean benchmark 训练分布与真实语音 disfluency 的严重 gap [2605.13360]。
PASTE 的投机执行中间件要求 serving 引擎支持 authoritative vs speculative 任务的优先级隔离 [2603.18897]。SAGA 的 session-affinity batching 要求引擎暴露 per-session KV cache 的跨 worker 迁移接口 [2605.00528]。SideQuest 的辅助线程需要 serving 框架支持 KV cache 的 fork-and-share 机制 [2602.22603]。这些需求推动 vLLM/SGLang 从"单请求引擎"演进为"agent-aware runtime"。
OpenAI Agents SDK 的 Runner 循环 + Guardrails + Handoffs 结构 [openai-openai-agents-python] 与 Claude Code 的 queryLoop + Permission System + AgentTool 设计 [2604.14228] 在抽象层级上高度同构,表明生产级 agent 的架构模式已收敛:中央循环 + 安全网关 + 工具分发 + 子代理委派 [code]。Hermes Agent 的 skill 自动创建和持久记忆则映射到 Claude Code 的 CLAUDE.md 4 级层次和 MCP 扩展机制 [NousResearch-hermes-agent] [2604.14228]。两条路线的核心对称性在于:OpenAI SDK 追求 可控性(Guardrails + HitL + RunState 序列化)但无学习能力,Hermes 追求 自治性(Skill patch + 持久记忆 + Atropos RL)但无安全护栏——尚无框架同时实现两者 [code]。
2026 年 agent 系统设计出现了两个对立极端,形成当前最根本的架构分歧:
这一张力的深层含义:Claude Code 证明当 backbone model 足够强时,最小化编排框架反而最优(复杂性的负回报);Qualixar OS 则赌注当 backbone 不够强时,系统化编排仍能通过 multi-agent 拓扑 + 质量兜底弥补。SGH 的 scheduler 理论将两者映射为 $|\mathcal{U}|=1$ non-det(Agent Loop)vs $|\mathcal{U}| \geq 1$ det(Structured Graph)的连续谱 [2604.11378],但 Qualixar OS 试图同时覆盖两端(12 种拓扑既含 sequential/circular 也含 hierarchical/forest)却未提供形式化正确性保证——这是其与 SGH 的关键脱节。
悬而未决:Qualixar OS 的 Forge 自动团队设计和 Goodhart 检测是组件级创新 [2604.06392],但整体系统未通过标准基准验证(仅 20 定制任务,不含 web browsing/file manipulation)。若 frontier model 能力持续提升,minimalist 范式的优势将加速放大——Qualixar OS 的价值可能最终体现在其组件被 minimalist 系统吸收,而非整体架构被采纳。
Agent Interop Survey 首次系统揭示了 agent 系统栈中被忽视的协议层碎片化 [2505.02279] [2505.02279]。四阶段协议栈(MCP: Tool Access → ACP: Messaging → A2A: Enterprise Coordination → ANP: Open Internet)中,实际采用呈极端 power law 分布:MCP >> A2A > ACP ≈ ANP。
与已有工作的交叉:
核心张力:协议标准化的理论收益(O(N) 集成、跨组织互操作)与实际开销(链式调用延迟放大、协议组合复杂度)之间的平衡点尚未找到。当前市场正以 MCP 一家独大的方式隐式"解决"碎片化——但这以牺牲高层协议的 enterprise/internet 级互操作为代价。
PrefillShare 在 agent 类别中开辟了一个全新的优化层次——通过修改模型训练过程消除 serving 层的根本限制 [2602.12029] [2602.12029]。现有 agent-serving 研究(Continuum/SAGA/PBKV/ThunderAgent)100% 在 serving 层操作,假设模型参数不可变。PrefillShare 通过 cache-conditioned fine-tuning 打破这一前提:frozen base model 生成共享 KV cache + task-specific decode modules 读取共享 cache,将 $N$ 模型的 KV 冗余从 $O(N)$ 降至 $O(1)$。
与已有 KV cache 管理方案的正交性使 PrefillShare 可直接叠加:
这一范式的深层含义类似于 quantization-aware training vs post-training quantization:PrefillShare 选择改变模型以适应部署约束,而非在不可变模型上做调度优化。其隐含预测是:当 multi-model agent pipeline 成为主流(coding + reasoning + testing 分别用不同 fine-tuned 模型),训练时对齐将成为消除跨模型 KV 冗余的唯一彻底方案。
vLLM Semantic Router 在 agent stack 中引入了全新的基础设施级路由层——位于应用编排器之下、推理引擎之上 [vllm-project-semantic-router]。这一层将"模型选择"从应用代码中剥离并下沉到基础设施,类似 Envoy 将负载均衡从应用代码中剥离。其信号驱动决策架构与 Sutradhara 的 orchestrator-engine co-design [2601.12967] 和 Scepsy 的 aggregate pipeline scheduling [2604.15186] 形成三层互补:Semantic Router 决定"哪个模型",Sutradhara 优化"单模型上的 agentic pipeline",Scepsy 优化"多模型间的 GPU 分配"。
2024–2026 年的路由研究呈现清晰的演进谱系。RouteLLM 首次证明人类偏好数据(Chatbot Arena 80K 对战)编码了 query-difficulty 信号,MF 路由器以 <0.4% 开销实现 >2× 成本节约且跨模型族迁移(GPT-4/Mixtral → Claude Opus/Sonnet 零样本)[2406.18665]。OI-MAS 将路由从 query-level 提升到 per-step level——层级化 role router + model router 联合优化,置信感知 RL 目标中高置信放大成本惩罚、低置信允许升级,实现 +7.68% 准确率同时 79.78% 成本削减 [2601.04861]。CASTER 进一步引入 on-policy 自改进——双分支融合网络(语义 1536d + 结构 6d)预测 step 难度,routing 失败自动成为最高价值训练信号,72.4% 成本削减且 Pareto 优于 FrugalGPT cascading [2601.19793]。AgentOpt 则发现路由的 组合级本质——模型质量不是 context-free 属性:Opus 4.6 作为独立模型最强,但作为 planner 最差(31.71% vs 74.27%,7/9 配置完全绕过 solver)[2604.06296]。这一发现从根本上否定了 per-call 路由的假设——必须在 pipeline 级评估模型组合。
路由研究的谱系可按决策粒度和信号类型组织:
| 方案 | 决策粒度 | 信号类型 | 训练数据 | 成本节约 | |
|---|---|---|---|---|---|
| RouteLLM | per-query | 偏好数据预测 $P(\text{win}_s\ | q)$ | 80K Arena + augmentation | >2× (CPT 13.4%) |
| Semantic Router | per-request | 20+ 异构信号布尔表达式 | 无训练(规则驱动) | — | |
| OI-MAS | per-step | token log-prob 置信 + RL | 任务正确性奖励 | 79.78% | |
| CASTER | per-step | 语义嵌入 + 结构元特征 | 合成冷启动 + 负反馈 | 72.4% | |
| AgentOpt | per-pipeline | 端到端 accuracy/cost/latency | bandit exploration | 62–76% |
核心张力:per-call 路由(RouteLLM、Semantic Router)vs per-step 路由(OI-MAS、CASTER)vs per-pipeline 优化(AgentOpt)代表三个不同的抽象层次。AgentOpt 的实证表明 per-call 路由在多步 pipeline 中可能产生反直觉结果(LM Proposal 仅 34.13% vs brute-force 74.27%)[2604.06296],但 per-pipeline 搜索需要 exhaustive evaluation($51–124/benchmark)[2604.06296]。OI-MAS 和 CASTER 的 per-step 路由在中间找到了实用平衡点。
当模型权重冻结时,"如何改进固定基座"分化出两条互补的外层优化路线,二者共同把"对冻结基座做外层搜索能撬动巨大收益"确立为独立于 serving 调度的优化范式:
两者占据"同一外层优化空间的两个不同坐标"——黑盒配置 vs 白盒代码 [2603.28052]。一个尚未占据的杂交格子是把"谁当 proposer、谁当 base"也纳入 Meta-Harness 的联合搜索空间,做 (组合配置, harness 代码) 的二级优化 [2603.28052]。
Meta-Harness 与本主题 context-management 成员的关系——自动化 vs 人工设计。Claude Code 的 5 层 compaction [2604.14228]、CMV 的 DAG 三遍裁剪 [2602.22402]、SideQuest 的 LLM 语义淘汰 [2602.22603] 都是人工设计的"存什么/取什么/怎么呈现给模型"策略。Meta-Harness 的核心主张是这类决策可被自动搜索——它优化的正是这些 context 管理系统手工设计的对象,并在文本分类上把发现的 harness 做到比 SOTA 上下文管理系统 ACE 高 7.7 分(48.6 vs 40.9)、context token 仅 ACE 的 ~22% [2603.28052],在 TerminalBench-2 上超过手工 harness Terminus-KIRA(76.4% vs 74.7%)[2603.28052]。其壁垒不在"用 LLM 改代码",而在"全保真历史 trace + proposer 选择性访问"二者缺一不可——压成 summary/scalar 即塌掉 [2603.28052]。
与 serving 层优化的成本口径张力。Meta-Harness 报告的"48.6 分只用 11.4K token、比 ACE 省 4×"指的是被发现 harness 的部署期推理成本,其搜索期成本被隐藏——单次评估可达 10M token、一次 run 约评估 60 个 harness、proposer 是 Opus-4.6 [2603.28052]。相较之下 AgentOpt 明算了搜索 $ 开销(brute-force $4.71–123.87/benchmark,bandit 省 62–76%)[2604.06296]。这是一次性巨额前置成本——外层优化的真实经济性需把"一次性搜索投入"与"长期部署节省"一并核算,而 Meta-Harness 在这点上拿部署省 4× 去对标 ACE,回避了搜索投入 [2603.28052]。
2026 年 agent 安全研究从"事后检测"走向"形式化验证 + 运行时强制"的范式转变。三篇论文从互补角度构建了 agent 安全的三层防御:
行为合约层(AgentAssert):首次将 Design-by-Contract 引入 AI agent 运行时——六元组合约 $(\mathcal{P}, \mathcal{I}_{\text{hard}}, \mathcal{I}_{\text{soft}}, \mathcal{G}_{\text{hard}}, \mathcal{G}_{\text{soft}}, \mathcal{R})$ 区分 hard/soft 约束,$(p,\delta,k)$-satisfaction 为随机 LLM 提供概率合规语义 [2602.22302]。核心创新是 Ornstein–Uhlenbeck 漂移模型的 前导指标——JSD 分布漂移在约束违反 发生之前 检测行为偏移(类似于金融市场的波动率预警 vs 实际亏损),这是所有先验方法(NeMo Guardrails、输出过滤)所不具备的能力 [2602.22302]。组合性定理(Theorem 4.9)为 multi-agent 链提供了可靠性量化退化界:可靠性乘法退化 $p_{\text{chain}} \geq \prod p_i$,漂移加法积累 $\delta_{\text{chain}} \leq \sum \delta_i$。实验覆盖 7 模型 × 1,980 session,<10 ms 执行开销证明生产可行性。
供应链安全层(SkillFortify):agent skill 生态系统面临供应链危机——ClawHavoc 渗透 1,200+ 恶意 skills、MalTool 编录 6,487 恶意工具、26.1% 扫描 skills 存在漏洞 [2603.00195]。SkillFortify 提供首个形式化分析框架:Dolev-Yao 攻击模型适配 5 阶段 skill 生命周期(maximality theorem 3.6),抽象解释在 4 元素 capability lattice 上实现 sound 静态分析(Galois connection 保证 soundness: $\mathit{Viol}(s) = \emptyset$ 则无具体执行超出声明能力),SAT 编码将 capability 约束注入依赖解析 [2603.00195]。0% FPR + 96.95% F1 是工程级可用的——"no findings = no risk" 的形式化保证类似于 A380 飞控软件的 Astrée 验证器。
随机测试层(AgentAssay):agent 的内在非确定性使传统二值 pass/fail 测试失效——同一 prompt/tools/model 产生发散行为。AgentAssay 引入三值随机判决(Wilson score CI)+ SPRT 自适应停止(78% 试验缩减)+ 行为指纹检测(Hotelling's $T^2$ test)[2603.02601]。核心发现:当 agent 改变工具使用模式或推理链但不影响输出正确性时,传统测试有 完全 0% 检测力,而指纹方法达 86% [2603.02601]。与 AgentAssert 的集成点:trace-first 离线分析可在存储的 traces 上运行合约检查,零 API 成本。
三层防御的互补性和与已有安全机制的交叉:
| 层次 | 时机 | 保证类型 | 与 Claude Code 7 层安全的关系 |
|---|---|---|---|
| SkillFortify | 部署前(CI/CD) | 形式化可靠性(soundness) | 替代 permission-based gatekeeping 的静态分析层 |
| AgentAssert | 运行时(per-action) | 概率合规 + 漂移界 | 形式化 Claude Code 的 defense-in-depth 中 approval 机制 |
| AgentAssay | 版本间(regression) | 统计检测力保证 | 为 Claude Code 的 5 层 compaction 提供回归检测 |
这一集群显著加强了 Challenge 4(Agent 安全性的多层联防)的方案侧:AgentAssert 的合约验证提供了 Claude Code 93% approval fatigue 问题的替代路径——用形式化合约代替人类确认 [2602.22302];SkillFortify 攻击 Hermes Agent 缺乏安全护栏的具体盲区——skill supply chain [2603.00195];AgentAssay 为 SGH 的 validation gap($0.95^{10} \approx 0.6$)提供了统计检测框架 [2603.02601]。
Agent 持久记忆系统从"附加功能"演进为安全关键型基础设施。SuperLocalMemory 的两代演进代表了这一领域的两个独立突破:
安全优先的记忆架构(SLM-v2):OWASP ASI06 将记忆投毒识别为关键威胁——中毒记忆跨越 session 边界影响所有后续决策(Gemini Memory 漏洞、日历邀请投毒 73% 成功率)[2603.02240]。SLM-v2 的核心创新是 architectural isolation——local-first 设计从结构上消除云介导攻击面(记忆永不经过网络),Bayesian 信任评分以不对称信号幅度(负 > 正)使信任获取比丧失更难(trust gap = 0.90),sleeper agent 攻击从 0.902 衰减到 0.249(低于 0.3 写入阈值)[2603.02240]。四层渐进增强栈(SQLite+FTS5 → 层次索引 → 知识图谱 → 模式学习)+ v2.7 自适应 re-ranking 实现 +104% NDCG@5,20 ms 开销。
信息几何驱动的检索(SLM-v3):三个数学上未被解决的问题——(1) cosine 对所有嵌入维度等权(忽略 per-dimension 统计精度),(2) 固定 TTL/指数衰减忽略记忆空间几何,(3) 无形式化矛盾检测 [2603.14588]。SLM-v3 的解决方案:Fisher 信息加权检索(Theorem 6.1, Čencov 唯一性定理保证这是唯一满足统计不变性的检索度量),Poincaré ball 上 Riemannian Langevin 动力学驱动记忆自然遗忘(Theorem 6.3, Fokker-Planck 证明唯一稳态分布),Sheaf 上同调($H^1 \neq 0$ = 不可调和矛盾)[2603.14588]。实证:LoCoMo +12.7 pp(最难对话 +19.9 pp),Fisher vs cosine 的优势随 memory store 密度增长(Proposition 7.2:Fisher 打破 cosine 集中屏障)。
与已有 agent 记忆系统的关系:
| 系统 | 定位 | 关键差异 |
|---|---|---|
| Pancake [2602.21477] | 多 agent 长期记忆 ANN 索引 | 性能优化(82%→3.2% 开销),无安全考量 |
| SLM-v2 | 单/多 agent 本地记忆 | 安全优先(Bayesian 信任 + 架构隔离),无高级检索数学 |
| SLM-v3 | 单/多 agent 本地记忆 | 检索质量优先(信息几何),建立在 SLM-v2 基础设施上 |
| Hermes Agent Memory [NousResearch-hermes-agent] | Skill 持久化 + 记忆 | 功能实现,无安全或数学基础 |
核心张力:SLM-v2/v3 的 local-first 假设(零云依赖)与 multi-agent collaboration 的共享记忆需求存在本质矛盾——当多个 agent 需要共享记忆时,"local" 的边界如何定义?Pancake 解决了共享记忆的性能问题,SLM-v2 解决了安全问题,但两者尚未组合。SLM-v3 的 sheaf 上同调矛盾检测可能成为 multi-agent 共享记忆的一致性层——当不同 agent 写入矛盾记忆时,$H^1 \neq 0$ 提供形式化检测。
共识 1:KV cache 管理是 agentic serving 的核心瓶颈。从 KVFlow 的 STE 驱逐 [2507.07400]、Continuum 的 TTL [2511.02230]、Concur 的 AIMD [2601.22705]、ThunderAgent 的指数衰减 [2602.13692]、SideQuest 的语义 GC [2602.22603]、DualPath 的双路径加载 [2602.21548]、Helium 的 Templated Radix Tree [2603.16104]、TokenDance 的 collective 去重 [2604.03143]、SAGA 的 WA-LRU [2605.00528]、到 PBKV 的 GraphSAGE 预测 [2605.06472]——10+ 篇论文从不同角度攻击 GPU HBM 中的 KV cache。SAGA 量化表明 38% 集群时间花在 KV 重建 [2605.00528]。
共识 2:请求级调度在 agentic workload 下系统性失效。Concur 证明 request-level admission 可能比无控制更差(某配置 0.72×)[2601.22705]。ThunderAgent 测得 vLLM 的 KV-aware 路由导致 51% 跨节点内存不均衡 [2602.13692]。KVFlow 证明 LRU 在循环 workflow 下产生反向驱逐信号 [2507.07400]。SAGA 的 O(k²c) 退化分析给出了理论解释 [2605.00528]。Halo、Helium、ThunderAgent、SAGA 一致认为需要 agent-level 或 program-level 的调度粒度 [framework]。
共识 3:Tool 执行是 agentic 系统的主要延迟源,且 idle time 是可利用的资源。CPU-Centric Profiling 测得 35%–88% [2511.00739],PASTE 复现 35%–61% [2603.18897],Sutradhara 在 Microsoft 生产 trace 上测得 30%–80% [2601.12967],Continuum 发现排队延迟占 58.2% [2511.02230],IdleSpec 独立测得 81%–92.6% 的 agent 运行时间被工具执行占据 [2605.22154]。五篇独立工作一致确认 CPU 侧是主要延迟贡献者——GPU 越强(H200/B200),CPU 瓶颈越突出(Toolformer 推理占比从 Sys1 88% 降至 Sys2 77%)[2511.00739]。更重要的是,PASTE、IdleSpec、Speculative Interaction Agents 三篇方案一致证明这些 idle time 并非不可避免的浪费,可分别用于投机工具执行、投机规划、和异步 I/O 重叠 [2603.18897] [2605.22154] [2605.13360]。
共识 4:安全正从附加检查上升为形式化验证体系。Semantic Router 将 jailbreak/PII/hallucination 检测作为路由决策的一等信号 [vllm-project-semantic-router]。Claude Code 的 7 层安全管道将安全嵌入 agent runtime 核心循环——93% 的 approval rate 证明交互式确认不可靠,必须用 defense-in-depth 替代人类警觉性 [2604.14228] [2604.14228]。Agents SDK 的 Guardrails 将安全检查作为并行执行组件 [openai-openai-agents-python]。2026 年安全研究进一步走向形式化:AgentAssert 的行为合约将概率合规从直觉提升为可证明性质 [2602.22302],SkillFortify 的 soundness 保证(Theorem 4.9: $\mathit{Viol}(s)=\emptyset$ 则无越权执行)为 agent skill 生态系统提供了首个可靠性形式化基础 [2603.00195],AgentAssay 的三值随机判决将测试从"定性 pass/fail"提升为有统计保证的"定量检测力" [2603.02601]。安全从"事后检查"→"事前决策输入"→"形式化验证"的三阶段演进正在完成。
共识 5:编程 agent 的架构模式趋于收敛。Claude Code 的 "while-loop + harness"、OpenAI SDK 的 "Runner + Guardrails + Handoffs"、Hermes 的 "Agent loop + Skill + Memory" 在核心结构上同构——都采用中央循环 + 安全网关 + 工具分发 + 子代理委派 [2604.14228] [openai-openai-agents-python] [NousResearch-hermes-agent] [code]。SGH 的 scheduler 模型将此形式化为 $|\mathcal{U}|=1$ 的单就绪单元调度器 [2604.11378]。
分歧 1:KV cache 应该保留多久——时间维度 vs 语义维度。Continuum 声称 TTL 应由 cost-benefit 模型决定——tool call 在 TTL 内返回则 KV 被保留 [2511.02230]。SideQuest 的核心论点是 token 重要性非单调——某些 tool response 在第 t 轮看似无用但到第 t+n 轮可能重新变关键 [2602.22603]。根源:实验 workload 不同。Continuum 的 SWE-Bench/BFCL 是 6–11 轮短 horizon function-calling agent,SideQuest 的 FRAMES/BrowseComp 是 80+ 轮 120K+ token 的 deep research agent——时间维度对短 horizon 足够,语义维度对长 horizon 不可或缺 [agent]。SideQuest 在 coding agent benchmark(SWE-bench)上未评估 [2602.22603]——这一关键盲区使两者无法直接比较。
分歧 2:静态 DAG vs 动态预测。SAGA 用 Agent Execution Graph(DAG + 转移概率)预测 KV 复用 [2605.00528]。PBKV 明确批评"静态 DAG 假设无法处理运行时条件分支和重试循环"——在动态工作流上 PBKV 命中率 69% vs KVFlow 的 39.87% [2605.06472]。根源:SAGA 的 AEG 支持 backward retry edges 和 transition probabilities(非纯静态 DAG),在无 framework hints 时仍达 87% accuracy [2605.00528]。PBKV 的批评更准确地针对 KVFlow 的纯静态距离,而非 SAGA 的概率化 DAG [2605.06472]。两者面向不同的动态性程度——SAGA 面向结构化 coding agent(SWE-bench),PBKV 面向含重试循环的高动态工作流。
分歧 3:Agent Loop vs Structured Graph。SGH 论证 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计)[2604.11378]。但 Claude Code 恰恰是一个 Agent Loop 系统,通过 7 层安全管道 + append-only transcript 实现生产级可靠性 [2604.14228]。根源:对 LLM 判断力的信任程度不同。SGH 假设 LLM 策略"不可检查"(non-det $\mathcal{P}$);Claude Code 假设 frontier 模型有"good judgment"并用 harness 兜底 [agent]。关键的可攻击面在于:Claude Code 的 "minimal scaffolding" 范式可能是 Claude-specific——如果 backbone 换为 Llama-70B 或 Qwen-72B,minimal scaffolding 是否仍然可行 [2604.14228]?
分歧 4:PD 分离在 agent workload 下是否可行。ThunderAgent 实验证明朴素 PD 分离在 agent workload 下退化——"单侧 HBM 池变小,更低并发就触发 thrashing" [2602.13692]。然而 DualPath 的整个方案正是在 PD 分离架构内通过聚合 DE SNIC 带宽来解决 agent workload 的存储 I/O 瓶颈,在 1152 GPU 上实现近线性扩展 [2602.21548]。根源:ThunderAgent 评测的是 vLLM 标准 PD 实现(无 QoS 隔离、无带宽聚合),DualPath 的方案带有 layerwise streaming + CNIC-centric flow isolation + InfiniBand VL QoS。两者的结论在各自硬件假设下都正确:朴素 PD 分离对 agent 退化,优化 PD 分离在超大规模可行 [2602.13692]。PPD 提供了第三种视角——Turn 2+ 的 append-prefill 干扰仅 2%,可以安全 co-locate [2603.13358]——暗示小模型场景下 PD 分离本身可能不必要。
分歧 5:GPU 侧优化 vs CPU-GPU 协同。当 CPU 工具执行占 E2E 延迟 88% 时,GPU kernel 优化上限仅 12% [2511.00739]。KV cache 优化攻击 GPU 侧,COMB/MAS 攻击 CPU-GPU 调度 [2511.00739]。但 SideQuest 证明语义淘汰可使 SGLang 峰值吞吐提升 83.9% [2602.22603]——表明 GPU 侧优化仍有巨大空间。根源:CPU 瓶颈和 GPU 瓶颈在不同并发度下交替成为主导约束——低并发 CPU 主导,高并发 GPU(内存)主导。
分歧 6:Maximalist Orchestration vs Minimal Loop——框架复杂度的方向。Qualixar OS 用 12 种拓扑 + Forge 自动设计 + 8 模块质量保障构建最大化编排栈 [2604.06392]。Claude Code 用极简 while-loop + 98.4% 确定性基础设施取得生产成功 [2604.14228]。根源:对 backbone model 能力的不同预期。Minimalist 范式赌注 frontier model 的 reasoning 足以替代复杂编排;maximalist 范式赌注 model 不够强时系统化补偿仍有价值。Qualixar OS 的自改进循环实际退化(0.564→0.519)[2604.06392] 为 minimalist 方向提供了反面证据——但这也可能是实现质量而非范式选择的问题。关键观察:两者不一定互斥——Qualixar OS 的 Goodhart 检测和 Forge 组件可被 minimalist 系统作为可选模块吸收 [2604.06392]。
分歧 7:Idle-time 应用于延迟优化还是精度优化。IdleSpec 和 Speculative Interaction Agents 同月发表,研究同一 niche(工具执行期间的投机推理),但优化目标正交 [2605.22154]。IdleSpec 将 idle time 定位为 test-time compute budget——生成 plan candidates 作为 reference 聚合,追求精度提升(+5.1%)而不改变延迟 [2605.22154]。Speculative Interaction 将 idle time 定位为 I/O 重叠窗口——投机发起 tool call 并异步执行,追求延迟降低(1.6–2.2×)而容忍微小精度损失 [2605.13360]。根源:目标函数不同决定了设计选择的完全分化——IdleSpec 不修改模型(prompt-only),需要多候选聚合;SIA 必须修改模型(SI-SFT),需要正确性保护机制(commit-point)[2605.13360]。两者的 benchmark 完全不重叠(GAIA/FRAMES/MLE-Bench vs HotpotQA/TinyAgent),核心假设冲突未被任何实验检验 [2605.22154]。理论上两者可叠加——idle time 前半段做 speculative tool call,后半段做 speculative planning [2605.22154]——但这一组合方案尚无实证。
分歧 8:淘汰决策的开销——极简 vs 重模型。PBKV 的预测器仅 ~350K 参数、1.18 ms 推理 [2605.06472],SAGA 的 coordinator 开销仅 12.3ms + 3.1ms [2602.22603]。而 SideQuest 的辅助线程每次生成 ~110-140 token 的管理推理——GPU 开销可能高 1-2 个数量级 [2602.22603]。SideQuest 用"精度"换"开销"(non-completion rate 近零 vs heuristic 60%+),PBKV/SAGA 用"开销"换"覆盖度"(跨工作流全局操作)。
为何根本性困难:当前 5 种方案分别在各自假设下工作,但缺乏统一的信息论框架来回答"KV cache 最优淘汰策略的理论极限是什么"。SAGA 达到 Bélády 最优的 1.31× [2605.00528],但 Bélády 假设 perfect future knowledge,agent workload 的 future knowledge 天然受限于 LLM 决策的非确定性。PBKV 首次将 algorithms-with-predictions 框架引入此领域,其 Lipschitz 遗憾界 $\mathcal{R}(B) \leq \frac{1}{2(1-\gamma)} \sum \epsilon_c^\gamma$ 将预测误差与性能退化定量关联 [2605.06472] [2605.06472]——但尚未建立与模型表达力(attention 的 effective context window)之间的关系。
需要哪些 category 协同:model 层的注意力机制选择(KDA 的 fixed-state 完全消除问题 [2510.26692],CSA/HCA 的压缩改变问题规模 [deepseek-v4])决定了 cache 管理的问题空间;agent 层的 workload 可预测性(SAGA 87% AEG accuracy [2605.00528],PBKV 0.94 1-step accuracy [2605.06472])决定了可达到的 competitive ratio;framework 层需标准化 cache 管理 API 让不同策略可插拔。
预估难度:3–5 年。需先建立 agentic workload 的信息论模型。
为何根本性困难:编程 agent 的 context 管理现在分散在三个独立层:(1) 应用层——Claude Code 的 5 层 compaction [2604.14228]、CMV 的 DAG 裁剪 [2602.22402];(2) Serving 层——Continuum 的 KV TTL [2511.02230]、SAGA 的 WA-LRU [2605.00528]、SideQuest 的语义淘汰 [2602.22603];(3) 模型层——V4 CSA/HCA 的物理压缩 [deepseek-v4]、KDA 的 recurrent state [2510.26692]。三层独立优化可能互相冲突:agent 做 auto-compact 后 KV cache 前缀失效,serving 层的 prefix cache 策略被动失效 [2604.14228]。如果 SideQuest 认为某 cursor 仍有语义价值,但 Continuum 的 TTL 已过期并驱逐了整个 session 的 KV cache,语义判断就被浪费了 [2602.22603]。
需要哪些 category 协同:需要 agent-serving 双向信号通道——agent 的 compaction 决策应考虑 serving 层的 cache 状态(如果当前 prefix 有 cache hit,推迟 compact;如果 cache 已被 evict,aggressively compact)。模型层的压缩方案决定了 serving 层 KV 的绝对大小和格式。
预估难度:2–3 年。技术上直接可做(定义跨层 API),难点在标准化——需要 vLLM/SGLang/TensorRT 等框架协同定义接口。
为何根本性困难:agentic workload 的端到端延迟由 LLM 推理 + tool 执行 + orchestrator 逻辑三部分组成,三者的延迟分布特性完全不同——LLM 推理可预测,tool 执行变异系数超过 100% [2601.12967],orchestrator 逻辑依赖 LLM 实时决策。Scepsy 发现 agentic workflow 的绝对延迟抖动巨大(beam search 24–844 次 generator 调用)[2604.15186]。传统 TTFT/TPOT SLO 定义在编程 agent 场景下失效——"完成一个 SWE-bench 任务的延迟"无法分解为单请求 SLO 的简单聚合。
需要哪些 category 协同:framework 层需要 workflow-level SLO 语义(HexGen-Flow 的 SLO 预算传播是最接近的尝试 [2505.05286] [2505.05286]);agent 层需暴露 tool 延迟预测信号;model 层需稳定的 function calling 格式以支持 streaming dispatch。SGH 的 bounded termination 证明 [2604.11378] 提供了理论基础但无实验验证。
预估难度:3–5 年。
为何根本性困难:Claude Code 的 93% permission approval rate 揭示了 approval fatigue——交互式确认作为安全机制已经失效 [2604.14228] [2604.14228]。然而替代解释也存在:93% 批准率可能反映模型决策本身已非常准确,用户 approve 是理性而非疲劳(论文未提供 approval rate 随 session 时长递增的时序数据)[2604.14228]。PASTE 的 side-effect management 依赖用户定义的 policy,3% 投机操作被检测为有副作用 [2603.18897]。SGH 的 validation gap:10 节点链的正确率可能仅 $0.95^{10} \approx 0.6$ [2604.11378]。Hermes Agent 完全缺乏形式化安全护栏 [NousResearch-hermes-agent] [code]。
需要哪些 category 协同:model 层需更强 alignment 以支持 values-over-rules 范式(但这一范式可能是 Claude-specific [2604.14228]);agent 层需 side-effect 分类和 rollback 协议——AgentAssert 的合约验证 [2602.22302] 和 AgentAssay 的行为指纹 [2603.02601] 提供了两种互补的运行时检测机制;framework 层需 sandbox 隔离和 audit trail(Agents SDK 已有 7+ sandbox 后端 [openai-openai-agents-python]);供应链层需 SkillFortify 类形式化扫描集成 CI/CD [2603.00195];路由层需高精度安全信号提取 [vllm-project-semantic-router];code 层需开发者友好的安全 API。AgentAssert 的 compositionality theorem 为 multi-agent chain 提供了首个可靠性量化退化界 [2602.22302]——这是连接形式验证与 multi-agent 安全的关键桥梁。
预估难度:3–5 年(从 5+ 年下调)。AgentAssert/SkillFortify/AgentAssay 的形式化框架显著降低了理论基础的建立难度,但从形式化到生产级集成仍需工具链成熟。
为何根本性困难:K2.6 的 4000+ 工具调用 / 12 小时 session [kimi-k2-6] 使 KV cache 成为长期共享资源。DualPath 分析显示 working set 以 $r^2$ 扩展、总成本以 $r^3$ 增长 [2602.21548]。ThunderAgent 证明 KV offload 到 CPU 因 PCIe 带宽不足而失效 [2602.13692]——这意味着 GPU HBM 是不可逃逸的约束。SideQuest 在 80+ 轮的 deep research agent 上实现 56–65% token 降幅 [2602.22603],但其辅助线程的 GPU 开销在高并发场景可能成为新瓶颈 [2602.22603]。面向 100 小时级 session 的资源管理仍是未知领域。
需要哪些 category 协同:framework 层需 hierarchical memory management(SAGA 的 AEG [2605.00528] 和 PBKV 的 GNN predictor [2605.06472] 提供了预测信号,但仅验证短 session);model 层的 KV 压缩方案直接影响每 agent 的内存足迹——V4 的 CSA+HCA 将 KV 降至 10% [deepseek-v4],KDA 的 fixed state 消除增长 [2510.26692];agent 层的客户端 compaction(Claude Code 5 层管道 [2604.14228])与 serving 层的 KV 管理需要协同而非独立运作。
预估难度:2–3 年(短 horizon 已有方案),但面向 100h+ session 为 unknown territory。
为何根本性困难:Agent Interop Survey 揭示了 4 层协议栈(MCP→ACP→A2A→ANP)的互补性架构 [2505.02279],但"协议组合"——即单个 agent runtime 同时实现多层协议接口——是根本未解难题 [2505.02279]。当前采用呈极端 power law(MCP >> A2A > ACP ≈ ANP),市场正以 MCP 一家独大隐式"解决"碎片化。Qualixar OS 的 Claw Bridge 走的是 adapter 路线($O(N^2)$ 维护成本)[2604.06392],尚无系统实现 protocol-native 的 $O(N)$ 集成。同时 CPU-Centric Profiling 的 35%–88% tool 延迟意味着链式协议调用进一步放大 CPU-side overhead [2505.02279]——互操作收益何时超过协议开销的 break-even point 未知。
需要哪些 category 协同:agent 层需要定义协议组合的形式化语义(SGH + A2A 的 multi-agent 有界终止 [2505.02279]);framework 层需要 protocol-aware 的 KV cache 管理——若 KV manager 能感知 A2A session 语义则可做跨 agent prefetching [2505.02279];code 层需要开发者友好的多协议 SDK。
预估难度:3–5 年。MCP 已 production-ready,A2A 在 enterprise 赛道初步采用,但全栈组合验证需要跨组织协同。
为何根本性困难:三种投机方案(PASTE、IdleSpec、Speculative Interaction)均缺乏统一的理论框架来回答"agent 投机执行的最优策略是什么"。PASTE 的 Top-1 预测准确率仅 27.8%,靠多候选弥补 [2603.18897]。IdleSpec 的 Beta-Bernoulli Thompson sampling 有经典 bandit 的 regret bound,但论文未将其扩展到 agent task 的 success-rate model [2605.22154]。Speculative Interaction 报告 2.2× 加速但无理论分析——给定 tool latency 分布和用户输入速率,最优延迟下界可通过排队论建立(M/G/1 with preemption),但未做此分析 [2605.13360] [2605.13360]。更深层的问题是 多租户资源竞争:IdleSpec 的 idle-time drafting 在单用户设置下"免费",但在高并发 serving 中会占用 batch 槽位和 KV-cache 容量 [2605.22154],而 ThunderAgent 已证明 KV-cache 是 agent serving 的硬约束 [2602.13692]。
需要哪些 category 协同:agent 层需要建立 observation uncertainty 模型(工具返回的成功概率分布 + 信息量分布),证明 progressive/recovery 混合策略的 regret bound 是否优于 pure strategy [2605.22154]。framework 层需要投机请求的优先级管理——PASTE 的 preemption 保护 authoritative 请求 [2603.18897] 是正确方向,但需泛化到 IdleSpec/SIA 的场景。Speculative Interaction 的 safe/unsafe 工具分类需从静态硬编码走向上下文相关的动态判定 [2605.13360]。
预估难度:2–3 年。方法已验证,缺理论框架和多租户验证。
为何根本性困难:当 N 个 agent 共享同一轮输出时,现有系统产生 N 份几乎相同的 KV cache 副本——TokenDance 测得 91%–97% 块级重叠 [2604.03143]。SAGA 的 session-affinity routing 减少跨 worker 迁移但不解决同 worker 内的副本问题 [2605.00528]。GLM 的 prefix caching 利用 Graph-CoT 的前缀共享但限于静态 prompt 部分 [2511.01633]。TokenDance 将复用代价从 O(N) 摊销到 O(1),但严格绑定同步 All-Gather 模式——异步 multi-agent 场景下的共享对齐更加困难 [2604.03143]。Pancake 从记忆索引侧统一了跨 agent 查询 [2602.21477],但 KV cache 与 vector memory 仍然是独立的 HBM 消费者。
预估难度:2–4 年。同步场景已有方案,异步场景仍是 open problem。
| 子方向 | 成熟度 | 证据 | 趋势 |
|---|---|---|---|
| Agent KV cache 管理 | Research frontier → early production | 5 篇方案覆盖从统计到语义到预测的完整谱系 [2511.02230] [2605.00528];Continuum 已开源并集成 vLLM [agent];DualPath 在 DeepSeek 生产 1152 GPU 部署 [2602.21548];PBKV 的 Lipschitz 退化保证提供了首个理论基础 [2605.06472] | 加速 |
| Agent-level scheduling | Research frontier | ThunderAgent(理论最优性证明)、Helium(DB-style plan opt)、SAGA(64-GPU SLO 99.2%)均有完整实现 [2602.13692] [2603.16104] [2605.00528];但均未被 vLLM/SGLang 主线采纳 | 加速 |
| Application-layer context management | Early production | Claude Code 5-layer pipeline 大规模部署 [2604.14228];CMV 开源(claude-code-cmv)但仅单用户验证(n=1)[agent] | 稳定 |
| Speculative tool execution (latency) | Early research → research frontier | PASTE 首个 middleware 方案(48.5% 降低,4 节点)[2603.18897];Speculative Interaction 首个端到端训练方案(1.6–2.2× 降低,3B 边缘模型,但自然语音退化严重)[2605.13360]。两者分别代表 serving-layer 和 agent-internal 投机路线,但均缺乏理论 bound | 加速 |
| Idle-time compute (accuracy) | Early research | IdleSpec 首个系统方案(+5.1% 准确率,延迟 ~0),Thompson sampling + reference aggregation 在 3 benchmark × 3 model 上一致有效 [2605.22154];采纳门槛极低(4 prompt template + 两个计数器)[2605.22154];但多租户资源竞争未验证 | 加速 |
| Agent runtime formalization | Theoretical | SGH 纯 position paper 无实现;已设计 7 组对照 protocol (G0–G6) 但缺实验 [2604.11378] [agent] | 观望 |
| Production agent architecture | Production-ready | Claude Code 大规模部署 + 源码开放供分析 [2604.14228];OpenAI Agents SDK 21K stars + 158K LOC 测试 + 7 Sandbox 后端 [openai-openai-agents-python];Hermes Agent 20+ 平台网关 + RL 闭环 [NousResearch-hermes-agent] | 稳定 |
| Long-horizon agentic RL | Early production | K2.6 达 4000+ tool calls / 12h [kimi-k2-6];但训练 recipe 未公开且 INT4 vs BF16 长程消融缺失 [model] | 加速 |
| Multi-agent memory & KV sharing | Research frontier | TokenDance(2.7× 并发、91–97% 重叠率量化)[2604.03143],Pancake(4.29× 吞吐)[2602.21477],GLM(15.1× 吞吐)[2511.01633]——方案分散尚未统一 | 加速 |
| Multi-LLM workflow serving | Research frontier | Scepsy 在 16 GPU 验证 [2604.15186],HexGen-Flow 验证多阶段 SLO [2505.05286],规模有限 | 加速 |
| System-level model routing | Early production | Semantic Router 8 个月 4.2k stars,v0.2 发布 [vllm-project-semantic-router],信号驱动架构成熟但缺乏大规模生产部署数据 | 加速 |
| Model-side agent efficiency | Early production | DeepSeek-V4 KV 降至 10% [deepseek-v4],Kimi Linear KV 降 75% [2510.26692]——均可直接减轻 agent serving 内存压力但尚未被 agent-aware 系统显式利用 | 加速 |
| Dynamic PD routing for agents | Research frontier | PPD(append-prefill 仅 2% 干扰)[2603.13358],DualPath(优化 PD 1152 GPU)[2602.21548]——ThunderAgent 否定朴素 PD 但优化 PD 可行 [2602.13692] | 加速 |
| Agent interop protocols | Early adoption (MCP) / Nascent (A2A/ACP/ANP) | MCP 已被 Anthropic/OpenAI/Cursor 生产采用;A2A Google 2025-04 发布但无大规模部署;ACP/ANP 纯研究阶段 [2505.02279];Qualixar OS 的 adapter 方案绕过协议层 [2604.06392] | 观望→加速 |
| Cross-model KV sharing (training-level) | Early research | PrefillShare 和 ICaRus 代表 "training for shared inference" 新范式,实验仅覆盖 Qwen3-14B / 4 agent,未在 SWE-Bench 等标准基准验证 [2602.12029];代码未开源阻碍采纳 | 加速 |
| Maximalist agent orchestration | Theoretical / Early research | Qualixar OS 20 定制任务评测,不含核心 agent 场景(web browsing/file manipulation);自改进循环退化 [2604.06392];组件级创新(Goodhart 检测)有独立价值 | 观望 |
| Agent behavioral contracts & runtime enforcement | Early research → theoretical framework | AgentAssert 六元组合约 + OU 漂移界有完整形式化证明体系 [2602.22302],<10 ms 执行开销可生产化,但仅 6–12 轮 session 验证 [2602.22302];参考分布校准缺乏自动化 | 加速 |
| Agent skill supply-chain security | Early research | SkillFortify 首个形式化框架,soundness 保证(0% FPR)可媲美工业验证工具 [2603.00195];A11 typosquatting(50%)和 A12 dependency confusion(0%)为架构盲区 | 加速 |
| Agent stochastic testing | Early research | AgentAssay 78% SPRT 试验缩减 + 86% 指纹检测力 [2603.02601];10 框架适配器 + pytest 插件已开源;但 state-space coverage λ 校准为 chicken-and-egg 问题 | 加速 |
| Agent memory (security + retrieval) | Early research | SLM-v2 Bayesian 信任验证(trust gap 0.90)[2603.02240],SLM-v3 LoCoMo +12.7 pp [2603.14588];但 SLM-v2 N=1 用户,SLM-v3 Fisher 度量在基准中因 $n_{\text{access}}=0$ 几乎未激活 | 观望→加速 |
| Per-step model routing for agents | Research frontier → early production | RouteLLM 开源 + 跨模型迁移验证 [2406.18665];OI-MAS +7.68% + 79.78% 成本削减 [2601.04861];CASTER 5 provider 验证 [2601.19793];AgentOpt 否定 per-call 假设 [2604.06296]——方案丰富但标准化缺失 | 加速 |
| Outer-loop / harness optimization (frozen base) | Early research | AgentOpt 客户端组合搜索开源(62–76% 预算节约)[2604.06296];Meta-Harness 在三域超强基线(ACE +7.7、TerminalBench-2 超手工 harness)且消融证明原始 trace 不可压 [2603.28052],但 proposer 闭源、实现未公开、搜索期成本巨大(单次评估 10M token、Opus proposer)[2603.28052] | 加速 |
整体判断:Agent System 正处于从 research frontier 向 early production 过渡的加速期。九个最显著的变化:(1) Agent KV cache 管理从单点创新爆发为 5+ 方案的竞争集群,且 PBKV 的 Lipschitz 退化保证标志着从工程解决方案走向有理论基础的系统设计 [2605.06472];(2) 应用层 context 管理(Claude Code 5-layer compaction、CMV DAG trimming)作为独立于 serving 层的优化维度被正式确立 [2604.14228];(3) 编程 agent(Cursor、Claude Code)成为最大规模的 agentic workload 并反向定义了基础设施需求;(4) Agent OS 设计出现 maximalist vs minimalist 的哲学级极化——Qualixar OS 的 12 种拓扑 + 8 模块质量保障 vs Claude Code 的 while-loop + harness [2604.06392],前者实证未达但组件创新有独立价值;(5) PrefillShare 开辟了 "training for shared inference" 的第三条优化路线——通过训练时对齐消除跨模型 KV 冗余 [2602.12029],预示 training + serving 联合优化将成为 multi-model agent serving 的新方向;(6) Agent Safety & Governance 从零到三——AgentAssert + SkillFortify + AgentAssay 分别在运行时合约、供应链扫描、回归测试三层建立了形式化框架,使安全从工程实践走向可证明性质 [2602.22302] [2603.00195] [2603.02601];(7) Agent Memory 浮现为独立子方向——SLM-v2 的信任防御和 SLM-v3 的信息几何检索将 agent 持久记忆从"附加功能"提升为安全关键型基础设施 [2603.02240] [2603.14588];(8) Agent 投机执行从单一方案扩展为方法三角——PASTE(middleware pattern prediction)、IdleSpec(idle-time Thompson sampling for accuracy)、Speculative Interaction(agent-internal async I/O for latency)分别从三个层次攻击工具执行 idle time [2605.22154] [2605.13360],其中 IdleSpec 开创性地将 idle time 从系统开销重新定义为 test-time compute budget [2605.22154];(9) Model Routing 达到临界密度——RouteLLM/OI-MAS/CASTER/AgentOpt 4 篇论文覆盖 per-query 到 per-pipeline 的完整决策粒度梯度,AgentOpt 从实证上否定了 per-call 路由在多步 pipeline 中的有效性 [2604.06296];(10) 外层优化(outer-loop optimization)兴起为"改进固定基座"的第二条路线——AgentOpt 搜模型组合配置(黑盒)与 Meta-Harness 搜 harness 代码(白盒、experience-rich)共同确立"对冻结基座做外层搜索"范式,Meta-Harness 进一步把 context 管理系统人工设计的"存/取/呈现"策略变成自动搜索产物,并以受控消融证明全保真 trace 访问不可压缩 [2603.28052] [2603.28052]。
未来 12–18 个月的关键里程碑:(a) vLLM/SGLang 是否将 workflow-aware cache 管理纳入核心(Continuum 已开源集成是第一步 [agent]);(b) 模型侧的注意力压缩(V4 CSA/HCA、KDA)是否使 cache 管理问题本身消失或改变形态 [model];(c) agent 应用层和 serving 层的 context 管理是否建立双向信号通道 [2604.14228];(d) 协议标准化的走向——MCP 是否持续一家独大,还是 A2A 在 enterprise 赛道获得真正采纳 [2505.02279];(e) cross-model KV sharing(PrefillShare/ICaRus)是否在 SWE-Bench 等标准 agent 基准上验证可行性;(f) agent safety 的三层形式化框架(合约/扫描/测试)是否被主流 agent 框架采纳——AgentAssert 的 <10 ms 开销使运行时集成技术可行,SkillFortify 的 CI/CD 集成路径最清晰 [2603.00195];(g) model routing 是否收敛到标准化方案——RouteLLM 已开源但仅支持 binary routing,per-step 路由(OI-MAS/CASTER)需要与 agent framework 深度集成,AgentOpt 的组合搜索需要降低 exploration 成本。
PD-disaggregation:DualPath 的存储带宽瓶颈分析直接建立在 PD 分离架构之上 [2602.21548]。ThunderAgent 已证明朴素 PD 分离在 agent workload 下退化 [2602.13692] [2602.13692]。PPD 揭示 append-prefill 干扰仅 2% [2603.13358]。SAGA 的 session-affinity routing 部分缓解了 PD 分离下的 KV 迁移问题 [2605.00528]。建议保持两个 topic 独立但交叉引用——agent workload 改变了 PD 分离的前提假设,但不否定优化 PD 的价值。
attention-optimization:DeepSeek-V4 的 CSA+HCA [deepseek-v4]、Kimi K2 的 MLA [2507.20534]、Kimi Linear 的 KDA [2510.26692] 直接影响 agentic serving 的 per-agent 内存足迹。注意力机制的选择是 agent-system 的上游约束——特别是 KDA 的 O(1) KV 可能从根本上消除 agent cache 管理问题的必要性 [model]。TokenDance 的 collective reuse 深度依赖 RoPE 位置编码机制 [2604.03143]。
agent-safety:Claude Code 的 93% approval fatigue [2604.14228]、SGH 的 validation gap [2604.11378]、PASTE 的 side-effect management [2603.18897]、Semantic Router 的安全信号 [vllm-project-semantic-router]、Agents SDK 的 Guardrails [openai-openai-agents-python]、Hermes Agent 缺乏安全护栏 [NousResearch-hermes-agent]、AgentAssert 的行为合约验证 [2602.22302]、SkillFortify 的供应链安全 [2603.00195]、AgentAssay 的随机测试框架 [2603.02601] 均触及安全边界。已达 8+ 篇安全相关论文,建议下一轮拆出独立 agent-safety topic——AgentAssert + SkillFortify + AgentAssay 提供了形式化验证的独立技术线,与 Claude Code/Agents SDK 的工程安全形成理论-工程互补。
agent-memory:Pancake 的多层级 ANN 索引 [2602.21477]、SLM-v2 的 Bayesian 信任防御 [2603.02240]、SLM-v3 的 Fisher 信息几何检索 [2603.14588]、Hermes Agent 的 skill 持久化 [NousResearch-hermes-agent] 共同定义了 agent 持久记忆的独立方向——从性能(Pancake 82%→3.2% 开销)到安全(SLM-v2 信任防御)到检索质量(SLM-v3 Fisher-Rao)再到记忆投毒防御(SLM-v2 OWASP ASI06)。与 KV cache 管理不同,agent memory 关注跨 session 的持久化知识而非单 session 内的推理上下文。当相关实体积累到 5+ 篇时,建议拆出独立 agent-memory topic。
RL-training-infra:K2.6 的长程 agentic RL [kimi-k2-6] 和 Hermes Agent 的 Atropos RL 管线 [NousResearch-hermes-agent] 连接了 agent-system 与 RL 训练基础设施。Agent serving 和 RL rollout 共享同一组 KV cache 管理挑战——ThunderAgent 在 RL rollout 场景验证了 1.79–3.92× 吞吐提升 [2602.13692]。TensorHub 优化 trainer→rollout 权重传输 [2601.22705],与 ThunderAgent 的 rollout 推理优化理论上可叠加。
model-routing / AI-gateway:Semantic Router [vllm-project-semantic-router]、RouteLLM [2406.18665]、OI-MAS [2601.04861]、CASTER [2601.19793]、AgentOpt [2604.06296]、Scepsy [2604.15186] 共 6 个实体直接聚焦模型路由方向。已达拆分阈值(6 篇),强烈建议拆出独立 model-routing topic。路由谱系从 per-query(RouteLLM)→ per-request 信号驱动(Semantic Router)→ per-step 置信/结构感知(OI-MAS、CASTER)→ per-pipeline 组合搜索(AgentOpt)→ multi-LLM GPU 分配(Scepsy),已形成完整的决策粒度梯度和独立的研究主线。
agent-interop-protocols:Agent Interop Survey 的 MCP→ACP→A2A→ANP 四层栈 [2505.02279] 定义了与 agent-system 正交的通信标准化维度。当前仅此一篇系统综述 + Qualixar OS 的 Claw Bridge 实现 [2604.06392]。MCP 已被 Claude Code / OpenAI Agents SDK 生产采用,证明 Stage 1 (Tool Access) 已稳定 [2505.02279]。当 A2A/ACP 相关实体积累到 3+ 篇时,建议拆出独立 agent-interop topic。
speculative-agent-execution:PASTE [2603.18897]、IdleSpec [2605.22154]、Speculative Interaction Agents [2605.13360] 三篇论文加上更早的 Speculative Tool Calls (2512.15834) 共同定义了 "agent 投机执行" 方向——从 middleware pattern prediction 到 idle-time Thompson sampling 到 agent-internal async I/O。三者的目标函数(延迟 vs 精度)、模型修改需求(无 vs 必须)、正确性机制(preemption vs reference vs commit-point)高度分化 [2605.22154] [2605.13360]。已达 3+ 篇核心论文(4 篇含 2512.15834),当进一步积累到 5+ 篇时建议拆出独立 speculative-agent topic。关键未解问题包括:多租户资源竞争下投机请求的优先级管理、精度-延迟联合 Pareto 优化、以及投机策略的形式化 regret bound [2605.22154] [2605.13360]。
coding-agent-patterns:Claude Code Analysis [2604.14228]、CMV [2602.22402]、OpenAI Agents SDK [openai-openai-agents-python]、Hermes Agent [NousResearch-hermes-agent] 共同定义了编程 agent 的架构模式。当更多编程 agent 的系统分析(如 Cursor、Codex Agent)出现时,建议拆出 coding-agent-architecture 独立 topic。
harness-engineering / code-space-search:Meta-Harness 把"包裹冻结 LLM 的 harness 代码"当作搜索目标 [2603.28052],与 AgentOpt 的模型组合配置搜索 [2604.06296] 共同定义了"对冻结基座做外层优化"的独立方向——前者白盒代码、后者黑盒配置 [2603.28052]。这一方向与 coding-agent-patterns(Meta-Harness 的 proposer 本身是 Claude Code 式编程 agent)和 context-management(Meta-Harness 自动搜索 Claude Code/CMV 人工设计的 context 策略)双向交叉 [2603.28052]。当 AVO/LoongFlow 等 agentic 进化搜索实体积累到 4+ 篇时,建议拆出独立 outer-loop-optimization / experience-driven-optimization topic——关键张力是"反馈压缩度"(全保真 trace 选择性访问 vs 结构化记忆 vs scalar/summary)[2603.28052]。
multi-model-serving:PrefillShare 的 cross-model KV sharing [2602.12029] 与 Scepsy 的 aggregate pipeline scheduling [2604.15186] 共同指向"多模型协同 serving"的独立方向。PrefillShare 从训练侧消除 KV 冗余,Scepsy 从调度侧优化多 LLM GPU 分配——两者组合定义了 multi-model agent pipeline 的完整优化栈。当相关实体积累到 4+ 篇时,建议拆出。
| Entity | Categories | Role in topic | Key contribution |
|---|---|---|---|
| [2511.00739] | agent | 瓶颈刻画 | 首次系统量化 CPU 工具执行占 agentic E2E 延迟 88%,提出 COMB/MAS 调度 |
| [2511.02230] | agent | KV TTL | Cost-benefit TTL + tool latency CDF 作为核心输入,program-level FCFS |
| [2602.22402] | agent | 客户端 context 管理 | DAG 版本控制 + 三遍裁剪,代表 serving 层外的 context 管理新范式 |
| [2602.22603] | agent | 语义淘汰 | 首次用 LLM 自身做 KV cache GC——从统计代理到语义信号的范式跃迁 |
| [2603.18897] | agent | 延迟优化 | Pattern-aware speculative tool execution,Pattern Tuple (C,T,f,p) 解耦 |
| [2604.11378] | agent | 形式化框架 | Scheduler 五元组统一 Agent Loop 和 graph executor,bounded termination |
| [2604.14228] | agent | 架构参考 | "1.6% 决策 + 98.4% 基础设施"范式,5 层 compaction,7 层 safety |
| [2605.00528] | agent | 集群调度 | Workflow-atomic scheduling + AEG,1.31× Bélády,64-GPU 验证 |
| [2605.06472] | agent | 预测驱动缓存 | 首个 algorithms-with-predictions 在 KV cache 的应用,Lipschitz 退化保证 |
| [2604.06392] | agent | Maximalist 编排 | 12 种拓扑 + Forge 自动团队设计 + 8 模块质量保障,maximalist orchestration OS |
| [2505.02279] | agent | 协议层综述 | 首篇 MCP/ACP/A2A/ANP 全景对比,四阶段成熟度路线图,协议组合为根本难题 |
| [2602.12029] | agent | 跨模型 KV 共享 | 训练时对齐消除 N 模型 KV 冗余 O(N)→O(1),开辟 "training for shared inference" 范式 |
| [2604.06392] | agent | 生态位分析 | Maximalist vs minimalist 对立 + Goodhart 检测组件价值 |
| [2505.02279] | agent | 生态位分析 | 协议层碎片化作为规模化多 agent 系统的被忽视瓶颈 |
| [2602.12029] | agent | 生态位分析 | 从 "scheduling the inference" 到 "training for shared inference" 的范式转变 |
| [2504.09285] | framework | 统一调度 | Micro-request 统一 colocation/disaggregation,SLO-aware batch composition |
| [2504.20068] | framework | SLO 理论 | GMAX 1/8.55 竞争比,首次证明 SJF/EDF 无常数竞争比 |
| [2505.05286] | framework | SLO 调度 | 首个 SLO 预算沿 workflow DAG 反向传播的调度器 |
| [2507.07400] | framework | 缓存驱逐 | Steps-to-execution 替代 LRU,首个 workflow-aware KV 策略 |
| [2509.02121] | framework | 查询优化 | 数据库批查询优化引入 agentic workflow,占据 plan-layer 独创位置 |
| [2511.01633] | framework | 图推理 serving | Multi-agent Graph-CoT + prefix caching,15.1× 吞吐 |
| [2601.12967] | framework | 协同设计 | Orchestrator-engine co-design 5 API,打破黑箱 |
| [2601.22705] | framework | 准入控制 | 将 KV cache 类比网络带宽,AIMD agent-level admission,4.09× |
| [2602.13692] | framework | 程序调度 | Program 一等公民 + 指数衰减最优性证明 + shortest-first eviction |
| [2602.21477] | framework | Agent 记忆 | 多层级 ANN 索引,记忆操作开销 82%→3.2%,4.29× 吞吐 |
| [2602.21548] | framework | 存储带宽 | 双路径 KV 加载 + CNIC 流量隔离,解决 PD 分离下 agentic I/O 瓶颈 |
| [2603.13358] | framework | 动态 PD 路由 | Append-prefill 仅 2% 干扰,Turn 2+ 可安全 co-locate |
| [2603.16104] | framework | 查询优化 | Templated Radix Tree 重构 agentic workflow,1.56× over KVFlow |
| [2604.03143] | framework | KV 去重 | Multi-agent collective reuse O(N)→O(1),91–97% 块级重叠 |
| [2604.15186] | framework | 多 LLM 调度 | Aggregate Pipeline + 分数 GPU + 相对份额稳定性 |
| [vllm-project-semantic-router] | framework | 智能路由 | 信号驱动 20+ 信号类型决策,安全作为路由一等信号 |
| [2507.20534] | model | 架构基底 | 1T MoE + MLA 开源 agentic 旗舰,MuonClip 稳定训练 |
| [2510.26692] | model | 线性注意力 | KDA 首次全面超越全注意力,O(1) fixed-size state 消除 KV 增长 |
| [2602.02276] | model | 多模态扩展 | K2 主干 + MoonViT + Agent Swarm 100 sub-agent |
| [kimi-k2-6] | model | 长程 RL | 4000+ tool calls / 12h,config 三代未变证明架构-训练解耦 |
| [deepseek-v4] | model | 注意力压缩 | CSA+HCA 将 1M 下 FLOPs 降至 27%、KV 降至 10% |
| [NousResearch-hermes-agent] | code | 自进化框架 | 闭环学习 + Skill auto-create/patch + 20+ 平台网关 + Atropos RL |
| [openai-openai-agents-python] | code | 声明式编排 | Runner loop + Guardrails + Handoffs + MCP + 7 Sandbox 后端 |
| [framework] | framework | 领域综述 | 从单请求优化到 agentic workload 全生命周期编排的范式转变 |
| [agent] | agent | 领域综述 | Agent KV cache 管理成为独立研究集群(5 篇方案竞争) |
| [model] | model | 领域综述 | MoE 主导化 + 注意力多元化 + 全模态端到端 |
| [code] | code | 领域综述 | 自治-编排分化的两条工程路线 |
| [2604.14228] | agent | 生态位分析 | "逆向工程即学术"范式 + 应用层 context 管理独立价值 |
| [2602.22603] | agent | 生态位分析 | 从统计代理信号到语义信号的淘汰决策谱系 |
| [2605.06472] | agent | Delta 分析 | algorithms-with-predictions 框架首次应用于 KV cache |
| [2602.13692] | framework | Delta 分析 | Program 一等公民 + PD 分离否定(朴素 vs 优化) |
| [2601.22705] | framework | Delta 分析 | KV-as-bandwidth 资源抽象的独特性 |
| [2602.22302] | agent | 行为合约 | Design-by-Contract 六元组 + OU 漂移界 + JSD 前导指标 + 组合性定理,<10 ms 运行时强制 |
| [2603.00195] | agent | 供应链安全 | 首个 agent skill 形式化安全框架:Dolev-Yao + 抽象解释 soundness(0% FPR)+ SAT 依赖解析 + 信任代数 |
| [2603.02240] | agent | Agent 记忆安全 | 本地优先 + Bayesian 信任防御记忆投毒(trust gap 0.90),sleeper agent 72% 信任衰减 |
| [2603.02601] | agent | 随机测试 | 三值判决 + SPRT 78% 试验缩减 + 行为指纹 86% 检测力(vs 传统 0%),10 框架适配 |
| [2603.14588] | agent | 信息几何记忆 | Fisher-Rao 检索(Čencov 唯一性)+ Poincaré Langevin 生命周期 + Sheaf 矛盾检测,LoCoMo +12.7 pp |
| [2604.06296] | agent | 客户端优化 | 组合级模型选择:pipeline 内模型质量非 context-free,13–32× 成本差异,UCB-E 62–76% 预算节约 |
| [2406.18665] | agent | 模型路由 | 首个偏好数据训练的 LLM 路由器,>2× 成本节约、跨模型族零样本迁移,开源框架 |
| [2601.04861] | agent | 置信路由 | 层级化 role+model 联合路由 + 置信感知 RL,+7.68% 准确率 + 79.78% 成本削减 |
| [2601.19793] | agent | 神经路由 | 双分支语义+结构路由 + on-policy 负反馈自改进,72.4% 成本削减,Pareto 优于 FrugalGPT |
| [2605.22154] | agent | Idle-time 投机规划 | Thompson 采样 progressive/recovery 双策略 + reference-based 聚合,idle time 期间做 test-time compute,+5.1% 准确率且延迟 ~0 |
| [2605.13360] | agent | 异步投机执行 | 硬件投机执行迁移到 agent——async I/O + safe/unsafe 工具分类 + DAG commit-point,clock-based SI-SFT 训练 3B 模型达 1.6–2.2× 延迟降低 |
| [2605.22154] | agent | Delta 分析 | IdleSpec 开辟 "idle-time compute for accuracy" 坐标点,与 PASTE/SIA 延迟优化正交 |
| [2605.13360] | agent | Delta 分析 | SIA 开创 agent-internal speculative execution 范式,同时解耦用户输入和工具返回两个 I/O 阻塞点 |
| [2603.28052] | agent | 外层 harness 搜索 | 把 harness 代码当搜索目标的 outer-loop 系统——coding-agent proposer 经文件系统读取全部历史 trace,比 ACE +7.7 且 ctx 少 4×,TerminalBench-2 超手工 harness |
| [2603.28052] | agent | 接口消融证据 | 受控消融证明原始 trace 访问不可压缩:Scores-Only 34.6 / Summary 34.9 ≪ full traces 50.0 median |
| [2603.28052] | agent | 生态位分析 | "优化对象 × 反馈压缩度"二维:Meta-Harness 占据"harness 代码 + 冻结权重 + 全保真 trace 选择性访问"此前空着的格子,与 AgentOpt 黑盒配置搜索互补 |
| [2603.28052] | agent | Delta 分析 | 自动搜索 vs 人工设计 context 策略;白盒代码 vs 黑盒配置;全保真 trace 不可压(与 ECS/PEEK 的压缩处方张力) |