2025–2026 年,agent 系统从"单轮推理优化"跃迁至"多轮工作流系统工程",而工作流中的不同阶段对模型能力的需求呈现出显著的异构性——规划与工具选择需要 frontier 大模型(LLM, 70B+),而子任务执行、结果组装、本地数据读取等环节完全可以交给小模型(SLM, 1B–8B)。这种异构需求催生了"强弱模型协作"这一跨 agent、framework、model 三个类别的系统性研究方向。
从 agent 类别看,生产系统已验证分层 agent 架构的可行性——Claude Code 的极简 while-loop 加 98.4% 确定性基础设施表明,agent 核心决策逻辑极少,大部分工作可由轻量组件承担 [2604.14228];Kimi K2.6 的 Agent Swarm 支持 300 个 sub-agent 并行,Claw Groups 允许异构模型编排,不同 sub-agent 可使用不同 effort 级别 [kimi-k2-6]。
从 framework 类别看,agentic workload 的 serving 已成为最活跃的基础设施方向——多轮 tool-call 间隙中 KV cache 的不当驱逐可导致延迟膨胀 1.5–6× [agent],催生了 Continuum、SideQuest、SAGA、PBKV 等一系列 agent-aware 缓存管理系统 [agent]。ThunderAgent 将"agentic program"提升为一等调度单元 [2602.13692],Scepsy 的 Aggregate Pipeline 抽象首次实现了多个不同大小 LLM 的联合 serving [2604.15186]。
从 model 类别看,注意力机制和量化技术的突破正在改变大小模型的能力边界——DeepSeek-V4 的压缩注意力将 1M context 下 FLOPs 降至前代 27%、KV cache 降至 10% [deepseek-v4],使 frontier 模型的推理成本大幅下降;Kimi Linear 的 KDA 线性注意力首次在公平对比下全面超越全注意力,KV cache 减少 75% [2510.26692],使中等规模模型的 serving 密度成倍提升;K2.6 的 INT4 默认量化把 1T MoE 拉到单 8×H200 节点 [kimi-k2-6],模糊了"大模型"与"可部署模型"的边界。
这三条技术线的交汇——agent 需要异构模型编排、framework 需要高效多模型 serving、model 提供了不同效率档位的选择——构成了本 topic 存在的根本原因。
| Category | 论文数量 | 代表性工作 |
|---|---|---|
| Agent | 14 | Continuum (KV TTL), SideQuest (语义淘汰), SAGA (工作流调度), Claude Code (架构分析), PASTE (投机工具执行), RouteLLM (偏好路由), OI-MAS (置信度路由), CASTER (神经路由), Speculative Tool Calls (投机工具调用), AgentOpt (模型组合搜索) |
| Framework | 20 | ThunderAgent (程序级调度), Helium (模板化 radix tree), Scepsy (多 LLM pipeline), DynaServe (统一 serving), Saguaro (推测解码), DualPath/PrfaaS (PD 分离), CodeComp (结构化 KV 压缩) |
| Model | 6 | DeepSeek-V4 (压缩注意力), DeepSeek-V2 (MLA), Kimi K2.6 (agent RL + INT4), Kimi K2 (agentic MoE), K2.5 (PARL 多 agent RL), Kimi Linear (KDA) |
| 合计 | 40 | — |
Agent 类提供了多轮工作流的缓存与执行优化视角,Framework 类提供了异构模型 serving 基础设施,Model 类提供了不同效率档位的模型设计。三者的交叉点——如何在 agent 工作流中高效编排和 serving 不同大小的模型——正是本 topic 的核心问题。
| 时间 | 里程碑 | 类别 | 贡献 |
|---|---|---|---|
| 2024-05 | DeepSeek-V2 | model | MLA 首创 KV 联合低秩压缩(93.3% 压缩率),21B 激活达 70B dense 水平,5.76× 推理吞吐提升,奠定"大模型可廉价 serving"基础 [2405.04434] |
| 2024-06 | RouteLLM | agent | 首个基于人类偏好数据的二元模型路由框架,>2× 成本节省保持 >95% 强模型质量,跨模型对泛化无需重训 [2406.18665] |
| 2025-04 | DynaServe | framework | 首个以 micro-request 统一 colocation 和 disaggregation 的 serving 系统,为异构模型部署奠基 [2504.09285] |
| 2025-04 | JITServe | framework | 首个可证明 competitive ratio(1/8.55)的 SLO-aware goodput 调度,支撑多模型部署下的 SLO 保证 [2504.20068] |
| 2025-07 | KVFlow | framework | 首个 workflow-aware KV cache 淘汰策略,用 Agent Step Graph 预测复用 [2507.07400] |
| 2025-07 | Kimi K2 | model | 1T MoE(32B 活跃)开源,MuonClip 实现零 loss spike,20K+ 工具合成数据启动 agentic 训练范式 [2507.20534] |
| 2025-09 | Halo | framework | 首个面向 batch agent DAG 的 DP solver,request coalescing 实现 2.54× fan-out 加速 [2509.02121] |
| 2025-10 | Kimi Linear | model | KDA 线性注意力首次在公平对比下全面超越全注意力,KV cache −75%,为高并发 agent serving 提供模型侧基础 [2510.26692] |
| 2025-11 | Continuum | agent | 首个 KV cache TTL 机制,量化 tool-call 间隙的缓存保留收益,真实 SWE-agent 8.18× 加速 [2511.02230] |
| 2025-11 | CPU-Centric | agent | 首次系统性刻画 agent workload 中 CPU 侧瓶颈:工具执行占 E2E 延迟 35%–88% [2511.00739] |
| 2025-12 | Speculative Tool Calls | agent | Tool-call 级投机执行(token 级→工具级),client-side 6–21% E2E 时延节省,理论上界 <2×,商业 API 仅 4% 额外成本 [2512.15834] |
| 2026-01 | OI-MAS | agent | 置信度感知 RL 联合路由角色与模型规模,token log-prob 驱动成本惩罚调制,+7.68% 准确率 + 最高 79.78% 成本降低 [2601.04861] |
| 2026-01 | CASTER | agent | 双分支神经路由(语义嵌入 + 结构元特征),on-policy 负反馈自改善,最高 72.4% 成本降低且 Pareto 支配 FrugalGPT cascading [2601.19793] |
| 2026-01 | Concur | framework | AIMD 式 agent-level 准入控制,消除 KV cache 中间相位抖动,4.09× 吞吐 [2601.22705] |
| 2026-02 | ThunderAgent | framework | "agentic program"成为一等调度单元,生命周期感知的 KV cache GC [2602.13692] |
| 2026-02 | SideQuest | agent | 让推理模型自身做 KV cache 语义淘汰,56–65% 峰值 token 降幅 [2602.22603] |
| 2026-02 | Kimi K2.5 | model | 1T MoE 接入 MoonViT-3D 多模态,PARL 框架实现多 agent RL 训练(orchestrator 训练 + sub-agent 冻结)[2602.02276] |
| 2026-02 | Kimi K2.6 | model | 长程 agentic RL(12–13 小时 / 4000+ 工具调用)+ INT4 默认量化 + Agent Swarm 3× 扩展 [kimi-k2-6] |
| 2026-03 | PASTE | agent | Pattern-based 投机工具执行,E2E 延迟降低 48.5%,tool stall 减少 67% [2603.18897] |
| 2026-03 | Helium | framework | 数据库风格查询优化应用于 batch agent 工作流,Templated Radix Tree + proactive KV caching [2603.16104] |
| 2026-03 | Saguaro | framework | 推测性推测解码(Speculative Speculative Decoding),辅助线程并行构建推测缓存,~30% 加速 [2603.03251] |
| 2026-04 | Claude Code 分析 | agent | 源码级逆向工程揭示生产 agent "1.6% 决策逻辑 + 98.4% 确定性基础设施"范式 [2604.14228] |
| 2026-04 | AgentOpt | agent | Client-side 模型组合搜索(Matrix UCB-E),揭示最强单模型可为最差 planner(Opus 31.7% vs 最优 74.3%),62–76% 预算节省 [2604.06296] |
| 2026-04 | CodeComp | framework | CPG 结构感知 KV cache 压缩,span-level 保护 call/control-flow token,91% full-context 恢复率 @ 60% KV 保留 [2604.10235] |
| 2026-04 | Scepsy | framework | Aggregate Pipeline 抽象,首次实现多个不同大小 LLM 的联合 serving(fractional-GPU + TP 联合搜索)[2604.15186] |
| 2026-04 | TokenDance | framework | Collective KV cache 共享,All-Gather 模式下 PIC 复用从 O(N) 降至 O(1),11–17× 压缩 [2604.03143] |
| 2026-05 | SAGA | agent | Agent Execution Graph 形式化工作流为 DAG,WA-LRU 达 Bélády 最优 1.31× competitive ratio [2605.00528] |
| 2026-05 | PBKV | agent | GraphSAGE 多步预测驱动分层 KV cache 淘汰,命中率 27%→69%,Lipschitz 退化保证 [2605.06472] |
| 2026-05 | DeepSeek-V4 | model | CSA+HCA 压缩注意力,1M context 下 FLOPs 仅前代 27%、KV cache 仅 10%,配 FP4 QAT [deepseek-v4] |
四条跨类别技术演进线在"强弱模型协作 agent"处交汇:
Agent 运行时形式化 (agent 类)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Agent Loop (非确定性) SGH 静态 DAG ThunderAgent
[Claude Code 验证] ─→ [有界终止证明] ─→ [程序级调度单元]
│ │ │
│ ▼ ▼
│ SAGA 工作流原子 Scepsy 多 LLM Pipeline
│ [DAG + 公平调度] [异构模型联合 serving]
│ │
▼ ▼
K2.6 Claw Groups ──────────────────→ 强弱模型异构编排
[orchestrator + sub-agent] (本 topic 核心)
KV Cache 管理演进 (agent × framework 类)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
全局 LRU 工作流感知
│ │
├→ Continuum KV TTL ──→ KVFlow STE ──→ SAGA WA-LRU
│ [时间维度] [步数预测] [DAG 预测,1.31×Bélády]
│ │
├→ SideQuest 语义淘汰 │
│ [辅助 LRM 线程] │
│ ▼
└→ PBKV GraphSAGE ───→ 分层淘汰 + Lipschitz 保证
[GNN 多步预测] [退役缓存+评分驱动]
│
▼
TokenDance 集体复用
[All-Gather O(1)]
模型效率演进 (model 类)
━━━━━━━━━━━━━━━━━━━━━━━
标准 Attention ─→ GQA ─→ MLA (V2, KV −93.3%) ─→ MLA (K2)
│ │
│ KDA (Kimi Linear)
│ KV −75%, decode +75%
▼
CSA+HCA (DeepSeek-V4)
FLOPs −73%, KV −90% @1M
│
▼
INT4/FP4 量化 ─── K2.6 INT4 (1T→单节点)
└── V4 FP4 QAT (train=deploy)
模型路由演进 (agent 类, 新增)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Query-level 二元路由 Step-level 多规模路由
RouteLLM (2024.06) OI-MAS (2026.01)
[偏好数据→阈值 α] ─→ [RL + confidence 调制]
│ 跨模型泛化 │ 角色×模型联合
│ 无需重训 │ per-step 自适应
│ ▼
│ CASTER (2026.01)
│ [双分支神经路由 + on-policy 反馈]
│ │
▼ ▼
Combination-level 搜索 强弱协作路由
AgentOpt (2026.04) (本 topic 核心)
[UCB-E 组合搜索]
"最强单模型 ≠ 最优 planner"
关键分支点:KV cache 管理从单一 LRU 分裂为"时间维度"(Continuum TTL)和"语义维度"(SideQuest)两条路线 [2511.02230] [2602.22603],又在工作流级汇聚为结构化预测方法(SAGA/PBKV)[2605.00528] [2605.06472]。
关键收敛点:模型侧的注意力压缩(DeepSeek-V2 MLA [2405.04434]→DeepSeek-V4 CSA+HCA [deepseek-v4]、Kimi Linear KDA [2510.26692])与框架侧的 PD 分离(DualPath [2602.21548]、PrfaaS [2604.15039])共同使"大模型 serving 成本下降到足以与小模型混合部署"成为可能。
关键新分支:模型路由从 query-level 二元分类(RouteLLM [2406.18665])快速演进为 step-level 多规模路由(OI-MAS [2601.04861]、CASTER [2601.19793]),再到 combination-level 搜索(AgentOpt [2604.06296]),但 AgentOpt 的发现——最强单模型在多步 pipeline 中可能是最差 planner——揭示了 per-call routing 与 pipeline-level 优化之间的根本张力。
MLA 技术从 DeepSeek-V2 的 93.3% KV 压缩率 [2405.04434] 演进到 DeepSeek-V4 的 CSA+HCA(KV cache 压缩至前代 10%),但 V4 需要 Lightning Indexer(FP4) + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [deepseek-v4]。这种架构使得"大模型端"的 KV 传输成本大幅下降——PrfaaS 的跨 DC PD 分离因此变为可行(hybrid attention 模型 KV 吞吐仅 ~3 Gbps,商用以太网即可承载)[2604.15039]。反过来,若 agent 系统使用 KDA 类线性注意力的小模型(decode 吞吐 +75%)[2510.26692],serving 侧的 KV cache 管理策略需要根本性调整——Continuum 的 TTL 模型假设 KV reload 成本与 token 数成正比 [2511.02230],但 KDA 的固定大小 recurrent state 使 reload 成本变为常数。
Claude Code 的生产架构表明 agent 决策逻辑仅占 1.6%,其余 98.4% 是确定性基础设施(context compaction、权限管理、工具执行)[2604.14228]。这一比例暗示:在强弱模型协作系统中,大模型实际只需要处理极少量的关键决策,大量确定性工作可以由 SLM 或甚至非模型组件完成。
K2.6 的 Claw Groups 机制将这一洞察系统化——异构 agent 组中,orchestrator 使用 thinking 模式做高层规划,sub-agent 使用非 thinking 模式执行具体任务,不同 agent 可配置不同的 effort 级别 [kimi-k2-6]。K2.5 的 PARL 框架更进一步:训练时只更新 orchestrator 参数,sub-agent 保持冻结 [2602.02276]——这直接支持"大模型做规划、小模型做执行"的协作范式。
在 framework 侧,Scepsy 发现 agentic 工作流中不同 LLM 的相对执行份额在稳态下保持稳定(relative share stability)[2604.15186],这使得 fractional-GPU 分配 + TP 拓扑联合搜索成为可能——异构模型的 GPU 资源不再需要静态预分配。ThunderAgent 的 program-level 调度 [2602.13692] 和 Helium 的 Templated Radix Tree [2603.16104] 则从不同角度解决了多轮异构调用的调度优化。
CPU-Centric 的刻画 [2511.00739] 揭示了一个关键事实:LLM serving 节点中工具执行占 E2E 延迟 35%–88%,但 CPU 利用率远未饱和。COMB 微批重叠可以将 serving 延迟降低 3.9×(P50)[2511.00739]。Pancake 的 GPU-CPU 协调动态索引进一步验证了在同一节点上同时运行 GPU 大模型推理和 CPU 小模型/索引服务的可行性 [2602.21477]。
这意味着在已有 GPU serving 基础设施上零额外硬件成本部署 SLM 是可行的——大模型的 GPU-bound 推理与 SLM 的 CPU-bound 执行天然错开资源使用。Halo 的 CPU-GPU 流水线设计 [2509.02121] 和 Sutradhara 的 prefill-tool overlap [2601.12967] 分别在 batch 和 session 粒度验证了这种互补模式。
推测执行的思想已从 token 级推测解码扩展到更高粒度:
模型路由是强弱协作的最直接体现——决定"这个请求/子任务应该交给大模型还是小模型"。三篇路由论文展现了清晰的演进轨迹:
阶段一:Query-level 二元路由(RouteLLM, 2024.06)[2406.18665]。将路由建模为偏好预测:$P_{\bm{\theta}}(\text{win}_s \mid q) \geq \alpha$ 则路由到强模型,否则到弱模型。核心洞察是 Chatbot Arena 的人类偏好数据已编码了 query 难度信号。优势:(1) 每请求只调用一个 LLM(无 cascading 双重开销),(2) 跨模型对泛化无需重训(GPT-4/Mixtral 训练的 router 直接迁移到 Claude 3 Opus/Sonnet),(3) 最轻量 router(MF)仅需 8GB GPU,6.4 ms/query。局限:(1) 二元分类无法处理 N 个模型规模,(2) 无状态——不感知多轮推理的 context 演化,(3) 偏好数据对 agentic reasoning 覆盖不足。
阶段二:Step-level 多规模路由(OI-MAS + CASTER, 2026.01)。两项工作同期独立攻击 RouteLLM 的三个局限:
阶段三:Combination-level 搜索(AgentOpt, 2026.04)[2604.06296]。AgentOpt 揭示了 per-call routing 的根本盲区——模型质量不是 context-free 的属性。在 HotpotQA 的 81 种 planner-solver 组合中,最强单模型 Claude Opus 4.6 作为 planner 准确率仅 31.71%(全局最差),因为它绕过 solver 工具直接从参数知识回答。这意味着 RouteLLM/OI-MAS/CASTER 的 per-call routing 假设——"给定 query/state,可以独立评估每个模型的适合度"——在多步 pipeline 中不成立。AgentOpt 用 Matrix UCB-E 在组合空间中搜索,62–76% 预算节省下接近最优。
范式张力:per-call routing(实时、轻量、适合在线决策)与 combination-level 搜索(offline、全局最优、需要搜索预算)之间存在根本权衡。未来方向可能是两者的融合——先用 AgentOpt 式搜索确定 pipeline 架构和模型分配的大致方向,再用 OI-MAS/CASTER 式 router 做运行时微调。
CodeComp [2604.10235] 揭示了 KV cache 压缩的第三个维度:领域结构先验。在代码任务中,attention-based 重要性与 CPG(Code Property Graph)结构重要性近乎正交(Jaccard = 0.0944),52% 的 call site token 在 attention-only 压缩下被错误淘汰。CodeComp 的 span-level 结构保护(function calls 0.20、control-flow 0.18、query alignment 0.18 权重)在 60% KV 保留率下恢复 91% full-context 准确率——消融表明 span 保护(0.617–0.783)远优于 capacity 分配(0.283–0.450)。
这对强弱协作的启示:当 SLM 处理代码类子任务时,其有限的 context window 可以通过结构感知压缩得到更高效的利用——不是简单缩短 context,而是保留结构关键 token。这与 §5.1 中"模型架构约束 serving 基础设施"的论点形成互补:模型侧通过 MLA/KDA 降低 KV cache 总量,框架侧通过 CodeComp 式结构压缩提升已有 cache 的信息密度。
共识 1:Orchestrator 能力决定系统上限,Executor 大小影响较小。 Claude Code 的 1.6% 决策逻辑比例 [2604.14228]、K2.5 PARL 训练中 sub-agent 冻结而 orchestrator 更新 [2602.02276]、以及 SGH 对 Agent Loop planner-limited 特性的形式化分析 [2604.11378] 均指向同一结论:agent 系统的性能瓶颈在规划层而非执行层。这直接支持了"大模型做规划、小模型做执行"的协作范式。
共识 2:KV cache 管理是 agent serving 的关键瓶颈。 全部 5 个 agent-aware KV cache 系统(Continuum、SideQuest、CMV、SAGA、PBKV)一致认为现有引擎的 end-of-turn eviction 对 agent workload 造成严重性能损失 [agent]。Continuum 量化了这一损失:per-turn queueing delay 累积可占总延迟 58.2% [2511.02230]。在强弱模型协作场景下,模型切换带来的 KV cache 失效是这一问题的加剧版。
共识 3:多模型 serving 需要工作流级调度。 ThunderAgent [2602.13692]、Helium [2603.16104]、Halo [2509.02121]、SAGA [2605.00528] 均从不同角度得出:请求级调度无法捕获 agent 工作流中的跨模型依赖,必须提升调度粒度到程序/工作流/DAG 级别。
共识 4:模型路由可实现 2× 以上成本节省且不显著损失质量。 RouteLLM(>2× 成本节省、95% 质量保持)[2406.18665]、OI-MAS(+7.68% 准确率、17–79% 成本降低)[2601.04861]、CASTER(23–72% 成本降低、质量持平或超越全强模型)[2601.19793] 三项独立工作在完全不同的实验设置下达成一致结论:大量子任务可安全路由到弱模型。更值得注意的是,RouteLLM 的跨模型泛化(GPT-4/Mixtral 训练→Claude 3/Llama 3.1 部署无需重训)表明 router 学到的是 query-intrinsic complexity,而非 model-specific artifacts。
共识 5:投机执行是强弱协作的天然加速模式。 从 token 级(Saguaro [2603.03251])到工具调用级(PASTE [2603.18897]、Speculative Tool Calls [2512.15834]),小模型为大模型提前"打草稿"的范式已在多个粒度上验证有效。Speculative Tool Calls 的理论分析(Lemma 1: 加速上界 <2×)提供了首个严格的性能界。
分歧 1:KV cache 应该按时间维度还是语义维度淘汰? Continuum 认为 tool-call 延迟的 CDF 即可决定最优 TTL [2511.02230]。SideQuest 反对,认为 token 重要性非单调——某些 tool response 在第 $t$ 轮看似无用但到第 $t+n$ 轮可能重新变关键 [2602.22603]。根本原因在于实验 workload 不同:Continuum 面向 6–11 turn 的 function-calling agent,SideQuest 面向 80+ turn 的 deep research agent [agent]。在强弱模型协作系统中,短 horizon 的 SLM 执行子任务适用时间维度,长 horizon 的 LLM 规划链路则需要语义维度。
分歧 2:Agent Loop 是否足以支撑生产系统? SGH 论证 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),只有显式 DAG 才能根本解决 [2604.11378]。但 Claude Code 的生产成功恰恰建立在 Agent Loop 之上,通过 5 层 compaction + 7 层安全管道实现 production readiness [2604.14228]。在强弱协作场景下,这一分歧映射为:结构化 DAG 更适合"预规划的强弱分工"(如 Halo 的 batch DAG [2509.02121]),而 Agent Loop 更适合"运行时动态路由"(如 Claw Groups 的异构编排 [kimi-k2-6])。
分歧 3:模型路由应在什么粒度上做出决策? RouteLLM [2406.18665] 在 query 级做一次性路由(无状态、最低开销),OI-MAS [2601.04861] 和 CASTER [2601.19793] 在 step 级做实时路由(state-dependent、可自适应),AgentOpt [2604.06296] 在 combination 级做 offline 搜索(全局最优但需要搜索预算)。AgentOpt 的核心发现——Claude Opus 4.6 作为 planner 准确率仅 31.71%(全局最差),因为它绕过 solver 工具直接回答——直接挑战了 per-call routing 的前提:模型质量不是 context-free 的,同一模型在不同 pipeline 位置的表现可能截然不同。这一分歧的根源在于 per-call router 无法感知 pipeline 下游的交互效应。
分歧 4:PD 分离的粒度——静态物理分离 vs 动态逻辑分离? DualPath [2602.21548] 和 PrfaaS [2604.15039] 主张 prefill 和 decode 物理分离到不同节点(甚至不同数据中心),而 DynaServe 的 micro-request [2504.09285] 在任意 token 边界动态决定分离点。在强弱协作中,物理分离自然对应"大模型 prefill 集群 + 小模型 decode 集群",逻辑分离则允许同一请求在同一节点上跨模型执行。
在强弱模型切换时,前序模型积累的 KV cache 无法直接迁移到后续模型(内部表示空间完全不同)。TokenDance 的 collective KV 共享 [2604.03143] 和 KVServe 的 service-aware 压缩 [kvserve] 都假设同一模型的多实例共享,而非跨模型传递。这不仅是工程问题(需要 adapter 做空间对齐),更是理论问题:KV cache 中编码的信息量与文本表示之间存在信息瓶颈——CMV 的三遍裁剪 [2602.22402] 表明即使在文本层面也只能实现 ~20% 的无损压缩。
为何根本性困难:不同模型的表示空间基于不同的预训练数据和架构(MLA vs KDA vs CSA),对齐需要在保持语义完整性的同时适应完全不同的 attention 模式。agent 类和 framework 类需要协同解决——agent 层提供语义保真度评估,framework 层提供高效传输通道。预计 2–3 年内只能通过结构化文本中间表示部分解决。
早期强弱协作系统依赖手动设计的分工规则:K2.6 的 Claw Groups 需要预定义 effort 级别 [kimi-k2-6],Scepsy 的 relative share 假设稳态分布 [2604.15186],PASTE 的 pattern mining 需要历史模式积累 [2603.18897]。模型路由(RouteLLM [2406.18665]、OI-MAS [2601.04861]、CASTER [2601.19793])开始自动化这一决策,但仅限于 per-call 或 per-step 粒度——AgentOpt [2604.06296] 揭示 pipeline-level 交互效应使 per-call routing 在某些场景下失效。
为何根本性困难:最优分解边界取决于三个动态变量的联合分布——任务复杂度(语义维度)、模型能力边界(随模型迭代变化)、和部署约束(延迟/成本/可用资源)。JITServe 的 QRF 预测 [2504.20068] 表明即使单模型场景下长度预测已经困难(冷启动风险),跨模型的能力边界预测更不确定。agent、framework、model 三个类别都需要参与——agent 层提供任务复杂度信号,model 层提供能力自评估,framework 层做运行时路由。预计 3–5 年。
在 GPU serving 节点上 co-deploy SLM 的可行性已被验证——CPU-Centric [2511.00739] 和 Pancake [2602.21477] 分别从 serving 和 memory 角度展示了 CPU-GPU 协同的收益。但在高负载时,CPU 内存带宽竞争可能导致 SLM 推理慢 30–50%(8B Q4 decode 需要 ~30–50 GB/s 持续带宽)。更关键的是,SAGA 实测 GPU 利用率从 42% 提升至 71% [2605.00528]——当 GPU serving 负载提高后,host memory 压力也随之增大,SLM co-deployment 的性能退化会更严重。
为何根本性困难:这是 hardware-level 资源竞争,软件层面只能做 NUMA 隔离(将 SLM 绑定到远离 GPU 的 NUMA node),不能根本消除。随着 GPU 内存带宽持续增长(HBM3E → HBM4)但 CPU DDR 带宽增长放缓(DDR5 → DDR6 仅 ~50% 提升),这一矛盾可能加剧。需要硬件层面的解决(如 CXL 池化内存或专用 NPU)。
在多模型 agent 工作流中,端到端延迟由多个异构模型的推理延迟、工具执行延迟、模型切换开销叠加而成。JITServe 的 GMAX 提供了单模型场景的 1/8.55 competitive ratio [2504.20068],但跨模型的 compound SLO 目前没有任何系统能提供理论保证。Justitia 的 KV token-time 成本模型 [2510.17015] 是单模型的,扩展到异构模型需要考虑完全不同的 per-token 成本结构。SAGA 的 workflow-atomic 调度 [2605.00528] 是最接近的尝试,但其 SLO attainment 99.2% 是在同构模型上测得。
| 子方向 | 成熟度 | 证据 | 趋势 |
|---|---|---|---|
| 单模型 agent 架构 | 生产就绪 | Claude Code 已在 Anthropic 全面部署(1.6% 决策 + 98.4% infra)[2604.14228];K2.6 验证 12–13 小时连续 coding [kimi-k2-6] | 加速 |
| Agent-aware KV cache 管理 | 研究前沿 → 早期生产 | 5 篇并发研究(Continuum 已开源 vLLM 插件)[2511.02230];但仅 Continuum 有开源实现 [agent] | 加速 |
| 多 LLM 联合 serving | 研究前沿 | Scepsy 首次展示 [2604.15186],ThunderAgent 开源 [2602.13692],但异构模型场景验证不足 | 加速 |
| 推测执行(token → tool 级) | 研究前沿 → 早期生产 | Saguaro ~30% 加速 [2603.03251],PASTE 48.5% E2E 降低 [2603.18897],Speculative Tool Calls 提供首个理论上界(<2×)和商业 API 验证(gpt-5 + gpt-5-nano, 仅 4% 成本增加)[2512.15834] | 加速 |
| 模型路由 | 研究前沿 → 早期生产 | RouteLLM 开源 [2406.18665] 已有生产部署;OI-MAS/CASTER 验证 step-level 路由可行 [2601.04861] [2601.19793];但 AgentOpt 揭示 per-call routing 在多步 pipeline 中的局限 [2604.06296] | 加速 |
| 跨模型 context 传递 | 早期探索 | TokenDance 解决同模型多实例共享 [2604.03143],真正的跨架构传递无解 | 萌芽 |
| CPU co-deployment | 概念验证 | CPU-Centric 刻画了瓶颈 [2511.00739],Pancake 验证了 GPU-CPU 协同 [2602.21477],无专门的 SLM co-deploy 系统 | 萌芽 |
| 异构模型训练(多 agent RL) | 早期生产 | K2.5 PARL [2602.02276] 和 K2.6 Agent Swarm [kimi-k2-6] 已在 Moonshot 内部使用 | 加速 |
总体判断:agent 单体架构和 serving 基础设施已接近生产就绪。模型路由作为强弱协作的核心决策组件已从早期探索进入早期生产——RouteLLM 的开源框架已有实际部署,OI-MAS/CASTER 验证了 step-level 路由的可行性。然而 AgentOpt 揭示了 per-call routing 在多步 pipeline 中的根本局限,真正的多模型协作——不同大小的模型在同一工作流中无缝协作——仍处于研究前沿。核心缺失环节从"是否可以自动路由"(已部分解决)转移至"跨模型 context 传递"和"pipeline-level 组合优化"。当前的"协作"更多是编排(大模型发指令、小模型执行)而非深度融合(两个模型在推理过程中交替贡献)。趋势方向:加速中,2026 年底预计会出现首个开源的端到端异构模型协作 agent serving 系统。
| 邻接 Topic | 重叠区域 | 边界 |
|---|---|---|
| agent-serving | KV cache 管理、工作流调度、tool execution 优化——本 topic 的 framework 侧内容大量重叠 | agent-serving 关注"如何高效 serve agent workload",本 topic 关注"如何在 agent 中协作使用不同大小的模型"。agent-serving 不涉及模型异构性 |
| PD-disagg | DualPath、PrfaaS、DynaServe 的 PD 分离为强弱模型物理分离部署提供基础设施 | PD-disagg 关注 prefill 和 decode 的资源分离,本 topic 关注不同模型间的任务分离。两者可能在"大模型做 prefill、小模型做 decode"处合并 |
| attention-optimization | DeepSeek-V4 CSA/HCA、Kimi Linear KDA 的效率提升直接影响强弱模型的能力边界 | attention-optimization 关注单模型效率,本 topic 关注多模型协作。当 attention 效率足够高时,"大模型"可能不再"大",本 topic 的前提可能消解 |
| multi-agent-orchestration | K2.6 Claw Groups、Claude Code subagent delegation、PARL 框架均为多 agent 编排 | 多 agent 编排不要求模型异构——homogeneous agent pool 也是合法的。本 topic 特别关注异构场景 |
潜在合并预测:随着模型效率持续提升(V4 的 284B/13B Flash 已达前代 70B 级能力 [deepseek-v4]),"大模型"的定义在滑动——曾经需要 8 卡的模型现在单卡可跑。如果这一趋势持续,本 topic 可能在 1–2 年内部分合并入 agent-serving,因为"异构"不再是关键约束。
| Entity | Categories | Role in topic | Key contribution | ||
|---|---|---|---|---|---|
| [2511.02230] | agent | KV cache 管理 | 首个 agent-aware TTL 机制,量化 tool-call 间隙缓存价值,8.18× 实测加速 | ||
| [2602.22402] | agent | 会话 context 管理 | DAG 版本控制 + 三遍裁剪,~20% 无损 token 缩减 | ||
| [2602.22603] | agent | 语义 KV 淘汰 | 辅助 LRM 线程做语义淘汰,56–65% 峰值 token 降幅 | ||
| [2604.14228] | agent | 生产架构分析 | Claude Code 源码级逆向,1.6% 决策 + 98.4% infra 范式 | ||
| [2605.00528] | agent | 集群调度 | AEG + WA-LRU 1.31× Bélády,workflow-atomic 调度 | ||
| [2605.06472] | agent | 预测性缓存 | GraphSAGE 多步预测,命中率 27%→69%,Lipschitz 保证 | ||
| [2511.00739] | agent | CPU 侧瓶颈 | 首次量化 agent workload CPU 占比 35–88%,COMB 3.9× | ||
| [2603.18897] | agent | 投机执行 | Pattern-based 投机工具执行,E2E −48.5%,tool stall −67% | ||
| [2604.11378] | agent | 形式化框架 | Agent Loop 作为 | U | ≤1 scheduler,SGH 有界终止证明 |
| [2602.13692] | framework | 程序级调度 | "Agentic program"一等调度单元,1.48–3.92× 吞吐 | ||
| [2603.16104] | framework | 模板化优化 | DB-style plan optimization + proactive KV caching,1.56× vs KVFlow | ||
| [2509.02121] | framework | Batch 工作流 | DP solver + request coalescing + CPU-GPU pipeline | ||
| [2507.07400] | framework | 工作流缓存 | Steps-to-execution 优先级 + proactive prefetch,1.83–2.19× | ||
| [2604.03143] | framework | 集体 KV 共享 | All-Gather PIC 复用 O(N)→O(1),Master-Mirror 11–17× 压缩 | ||
| [2601.22705] | framework | 准入控制 | AIMD 双信号门控消除中间相位抖动,4.09× 吞吐 | ||
| [2604.15186] | framework | 多 LLM serving | 首个异构多 LLM 联合 serving(fractional-GPU + TP 搜索),2.4× | ||
| [2601.12967] | framework | 编排-引擎协同 | Prompt splitting + streaming tool dispatch,15% FTR 降低 | ||
| [2504.09285] | framework | 统一 serving | Micro-request 统一 colocation/disaggregation,1.15–3.07× capacity | ||
| [2602.21477] | framework | 多 agent 记忆 | FSM 多级缓存 + hybrid-graph 跨 agent 索引,4.29× 吞吐 | ||
| [2603.03251] | framework | 推测解码 | 并行辅助线程构建推测缓存,~30% 加速 vs SD baseline | ||
| [2602.21548] | framework | PD 分离 | 聚合 SNIC 带宽 + CNIC 流量隔离,1152 GPU 近线性扩展 | ||
| [2604.15039] | framework | 跨 DC 推理 | Hybrid attention KV ~3 Gbps 使跨 DC Ethernet PD 可行 | ||
| [2504.20068] | framework | SLO 调度 | GMAX 1/8.55 competitive ratio,compound SLO 支持 | ||
| [2510.17015] | framework | 公平调度 | KV token-time 成本模型 + WFQ,57.5% JCT 降低 | ||
| [tile-ai-tilert] | framework | 低延迟引擎 | Persistent Engine Kernel,BS=1 达 600 tok/s | ||
| [tokenspeed] | framework | 低延迟引擎 | C++ FSM + Placement 编译器,Pareto 优于 TRT-LLM | ||
| [kvserve] | framework | KV 压缩 | Service-aware 压缩 + controller,up to 10× 压缩 | ||
| [ref:2505.05286] | framework | Agentic 调度 | Text-to-SQL agentic scheduling,P95 latency 1.42–1.56× | ||
| [deepseek-v4] | model | 压缩注意力 | CSA+HCA 1M context FLOPs −73%、KV −90%,FP4 QAT | ||
| [kimi-k2-6] | model | Agent RL | 12–13h / 4000+ tool calls,Agent Swarm 3×,Claw Groups,INT4 | ||
| [2507.20534] | model | Agentic MoE | 1T/32B 开源,MuonClip 零 spike,20K+ 工具合成 | ||
| [2602.02276] | model | 多 agent 训练 | PARL:orchestrator 训练 + sub-agent 冻结,零视觉 SFT | ||
| [2510.26692] | model | 高效注意力 | KDA 线性注意力超全注意力,KV −75%,decode +75% | ||
| [2405.04434] | model | KV 压缩 | MLA 首创 KV 联合低秩压缩(93.3%),21B 激活达 70B dense 水平,5.76× 吞吐 | ||
| [2406.18665] | agent | 模型路由 | 偏好数据驱动的二元路由,>2× 成本节省,跨模型对泛化无需重训,开源框架 | ||
| [2601.04861] | agent | 模型路由 | 置信度感知 RL 联合路由角色×模型规模,+7.68% avg accuracy,最高 79.78% 成本降低 | ||
| [2601.19793] | agent | 模型路由 | 双分支神经路由 + on-policy 负反馈,Pareto 支配 FrugalGPT,最高 72.4% 成本降低 | ||
| [2512.15834] | agent | 投机执行 | Tool-call 级投机执行,client-side 6–21% 时延节省,理论上界 <2×,商业 API 验证 | ||
| [2604.06296] | agent | 模型组合 | Client-side 模型组合搜索(UCB-E),最强单模型可为最差 planner,62–76% 预算节省 | ||
| [2604.10235] | framework | 结构化 KV 压缩 | CPG 结构感知 span-level 保护,91% full-context 恢复率 @ 60% KV 保留,Jaccard=0.09 | ||
| [agent] | agent (survey) | 现状综合 | 9 篇 agent 论文综合,KV cache 管理为最活跃方向 | ||
| [agent] | agent (survey) | 主线分析 | 5 条 KV cache 管理分支 + 2 条执行优化分支 | ||
| [agent] | agent (survey) | 强弱对比 | PASTE top-1 仅 27.8% 但 overall 93.8% | ||
| [agent] | agent (survey) | 冲突分析 | 时间 vs 语义淘汰的 workload 依赖性 | ||
| [framework] | framework (survey) | Taxonomy | 32 篇框架论文的 Stage × Workload × Layer 分类 | ||
| [framework] | framework (survey) | 主线分析 | PD 分离、Agentic Serving、低延迟引擎、RL 框架 4 条主线 | ||
| [model] | model (survey) | 现状综合 | 11 篇模型论文:MoE 主导化、注意力多元化、全模态端到端 | ||
| [model] | model (survey) | Trade-off 轴 | KV 压缩 vs 复杂度、稀疏度 vs 通信、量化 vs 部署门槛 |