llm-slm-cooperative-agent

Cross-category topic | 40 sources

LLM-SLM 协作 Agent 系统:强弱模型组合的研究全景 #

1. 主题缘起 #

2025–2026 年,agent 系统从"单轮推理优化"跃迁至"多轮工作流系统工程",而工作流中的不同阶段对模型能力的需求呈现出显著的异构性——规划与工具选择需要 frontier 大模型(LLM, 70B+),而子任务执行、结果组装、本地数据读取等环节完全可以交给小模型(SLM, 1B–8B)。这种异构需求催生了"强弱模型协作"这一跨 agent、framework、model 三个类别的系统性研究方向。

agent 类别看,生产系统已验证分层 agent 架构的可行性——Claude Code 的极简 while-loop 加 98.4% 确定性基础设施表明,agent 核心决策逻辑极少,大部分工作可由轻量组件承担 [2604.14228];Kimi K2.6 的 Agent Swarm 支持 300 个 sub-agent 并行,Claw Groups 允许异构模型编排,不同 sub-agent 可使用不同 effort 级别 [kimi-k2-6]

framework 类别看,agentic workload 的 serving 已成为最活跃的基础设施方向——多轮 tool-call 间隙中 KV cache 的不当驱逐可导致延迟膨胀 1.5–6× [agent],催生了 Continuum、SideQuest、SAGA、PBKV 等一系列 agent-aware 缓存管理系统 [agent]。ThunderAgent 将"agentic program"提升为一等调度单元 [2602.13692],Scepsy 的 Aggregate Pipeline 抽象首次实现了多个不同大小 LLM 的联合 serving [2604.15186]

model 类别看,注意力机制和量化技术的突破正在改变大小模型的能力边界——DeepSeek-V4 的压缩注意力将 1M context 下 FLOPs 降至前代 27%、KV cache 降至 10% [deepseek-v4],使 frontier 模型的推理成本大幅下降;Kimi Linear 的 KDA 线性注意力首次在公平对比下全面超越全注意力,KV cache 减少 75% [2510.26692],使中等规模模型的 serving 密度成倍提升;K2.6 的 INT4 默认量化把 1T MoE 拉到单 8×H200 节点 [kimi-k2-6],模糊了"大模型"与"可部署模型"的边界。

这三条技术线的交汇——agent 需要异构模型编排、framework 需要高效多模型 serving、model 提供了不同效率档位的选择——构成了本 topic 存在的根本原因。


2. 覆盖的 category 分布 #

Category论文数量代表性工作
Agent14Continuum (KV TTL), SideQuest (语义淘汰), SAGA (工作流调度), Claude Code (架构分析), PASTE (投机工具执行), RouteLLM (偏好路由), OI-MAS (置信度路由), CASTER (神经路由), Speculative Tool Calls (投机工具调用), AgentOpt (模型组合搜索)
Framework20ThunderAgent (程序级调度), Helium (模板化 radix tree), Scepsy (多 LLM pipeline), DynaServe (统一 serving), Saguaro (推测解码), DualPath/PrfaaS (PD 分离), CodeComp (结构化 KV 压缩)
Model6DeepSeek-V4 (压缩注意力), DeepSeek-V2 (MLA), Kimi K2.6 (agent RL + INT4), Kimi K2 (agentic MoE), K2.5 (PARL 多 agent RL), Kimi Linear (KDA)
合计40

Agent 类提供了多轮工作流的缓存与执行优化视角,Framework 类提供了异构模型 serving 基础设施,Model 类提供了不同效率档位的模型设计。三者的交叉点——如何在 agent 工作流中高效编排和 serving 不同大小的模型——正是本 topic 的核心问题。


3. 时间线 #

时间里程碑类别贡献
2024-05DeepSeek-V2modelMLA 首创 KV 联合低秩压缩(93.3% 压缩率),21B 激活达 70B dense 水平,5.76× 推理吞吐提升,奠定"大模型可廉价 serving"基础 [2405.04434]
2024-06RouteLLMagent首个基于人类偏好数据的二元模型路由框架,>2× 成本节省保持 >95% 强模型质量,跨模型对泛化无需重训 [2406.18665]
2025-04DynaServeframework首个以 micro-request 统一 colocation 和 disaggregation 的 serving 系统,为异构模型部署奠基 [2504.09285]
2025-04JITServeframework首个可证明 competitive ratio(1/8.55)的 SLO-aware goodput 调度,支撑多模型部署下的 SLO 保证 [2504.20068]
2025-07KVFlowframework首个 workflow-aware KV cache 淘汰策略,用 Agent Step Graph 预测复用 [2507.07400]
2025-07Kimi K2model1T MoE(32B 活跃)开源,MuonClip 实现零 loss spike,20K+ 工具合成数据启动 agentic 训练范式 [2507.20534]
2025-09Haloframework首个面向 batch agent DAG 的 DP solver,request coalescing 实现 2.54× fan-out 加速 [2509.02121]
2025-10Kimi LinearmodelKDA 线性注意力首次在公平对比下全面超越全注意力,KV cache −75%,为高并发 agent serving 提供模型侧基础 [2510.26692]
2025-11Continuumagent首个 KV cache TTL 机制,量化 tool-call 间隙的缓存保留收益,真实 SWE-agent 8.18× 加速 [2511.02230]
2025-11CPU-Centricagent首次系统性刻画 agent workload 中 CPU 侧瓶颈:工具执行占 E2E 延迟 35%–88% [2511.00739]
2025-12Speculative Tool CallsagentTool-call 级投机执行(token 级→工具级),client-side 6–21% E2E 时延节省,理论上界 <2×,商业 API 仅 4% 额外成本 [2512.15834]
2026-01OI-MASagent置信度感知 RL 联合路由角色与模型规模,token log-prob 驱动成本惩罚调制,+7.68% 准确率 + 最高 79.78% 成本降低 [2601.04861]
2026-01CASTERagent双分支神经路由(语义嵌入 + 结构元特征),on-policy 负反馈自改善,最高 72.4% 成本降低且 Pareto 支配 FrugalGPT cascading [2601.19793]
2026-01ConcurframeworkAIMD 式 agent-level 准入控制,消除 KV cache 中间相位抖动,4.09× 吞吐 [2601.22705]
2026-02ThunderAgentframework"agentic program"成为一等调度单元,生命周期感知的 KV cache GC [2602.13692]
2026-02SideQuestagent让推理模型自身做 KV cache 语义淘汰,56–65% 峰值 token 降幅 [2602.22603]
2026-02Kimi K2.5model1T MoE 接入 MoonViT-3D 多模态,PARL 框架实现多 agent RL 训练(orchestrator 训练 + sub-agent 冻结)[2602.02276]
2026-02Kimi K2.6model长程 agentic RL(12–13 小时 / 4000+ 工具调用)+ INT4 默认量化 + Agent Swarm 3× 扩展 [kimi-k2-6]
2026-03PASTEagentPattern-based 投机工具执行,E2E 延迟降低 48.5%,tool stall 减少 67% [2603.18897]
2026-03Heliumframework数据库风格查询优化应用于 batch agent 工作流,Templated Radix Tree + proactive KV caching [2603.16104]
2026-03Saguaroframework推测性推测解码(Speculative Speculative Decoding),辅助线程并行构建推测缓存,~30% 加速 [2603.03251]
2026-04Claude Code 分析agent源码级逆向工程揭示生产 agent "1.6% 决策逻辑 + 98.4% 确定性基础设施"范式 [2604.14228]
2026-04AgentOptagentClient-side 模型组合搜索(Matrix UCB-E),揭示最强单模型可为最差 planner(Opus 31.7% vs 最优 74.3%),62–76% 预算节省 [2604.06296]
2026-04CodeCompframeworkCPG 结构感知 KV cache 压缩,span-level 保护 call/control-flow token,91% full-context 恢复率 @ 60% KV 保留 [2604.10235]
2026-04ScepsyframeworkAggregate Pipeline 抽象,首次实现多个不同大小 LLM 的联合 serving(fractional-GPU + TP 联合搜索)[2604.15186]
2026-04TokenDanceframeworkCollective KV cache 共享,All-Gather 模式下 PIC 复用从 O(N) 降至 O(1),11–17× 压缩 [2604.03143]
2026-05SAGAagentAgent Execution Graph 形式化工作流为 DAG,WA-LRU 达 Bélády 最优 1.31× competitive ratio [2605.00528]
2026-05PBKVagentGraphSAGE 多步预测驱动分层 KV cache 淘汰,命中率 27%→69%,Lipschitz 退化保证 [2605.06472]
2026-05DeepSeek-V4modelCSA+HCA 压缩注意力,1M context 下 FLOPs 仅前代 27%、KV cache 仅 10%,配 FP4 QAT [deepseek-v4]

4. 技术谱系(Evolution Timeline) #

四条跨类别技术演进线在"强弱模型协作 agent"处交汇:


Agent 运行时形式化 (agent 类)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Agent Loop (非确定性)     SGH 静态 DAG           ThunderAgent
[Claude Code 验证]  ─→  [有界终止证明]  ─→   [程序级调度单元]
        │                    │                     │
        │                    ▼                     ▼
        │            SAGA 工作流原子        Scepsy 多 LLM Pipeline
        │            [DAG + 公平调度]       [异构模型联合 serving]
        │                                         │
        ▼                                         ▼
  K2.6 Claw Groups ──────────────────→  强弱模型异构编排
  [orchestrator + sub-agent]              (本 topic 核心)


KV Cache 管理演进 (agent × framework 类)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
全局 LRU                 工作流感知
    │                        │
    ├→ Continuum KV TTL ──→ KVFlow STE ──→ SAGA WA-LRU
    │  [时间维度]           [步数预测]     [DAG 预测,1.31×Bélády]
    │                                          │
    ├→ SideQuest 语义淘汰                      │
    │  [辅助 LRM 线程]                         │
    │                                          ▼
    └→ PBKV GraphSAGE ───→ 分层淘汰 + Lipschitz 保证
       [GNN 多步预测]        [退役缓存+评分驱动]
                                 │
                                 ▼
                        TokenDance 集体复用
                        [All-Gather O(1)]


模型效率演进 (model 类)
━━━━━━━━━━━━━━━━━━━━━━━
标准 Attention ─→ GQA ─→ MLA (V2, KV −93.3%) ─→ MLA (K2)
                              │                       │
                              │                 KDA (Kimi Linear)
                              │                 KV −75%, decode +75%
                              ▼
                    CSA+HCA (DeepSeek-V4)
                    FLOPs −73%, KV −90% @1M
                              │
                              ▼
              INT4/FP4 量化 ─── K2.6 INT4 (1T→单节点)
                          └── V4 FP4 QAT (train=deploy)


模型路由演进 (agent 类, 新增)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Query-level 二元路由          Step-level 多规模路由
RouteLLM (2024.06)            OI-MAS (2026.01)
[偏好数据→阈值 α]     ─→    [RL + confidence 调制]
  │ 跨模型泛化                    │ 角色×模型联合
  │ 无需重训                      │ per-step 自适应
  │                               ▼
  │                         CASTER (2026.01)
  │                         [双分支神经路由 + on-policy 反馈]
  │                               │
  ▼                               ▼
Combination-level 搜索      强弱协作路由
AgentOpt (2026.04)          (本 topic 核心)
[UCB-E 组合搜索]
"最强单模型 ≠ 最优 planner"

关键分支点:KV cache 管理从单一 LRU 分裂为"时间维度"(Continuum TTL)和"语义维度"(SideQuest)两条路线 [2511.02230] [2602.22603],又在工作流级汇聚为结构化预测方法(SAGA/PBKV)[2605.00528] [2605.06472]

关键收敛点:模型侧的注意力压缩(DeepSeek-V2 MLA [2405.04434]→DeepSeek-V4 CSA+HCA [deepseek-v4]、Kimi Linear KDA [2510.26692])与框架侧的 PD 分离(DualPath [2602.21548]、PrfaaS [2604.15039])共同使"大模型 serving 成本下降到足以与小模型混合部署"成为可能。

关键新分支:模型路由从 query-level 二元分类(RouteLLM [2406.18665])快速演进为 step-level 多规模路由(OI-MAS [2601.04861]、CASTER [2601.19793]),再到 combination-level 搜索(AgentOpt [2604.06296]),但 AgentOpt 的发现——最强单模型在多步 pipeline 中可能是最差 planner——揭示了 per-call routing 与 pipeline-level 优化之间的根本张力。


5. 技术线交错 #

5.1 模型架构选择约束 serving 基础设施 #

MLA 技术从 DeepSeek-V2 的 93.3% KV 压缩率 [2405.04434] 演进到 DeepSeek-V4 的 CSA+HCA(KV cache 压缩至前代 10%),但 V4 需要 Lightning Indexer(FP4) + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [deepseek-v4]。这种架构使得"大模型端"的 KV 传输成本大幅下降——PrfaaS 的跨 DC PD 分离因此变为可行(hybrid attention 模型 KV 吞吐仅 ~3 Gbps,商用以太网即可承载)[2604.15039]。反过来,若 agent 系统使用 KDA 类线性注意力的小模型(decode 吞吐 +75%)[2510.26692],serving 侧的 KV cache 管理策略需要根本性调整——Continuum 的 TTL 模型假设 KV reload 成本与 token 数成正比 [2511.02230],但 KDA 的固定大小 recurrent state 使 reload 成本变为常数。

5.2 Agent 编排模式驱动 framework 设计 #

Claude Code 的生产架构表明 agent 决策逻辑仅占 1.6%,其余 98.4% 是确定性基础设施(context compaction、权限管理、工具执行)[2604.14228]。这一比例暗示:在强弱模型协作系统中,大模型实际只需要处理极少量的关键决策,大量确定性工作可以由 SLM 或甚至非模型组件完成。

K2.6 的 Claw Groups 机制将这一洞察系统化——异构 agent 组中,orchestrator 使用 thinking 模式做高层规划,sub-agent 使用非 thinking 模式执行具体任务,不同 agent 可配置不同的 effort 级别 [kimi-k2-6]。K2.5 的 PARL 框架更进一步:训练时只更新 orchestrator 参数,sub-agent 保持冻结 [2602.02276]——这直接支持"大模型做规划、小模型做执行"的协作范式。

在 framework 侧,Scepsy 发现 agentic 工作流中不同 LLM 的相对执行份额在稳态下保持稳定(relative share stability)[2604.15186],这使得 fractional-GPU 分配 + TP 拓扑联合搜索成为可能——异构模型的 GPU 资源不再需要静态预分配。ThunderAgent 的 program-level 调度 [2602.13692] 和 Helium 的 Templated Radix Tree [2603.16104] 则从不同角度解决了多轮异构调用的调度优化。

5.3 硬件异构性(GPU + CPU)使强弱协作的部署经济性成立 #

CPU-Centric 的刻画 [2511.00739] 揭示了一个关键事实:LLM serving 节点中工具执行占 E2E 延迟 35%–88%,但 CPU 利用率远未饱和。COMB 微批重叠可以将 serving 延迟降低 3.9×(P50)[2511.00739]。Pancake 的 GPU-CPU 协调动态索引进一步验证了在同一节点上同时运行 GPU 大模型推理和 CPU 小模型/索引服务的可行性 [2602.21477]

这意味着在已有 GPU serving 基础设施上零额外硬件成本部署 SLM 是可行的——大模型的 GPU-bound 推理与 SLM 的 CPU-bound 执行天然错开资源使用。Halo 的 CPU-GPU 流水线设计 [2509.02121] 和 Sutradhara 的 prefill-tool overlap [2601.12967] 分别在 batch 和 session 粒度验证了这种互补模式。

5.4 推测执行横跨多个粒度 #

推测执行的思想已从 token 级推测解码扩展到更高粒度:

5.5 Model Routing 范式演进:从二元分类到多规模 step-level 路由 #

模型路由是强弱协作的最直接体现——决定"这个请求/子任务应该交给大模型还是小模型"。三篇路由论文展现了清晰的演进轨迹:

阶段一:Query-level 二元路由(RouteLLM, 2024.06)[2406.18665]。将路由建模为偏好预测:$P_{\bm{\theta}}(\text{win}_s \mid q) \geq \alpha$ 则路由到强模型,否则到弱模型。核心洞察是 Chatbot Arena 的人类偏好数据已编码了 query 难度信号。优势:(1) 每请求只调用一个 LLM(无 cascading 双重开销),(2) 跨模型对泛化无需重训(GPT-4/Mixtral 训练的 router 直接迁移到 Claude 3 Opus/Sonnet),(3) 最轻量 router(MF)仅需 8GB GPU,6.4 ms/query。局限:(1) 二元分类无法处理 N 个模型规模,(2) 无状态——不感知多轮推理的 context 演化,(3) 偏好数据对 agentic reasoning 覆盖不足。

阶段二:Step-level 多规模路由(OI-MAS + CASTER, 2026.01)。两项工作同期独立攻击 RouteLLM 的三个局限:

阶段三:Combination-level 搜索(AgentOpt, 2026.04)[2604.06296]。AgentOpt 揭示了 per-call routing 的根本盲区——模型质量不是 context-free 的属性。在 HotpotQA 的 81 种 planner-solver 组合中,最强单模型 Claude Opus 4.6 作为 planner 准确率仅 31.71%(全局最差),因为它绕过 solver 工具直接从参数知识回答。这意味着 RouteLLM/OI-MAS/CASTER 的 per-call routing 假设——"给定 query/state,可以独立评估每个模型的适合度"——在多步 pipeline 中不成立。AgentOpt 用 Matrix UCB-E 在组合空间中搜索,62–76% 预算节省下接近最优。

范式张力:per-call routing(实时、轻量、适合在线决策)与 combination-level 搜索(offline、全局最优、需要搜索预算)之间存在根本权衡。未来方向可能是两者的融合——先用 AgentOpt 式搜索确定 pipeline 架构和模型分配的大致方向,再用 OI-MAS/CASTER 式 router 做运行时微调。

5.6 结构感知 KV 压缩扩展缓存管理维度 #

CodeComp [2604.10235] 揭示了 KV cache 压缩的第三个维度:领域结构先验。在代码任务中,attention-based 重要性与 CPG(Code Property Graph)结构重要性近乎正交(Jaccard = 0.0944),52% 的 call site token 在 attention-only 压缩下被错误淘汰。CodeComp 的 span-level 结构保护(function calls 0.20、control-flow 0.18、query alignment 0.18 权重)在 60% KV 保留率下恢复 91% full-context 准确率——消融表明 span 保护(0.617–0.783)远优于 capacity 分配(0.283–0.450)。

这对强弱协作的启示:当 SLM 处理代码类子任务时,其有限的 context window 可以通过结构感知压缩得到更高效的利用——不是简单缩短 context,而是保留结构关键 token。这与 §5.1 中"模型架构约束 serving 基础设施"的论点形成互补:模型侧通过 MLA/KDA 降低 KV cache 总量,框架侧通过 CodeComp 式结构压缩提升已有 cache 的信息密度。


6. 共识与分歧 #

共识 #

共识 1:Orchestrator 能力决定系统上限,Executor 大小影响较小。 Claude Code 的 1.6% 决策逻辑比例 [2604.14228]、K2.5 PARL 训练中 sub-agent 冻结而 orchestrator 更新 [2602.02276]、以及 SGH 对 Agent Loop planner-limited 特性的形式化分析 [2604.11378] 均指向同一结论:agent 系统的性能瓶颈在规划层而非执行层。这直接支持了"大模型做规划、小模型做执行"的协作范式。

共识 2:KV cache 管理是 agent serving 的关键瓶颈。 全部 5 个 agent-aware KV cache 系统(Continuum、SideQuest、CMV、SAGA、PBKV)一致认为现有引擎的 end-of-turn eviction 对 agent workload 造成严重性能损失 [agent]。Continuum 量化了这一损失:per-turn queueing delay 累积可占总延迟 58.2% [2511.02230]。在强弱模型协作场景下,模型切换带来的 KV cache 失效是这一问题的加剧版。

共识 3:多模型 serving 需要工作流级调度。 ThunderAgent [2602.13692]、Helium [2603.16104]、Halo [2509.02121]、SAGA [2605.00528] 均从不同角度得出:请求级调度无法捕获 agent 工作流中的跨模型依赖,必须提升调度粒度到程序/工作流/DAG 级别。

共识 4:模型路由可实现 2× 以上成本节省且不显著损失质量。 RouteLLM(>2× 成本节省、95% 质量保持)[2406.18665]、OI-MAS(+7.68% 准确率、17–79% 成本降低)[2601.04861]、CASTER(23–72% 成本降低、质量持平或超越全强模型)[2601.19793] 三项独立工作在完全不同的实验设置下达成一致结论:大量子任务可安全路由到弱模型。更值得注意的是,RouteLLM 的跨模型泛化(GPT-4/Mixtral 训练→Claude 3/Llama 3.1 部署无需重训)表明 router 学到的是 query-intrinsic complexity,而非 model-specific artifacts。

共识 5:投机执行是强弱协作的天然加速模式。 从 token 级(Saguaro [2603.03251])到工具调用级(PASTE [2603.18897]、Speculative Tool Calls [2512.15834]),小模型为大模型提前"打草稿"的范式已在多个粒度上验证有效。Speculative Tool Calls 的理论分析(Lemma 1: 加速上界 <2×)提供了首个严格的性能界。

分歧 #

分歧 1:KV cache 应该按时间维度还是语义维度淘汰? Continuum 认为 tool-call 延迟的 CDF 即可决定最优 TTL [2511.02230]。SideQuest 反对,认为 token 重要性非单调——某些 tool response 在第 $t$ 轮看似无用但到第 $t+n$ 轮可能重新变关键 [2602.22603]。根本原因在于实验 workload 不同:Continuum 面向 6–11 turn 的 function-calling agent,SideQuest 面向 80+ turn 的 deep research agent [agent]。在强弱模型协作系统中,短 horizon 的 SLM 执行子任务适用时间维度,长 horizon 的 LLM 规划链路则需要语义维度。

分歧 2:Agent Loop 是否足以支撑生产系统? SGH 论证 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),只有显式 DAG 才能根本解决 [2604.11378]。但 Claude Code 的生产成功恰恰建立在 Agent Loop 之上,通过 5 层 compaction + 7 层安全管道实现 production readiness [2604.14228]。在强弱协作场景下,这一分歧映射为:结构化 DAG 更适合"预规划的强弱分工"(如 Halo 的 batch DAG [2509.02121]),而 Agent Loop 更适合"运行时动态路由"(如 Claw Groups 的异构编排 [kimi-k2-6])。

分歧 3:模型路由应在什么粒度上做出决策? RouteLLM [2406.18665] 在 query 级做一次性路由(无状态、最低开销),OI-MAS [2601.04861] 和 CASTER [2601.19793] 在 step 级做实时路由(state-dependent、可自适应),AgentOpt [2604.06296] 在 combination 级做 offline 搜索(全局最优但需要搜索预算)。AgentOpt 的核心发现——Claude Opus 4.6 作为 planner 准确率仅 31.71%(全局最差),因为它绕过 solver 工具直接回答——直接挑战了 per-call routing 的前提:模型质量不是 context-free 的,同一模型在不同 pipeline 位置的表现可能截然不同。这一分歧的根源在于 per-call router 无法感知 pipeline 下游的交互效应。

分歧 4:PD 分离的粒度——静态物理分离 vs 动态逻辑分离? DualPath [2602.21548] 和 PrfaaS [2604.15039] 主张 prefill 和 decode 物理分离到不同节点(甚至不同数据中心),而 DynaServe 的 micro-request [2504.09285] 在任意 token 边界动态决定分离点。在强弱协作中,物理分离自然对应"大模型 prefill 集群 + 小模型 decode 集群",逻辑分离则允许同一请求在同一节点上跨模型执行。


7. 根本性困难(Open Challenges) #

7.1 跨模型 KV cache 传递的信息瓶颈 #

在强弱模型切换时,前序模型积累的 KV cache 无法直接迁移到后续模型(内部表示空间完全不同)。TokenDance 的 collective KV 共享 [2604.03143] 和 KVServe 的 service-aware 压缩 [kvserve] 都假设同一模型的多实例共享,而非跨模型传递。这不仅是工程问题(需要 adapter 做空间对齐),更是理论问题:KV cache 中编码的信息量与文本表示之间存在信息瓶颈——CMV 的三遍裁剪 [2602.22402] 表明即使在文本层面也只能实现 ~20% 的无损压缩。

为何根本性困难:不同模型的表示空间基于不同的预训练数据和架构(MLA vs KDA vs CSA),对齐需要在保持语义完整性的同时适应完全不同的 attention 模式。agent 类和 framework 类需要协同解决——agent 层提供语义保真度评估,framework 层提供高效传输通道。预计 2–3 年内只能通过结构化文本中间表示部分解决。

7.2 强弱模型任务分解边界的自动化确定 #

早期强弱协作系统依赖手动设计的分工规则:K2.6 的 Claw Groups 需要预定义 effort 级别 [kimi-k2-6],Scepsy 的 relative share 假设稳态分布 [2604.15186],PASTE 的 pattern mining 需要历史模式积累 [2603.18897]。模型路由(RouteLLM [2406.18665]、OI-MAS [2601.04861]、CASTER [2601.19793])开始自动化这一决策,但仅限于 per-call 或 per-step 粒度——AgentOpt [2604.06296] 揭示 pipeline-level 交互效应使 per-call routing 在某些场景下失效。

为何根本性困难:最优分解边界取决于三个动态变量的联合分布——任务复杂度(语义维度)、模型能力边界(随模型迭代变化)、和部署约束(延迟/成本/可用资源)。JITServe 的 QRF 预测 [2504.20068] 表明即使单模型场景下长度预测已经困难(冷启动风险),跨模型的能力边界预测更不确定。agent、framework、model 三个类别都需要参与——agent 层提供任务复杂度信号,model 层提供能力自评估,framework 层做运行时路由。预计 3–5 年。

7.3 CPU 内存带宽竞争下的 co-deployment 稳定性 #

在 GPU serving 节点上 co-deploy SLM 的可行性已被验证——CPU-Centric [2511.00739] 和 Pancake [2602.21477] 分别从 serving 和 memory 角度展示了 CPU-GPU 协同的收益。但在高负载时,CPU 内存带宽竞争可能导致 SLM 推理慢 30–50%(8B Q4 decode 需要 ~30–50 GB/s 持续带宽)。更关键的是,SAGA 实测 GPU 利用率从 42% 提升至 71% [2605.00528]——当 GPU serving 负载提高后,host memory 压力也随之增大,SLM co-deployment 的性能退化会更严重。

为何根本性困难:这是 hardware-level 资源竞争,软件层面只能做 NUMA 隔离(将 SLM 绑定到远离 GPU 的 NUMA node),不能根本消除。随着 GPU 内存带宽持续增长(HBM3E → HBM4)但 CPU DDR 带宽增长放缓(DDR5 → DDR6 仅 ~50% 提升),这一矛盾可能加剧。需要硬件层面的解决(如 CXL 池化内存或专用 NPU)。

7.4 Agent 工作流的端到端延迟预测与保证 #

在多模型 agent 工作流中,端到端延迟由多个异构模型的推理延迟、工具执行延迟、模型切换开销叠加而成。JITServe 的 GMAX 提供了单模型场景的 1/8.55 competitive ratio [2504.20068],但跨模型的 compound SLO 目前没有任何系统能提供理论保证。Justitia 的 KV token-time 成本模型 [2510.17015] 是单模型的,扩展到异构模型需要考虑完全不同的 per-token 成本结构。SAGA 的 workflow-atomic 调度 [2605.00528] 是最接近的尝试,但其 SLO attainment 99.2% 是在同构模型上测得。


8. 成熟度判断 #

子方向成熟度证据趋势
单模型 agent 架构生产就绪Claude Code 已在 Anthropic 全面部署(1.6% 决策 + 98.4% infra)[2604.14228];K2.6 验证 12–13 小时连续 coding [kimi-k2-6]加速
Agent-aware KV cache 管理研究前沿 → 早期生产5 篇并发研究(Continuum 已开源 vLLM 插件)[2511.02230];但仅 Continuum 有开源实现 [agent]加速
多 LLM 联合 serving研究前沿Scepsy 首次展示 [2604.15186],ThunderAgent 开源 [2602.13692],但异构模型场景验证不足加速
推测执行(token → tool 级)研究前沿 → 早期生产Saguaro ~30% 加速 [2603.03251],PASTE 48.5% E2E 降低 [2603.18897],Speculative Tool Calls 提供首个理论上界(<2×)和商业 API 验证(gpt-5 + gpt-5-nano, 仅 4% 成本增加)[2512.15834]加速
模型路由研究前沿 → 早期生产RouteLLM 开源 [2406.18665] 已有生产部署;OI-MAS/CASTER 验证 step-level 路由可行 [2601.04861] [2601.19793];但 AgentOpt 揭示 per-call routing 在多步 pipeline 中的局限 [2604.06296]加速
跨模型 context 传递早期探索TokenDance 解决同模型多实例共享 [2604.03143],真正的跨架构传递无解萌芽
CPU co-deployment概念验证CPU-Centric 刻画了瓶颈 [2511.00739],Pancake 验证了 GPU-CPU 协同 [2602.21477],无专门的 SLM co-deploy 系统萌芽
异构模型训练(多 agent RL)早期生产K2.5 PARL [2602.02276] 和 K2.6 Agent Swarm [kimi-k2-6] 已在 Moonshot 内部使用加速

总体判断:agent 单体架构和 serving 基础设施已接近生产就绪。模型路由作为强弱协作的核心决策组件已从早期探索进入早期生产——RouteLLM 的开源框架已有实际部署,OI-MAS/CASTER 验证了 step-level 路由的可行性。然而 AgentOpt 揭示了 per-call routing 在多步 pipeline 中的根本局限,真正的多模型协作——不同大小的模型在同一工作流中无缝协作——仍处于研究前沿。核心缺失环节从"是否可以自动路由"(已部分解决)转移至"跨模型 context 传递"和"pipeline-level 组合优化"。当前的"协作"更多是编排(大模型发指令、小模型执行)而非深度融合(两个模型在推理过程中交替贡献)。趋势方向:加速中,2026 年底预计会出现首个开源的端到端异构模型协作 agent serving 系统。


9. 邻接 topic #

邻接 Topic重叠区域边界
agent-servingKV cache 管理、工作流调度、tool execution 优化——本 topic 的 framework 侧内容大量重叠agent-serving 关注"如何高效 serve agent workload",本 topic 关注"如何在 agent 中协作使用不同大小的模型"。agent-serving 不涉及模型异构性
PD-disaggDualPath、PrfaaS、DynaServe 的 PD 分离为强弱模型物理分离部署提供基础设施PD-disagg 关注 prefill 和 decode 的资源分离,本 topic 关注不同模型间的任务分离。两者可能在"大模型做 prefill、小模型做 decode"处合并
attention-optimizationDeepSeek-V4 CSA/HCA、Kimi Linear KDA 的效率提升直接影响强弱模型的能力边界attention-optimization 关注单模型效率,本 topic 关注多模型协作。当 attention 效率足够高时,"大模型"可能不再"大",本 topic 的前提可能消解
multi-agent-orchestrationK2.6 Claw Groups、Claude Code subagent delegation、PARL 框架均为多 agent 编排多 agent 编排不要求模型异构——homogeneous agent pool 也是合法的。本 topic 特别关注异构场景

潜在合并预测:随着模型效率持续提升(V4 的 284B/13B Flash 已达前代 70B 级能力 [deepseek-v4]),"大模型"的定义在滑动——曾经需要 8 卡的模型现在单卡可跑。如果这一趋势持续,本 topic 可能在 1–2 年内部分合并入 agent-serving,因为"异构"不再是关键约束。


10. 参考 #

EntityCategoriesRole in topicKey contribution
[2511.02230]agentKV cache 管理首个 agent-aware TTL 机制,量化 tool-call 间隙缓存价值,8.18× 实测加速
[2602.22402]agent会话 context 管理DAG 版本控制 + 三遍裁剪,~20% 无损 token 缩减
[2602.22603]agent语义 KV 淘汰辅助 LRM 线程做语义淘汰,56–65% 峰值 token 降幅
[2604.14228]agent生产架构分析Claude Code 源码级逆向,1.6% 决策 + 98.4% infra 范式
[2605.00528]agent集群调度AEG + WA-LRU 1.31× Bélády,workflow-atomic 调度
[2605.06472]agent预测性缓存GraphSAGE 多步预测,命中率 27%→69%,Lipschitz 保证
[2511.00739]agentCPU 侧瓶颈首次量化 agent workload CPU 占比 35–88%,COMB 3.9×
[2603.18897]agent投机执行Pattern-based 投机工具执行,E2E −48.5%,tool stall −67%
[2604.11378]agent形式化框架Agent Loop 作为U≤1 scheduler,SGH 有界终止证明
[2602.13692]framework程序级调度"Agentic program"一等调度单元,1.48–3.92× 吞吐
[2603.16104]framework模板化优化DB-style plan optimization + proactive KV caching,1.56× vs KVFlow
[2509.02121]frameworkBatch 工作流DP solver + request coalescing + CPU-GPU pipeline
[2507.07400]framework工作流缓存Steps-to-execution 优先级 + proactive prefetch,1.83–2.19×
[2604.03143]framework集体 KV 共享All-Gather PIC 复用 O(N)→O(1),Master-Mirror 11–17× 压缩
[2601.22705]framework准入控制AIMD 双信号门控消除中间相位抖动,4.09× 吞吐
[2604.15186]framework多 LLM serving首个异构多 LLM 联合 serving(fractional-GPU + TP 搜索),2.4×
[2601.12967]framework编排-引擎协同Prompt splitting + streaming tool dispatch,15% FTR 降低
[2504.09285]framework统一 servingMicro-request 统一 colocation/disaggregation,1.15–3.07× capacity
[2602.21477]framework多 agent 记忆FSM 多级缓存 + hybrid-graph 跨 agent 索引,4.29× 吞吐
[2603.03251]framework推测解码并行辅助线程构建推测缓存,~30% 加速 vs SD baseline
[2602.21548]frameworkPD 分离聚合 SNIC 带宽 + CNIC 流量隔离,1152 GPU 近线性扩展
[2604.15039]framework跨 DC 推理Hybrid attention KV ~3 Gbps 使跨 DC Ethernet PD 可行
[2504.20068]frameworkSLO 调度GMAX 1/8.55 competitive ratio,compound SLO 支持
[2510.17015]framework公平调度KV token-time 成本模型 + WFQ,57.5% JCT 降低
[tile-ai-tilert]framework低延迟引擎Persistent Engine Kernel,BS=1 达 600 tok/s
[tokenspeed]framework低延迟引擎C++ FSM + Placement 编译器,Pareto 优于 TRT-LLM
[kvserve]frameworkKV 压缩Service-aware 压缩 + controller,up to 10× 压缩
[ref:2505.05286]frameworkAgentic 调度Text-to-SQL agentic scheduling,P95 latency 1.42–1.56×
[deepseek-v4]model压缩注意力CSA+HCA 1M context FLOPs −73%、KV −90%,FP4 QAT
[kimi-k2-6]modelAgent RL12–13h / 4000+ tool calls,Agent Swarm 3×,Claw Groups,INT4
[2507.20534]modelAgentic MoE1T/32B 开源,MuonClip 零 spike,20K+ 工具合成
[2602.02276]model多 agent 训练PARL:orchestrator 训练 + sub-agent 冻结,零视觉 SFT
[2510.26692]model高效注意力KDA 线性注意力超全注意力,KV −75%,decode +75%
[2405.04434]modelKV 压缩MLA 首创 KV 联合低秩压缩(93.3%),21B 激活达 70B dense 水平,5.76× 吞吐
[2406.18665]agent模型路由偏好数据驱动的二元路由,>2× 成本节省,跨模型对泛化无需重训,开源框架
[2601.04861]agent模型路由置信度感知 RL 联合路由角色×模型规模,+7.68% avg accuracy,最高 79.78% 成本降低
[2601.19793]agent模型路由双分支神经路由 + on-policy 负反馈,Pareto 支配 FrugalGPT,最高 72.4% 成本降低
[2512.15834]agent投机执行Tool-call 级投机执行,client-side 6–21% 时延节省,理论上界 <2×,商业 API 验证
[2604.06296]agent模型组合Client-side 模型组合搜索(UCB-E),最强单模型可为最差 planner,62–76% 预算节省
[2604.10235]framework结构化 KV 压缩CPG 结构感知 span-level 保护,91% full-context 恢复率 @ 60% KV 保留,Jaccard=0.09
[agent]agent (survey)现状综合9 篇 agent 论文综合,KV cache 管理为最活跃方向
[agent]agent (survey)主线分析5 条 KV cache 管理分支 + 2 条执行优化分支
[agent]agent (survey)强弱对比PASTE top-1 仅 27.8% 但 overall 93.8%
[agent]agent (survey)冲突分析时间 vs 语义淘汰的 workload 依赖性
[framework]framework (survey)Taxonomy32 篇框架论文的 Stage × Workload × Layer 分类
[framework]framework (survey)主线分析PD 分离、Agentic Serving、低延迟引擎、RL 框架 4 条主线
[model]model (survey)现状综合11 篇模型论文:MoE 主导化、注意力多元化、全模态端到端
[model]model (survey)Trade-off 轴KV 压缩 vs 复杂度、稀疏度 vs 通信、量化 vs 部署门槛