agent-context-lifecycle

Cross-category topic | 35 sources

Agent Context 生命周期:从注意力位置偏置到工作流感知的 KV Cache 管理 #

1. 主题缘起 #

2025–2026 年,coding agent 和 deep-research agent 成为 LLM 的主流使用模式。一个 agent 在执行复杂任务时,其 context 窗口会经历数十轮工具调用,累积大量文件内容、搜索结果、执行日志。这个过程暴露了五个分布在不同系统层级、但互相交织的问题:

第一,模型层的位置偏置。 LLM 对 context 中间位置信息的利用能力显著低于开头和结尾——即 Lost in the Middle 现象。该现象在 2023 年由 Liu et al. 首次系统性记录,到 2026 年在 NoLiMa 等更严格的 benchmark 上证实:即使标称 128K–1M context 的 frontier 模型,其有效利用长度仍不超过 8K [2502.05167]。更严格的数学分析表明,U 型偏差可能是 causal decoder + residual connections 的固有几何性质——在模型初始化时就存在,且 attention 弥散在 ~40% 标称长度处触发悬崖式衰退 [2601.15300]。三层任务难度逐级暴露这一问题:单针字面匹配检索已被 Gemini 2.5 Flash 完全解决(1M context 100% 准确率)[2511.05850];去字面匹配后有效长度骤缩至 ≤8K [2502.05167];多跳 QA 中证据间距带来额外的乘性惩罚 [2412.10079] [algorithm]

第二,agent 工作负载对 KV cache 的特殊需求。 Agent 的多轮 tool-call 间隙极短(平均 925ms–1923ms),但现有推理引擎的 end-of-turn eviction 策略导致下一轮必须重入队列。Continuum 首次将"per-turn queueing delay"从"KV reload cost"中独立出来,证明前者是更严重的问题:即使 reload 近乎免费(CPU offloading),排队延迟仍占总延迟的 58.2% [2511.02230] [2511.02230]。这一观察重新定义了 agent serving 的优化目标函数——从简单的"reload cost vs memory cost"变为"reload + queueing delay vs memory blocking"。

第三,框架层缺乏工作流感知的调度。 传统 serving 框架按单请求粒度调度,不理解 agent 工作流的 DAG 结构。多个 agent step 之间的 KV 复用、跨 step 的 context 共享、以及工作流级的公平调度,都需要框架从"请求级"跃迁到"程序级"编排 [framework] [2602.13692]。ThunderAgent 将 agentic program 提升为调度一等公民 [2602.13692],HexAGenT 进一步将 agentic workflow 建模为 online-revealed DAG 并在异构 PD 分离集群上联合排序 prefill/decode placement,平均降低 Req99 33.0%(最大 80.5%)[2605.16637]

第四,注意力架构的多元化使问题更加复杂。 从标准 softmax 到 compressed attention (CSA+HCA)、再到线性注意力 (KDA),每种架构对 KV cache 的形状、大小、eviction 策略都有不同要求。三种范式构成连续谱:KDA fixed-size recurrent state(128×128/head,O(1))→ CSA/HCA 压缩条目(O(n/m))→ MLA per-token latent(576 floats/token,O(n))[model]。框架和 agent 系统必须同时适配多种注意力范式。

第五,agent context 的积极管理已成为生产必需。 Claude Code 的逆向分析揭示,生产级 coding agent 用 5 层渐进式 context compaction 管理 context 膨胀,其核心范式是"1.6% 决策逻辑 + 98.4% 确定性基础设施" [2604.14228]。Cursor 的 Dynamic Context Discovery 将所有 agent 辅助上下文(tool output、chat history、MCP schema)统一为惰性加载对象,A/B 测试显示 MCP-heavy session token 消耗减少 46.9% [blog-dynamic-context-discovery]。这两个生产案例表明:context 生命周期管理不再是可选优化,而是 agent 系统的核心基础设施。

此外,一条正交的"绕过"路线正在挑战上述全部前提。 上述五个方向都默认长 context 必须进入模型的注意力窗口,问题随之变成"如何在窗口内更好地放置、压缩、淘汰、调度"。Recursive Language Models (RLM) 提出相反的范式:根本不把长 prompt 喂进神经网络,而是将其绑成持久 Python REPL 中的一个环境变量,root 模型只看到常数大小的 metadata,并通过写代码递归地 sub-call 自己(llm_query / rlm_query)处理 prompt 的切片 [2512.24601]。它把"context rot"(质量随 prompt 变长而陡降,且越语义复杂的任务越早崩)作为出发点 [2512.24601],但解法是 decompose-and-recurse 而非 fit-and-manage——可处理 >10M token 输入(超出窗口 10×),在四个复杂度分级长上下文任务上以中位数 13–130% 优于 GPT-5 + compaction/CodeAct 等 scaffold [2512.24601]

更进一步,一条建立在 decompose-and-recurse 之上的"跨调用记忆"路线开始浮现。 RLM 每次 query 都从零初始化 REPL,root 永不复用上一轮对同一语料已经建立的认知 [2512.24601]。PEEK 针对"反复查询同一份大型外部语料(5 万条反馈语料库、一个代码仓库)"的场景,把可复用的 orientation knowledge(语料里有什么、如何组织、哪些实体/常量/schema 重要)缓存成一个常数大小(默认 1024 token)的 context map,常驻在 system prompt 里,由一套可编程缓存策略(Distiller → Cartographer → Evictor)从执行轨迹中自动维护 [2605.19932] [2605.19932]。它建立在 RLM backbone 之上——把 RLM 的 reasoning/action/observation 轨迹作为 Distiller 输入、把 map 注入 RLM 暴露的同一 system prompt,并声明这种 externalized-context 接口是硬前提 [2605.19932]。结果是在反复查询场景下 +6.3–34.0% 质量、少 93–145 轮迭代、成本比 SOTA prompt-learning(ACE)低 1.7–5.8× [2605.19932]

这五个问题的交汇点指向一个跨类别的主题:如何在模型层位置偏置的约束下,为 agent 工作负载设计有完整生命周期(load → use → evict → prefetch)的 context 管理系统? 这个问题不能由任何单一类别独立回答——它需要模型层的注意力机制、agent 层的 KV cache 策略、框架层的工作流调度、以及算法层的位置偏置修复四者协同设计。值得强调的是,RLM 代表了对这个问题本身的质疑——如果 context 可以被 decompose-and-recurse 地外置处理,那么"窗口内生命周期管理"可能只是 fit-and-manage 这一条假设路径下的局部最优 [2512.24601]。本主题因此同时容纳三条宏观策略:fit-and-manage-context(把长 context 放进窗口再压缩/淘汰/调度)、decompose-and-recurse(根本不放进窗口,外置后递归处理)、以及 persist-orientation-knowledge(在外置/递归之上,把"关于反复查询的外部语料的认知"持久化为常驻的跨调用缓存)——后者由 PEEK 代表,是一个 cache-policy / cross-invocation-memory 的角度,既区别于窗口内管理、也区别于 RLM 的 recurse-and-discard [2605.19932]


2. 覆盖的 category 分布 #

CategoryPaper countRepresentative
model4DeepSeek-V4 (CSA+HCA 压缩注意力), Kimi Linear (KDA 线性注意力), Massive Values (注意力机理分析), Attention Residuals (残差优化)
agent11Continuum (KV TTL), SideQuest (语义淘汰), SAGA (工作流图调度), PBKV (GNN 预测), Claude Code (生产架构), RLM (REPL 递归外置), PEEK (跨调用 orientation 缓存)
algorithm8NoLiMa (长上下文 benchmark), FilM/IN2 (位置偏置修复训练), PCD (对比解码), HexAGenT (工作流调度), Dynamic Context Discovery (惰性加载)
framework9ThunderAgent (程序级调度), Helium (模板化 Radix Tree), KVFlow (工作流感知缓存), KVServe (跨 DC 压缩), Concur (AIMD 准入), ICaRus (跨模型 KV 共享)

共计 32 篇论文/系统 + 4 份类别综述,覆盖 4 个类别。


3. 时间线 #

时间事件意义
2023Liu et al. "Lost in the Middle" (TACL 2024)首次系统记录 U 型性能曲线;GPT-3.5 在 middle position 下降超 20pp
2024-04FilM-7B / IN2 Training [2404.16811]证明 lost-in-middle 可通过数据合成+指令微调修复(VaL 47.3→85.9),核心论点:这是数据问题不是架构问题 [algorithm]
2024-12Lost in the Middle and In-Between [2412.10079]发现多跳 QA 中 adjacent 配置稳定优于 separated 1–7pp,CoT 在非指令微调模型上崩溃至 ≤1% [algorithm]
2025-02NoLiMa benchmark [2502.05167]ROUGE-L 压至 0.07 消除字面匹配,13 个 frontier 模型有效长度均 ≤8K;单 distractor 句子即可将 GPT-4o 从 8K 塌到 1K
2025-02Massive Values 分析 [2502.01563]揭示 RoPE 低频维度的 massive values 是上下文理解的功能信号,破坏后 GSM8K 76.9%→4.0%
2025-05HexGen-Flow [ref:2505.05286]在 agentic text-to-SQL 场景下优化调度,P95 latency 降 1.42–1.56×
2025-06PCD (ACL 2025) [2506.08371]Training-free 对比解码,通过 RoPE 过旋转缓解后验显著度衰减,衰减率压缩至 (ln B'/ln B)^{2/d}<1
2025-07KVFlow [2507.07400]首个 workflow-aware prefix caching:Agent Step Graph + STE 替代 LRU;但受制于静态 DAG 假设和单 GPU 验证 [2507.07400]
2025-09Halo [2509.02121]将 DB query optimization(parse→rewrite→schedule→execute)映射到 agentic serving,Request Coalescing 在 W6 上 +154% 吞吐 [2509.02121]
2025-10Kimi Linear (KDA) [2510.26692]线性注意力首次在公平对比下全面超越全注意力,KV cache −75%,NoPE 消除 RoPE 外推问题
2025-11Continuum [2511.02230]提出 KV cache TTL 机制;首次识别 per-turn queueing delay 是独立于 reload cost 的更严重问题 [2511.02230]
2025-11Gemini 2.5 Flash 消除单针 LITM [2511.05850]1M context 下 100% 准确率,但严格限于单针+事实查询+单一模型
2025-12Recursive Language Models (RLM) [2512.24601]范式提案:把长 prompt 移出窗口、绑成 REPL 环境变量递归 sub-call;depth=3 把 OOLONG-Pairs F1 从 0.1 拉到 76.0,处理 >10M token,1,000 样本 +28% [2512.24601]
2026-01Intelligence Degradation [2601.15300]五检测器交叉验证量化 cliff:Lc ≈ 43.2%(≈55K/128K),三瓶颈框架归因 attention 弥散 > RoPE aliasing
2026-01Concur [2601.22705]将 KV cache 重定义为共享有限资源,AIMD 准入控制防止 thrashing,4.09× 吞吐
2026-02SideQuest [2602.22603]范式转变:让 LRM 自身判断 KV 淘汰(从统计代理到语义信号),56–65% token 降幅,non-completion rate 近零
2026-02ThunderAgent [2602.13692]agentic program 一等公民抽象;指数衰减函数在 memoryless 假设下证明唯一最优 [2602.13692]
2026-03ICaRus [2603.13281]Frozen encoder + LoRA decoder 实现跨模型 KV cache 精确共享(N 模型 → 1 份 KV),训练时约束保证推理时 cache identity [2603.13281]
2026-03Helium [2603.16104]Templated Radix Tree 双层前缀统一表示(metadata 27× 缩减),nested-sequence schedule vs MILP 仅 0.9% gap [2603.16104]
2026-03PASTE [2603.18897]投机性工具执行,E2E 延迟降 48.5%,与 KV cache 优化正交可叠加
2026-03Attention Residuals [2603.15031]沿深度做 softmax 加权求和替代恒定残差,scaling law 节省 ~1.25× compute,GPQA +7.5
2026-04Claude Code 逆向分析 [2604.14228]揭示 "1.6% 决策 + 98.4% 确定性基础设施" 范式;5 层 compaction 与 prompt caching 经济学深度耦合 [2604.14228]
2026-04SGH [2604.11378]Scheduler-theoretic 框架:U连续谱统一 Agent Loop 和 DAG executor,70 个开源项目的唯一跨系统比较语言 [2604.11378]
2026-05SAGA [2605.00528]AEG + WA-LRU 达 Bélády 1.31× competitive ratio,但 session-affinity 引入 ~30% 吞吐代价 [2605.00528]
2026-05PBKV [2605.06472]"确定性护栏 + 概率系统"分层设计:退役缓存确定性淘汰贡献 1.66× 命中率,预测失败时退化至生命周期感知而非 LRU [2605.00528]
2026-05PEEK [2605.19932]在 RLM 之上把可复用的 orientation knowledge 缓存为常数大小 context map(默认 1024 token),可编程缓存策略 Distiller→Cartographer→Evictor 维护;反复查询同一语料 +6.3–34.0%,少 93–145 轮迭代,比 ACE 低 1.7–5.8× 成本 [2605.19932]
2026-05HexAGenT [2605.16637]Workflow-aware 调度在异构 PD 集群上 Req99 最大 −80.5%;per-call FCFS 需 α=5.85–26.89 才达 95% SLO [algorithm]
2026DeepSeek-V4 CSA+HCA [deepseek-v4]1M context 下 KV cache 仅 V3(MLA) 的 10%,FLOPs 仅 27%;CSA/HCA/mHC/Muon 全套协同

4. 技术谱系 (Evolution Timeline) #

本 topic 的技术演化跨越模型、算法、agent、框架四个类别,形成三条主干和多条交叉分支:

flowchart TD subgraph MODEL["模型层:注意力与位置编码"] MHA["MHA (标准多头注意力)"] GQA["GQA (Grouped Query Attention)"] MLA["MLA (Multi-head Latent Attention)
K2 系列, 576 floats/token"] KDA["KDA (线性注意力)
Kimi Linear, O(1) state"] CSA["CSA+HCA (压缩稀疏注意力)
DeepSeek-V4, O(n/m) KV"] AttnRes["Attention Residuals
深度 softmax 聚合, 1.25× compute 节省"] MV["Massive Values 分析
RoPE 低频功能信号"] MHA --> GQA --> MLA MLA -->|"NoPE 路线"| KDA MLA -->|"Partial RoPE 路线"| CSA GQA --> AttnRes MHA --> MV end subgraph ALGO["算法层:位置偏置与调度"] LITM["Lost in the Middle
Liu 2023"] FilM["FilM/IN2 Training
数据驱动修复, VaL 85.9"] LITM2["Lost in Middle & In-Between
多跳距离退化"] NoLiMa["NoLiMa
去字面匹配, 有效 ≤8K"] PCD["PCD 对比解码
RoPE 过旋转"] IDeg["Intelligence Degradation
cliff @ 43.2% 标称"] Gemini["Gemini 2.5 Flash
单针 100% @ 1M"] HexAG["HexAGenT
Workflow DAG 调度"] DCD["Dynamic Context Discovery
惰性加载, -46.9% token"] LITM --> FilM LITM --> LITM2 LITM --> NoLiMa LITM --> PCD LITM --> IDeg LITM --> Gemini end subgraph AGENT["Agent 层:KV Cache 生命周期"] EOT["End-of-turn eviction
(传统策略)"] TTL["Continuum
KV TTL + queueing delay 识别"] SQ["SideQuest
LLM 语义淘汰"] CMV["CMV
DAG 版本控制+三遍裁剪"] SAGA_N["SAGA
AEG + WA-LRU, 1.31× Bélády"] PBKV_N["PBKV
确定性护栏+GNN 概率系统"] CC["Claude Code
5 层 compaction + 7 层安全"] PST["PASTE
投机工具执行, -48.5% E2E"] EOT --> TTL EOT --> SQ EOT --> CMV TTL --> SAGA_N SQ -.->|"语义信号路线"| PBKV_N SAGA_N -.->|"结构预测路线"| PBKV_N end subgraph FW["框架层:工作流感知调度"] REQ["请求级调度
(vLLM/SGLang)"] TA["ThunderAgent
程序级调度, 指数衰减"] HE["Helium
TRT + nested-sequence"] HA["Halo
epoch DP + coalescing"] KVF["KVFlow
STE 替代 LRU"] CON["Concur
AIMD 准入控制"] REQ --> TA REQ --> HE REQ --> HA REQ --> KVF REQ --> CON end MV -.->|"量化策略指导"| CSA KDA -.->|"KV 形状变化
prefix caching 失效"| KVF CSA -.->|"KV 大幅缩减"| TA LITM -.->|"位置偏置驱动"| TTL LITM -.->|"有效长度 ≤8K"| CC NoLiMa -.->|"位置偏置驱动"| SQ SAGA_N -.->|"DAG 预测"| HE HexAG -.->|"workflow SLO"| TA DCD -.->|"惰性加载"| CC PST -.->|"时间重叠,正交叠加"| TTL

关键分支点

关键汇合点


5. 技术线交错 #

5.1 模型层注意力设计如何约束框架层 KV cache 管理 #

注意力架构决定了 KV cache 的形状、大小和生命周期特征,直接约束框架层的缓存策略。

标准 MLA (K2 系列) 产生 576 floats/token 的 latent KV [2507.20534],KV cache 与序列长度线性增长。在 agent 多轮场景下,128K context 的 KV cache 可达数十 GB,直接触发 Continuum 所识别的 end-of-turn eviction 问题 [2511.02230]

KDA 线性注意力 (Kimi Linear) 用 fixed-size recurrent state 替代 per-token KV,cache 大小与序列长度无关(128×128/head)[2510.26692]。这从根本上消除了 agent 多轮场景的 KV 膨胀问题——但框架层的 prefix caching 机制(KVFlow 的 STE [2507.07400]、Helium 的 Radix Tree [2603.16104])假设 KV cache 是 append-only 的 token 序列,无法直接适配 recurrent state。KVFlow 的核心可攻击面——workflow graph 静态可观测假设 [2507.07400]——在 KDA 模型下变得更加尖锐:recurrent state 不允许部分命中,STE 距离度量失去意义。

CSA+HCA 压缩注意力 (DeepSeek-V4) 做"先 4× 压缩再 sparse top-k 选择"(CSA)和"128× 压缩 + dense attention"(HCA),两者交错排列 [deepseek-v4]。KV 条目数缩减为 O(n/m),但需要 CSA compressor + Lightning Indexer(FP4) + HCA compressor + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [model]。这要求 KVServe 等跨 DC 传输框架重新设计压缩策略——service-aware 压缩必须理解不同注意力层的压缩比差异 [kvserve]

5.2 Agent 工作负载模式如何驱动框架重新设计 #

Agent 工作负载有四个区别于交互式对话的关键特征,每个都要求框架层的响应:

特征 1:短间隙多轮 tool call。 间隙仅 925ms–1923ms [2511.02230],远短于传统对话的分钟级间隔。框架响应的分化反映了不同的设计哲学:Continuum 用 cost-benefit TTL 做请求级保留(简洁但无工作流感知)[2511.02230];ThunderAgent 将程序整体作为调度单元(需显式 release 信号,健壮性弱于 TensorHub 的 ownership-free drain 机制)[2602.13692];Concur 用 AIMD 双信号准入控制(agent 级粒度,但无公平性保证且不兼容 PD 分离)[2601.22705]

特征 2:DAG 结构的工作流。 Agent 步骤间存在复杂的依赖关系。框架响应:SAGA 用 AEG 形式化为 DAG(支持 backward retry edges 和 transition probabilities,competitive ratio 1.31×,但 session-affinity 导致 ~30% 吞吐损失)[2605.00528] [2605.00528];Halo 借 DB query optimizer 做 epoch DP + Request Coalescing(从 MILP NP-complete 到 2s 求解且质量 ≈oracle,但受限于静态拓扑)[2509.02121] [2509.02121];HexAGenT 将 workflow 建模为 online-revealed DAG 并用 projected scaled-SLO risk 排序(per-call FCFS 需 α=5.85–26.89 才达 95% SLO,workflow-FCFS 立即减 31.4%)[2605.16637] [algorithm]

特征 3:CPU 侧瓶颈。 工具执行(文件读写、搜索、编译)占 E2E 延迟 35%–88% [2511.00739]。GPU 越强(H200/B200),CPU 瓶颈越突出——Toolformer 推理占比从 Sys1 的 88% 降至 Sys2 的 77% [agent]。框架响应:PASTE 通过 pattern mining + 投机性工具执行在 LLM "思考"时预执行下一个工具,E2E 延迟降 48.5%(但 Top-1 准确率仅 27.8%,用多候选投机达到 93.8% overall hit rate——tradeoff 是用资源换覆盖率)[2603.18897] [agent]。COMB 微批重叠降低 3.9× 服务延迟(P50)[2511.00739]

特征 4:跨工作流的 prefix 共享。 大量 agent workflow 共享 system prompt 和常见 tool response 前缀。Helium 的 Templated Radix Tree 以 template 粒度(而非 token 粒度)建索引,metadata 仅 552 KiB vs SGLang 的 14.8 MiB(27× 缩减)[2603.16104]。其 nested-sequence schedule 同时优化 inner(per-query context prefix)和 outer(static system prompt)两层 cache locality,vs MILP 仅 0.9% gap [2603.16104]。ICaRus 将 prefix 共享推进到更深一层——跨模型共享:通过冻结 base encoder + LoRA decoder 的训练时约束,保证不同 task model 对同一 prompt 产出精确相同的 KV cache,使 N 个模型的 KV 存储从 O(N) 降至 O(1) [2603.13281] [2603.13281]。Helium 消除同一模型跨 workflow 的 prefix 冗余,ICaRus 消除跨模型的 KV 冗余——两者可叠加:ICaRus 保证单份 KV cache,Helium/KVFlow 优化该份 cache 的 eviction 策略。

5.3 位置偏置如何从模型层传导到 agent 层 #

Lost in the Middle 的位置偏置在 agent 场景被放大。Agent 先读 file A(context 开头),然后读 file B、C、D(推入 middle),最后读 file E(context 末尾)。当需要综合 B/C/D 的信息时,这些内容恰好在注意力死区。

算法层的诊断揭示了三层任务难度的递进关系:单针字面匹配检索已被饱和(Gemini 2.5 Flash 1M 全通)[2511.05850],但隐式关联推理的有效长度仅 8K(GPT-4o 声称 128K,缩水 16×)[2502.05167],通用阅读理解的 cliff 在 43% 标称处触发(Qwen2.5-7B)[2601.15300]。三者的矛盾并非真矛盾:LITM 的"消失"是任务条件的函数——字面匹配检索已被训练课程饱和,但隐式推理能力尚未受益于同类训练 [algorithm]

这个传导链条解释了为什么 agent 的 KV cache 管理不能是简单的 LRU:被淘汰的 token 可能正是模型在注意力死区中遗漏的关键信息。但淘汰决策信号的选择本身是一个 design space,从弱到强:累积 attention score(H₂O/SnapKV)→ tool call 延迟 CDF(Continuum)→ AEG 转移概率 × token 重叠度(SAGA)→ GraphSAGE 拓扑+前缀+语义三流融合(PBKV)→ LLM 自身的语义推理(SideQuest)[2602.22603]。信号越强、overhead 越高——PBKV 的预测器仅 ~350K 参数、1.18ms/请求 [2605.00528],而 SideQuest 每次辅助线程生成 110–140 token 的管理推理,GPU 开销显著高出 1–2 个数量级 [2602.22603]

5.4 生产系统架构如何反映这些张力 #

Claude Code 的逆向工程揭示了一个精心设计的平衡:它选择了最简单的 Agent Loop 架构(while-loop + tool calls,queryLoop 仅占代码 1.6%),但用 5 层 context compaction + 7 层安全管道来管理 context 膨胀 [2604.14228]。五层 compaction(budget reduction → snip → microcompact → context collapse → auto-compact)之间的时序耦合令人注目——microcompact 需等 API 返回 cache_deleted_input_tokens 才能精确计算预算 [2604.14228]。93% approval rate 证明交互式确认不可靠,倒逼了 7 层独立安全机制的设计——PASTE 和 SGH 各自只有单层安全语义 [2604.14228]

这与 SGH 的理论分析形成核心张力。SGH 认为 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),主张用显式 DAG 替代 [2604.11378]。但 PASTE 用更轻量的方法(pattern-based speculation,无 DAG)达到了 48.5% E2E 延迟减少——SGH 声称需要 DAG 并行才能获得的收益,PASTE 通过时间重叠就实现了 [2604.11378]。SGH 自估 60–70% 任务实际是线性链 [2604.11378],PBKV 则直接证明静态 DAG 假设无法处理运行时条件分支和重试循环 [2605.06472]——SGH 在 PBKV 证明最有价值的场景(动态工作流)上完全不适用。

Dynamic Context Discovery 提供了第三条路径:不改执行结构也不改 serving 层,而是在 context assembly 阶段将所有辅助上下文统一为惰性加载对象,通过"不加载就不存在"的原则从源头减少 token 消耗 46.9% [blog-dynamic-context-discovery]。这与 Claude Code 的"只在需要时加载"和 Helium 的"CSE + CacheFetch 从 DAG 消除冗余 operator"异曲同工 [2603.16104]

5.5 多层系统的可组合性与冲突 #

理论上,一个完整的 agent context 管理栈可以同时部署多层优化 [2602.22603]

ICaRus 在此栈中补足了 SideQuest(intra-request 粒度的语义 GC)和 PBKV(inter-workflow 粒度的预测性 eviction)之间的第三层——cross-model sharing:SideQuest 决定单个请求内哪些 token 可丢弃,PBKV 决定跨工作流哪些 KV block 值得保留,ICaRus 则从根源上消除因模型不同而产生的 KV 冗余副本 [2603.13281]。三者的决策粒度(token → workflow → model)互不重叠,理论上可完全叠加。

但实际部署面临至少三个层间冲突:(1) 如果 SideQuest 认为某 token 仍有语义价值,但 Continuum 的 TTL 过期驱逐了整个 session 的 KV cache,语义判断被浪费 [2602.22603];(2) Concur 的 AIMD 准入控制假设单 SGLang 引擎暴露 usage 和 hit-rate 信号,在 PD 分离架构下信号需跨引擎聚合 [2601.22705];(3) ThunderAgent 直接否定朴素 PD 分离在 agent workload 下的价值,但 DualPath 证明优化过的 PD 分离(dual-path loading + CNIC QoS)可以工作——ThunderAgent 否定的是"朴素 PD"而非"所有 PD" [2602.13692]

5.6 "不进窗口" 与 "进窗口后管理" 的资源正交性 #

RLM 与本主题主流方案构成一组深刻的资源维度对照。SideQuest 让 token 先进 GPU KV cache、再用并行辅助 LRM 线程语义判断哪些过期并物理驱逐 [2602.22603];RLM 则让 token 根本不进 root 窗口、全程活在 CPU 侧 REPL 变量里,需要时才 sub-call [2512.24601]。两者的共识极深——都拒绝启发式重要性估计(attention score),都主张让模型用语义理解管理上下文 [2512.24601];但 SideQuest 优化的是 GPU KV 显存(+83.9% 吞吐),RLM 省的是 root 窗口(代价是多次 sub-call 重算)。二者解决的是同一问题的不同资源维度,可在 rlm_query 子循环内部嵌入 SideQuest 式辅助驱逐线程实现正交叠加 [2512.24601]

但 RLM 的"绕过"并非免费,它把退化问题递归地推给了下一层:sub-LM 自身仍要吃 ~500K 字符的 chunk [2512.24601],按 Intelligence Degradation 的 43.2% 容量悬崖 [2601.15300],若 sub-call 输入超过 sub-model 容量的 ~40% 同样会退化,而 RLM 未报告 sub-call 输入长度 vs 准确率曲线 [2512.24601]。此外 RLM 依赖强编码能力——弱编码模型会因 syntax error 在递归中传播而越深越差 [2512.24601],且其"comparable cost"仅在 per-answer 中位数成立,长尾轨迹极贵,在 batch serving 的 tail latency 视角下站不住 [2512.24601]。这与本主题主流方案恰好互补:RLM 强在 super-window,主流 fit-and-manage 强在窗口内的吞吐/延迟。

5.7 跨调用记忆:在 decompose-and-recurse 之上再加一层缓存 #

RLM 解决了"单次 query 内长上下文不进窗口",但留下一个空白:reusable 的"关于语料的认知"在 query 之间被反复重建。PEEK 填补的正是这个空白——它把 agent state 的设计空间画成 2×2(active/passive × agent-task/external-context),指出 shared chat/compaction 管的是 agent-task 轨迹、RAG/offloading 是对外部材料的 passive 访问、prompt-learning(ACE/Reflexion/GEPA)curate 的是 task-level 策略,而 active×external-context 这一格——主动维护一份"关于反复查询的外部语料"的 orientation 知识——此前是空的 [2605.19932]

与 RLM 的互补而非替代关系。 PEEK 不是 RLM 的 baseline,而是 built-on-top:它把 RLM 的执行轨迹喂给 Distiller,把 map 注入 RLM 同一个 system prompt [2605.19932]。两者回答正交问题——RLM 决定"上下文存在哪里"(offload 到环境),PEEK 决定"关于该上下文的什么可复用知识保持常驻" [2605.19932]。一个有意思的发现是:PEEK 的跨 backbone 可移植性(GPT-5-mini → Qwen3-Coder-Next-FP8,并把 RLM 换成生产级 OpenAI Codex 后 gains 反而更大)恰好落在 RLM 最脆弱处——RLM 的 system prompt 本身不跨模型移植 [2605.19932] [2512.24601]

与 KV 层 / 语义淘汰的层级分工。 PEEK 明确把它的 text map 与 model-level KV cache 区分开 [2605.19932]。SideQuest 在一个 task 内对 KV 字节做语义驱逐 [2602.22603],PEEK 在 query 之间累积一份 text artifact——两者作用在不相交的层,可叠加:一个 agent 既常驻 PEEK map、又在 per-query 轨迹上跑 SideQuest 式驱逐,可同时打 iteration-quality 和 KV-footprint 两个目标,但没有论文测过组合后的 Pareto 前沿 [2605.19932]。这与 §5.5 的多层可组合栈同构——PEEK 补的是"应用层之上、跨调用"的一层。Pancake 式的多 agent 向量记忆底座则可进一步把 PEEK 从"单语料"提升到"多语料"——按 context 键存取多份 map [2605.19932]

lossy vs lossless 的张力在此重现。 PEEK 为了把 orientation 压进预算,主动丢弃 task-specific 事实 [2605.19932];CMV 的核心主张恰恰相反——compaction 摧毁 98% 会话状态是病,无损保留每一轮 user/assistant 才是药 [2602.22402]。矛盾根源是两者管理的对象不同:CMV 管 agent-task 状态(同一项目内任何过去决策都可能再被需要),PEEK 蒸馏 external-context orientation(task-specific 开销对下一个 query 可证不可迁移)。两者在各自的象限都对,但"丢弃轨迹"与"永不丢一轮"不能被同一个 agent 同时采用,除非有一个 quadrant-aware 路由 [2605.19932]


6. 共识与分歧 #

共识 1:End-of-turn eviction 对 agent 工作负载是灾难性的 #

所有 5 篇 agent KV cache 论文都以此为出发点且提供了独立的量化证据。Continuum 测得 per-turn queueing delay 占总延迟 58.2% [2511.02230];SAGA 报告 Bélády 最优的 1.31× competitive ratio vs 传统 LRU 的巨大偏差 [2605.00528];PBKV 测得 LRU 命中率仅 27% [2605.06472];Concur 观测到 HiCache 在 DeepSeek-V3 Batch-16 下比 SGLang 慢 3×——naïve offload 不是解药 [2601.22705]无一论文为传统 end-of-turn eviction 辩护。

共识 2:位置偏置在多针/多跳场景远比单针严重 #

Gemini 2.5 Flash 在单针检索上已消除 LITM(1M context 100% 准确率,但严格限于单针+事实查询+单一模型)[2511.05850]。NoLiMa 的去字面匹配 benchmark(ROUGE-L 压至 0.07)将所有 frontier 模型有效长度压至 ≤8K,单 distractor 句子即可将 GPT-4o 从 8K 塌到 1K [2502.05167]。多跳 QA 中证据间距带来额外的乘性惩罚,且 CoT 在非指令微调模型上反而崩溃至 ≤1% [2412.10079]所有长上下文评测论文都同意:NIAH 式 benchmark 严重高估了模型的实际长上下文能力。

共识 3:KV cache 的形状正在多样化,框架必须适配 #

DeepSeek-V4 的压缩 KV (O(n/m))、Kimi Linear 的 recurrent state (O(1))、标准 MLA 的 per-token latent (O(n))——三种形状共存 [model]。V4 在 1M 下 KV cache 仅 V3(MLA) 的 10%,但需要 CSA+HCA+mHC+Muon 的完整复杂体系 [deepseek-v4]。Kimi Linear 通过 recurrence 获得 O(1) 但需要 chunkwise kernel 的数值正确性保障 [2510.26692]。位置编码的三种路线(K2 系列的 RoPE + YaRN、Kimi Linear 的 NoPE、V4 的 Partial RoPE)来自三个独立团队,使这种碎片化在可预见未来无法统一 [model]

共识 4:工作流感知是 agent serving 的必经之路 #

从不同层面出发,6 篇独立工作汇合到同一结论:per-request FCFS 远不足以服务 agent workload。HexAGenT 量化了差距:per-call FCFS 需 α=5.85–26.89 的 SLO budget 膨胀才达 95% SLO,workflow-FCFS 立即减 31.4% [2605.16637]。ThunderAgent 的 program 一等公民抽象 [2602.13692]、SAGA 的 AEG [2605.00528]、Helium 的 TRT [2603.16104]、KVFlow 的 STE [2507.07400]、Halo 的 epoch DP [2509.02121] 都是对这一共识的不同响应。

分歧 1:KV 保留决策应基于时间、结构还是语义? #

三条路线的根源是信号来源和 overhead 的 trade-off [2511.02230]

路线信号overhead适用场景
时间维度(Continuum TTL)per-tool 历史 CDF零(在线统计)短 horizon coding agent(6–11 turns)
结构预测(SAGA AEG / PBKV GNN)DAG 转移概率 / GraphSAGE 嵌入低(12.3ms / 1.18ms per-request)结构化工作流
语义理解(SideQuest LRM)LLM 自身推理高(110–140 token/次)长 horizon deep research(80+ turns)

Continuum 的 per-tool CDF 是上下文无关的——相同 tool name 在不同执行上下文下的延迟方差被完全忽略(cd 最慢 10% 占 94.1% 总延迟)[2511.02230]。SideQuest 的 non-completion rate 数据(heuristic baselines 高达 60%+)揭示了 Continuum 未讨论的风险:即使 KV cache 被完全保留,上下文膨胀导致的 attention 计算变慢可能从另一维度恶化延迟 [2602.22603]

实验 workload 差异是矛盾根源:Continuum 在 SWE-Bench/BFCL 上测试(6–11 turns),SideQuest 在 FRAMES/BrowseComp 上测试(80+ turns,120K+ tokens)[agent]。短 horizon 下时间维度足够;长 horizon 下语义维度不可或缺。但 SideQuest 的单模型验证(仅 gpt-oss-20b)使其泛化证据在所有竞品中最弱——Continuum 横跨 8B–355B 四个模型族 [2602.22603]

分歧 2:静态 DAG 还是动态工作流更适合 KV 预测? #

SAGA 用 AEG 预测 KV 复用(competitive ratio 1.31× vs Bélády)[2605.00528],但其 formal bound 极度松散(20.5×),1.31× 仅是 empirical average-case,且 Bélády 是单机 eviction 的 optimal,而非 joint scheduling + eviction 的全局最优 [2605.00528]。PBKV 批评"静态 DAG 假设无法处理运行时条件分支和重试循环",用 GNN 多步预测在动态工作流上达 69% 命中率 vs 静态距离方法 39.87% [2605.06472]

PBKV 的"确定性护栏 + 概率系统"分层设计在鲁棒性上优于 SAGA 的加权线性评分:PBKV 在预测精度从 0.94 到随机的整个谱上都严格优于 LRU [2605.00528],而 SAGA 去除 AEG 后 TCT 退化 54%——对预测质量的依赖更强。

KVFlow 的静态 workflow graph 假设是最脆弱的:ReAct/Reflexion/autonomous agent 在运行时动态生成下一步 agent,STE 无法预先计算——如果 2026 年 agentic 范式从静态 DAG 向动态 agent(self-play、tree-of-thought)迁移,KVFlow 的核心抽象需要根本性重新设计 [2507.07400]

分歧 3:Lost in the Middle 是数据问题还是架构问题? #

三种归因作用于不同层级 [algorithm]

三者可同时成立且互不矛盾——只是论文各自将自己的层级表述为"根因"。完整修复可能需要三层叠加:IN2-style 训练 + PCD 解码 + 架构级 attention 改进 [algorithm]

分歧 4:Agent Loop 是否"够用"? #

SGH 认为 Agent Loop 有结构性缺陷(隐式依赖、无界 recovery、不可审计),只有显式 DAG 才能根本解决 [2604.11378]。Claude Code 的生产成功恰恰建立在 Agent Loop 之上 [2604.14228]

但 Claude Code 的"minimal scaffolding"范式可能是 Claude-specific 的——论文论证"values-over-rules"需要模型具有"good judgment",如果 backbone 换为 Llama-70B 或 Qwen-72B,是否仍然 work?SGH 的批判在 frontier 模型不可用时可能更准确 [2604.14228]。Claude Code 的 93% approval rate 恰恰暴露了 Agent Loop 的脆弱性——approval fatigue 使人类审批无效化 [agent]

分歧 5:PD 分离在 agent workload 下是否合理? #

ThunderAgent 实验直接否定了朴素 PD 分离("单侧 HBM 池变小,更低并发就触发 thrashing")[2602.13692]。但 DualPath 在 1152 GPU 上实现近线性扩展——其成功恰恰证明朴素 PD 退化但优化 PD(layerwise streaming + 带宽聚合 + VL QoS)可以工作 [2602.13692]。Concur 拒绝了 naïve PCIe offload,而 DualPath 的方案是带 QoS 隔离的网络存储 offload——硬件约束不同使结论不同 [2601.22705]

分歧 6:长 context 应"进窗口后管理"还是"根本不进窗口"? #

本主题绝大多数工作默认 fit-and-manage-context:长 context 进入注意力窗口,再用压缩(DeepSeek-V4 CSA+HCA)、淘汰(Continuum/SAGA/SideQuest)、调度(ThunderAgent/HexAGenT)管理它。RLM 提出 decompose-and-recurse 的对立路线——把 prompt 绑成 REPL 变量,root 永不读全文,靠符号递归子调用处理 [2512.24601] [2512.24601]。这与 CMV 对 autocompaction "98% 损失" 的批判、RLM 对 compaction "对 dense-access 任务有损"(OOLONG-Pairs 仍是 0.1)的批判同向 [2512.24601],但解法走到了更远的"整篇不裁剪、留在环境里"。

二者并非简单对立而是适用区间互补:RLM 独占的生态位是 information-dense + super-window + long-output 三者同时成立的任务(OOLONG-Pairs 是典型,depth=3 达 76.0 而 compaction 仅 0.1)[2512.24601] [2512.24601];而在窗口内(≤32K)且延迟/吞吐敏感的 agent serving 场景,fit-and-manage 的 KV cache 复用收益是 RLM 全程 blocking sub-call 实现无法提供的 [2512.24601]。一个潜在的统一形态是分层混合:root 用 decompose-and-recurse scaffold,leaf sub-model 用 position-robust 基座(IN2 式训练)+ fit-and-manage KV 管理 [2512.24601]

PEEK 在这条轴上再插入第三点:它既不在窗口内压缩、也不替代 RLM 的 recurse-and-discard,而是在 decompose-and-recurse 之上"持久化跨调用的 orientation 知识"——一个 cache-policy / cross-invocation-memory 的角度 [2605.19932]。它与 SideQuest 共享"让模型自己管理上下文"的共识(Distiller 用模型而非启发式给轨迹打 helpful/harmful/neutral/stale 标签)[2605.19932],但把这条共识落到 semantic 层的 prompt-resident artifact 上、而非 KV 字节。其适用边界也清晰:只在"反复查询同一份持久语料"成立——在 per-task 证据几乎不相交(FanOutQA 仅 1.1% 问题对共享证据页)的 multi-document 检索上,orientation 知识无法跨语料复用,PEEK 自承收益有限 [2605.19932]


7. 根本性困难 (Open Challenges) #

7.1 位置偏置与注意力表达力的信息论困境 #

Lost in the Middle 可能是 causal decoder + residual connections 的固有几何性质——U 型偏差在模型初始化时就存在 [2601.15300]。Gated Attention 和 Attention Residuals 提供了有效补偿(GPQA +7.5,scaling law 节省 ~1.25× compute)[2603.15031],但补偿本身增加参数和计算量(Block-AttnRes I/O 增 1.8×)[model]

为什么困难:这不是"没人试"而是存在理论约束。在 causal masking 下,第一个 token 代数上不可避免地获得更高权重;residual connections 锚定 recency bias。要根治需要改变基础架构(bidirectional / non-autoregressive),但这与 LLM 的 autoregressive 生成范式冲突。线性注意力 (KDA) 通过 recurrent state 绕过了部分约束 [2510.26692],但 NoPE 方案需要 KDA 的 data-dependent gate 隐式补偿 RoPE 的语义功能——Massive Values 研究确认这些功能载体是 RoPE 低频维度的 Q/K concentrated massive values [2502.01563],KDA 的 DPLR 约束(a=b=k)能否完全替代这一机制缺乏理论解释 [model]。Recursive Language Models 试图用"根本不进窗口"绕过这一困境,但其 sub-call 仍把切片喂进 sub-model 的窗口——退化被递归地推给下一层而非消除,且 RLM 未证明下一层免疫(未报告 sub-call 输入长度 vs 准确率曲线)[2512.24601]

需要哪些类别协同:model(新注意力范式)+ algorithm(理论分析框架)+ framework(适配新 KV 形状)。

预估难度:5+ 年。零开销补偿方案可能不存在;最优 compute-quality tradeoff 尚未被理论刻画。

7.2 语义淘汰的 oracle 悖论与形式化困境 #

理想的 KV cache 淘汰应淘汰"未来最久不会用到的 token"(Semantic Bélády's Algorithm)。但判断"什么将来有用"本身需要理解任务的完整语义——这正是 agent 正在执行的推理过程。

为什么困难:现有方案的形式化保证程度参差不齐。PBKV 的 Lipschitz 退化保证(Theorem 5.1)是目前唯一的形式化 regret bound,但 GNN predictor 需要 per-workload 训练(~1K traces),且退化后仅保证优于生命周期感知而非 Bélády optimal [2605.06472]。SAGA 的 competitive ratio 1.31× 是 empirical average-case,formal bound 松至 20.5×,在 adversarial workload 下无下界保证 [2605.00528]。Continuum 的 expected utility maximization 完全没有 competitive ratio 或 regret bound [2511.02230]。SideQuest 的辅助线程 GPU 开销未量化,且其 hindsight 标注无法捕获因过早 evict 而导致失败的 counterfactual 路径 [2602.22603]

需要哪些类别协同:agent(语义理解)+ framework(高效淘汰执行)+ model(低开销语义信号提取)+ algorithm(形式化 regret 框架)。

预估难度:2–3 年达到实用。PBKV 的分层淘汰已在特定工作负载上接近最优,但统一的形式化框架(涵盖 TTL、AEG、GNN、LLM 语义四种决策机制)可能需要新的理论工具。

7.3 KV cache 形状碎片化与框架统一 #

三种主流注意力范式产生完全不同的 KV cache 形状:MLA 的 per-token latent、KDA 的 fixed-size recurrent state、CSA+HCA 的压缩条目 [model]。现有的 KV cache 管理系统(Continuum、SAGA、PBKV)都假设标准的 per-token KV 格式。位置编码的三路分化(RoPE+YaRN、NoPE、Partial RoPE)进一步加剧碎片化 [model]

为什么困难:框架层的 prefix caching(Radix Tree、STE)、eviction(TTL、LRU、GNN)、传输(KVServe 压缩)都依赖于 KV cache 是 token 序列这一假设。适配 recurrent state 需要重新定义"cache hit"的语义——一个 recurrent state 不能部分命中,KVFlow 的 STE 距离度量对其完全失效 [2507.07400]。适配压缩 KV 需要理解不同层的压缩比差异。V4 的框架适配需要 CSA compressor + Lightning Indexer + HCA compressor + SWA + Attention Sink 的完整体系同时 work [model]

需要哪些类别协同:model(统一 KV 接口标准)+ framework(多形状 cache manager)+ agent(工作流级缓存策略适配)。

预估难度:1–2 年。DeepSeek-V4 和 Kimi Linear 的部署已在推动各自团队的框架适配,但跨团队的统一接口标准尚不存在。

7.4 Context 生命周期的粒度与层间一致性问题 #

现有方案在 context eviction 粒度上差异巨大:Continuum 是 turn-level(TTL 到期则整轮 KV 驱逐)[2511.02230],SideQuest 是 token-level(逐 token 语义淘汰)[2602.22603],CMV 是 session-level(三遍裁剪保留结构)[2602.22402],Claude Code 的 5 层 compaction 按 conversation segment 操作 [2604.14228],Dynamic Context Discovery 在 context assembly 阶段做文件粒度的惰性加载 [blog-dynamic-context-discovery],PEEK 则在 跨调用 粒度维护一份常数大小的 orientation map、并由 Evictor 按 section-value 层级(Parsing Schema → Reusable Results → Domain Constants 先淘汰,Roadmap 与 Understanding 最后保护)在预算 B 内淘汰 [2605.19932]

为什么困难:最优粒度取决于任务类型,但更深层的问题是层间一致性:应用层的 context compaction(Claude Code)和 serving 层的 KV eviction(Continuum/SAGA)各自独立决策,可能互相冲突。Claude Code 在 serving 请求到达之前已做了大量裁剪——Continuum 保留的 KV cache 对应的是已被 compact 过的 context,保留的价值需要重新评估 [2511.02230]。反过来,如果 SAGA 驱逐了 SideQuest 认为有语义价值的 KV,语义判断被浪费 [2602.22603]。PEEK 又在此之上引入"跨调用"这一层——它常驻的 orientation map 是一份与 turn/token/session 都不重叠的 prompt-resident text artifact [2605.19932],理论上可与 SideQuest 式 per-query KV 驱逐正交叠加,但两层各自独立决策、谁都不知道对方淘汰了什么,没有论文测过组合 Pareto [2605.19932]。统一的多层 eviction 协议——让应用层、serving 层、token 层、跨调用层共享 eviction 意图——是一个未被解决的系统设计问题。

需要哪些类别协同:agent(任务类型识别 + 应用层 context 策略)+ framework(多粒度 eviction 机制 + 层间协议)。

预估难度:1–2 年。组件技术已存在,需要的是系统集成和标准化。

7.5 工作流调度的冷启动与动态性 #

SAGA 的 AEG 推断在结构化 benchmark(SWE-bench)上达 87% 准确率 [2605.00528],但 ReAct 循环模式固定(think→act→observe),推断不难。对更复杂的 workflow(multi-agent、tree-of-thought、动态子任务生成),推断准确率可能大幅下降。PBKV 需要 ~1K 训练轨迹 [2605.06472]。ThunderAgent 的指数衰减在 memoryless 假设下最优,但论文自己的主要实验 benchmark(ToolOrchestra + HLE)使用远程 API(重尾分布),此时理论最优性可能不成立 [2602.13692]

为什么困难:这是在线学习的经典 exploration-exploitation 问题,但 agent 工作流的状态空间远大于传统 bandit 设定。工作流模式随时间漂移(新工具、新 agent 策略、不同用户习惯),需要持续适应。

需要哪些类别协同:agent(工作流模式挖掘)+ framework(在线自适应调度)+ algorithm(bandit/RL 理论)。

预估难度:2–3 年。Continuum 的 per-tool CDF 是最简方案但信息不足;PBKV 的 GNN 更丰富但需 per-workload 训练。理想的方案可能是 Continuum 做 fast-path + SAGA/PBKV 做 slow-path 的混合架构 [2605.00528]


8. 成熟度判断 #

整体评估:研究前沿 → 早期生产

趋势方向快速加速。Agent workload 的爆发式增长驱动了从模型到框架的全栈创新。2025 年 11 月到 2026 年 5 月的 7 个月内,该领域产出了 14+ 篇系统论文。主要商业 agent 系统(Claude Code、Cursor、Windsurf、Kimi K2.6 的 12h agentic RL rollout [model])的部署规模正在为这些研究提供真实工作负载验证。


9. 邻接 topic #

Topic关系
agent-system (agent serving infrastructure)强关联。agent-system 侧重 serving infrastructure 的全栈设计(KV cache 调度、集群路由、SLO 管理),本 topic 侧重 context 从创建到淘汰的完整生命周期。重叠区域是 KV cache 管理——SAGA、PBKV、Continuum、HexAGenT 同时属于两个 topic。分界点:KV cache 的 scheduling 和 eviction policy 属于本 topic;KV cache 的 storage engine、network transfer(DualPath/PrfaaS/KVServe)和 MoE execution(ZeRO-Prefill)属于 agent-system。ThunderAgent 横跨两者——其 program 一等公民抽象属于 agent-system,其指数衰减函数属于本 topic。
attention-optimization (注意力机制优化)中等关联。DeepSeek-V4 的 CSA+HCA、Kimi Linear 的 KDA、Attention Residuals 等注意力优化技术影响位置偏置的严重程度和 KV cache 的形状。如果 KV 形状碎片化(§7.3)成为核心瓶颈,"多形状 KV cache 的框架统一适配"可独立为新 topic。当前分界点:注意力机制本身的设计属于 attention-optimization;注意力机制产生的 KV cache 如何在 agent 场景下管理属于本 topic。
persistent-execution-paradigm (持久化执行)弱关联。TileRT/TokenSpeed 的 persistent Engine Kernel 消除 GPU 端的 kernel launch overhead [framework],本 topic 管理 LLM context 端的信息冗余。两者都在对抗"不必要的状态重建",但操作层级不同(GPU kernel vs LLM context)。TileRT 的 BS=1 极致低延迟优化可以缩短 Helium cost model 中的 decode latency,间接扩大工作流调度的窗口 [2603.16104]
rl-training-infra (RL 训练基础设施)弱-中关联。Agent RL rollout(如 Kimi K2.6 的 12h/4000+ tool call 训练)产生极端的 context 生命周期需求。TensorHub 解决 trainer→rollout 权重传输 [2602.13692],ThunderAgent 解决 rollout 推理吞吐,两者分别覆盖 RL pipeline 的不同瓶颈段且理论上可叠加。当 agentic RL 对 context 管理的需求超越推理场景时,可能需要新 topic。
long-context / context-rot (长上下文退化与绕过)强关联。RLM 把 context rot 作为立论起点,但用 decompose-and-recurse 绕过而非在窗口内修复 [2512.24601]。其退化诊断簇(NoLiMa、Intelligence Degradation、Lost-in-Between)与本 topic §1 的位置偏置分析完全重叠。分界点:长上下文退化的"诊断与基座级修复"属 long-context / context-rot topic;退化在 agent context 生命周期中如何被管理(fit-and-manage)或绕过(decompose-and-recurse)属本 topic。RLM 横跨两者——其"把 P 移出窗口"的存在性论证属 long-context,其在 agent 工作流中作为 context 处理策略的定位属本 topic [2512.24601]
agent-memory (agent 记忆系统)强关联。PEEK 把"关于反复查询的外部语料的 orientation 知识"主动维护成常驻 prompt 的 context map,填补 active×external-context 象限 [2605.19932];它与 Pancake 的 passive 向量记忆底座、CMV 的 agent-task DAG 快照、SideQuest/Q4 的 KV 层记忆共同构成 agent-memory 的分层栈 [2605.19932]。分界点:记忆"管什么对象"(轨迹/KV/外部语料 orientation)跨入 agent-memory;这些记忆如何嵌入 agent 的 context 生命周期(load→use→evict)属本 topic。PEEK 横跨两者——其 2×2 设计空间(active/passive × agent-task/external-context)属 agent-memory,其作为 RLM 之上 context 处理策略的定位属本 topic [2605.19932]

潜在 topic 融合方向:如果 agent serving 系统开始在 KV cache 层面实现 context eviction(即 SAGA 的 WA-LRU 被集成到 vLLM/SGLang),那么 attention-level 的 KV 压缩(CSA+HCA)和 system-level 的 KV 淘汰(SAGA/PBKV)可能在 serving infrastructure 层面统一,推动本 topic 与 agent-system 的局部合并。同时,HexAGenT 将 workflow-aware 调度与 DP 负载均衡(BalanceRoute 的 intra-decode 优化 [algorithm])联合的趋势,可能催生"全局 workflow 优化 + 局部 decode 均衡"的统一调度 topic。


10. 参考 #

EntityCategoriesRole in topicKey contribution
[2404.16811]algorithm位置偏置修复IN2 训练证明 LITM 可通过数据合成修复(VaL 85.9 超 GPT-4-Turbo)
[2412.10079]algorithm位置偏置诊断发现多跳 QA 双层退化:绝对位置 + 证据间距;CoT 在弱模型上崩溃
[2502.05167]algorithm位置偏置 benchmarkROUGE-L 0.07 去字面匹配,frontier 模型有效长度 ≤8K
[2506.08371]algorithm解码层修复PCD 对比解码,衰减率 (ln B'/ln B)^{2/d}<1,但 throughput 减半
[2601.15300]algorithm临界点量化Qwen2.5-7B cliff @ 43.2%,三瓶颈框架
[2511.05850]algorithm单针 LITM 消除Gemini 2.5 Flash 在 1M context 单针检索 100%(严格限于单针+事实查询)
[2605.16637]algorithm工作流调度HexAGenT workflow DAG + 异构 PD placement,Req99 最大 −80.5%
[blog-dynamic-context-discovery]algorithm惰性加载Agent 上下文统一为文件系统惰性对象,MCP token −46.9%
[2502.01563]model注意力机理分析RoPE 低频 massive values 是上下文理解功能信号
[2510.26692]model线性注意力KDA 首次公平对比下全面超越全注意力,KV cache −75%,NoPE 消除外推
[2603.15031]model残差优化Attention Residuals 深度 softmax 聚合,scaling law 节省 1.25× compute
[deepseek-v4]model压缩注意力CSA+HCA 在 1M 下 KV cache 仅 MLA 的 10%,FLOPs 仅 27%
[2511.02230]agentKV TTL首次识别 per-turn queueing delay 独立于 reload cost;8.18× 真实环境改善
[2602.22603]agent语义淘汰LLM 辅助线程做语义级 KV 淘汰,56–65% token 降幅,non-completion ≈0
[2602.22402]agent会话裁剪DAG 版本控制 + 三遍裁剪,均值 20% token 缩减
[2604.14228]agent生产架构分析Claude Code 1.6% 决策 + 98.4% 基础设施;5 层 compaction 与 cache 经济学耦合
[2605.00528]agent工作流调度AEG + WA-LRU 达 Bélády 1.31×(formal 20.5×);~30% 吞吐代价
[2605.06472]agentGNN 预测"确定性护栏+概率系统"分层设计,Lipschitz 退化保证,命中率 27%→69%
[2604.11378]agent理论框架U连续谱统一分类 70 个项目;Agent Loop =U=1 scheduler
[2511.00739]agentCPU 瓶颈CPU 工具执行占 E2E 35–88%;COMB 微批 3.9× P50 降低
[2603.18897]agent投机执行Pattern mining + 投机工具执行,E2E −48.5%;Top-1 仅 27.8% 但 overall 93.8%
[2512.24601]agentREPL 递归外置把长 prompt 移出窗口绑成 REPL 变量、符号递归子调用;OOLONG-Pairs 0.1→76.0,处理 >10M token,1,000 样本 +28%
[2605.19932]agent跨调用 orientation 缓存在 RLM 之上把可复用 orientation knowledge 缓存为常数大小 context map(Distiller/Cartographer/Evictor 维护);反复查询 +6.3–34.0%,比 ACE 低 1.7–5.8× 成本,跨 base LM/backbone 可移植
[2602.13692]framework程序级调度Program 一等公民;指数衰减唯一最优(memoryless 假设);否定朴素 PD
[2603.16104]framework模板化缓存TRT 双层前缀统一(27× metadata 缩减);nested-sequence vs MILP 0.9% gap
[2509.02121]frameworkDAG 整合DB pipeline 映射到 serving;epoch DP 2s = oracle;Request Coalescing +154%
[2507.07400]framework工作流缓存Workflow-aware STE,但静态 graph 假设致命级脆弱
[2601.22705]framework准入控制AIMD 双信号(usage+hit-rate),但不兼容 PD 分离且无公平性保证
[2603.13281]framework跨模型 KV 共享Frozen encoder + LoRA decoder 训练时约束保证 KV cache identity,N 模型 → 1 份 KV,与 SideQuest/PBKV 正交叠加
[2604.03143]frameworkKV 共享Collective KV cache sharing 跨 agent
[2602.21477]framework记忆索引Hierarchical memory system for multi-agent
[kvserve]frameworkKV 压缩传输Service-aware 压缩,up to 10× KV 压缩,可与 KVFlow prefetch 叠加
[model]model (survey)跨论文综合KV cache 形状连续谱:KDA→CSA→MLA→GQA;三路位置编码分化
[agent]agent (survey)跨论文综合Agent-aware KV cache 管理 5 条技术路线;信号谱
[framework]framework (survey)跨论文综合Agentic workflow serving 6+ 系统;PD 分离争议
[algorithm]algorithm (survey)跨论文综合三层任务难度递进;调度粒度 vs 算法复杂度 trade-off