2025–2026 年,coding agent 和 deep-research agent 成为 LLM 的主流使用模式。一个 agent 在执行复杂任务时,其 context 窗口会经历数十轮工具调用,累积大量文件内容、搜索结果、执行日志。这个过程暴露了五个分布在不同系统层级、但互相交织的问题:
第一,模型层的位置偏置。 LLM 对 context 中间位置信息的利用能力显著低于开头和结尾——即 Lost in the Middle 现象。该现象在 2023 年由 Liu et al. 首次系统性记录,到 2026 年在 NoLiMa 等更严格的 benchmark 上证实:即使标称 128K–1M context 的 frontier 模型,其有效利用长度仍不超过 8K [2502.05167]。更严格的数学分析表明,U 型偏差可能是 causal decoder + residual connections 的固有几何性质——在模型初始化时就存在,且 attention 弥散在 ~40% 标称长度处触发悬崖式衰退 [2601.15300]。三层任务难度逐级暴露这一问题:单针字面匹配检索已被 Gemini 2.5 Flash 完全解决(1M context 100% 准确率)[2511.05850];去字面匹配后有效长度骤缩至 ≤8K [2502.05167];多跳 QA 中证据间距带来额外的乘性惩罚 [2412.10079] [algorithm]。
第二,agent 工作负载对 KV cache 的特殊需求。 Agent 的多轮 tool-call 间隙极短(平均 925ms–1923ms),但现有推理引擎的 end-of-turn eviction 策略导致下一轮必须重入队列。Continuum 首次将"per-turn queueing delay"从"KV reload cost"中独立出来,证明前者是更严重的问题:即使 reload 近乎免费(CPU offloading),排队延迟仍占总延迟的 58.2% [2511.02230] [2511.02230]。这一观察重新定义了 agent serving 的优化目标函数——从简单的"reload cost vs memory cost"变为"reload + queueing delay vs memory blocking"。
第三,框架层缺乏工作流感知的调度。 传统 serving 框架按单请求粒度调度,不理解 agent 工作流的 DAG 结构。多个 agent step 之间的 KV 复用、跨 step 的 context 共享、以及工作流级的公平调度,都需要框架从"请求级"跃迁到"程序级"编排 [framework] [2602.13692]。ThunderAgent 将 agentic program 提升为调度一等公民 [2602.13692],HexAGenT 进一步将 agentic workflow 建模为 online-revealed DAG 并在异构 PD 分离集群上联合排序 prefill/decode placement,平均降低 Req99 33.0%(最大 80.5%)[2605.16637]。
第四,注意力架构的多元化使问题更加复杂。 从标准 softmax 到 compressed attention (CSA+HCA)、再到线性注意力 (KDA),每种架构对 KV cache 的形状、大小、eviction 策略都有不同要求。三种范式构成连续谱:KDA fixed-size recurrent state(128×128/head,O(1))→ CSA/HCA 压缩条目(O(n/m))→ MLA per-token latent(576 floats/token,O(n))[model]。框架和 agent 系统必须同时适配多种注意力范式。
第五,agent context 的积极管理已成为生产必需。 Claude Code 的逆向分析揭示,生产级 coding agent 用 5 层渐进式 context compaction 管理 context 膨胀,其核心范式是"1.6% 决策逻辑 + 98.4% 确定性基础设施" [2604.14228]。Cursor 的 Dynamic Context Discovery 将所有 agent 辅助上下文(tool output、chat history、MCP schema)统一为惰性加载对象,A/B 测试显示 MCP-heavy session token 消耗减少 46.9% [blog-dynamic-context-discovery]。这两个生产案例表明:context 生命周期管理不再是可选优化,而是 agent 系统的核心基础设施。
此外,一条正交的"绕过"路线正在挑战上述全部前提。 上述五个方向都默认长 context 必须进入模型的注意力窗口,问题随之变成"如何在窗口内更好地放置、压缩、淘汰、调度"。Recursive Language Models (RLM) 提出相反的范式:根本不把长 prompt 喂进神经网络,而是将其绑成持久 Python REPL 中的一个环境变量,root 模型只看到常数大小的 metadata,并通过写代码递归地 sub-call 自己(llm_query / rlm_query)处理 prompt 的切片 [2512.24601]。它把"context rot"(质量随 prompt 变长而陡降,且越语义复杂的任务越早崩)作为出发点 [2512.24601],但解法是 decompose-and-recurse 而非 fit-and-manage——可处理 >10M token 输入(超出窗口 10×),在四个复杂度分级长上下文任务上以中位数 13–130% 优于 GPT-5 + compaction/CodeAct 等 scaffold [2512.24601]。
更进一步,一条建立在 decompose-and-recurse 之上的"跨调用记忆"路线开始浮现。 RLM 每次 query 都从零初始化 REPL,root 永不复用上一轮对同一语料已经建立的认知 [2512.24601]。PEEK 针对"反复查询同一份大型外部语料(5 万条反馈语料库、一个代码仓库)"的场景,把可复用的 orientation knowledge(语料里有什么、如何组织、哪些实体/常量/schema 重要)缓存成一个常数大小(默认 1024 token)的 context map,常驻在 system prompt 里,由一套可编程缓存策略(Distiller → Cartographer → Evictor)从执行轨迹中自动维护 [2605.19932] [2605.19932]。它建立在 RLM backbone 之上——把 RLM 的 reasoning/action/observation 轨迹作为 Distiller 输入、把 map 注入 RLM 暴露的同一 system prompt,并声明这种 externalized-context 接口是硬前提 [2605.19932]。结果是在反复查询场景下 +6.3–34.0% 质量、少 93–145 轮迭代、成本比 SOTA prompt-learning(ACE)低 1.7–5.8× [2605.19932]。
这五个问题的交汇点指向一个跨类别的主题:如何在模型层位置偏置的约束下,为 agent 工作负载设计有完整生命周期(load → use → evict → prefetch)的 context 管理系统? 这个问题不能由任何单一类别独立回答——它需要模型层的注意力机制、agent 层的 KV cache 策略、框架层的工作流调度、以及算法层的位置偏置修复四者协同设计。值得强调的是,RLM 代表了对这个问题本身的质疑——如果 context 可以被 decompose-and-recurse 地外置处理,那么"窗口内生命周期管理"可能只是 fit-and-manage 这一条假设路径下的局部最优 [2512.24601]。本主题因此同时容纳三条宏观策略:fit-and-manage-context(把长 context 放进窗口再压缩/淘汰/调度)、decompose-and-recurse(根本不放进窗口,外置后递归处理)、以及 persist-orientation-knowledge(在外置/递归之上,把"关于反复查询的外部语料的认知"持久化为常驻的跨调用缓存)——后者由 PEEK 代表,是一个 cache-policy / cross-invocation-memory 的角度,既区别于窗口内管理、也区别于 RLM 的 recurse-and-discard [2605.19932]。
| Category | Paper count | Representative |
|---|---|---|
| model | 4 | DeepSeek-V4 (CSA+HCA 压缩注意力), Kimi Linear (KDA 线性注意力), Massive Values (注意力机理分析), Attention Residuals (残差优化) |
| agent | 11 | Continuum (KV TTL), SideQuest (语义淘汰), SAGA (工作流图调度), PBKV (GNN 预测), Claude Code (生产架构), RLM (REPL 递归外置), PEEK (跨调用 orientation 缓存) |
| algorithm | 8 | NoLiMa (长上下文 benchmark), FilM/IN2 (位置偏置修复训练), PCD (对比解码), HexAGenT (工作流调度), Dynamic Context Discovery (惰性加载) |
| framework | 9 | ThunderAgent (程序级调度), Helium (模板化 Radix Tree), KVFlow (工作流感知缓存), KVServe (跨 DC 压缩), Concur (AIMD 准入), ICaRus (跨模型 KV 共享) |
共计 32 篇论文/系统 + 4 份类别综述,覆盖 4 个类别。
| 时间 | 事件 | 意义 | ||
|---|---|---|---|---|
| 2023 | Liu et al. "Lost in the Middle" (TACL 2024) | 首次系统记录 U 型性能曲线;GPT-3.5 在 middle position 下降超 20pp | ||
| 2024-04 | FilM-7B / IN2 Training [2404.16811] | 证明 lost-in-middle 可通过数据合成+指令微调修复(VaL 47.3→85.9),核心论点:这是数据问题不是架构问题 [algorithm] | ||
| 2024-12 | Lost in the Middle and In-Between [2412.10079] | 发现多跳 QA 中 adjacent 配置稳定优于 separated 1–7pp,CoT 在非指令微调模型上崩溃至 ≤1% [algorithm] | ||
| 2025-02 | NoLiMa benchmark [2502.05167] | ROUGE-L 压至 0.07 消除字面匹配,13 个 frontier 模型有效长度均 ≤8K;单 distractor 句子即可将 GPT-4o 从 8K 塌到 1K | ||
| 2025-02 | Massive Values 分析 [2502.01563] | 揭示 RoPE 低频维度的 massive values 是上下文理解的功能信号,破坏后 GSM8K 76.9%→4.0% | ||
| 2025-05 | HexGen-Flow [ref:2505.05286] | 在 agentic text-to-SQL 场景下优化调度,P95 latency 降 1.42–1.56× | ||
| 2025-06 | PCD (ACL 2025) [2506.08371] | Training-free 对比解码,通过 RoPE 过旋转缓解后验显著度衰减,衰减率压缩至 (ln B'/ln B)^{2/d}<1 | ||
| 2025-07 | KVFlow [2507.07400] | 首个 workflow-aware prefix caching:Agent Step Graph + STE 替代 LRU;但受制于静态 DAG 假设和单 GPU 验证 [2507.07400] | ||
| 2025-09 | Halo [2509.02121] | 将 DB query optimization(parse→rewrite→schedule→execute)映射到 agentic serving,Request Coalescing 在 W6 上 +154% 吞吐 [2509.02121] | ||
| 2025-10 | Kimi Linear (KDA) [2510.26692] | 线性注意力首次在公平对比下全面超越全注意力,KV cache −75%,NoPE 消除 RoPE 外推问题 | ||
| 2025-11 | Continuum [2511.02230] | 提出 KV cache TTL 机制;首次识别 per-turn queueing delay 是独立于 reload cost 的更严重问题 [2511.02230] | ||
| 2025-11 | Gemini 2.5 Flash 消除单针 LITM [2511.05850] | 1M context 下 100% 准确率,但严格限于单针+事实查询+单一模型 | ||
| 2025-12 | Recursive Language Models (RLM) [2512.24601] | 范式提案:把长 prompt 移出窗口、绑成 REPL 环境变量递归 sub-call;depth=3 把 OOLONG-Pairs F1 从 0.1 拉到 76.0,处理 >10M token,1,000 样本 +28% [2512.24601] | ||
| 2026-01 | Intelligence Degradation [2601.15300] | 五检测器交叉验证量化 cliff:Lc ≈ 43.2%(≈55K/128K),三瓶颈框架归因 attention 弥散 > RoPE aliasing | ||
| 2026-01 | Concur [2601.22705] | 将 KV cache 重定义为共享有限资源,AIMD 准入控制防止 thrashing,4.09× 吞吐 | ||
| 2026-02 | SideQuest [2602.22603] | 范式转变:让 LRM 自身判断 KV 淘汰(从统计代理到语义信号),56–65% token 降幅,non-completion rate 近零 | ||
| 2026-02 | ThunderAgent [2602.13692] | agentic program 一等公民抽象;指数衰减函数在 memoryless 假设下证明唯一最优 [2602.13692] | ||
| 2026-03 | ICaRus [2603.13281] | Frozen encoder + LoRA decoder 实现跨模型 KV cache 精确共享(N 模型 → 1 份 KV),训练时约束保证推理时 cache identity [2603.13281] | ||
| 2026-03 | Helium [2603.16104] | Templated Radix Tree 双层前缀统一表示(metadata 27× 缩减),nested-sequence schedule vs MILP 仅 0.9% gap [2603.16104] | ||
| 2026-03 | PASTE [2603.18897] | 投机性工具执行,E2E 延迟降 48.5%,与 KV cache 优化正交可叠加 | ||
| 2026-03 | Attention Residuals [2603.15031] | 沿深度做 softmax 加权求和替代恒定残差,scaling law 节省 ~1.25× compute,GPQA +7.5 | ||
| 2026-04 | Claude Code 逆向分析 [2604.14228] | 揭示 "1.6% 决策 + 98.4% 确定性基础设施" 范式;5 层 compaction 与 prompt caching 经济学深度耦合 [2604.14228] | ||
| 2026-04 | SGH [2604.11378] | Scheduler-theoretic 框架: | U | 连续谱统一 Agent Loop 和 DAG executor,70 个开源项目的唯一跨系统比较语言 [2604.11378] |
| 2026-05 | SAGA [2605.00528] | AEG + WA-LRU 达 Bélády 1.31× competitive ratio,但 session-affinity 引入 ~30% 吞吐代价 [2605.00528] | ||
| 2026-05 | PBKV [2605.06472] | "确定性护栏 + 概率系统"分层设计:退役缓存确定性淘汰贡献 1.66× 命中率,预测失败时退化至生命周期感知而非 LRU [2605.00528] | ||
| 2026-05 | PEEK [2605.19932] | 在 RLM 之上把可复用的 orientation knowledge 缓存为常数大小 context map(默认 1024 token),可编程缓存策略 Distiller→Cartographer→Evictor 维护;反复查询同一语料 +6.3–34.0%,少 93–145 轮迭代,比 ACE 低 1.7–5.8× 成本 [2605.19932] | ||
| 2026-05 | HexAGenT [2605.16637] | Workflow-aware 调度在异构 PD 集群上 Req99 最大 −80.5%;per-call FCFS 需 α=5.85–26.89 才达 95% SLO [algorithm] | ||
| 2026 | DeepSeek-V4 CSA+HCA [deepseek-v4] | 1M context 下 KV cache 仅 V3(MLA) 的 10%,FLOPs 仅 27%;CSA/HCA/mHC/Muon 全套协同 |
本 topic 的技术演化跨越模型、算法、agent、框架四个类别,形成三条主干和多条交叉分支:
关键分支点:
关键汇合点:
注意力架构决定了 KV cache 的形状、大小和生命周期特征,直接约束框架层的缓存策略。
标准 MLA (K2 系列) 产生 576 floats/token 的 latent KV [2507.20534],KV cache 与序列长度线性增长。在 agent 多轮场景下,128K context 的 KV cache 可达数十 GB,直接触发 Continuum 所识别的 end-of-turn eviction 问题 [2511.02230]。
KDA 线性注意力 (Kimi Linear) 用 fixed-size recurrent state 替代 per-token KV,cache 大小与序列长度无关(128×128/head)[2510.26692]。这从根本上消除了 agent 多轮场景的 KV 膨胀问题——但框架层的 prefix caching 机制(KVFlow 的 STE [2507.07400]、Helium 的 Radix Tree [2603.16104])假设 KV cache 是 append-only 的 token 序列,无法直接适配 recurrent state。KVFlow 的核心可攻击面——workflow graph 静态可观测假设 [2507.07400]——在 KDA 模型下变得更加尖锐:recurrent state 不允许部分命中,STE 距离度量失去意义。
CSA+HCA 压缩注意力 (DeepSeek-V4) 做"先 4× 压缩再 sparse top-k 选择"(CSA)和"128× 压缩 + dense attention"(HCA),两者交错排列 [deepseek-v4]。KV 条目数缩减为 O(n/m),但需要 CSA compressor + Lightning Indexer(FP4) + HCA compressor + SWA + Attention Sink + Partial RoPE 的完整复杂体系 [model]。这要求 KVServe 等跨 DC 传输框架重新设计压缩策略——service-aware 压缩必须理解不同注意力层的压缩比差异 [kvserve]。
Agent 工作负载有四个区别于交互式对话的关键特征,每个都要求框架层的响应:
特征 1:短间隙多轮 tool call。 间隙仅 925ms–1923ms [2511.02230],远短于传统对话的分钟级间隔。框架响应的分化反映了不同的设计哲学:Continuum 用 cost-benefit TTL 做请求级保留(简洁但无工作流感知)[2511.02230];ThunderAgent 将程序整体作为调度单元(需显式 release 信号,健壮性弱于 TensorHub 的 ownership-free drain 机制)[2602.13692];Concur 用 AIMD 双信号准入控制(agent 级粒度,但无公平性保证且不兼容 PD 分离)[2601.22705]。
特征 2:DAG 结构的工作流。 Agent 步骤间存在复杂的依赖关系。框架响应:SAGA 用 AEG 形式化为 DAG(支持 backward retry edges 和 transition probabilities,competitive ratio 1.31×,但 session-affinity 导致 ~30% 吞吐损失)[2605.00528] [2605.00528];Halo 借 DB query optimizer 做 epoch DP + Request Coalescing(从 MILP NP-complete 到 2s 求解且质量 ≈oracle,但受限于静态拓扑)[2509.02121] [2509.02121];HexAGenT 将 workflow 建模为 online-revealed DAG 并用 projected scaled-SLO risk 排序(per-call FCFS 需 α=5.85–26.89 才达 95% SLO,workflow-FCFS 立即减 31.4%)[2605.16637] [algorithm]。
特征 3:CPU 侧瓶颈。 工具执行(文件读写、搜索、编译)占 E2E 延迟 35%–88% [2511.00739]。GPU 越强(H200/B200),CPU 瓶颈越突出——Toolformer 推理占比从 Sys1 的 88% 降至 Sys2 的 77% [agent]。框架响应:PASTE 通过 pattern mining + 投机性工具执行在 LLM "思考"时预执行下一个工具,E2E 延迟降 48.5%(但 Top-1 准确率仅 27.8%,用多候选投机达到 93.8% overall hit rate——tradeoff 是用资源换覆盖率)[2603.18897] [agent]。COMB 微批重叠降低 3.9× 服务延迟(P50)[2511.00739]。
特征 4:跨工作流的 prefix 共享。 大量 agent workflow 共享 system prompt 和常见 tool response 前缀。Helium 的 Templated Radix Tree 以 template 粒度(而非 token 粒度)建索引,metadata 仅 552 KiB vs SGLang 的 14.8 MiB(27× 缩减)[2603.16104]。其 nested-sequence schedule 同时优化 inner(per-query context prefix)和 outer(static system prompt)两层 cache locality,vs MILP 仅 0.9% gap [2603.16104]。ICaRus 将 prefix 共享推进到更深一层——跨模型共享:通过冻结 base encoder + LoRA decoder 的训练时约束,保证不同 task model 对同一 prompt 产出精确相同的 KV cache,使 N 个模型的 KV 存储从 O(N) 降至 O(1) [2603.13281] [2603.13281]。Helium 消除同一模型跨 workflow 的 prefix 冗余,ICaRus 消除跨模型的 KV 冗余——两者可叠加:ICaRus 保证单份 KV cache,Helium/KVFlow 优化该份 cache 的 eviction 策略。
Lost in the Middle 的位置偏置在 agent 场景被放大。Agent 先读 file A(context 开头),然后读 file B、C、D(推入 middle),最后读 file E(context 末尾)。当需要综合 B/C/D 的信息时,这些内容恰好在注意力死区。
算法层的诊断揭示了三层任务难度的递进关系:单针字面匹配检索已被饱和(Gemini 2.5 Flash 1M 全通)[2511.05850],但隐式关联推理的有效长度仅 8K(GPT-4o 声称 128K,缩水 16×)[2502.05167],通用阅读理解的 cliff 在 43% 标称处触发(Qwen2.5-7B)[2601.15300]。三者的矛盾并非真矛盾:LITM 的"消失"是任务条件的函数——字面匹配检索已被训练课程饱和,但隐式推理能力尚未受益于同类训练 [algorithm]。
这个传导链条解释了为什么 agent 的 KV cache 管理不能是简单的 LRU:被淘汰的 token 可能正是模型在注意力死区中遗漏的关键信息。但淘汰决策信号的选择本身是一个 design space,从弱到强:累积 attention score(H₂O/SnapKV)→ tool call 延迟 CDF(Continuum)→ AEG 转移概率 × token 重叠度(SAGA)→ GraphSAGE 拓扑+前缀+语义三流融合(PBKV)→ LLM 自身的语义推理(SideQuest)[2602.22603]。信号越强、overhead 越高——PBKV 的预测器仅 ~350K 参数、1.18ms/请求 [2605.00528],而 SideQuest 每次辅助线程生成 110–140 token 的管理推理,GPU 开销显著高出 1–2 个数量级 [2602.22603]。
Claude Code 的逆向工程揭示了一个精心设计的平衡:它选择了最简单的 Agent Loop 架构(while-loop + tool calls,queryLoop 仅占代码 1.6%),但用 5 层 context compaction + 7 层安全管道来管理 context 膨胀 [2604.14228]。五层 compaction(budget reduction → snip → microcompact → context collapse → auto-compact)之间的时序耦合令人注目——microcompact 需等 API 返回 cache_deleted_input_tokens 才能精确计算预算 [2604.14228]。93% approval rate 证明交互式确认不可靠,倒逼了 7 层独立安全机制的设计——PASTE 和 SGH 各自只有单层安全语义 [2604.14228]。
这与 SGH 的理论分析形成核心张力。SGH 认为 Agent Loop 有三个结构性缺陷(隐式依赖、无界 recovery、不可审计),主张用显式 DAG 替代 [2604.11378]。但 PASTE 用更轻量的方法(pattern-based speculation,无 DAG)达到了 48.5% E2E 延迟减少——SGH 声称需要 DAG 并行才能获得的收益,PASTE 通过时间重叠就实现了 [2604.11378]。SGH 自估 60–70% 任务实际是线性链 [2604.11378],PBKV 则直接证明静态 DAG 假设无法处理运行时条件分支和重试循环 [2605.06472]——SGH 在 PBKV 证明最有价值的场景(动态工作流)上完全不适用。
Dynamic Context Discovery 提供了第三条路径:不改执行结构也不改 serving 层,而是在 context assembly 阶段将所有辅助上下文统一为惰性加载对象,通过"不加载就不存在"的原则从源头减少 token 消耗 46.9% [blog-dynamic-context-discovery]。这与 Claude Code 的"只在需要时加载"和 Helium 的"CSE + CacheFetch 从 DAG 消除冗余 operator"异曲同工 [2603.16104]。
理论上,一个完整的 agent context 管理栈可以同时部署多层优化 [2602.22603]:
ICaRus 在此栈中补足了 SideQuest(intra-request 粒度的语义 GC)和 PBKV(inter-workflow 粒度的预测性 eviction)之间的第三层——cross-model sharing:SideQuest 决定单个请求内哪些 token 可丢弃,PBKV 决定跨工作流哪些 KV block 值得保留,ICaRus 则从根源上消除因模型不同而产生的 KV 冗余副本 [2603.13281]。三者的决策粒度(token → workflow → model)互不重叠,理论上可完全叠加。
但实际部署面临至少三个层间冲突:(1) 如果 SideQuest 认为某 token 仍有语义价值,但 Continuum 的 TTL 过期驱逐了整个 session 的 KV cache,语义判断被浪费 [2602.22603];(2) Concur 的 AIMD 准入控制假设单 SGLang 引擎暴露 usage 和 hit-rate 信号,在 PD 分离架构下信号需跨引擎聚合 [2601.22705];(3) ThunderAgent 直接否定朴素 PD 分离在 agent workload 下的价值,但 DualPath 证明优化过的 PD 分离(dual-path loading + CNIC QoS)可以工作——ThunderAgent 否定的是"朴素 PD"而非"所有 PD" [2602.13692]。
RLM 与本主题主流方案构成一组深刻的资源维度对照。SideQuest 让 token 先进 GPU KV cache、再用并行辅助 LRM 线程语义判断哪些过期并物理驱逐 [2602.22603];RLM 则让 token 根本不进 root 窗口、全程活在 CPU 侧 REPL 变量里,需要时才 sub-call [2512.24601]。两者的共识极深——都拒绝启发式重要性估计(attention score),都主张让模型用语义理解管理上下文 [2512.24601];但 SideQuest 优化的是 GPU KV 显存(+83.9% 吞吐),RLM 省的是 root 窗口(代价是多次 sub-call 重算)。二者解决的是同一问题的不同资源维度,可在 rlm_query 子循环内部嵌入 SideQuest 式辅助驱逐线程实现正交叠加 [2512.24601]。
但 RLM 的"绕过"并非免费,它把退化问题递归地推给了下一层:sub-LM 自身仍要吃 ~500K 字符的 chunk [2512.24601],按 Intelligence Degradation 的 43.2% 容量悬崖 [2601.15300],若 sub-call 输入超过 sub-model 容量的 ~40% 同样会退化,而 RLM 未报告 sub-call 输入长度 vs 准确率曲线 [2512.24601]。此外 RLM 依赖强编码能力——弱编码模型会因 syntax error 在递归中传播而越深越差 [2512.24601],且其"comparable cost"仅在 per-answer 中位数成立,长尾轨迹极贵,在 batch serving 的 tail latency 视角下站不住 [2512.24601]。这与本主题主流方案恰好互补:RLM 强在 super-window,主流 fit-and-manage 强在窗口内的吞吐/延迟。
RLM 解决了"单次 query 内长上下文不进窗口",但留下一个空白:reusable 的"关于语料的认知"在 query 之间被反复重建。PEEK 填补的正是这个空白——它把 agent state 的设计空间画成 2×2(active/passive × agent-task/external-context),指出 shared chat/compaction 管的是 agent-task 轨迹、RAG/offloading 是对外部材料的 passive 访问、prompt-learning(ACE/Reflexion/GEPA)curate 的是 task-level 策略,而 active×external-context 这一格——主动维护一份"关于反复查询的外部语料"的 orientation 知识——此前是空的 [2605.19932]。
与 RLM 的互补而非替代关系。 PEEK 不是 RLM 的 baseline,而是 built-on-top:它把 RLM 的执行轨迹喂给 Distiller,把 map 注入 RLM 同一个 system prompt [2605.19932]。两者回答正交问题——RLM 决定"上下文存在哪里"(offload 到环境),PEEK 决定"关于该上下文的什么可复用知识保持常驻" [2605.19932]。一个有意思的发现是:PEEK 的跨 backbone 可移植性(GPT-5-mini → Qwen3-Coder-Next-FP8,并把 RLM 换成生产级 OpenAI Codex 后 gains 反而更大)恰好落在 RLM 最脆弱处——RLM 的 system prompt 本身不跨模型移植 [2605.19932] [2512.24601]。
与 KV 层 / 语义淘汰的层级分工。 PEEK 明确把它的 text map 与 model-level KV cache 区分开 [2605.19932]。SideQuest 在一个 task 内对 KV 字节做语义驱逐 [2602.22603],PEEK 在 query 之间累积一份 text artifact——两者作用在不相交的层,可叠加:一个 agent 既常驻 PEEK map、又在 per-query 轨迹上跑 SideQuest 式驱逐,可同时打 iteration-quality 和 KV-footprint 两个目标,但没有论文测过组合后的 Pareto 前沿 [2605.19932]。这与 §5.5 的多层可组合栈同构——PEEK 补的是"应用层之上、跨调用"的一层。Pancake 式的多 agent 向量记忆底座则可进一步把 PEEK 从"单语料"提升到"多语料"——按 context 键存取多份 map [2605.19932]。
lossy vs lossless 的张力在此重现。 PEEK 为了把 orientation 压进预算,主动丢弃 task-specific 事实 [2605.19932];CMV 的核心主张恰恰相反——compaction 摧毁 98% 会话状态是病,无损保留每一轮 user/assistant 才是药 [2602.22402]。矛盾根源是两者管理的对象不同:CMV 管 agent-task 状态(同一项目内任何过去决策都可能再被需要),PEEK 蒸馏 external-context orientation(task-specific 开销对下一个 query 可证不可迁移)。两者在各自的象限都对,但"丢弃轨迹"与"永不丢一轮"不能被同一个 agent 同时采用,除非有一个 quadrant-aware 路由 [2605.19932]。
所有 5 篇 agent KV cache 论文都以此为出发点且提供了独立的量化证据。Continuum 测得 per-turn queueing delay 占总延迟 58.2% [2511.02230];SAGA 报告 Bélády 最优的 1.31× competitive ratio vs 传统 LRU 的巨大偏差 [2605.00528];PBKV 测得 LRU 命中率仅 27% [2605.06472];Concur 观测到 HiCache 在 DeepSeek-V3 Batch-16 下比 SGLang 慢 3×——naïve offload 不是解药 [2601.22705]。无一论文为传统 end-of-turn eviction 辩护。
Gemini 2.5 Flash 在单针检索上已消除 LITM(1M context 100% 准确率,但严格限于单针+事实查询+单一模型)[2511.05850]。NoLiMa 的去字面匹配 benchmark(ROUGE-L 压至 0.07)将所有 frontier 模型有效长度压至 ≤8K,单 distractor 句子即可将 GPT-4o 从 8K 塌到 1K [2502.05167]。多跳 QA 中证据间距带来额外的乘性惩罚,且 CoT 在非指令微调模型上反而崩溃至 ≤1% [2412.10079]。所有长上下文评测论文都同意:NIAH 式 benchmark 严重高估了模型的实际长上下文能力。
DeepSeek-V4 的压缩 KV (O(n/m))、Kimi Linear 的 recurrent state (O(1))、标准 MLA 的 per-token latent (O(n))——三种形状共存 [model]。V4 在 1M 下 KV cache 仅 V3(MLA) 的 10%,但需要 CSA+HCA+mHC+Muon 的完整复杂体系 [deepseek-v4]。Kimi Linear 通过 recurrence 获得 O(1) 但需要 chunkwise kernel 的数值正确性保障 [2510.26692]。位置编码的三种路线(K2 系列的 RoPE + YaRN、Kimi Linear 的 NoPE、V4 的 Partial RoPE)来自三个独立团队,使这种碎片化在可预见未来无法统一 [model]。
从不同层面出发,6 篇独立工作汇合到同一结论:per-request FCFS 远不足以服务 agent workload。HexAGenT 量化了差距:per-call FCFS 需 α=5.85–26.89 的 SLO budget 膨胀才达 95% SLO,workflow-FCFS 立即减 31.4% [2605.16637]。ThunderAgent 的 program 一等公民抽象 [2602.13692]、SAGA 的 AEG [2605.00528]、Helium 的 TRT [2603.16104]、KVFlow 的 STE [2507.07400]、Halo 的 epoch DP [2509.02121] 都是对这一共识的不同响应。
三条路线的根源是信号来源和 overhead 的 trade-off [2511.02230]:
| 路线 | 信号 | overhead | 适用场景 |
|---|---|---|---|
| 时间维度(Continuum TTL) | per-tool 历史 CDF | 零(在线统计) | 短 horizon coding agent(6–11 turns) |
| 结构预测(SAGA AEG / PBKV GNN) | DAG 转移概率 / GraphSAGE 嵌入 | 低(12.3ms / 1.18ms per-request) | 结构化工作流 |
| 语义理解(SideQuest LRM) | LLM 自身推理 | 高(110–140 token/次) | 长 horizon deep research(80+ turns) |
Continuum 的 per-tool CDF 是上下文无关的——相同 tool name 在不同执行上下文下的延迟方差被完全忽略(cd 最慢 10% 占 94.1% 总延迟)[2511.02230]。SideQuest 的 non-completion rate 数据(heuristic baselines 高达 60%+)揭示了 Continuum 未讨论的风险:即使 KV cache 被完全保留,上下文膨胀导致的 attention 计算变慢可能从另一维度恶化延迟 [2602.22603]。
实验 workload 差异是矛盾根源:Continuum 在 SWE-Bench/BFCL 上测试(6–11 turns),SideQuest 在 FRAMES/BrowseComp 上测试(80+ turns,120K+ tokens)[agent]。短 horizon 下时间维度足够;长 horizon 下语义维度不可或缺。但 SideQuest 的单模型验证(仅 gpt-oss-20b)使其泛化证据在所有竞品中最弱——Continuum 横跨 8B–355B 四个模型族 [2602.22603]。
SAGA 用 AEG 预测 KV 复用(competitive ratio 1.31× vs Bélády)[2605.00528],但其 formal bound 极度松散(20.5×),1.31× 仅是 empirical average-case,且 Bélády 是单机 eviction 的 optimal,而非 joint scheduling + eviction 的全局最优 [2605.00528]。PBKV 批评"静态 DAG 假设无法处理运行时条件分支和重试循环",用 GNN 多步预测在动态工作流上达 69% 命中率 vs 静态距离方法 39.87% [2605.06472]。
PBKV 的"确定性护栏 + 概率系统"分层设计在鲁棒性上优于 SAGA 的加权线性评分:PBKV 在预测精度从 0.94 到随机的整个谱上都严格优于 LRU [2605.00528],而 SAGA 去除 AEG 后 TCT 退化 54%——对预测质量的依赖更强。
KVFlow 的静态 workflow graph 假设是最脆弱的:ReAct/Reflexion/autonomous agent 在运行时动态生成下一步 agent,STE 无法预先计算——如果 2026 年 agentic 范式从静态 DAG 向动态 agent(self-play、tree-of-thought)迁移,KVFlow 的核心抽象需要根本性重新设计 [2507.07400]。
三种归因作用于不同层级 [algorithm]:
三者可同时成立且互不矛盾——只是论文各自将自己的层级表述为"根因"。完整修复可能需要三层叠加:IN2-style 训练 + PCD 解码 + 架构级 attention 改进 [algorithm]。
SGH 认为 Agent Loop 有结构性缺陷(隐式依赖、无界 recovery、不可审计),只有显式 DAG 才能根本解决 [2604.11378]。Claude Code 的生产成功恰恰建立在 Agent Loop 之上 [2604.14228]。
但 Claude Code 的"minimal scaffolding"范式可能是 Claude-specific 的——论文论证"values-over-rules"需要模型具有"good judgment",如果 backbone 换为 Llama-70B 或 Qwen-72B,是否仍然 work?SGH 的批判在 frontier 模型不可用时可能更准确 [2604.14228]。Claude Code 的 93% approval rate 恰恰暴露了 Agent Loop 的脆弱性——approval fatigue 使人类审批无效化 [agent]。
ThunderAgent 实验直接否定了朴素 PD 分离("单侧 HBM 池变小,更低并发就触发 thrashing")[2602.13692]。但 DualPath 在 1152 GPU 上实现近线性扩展——其成功恰恰证明朴素 PD 退化但优化 PD(layerwise streaming + 带宽聚合 + VL QoS)可以工作 [2602.13692]。Concur 拒绝了 naïve PCIe offload,而 DualPath 的方案是带 QoS 隔离的网络存储 offload——硬件约束不同使结论不同 [2601.22705]。
本主题绝大多数工作默认 fit-and-manage-context:长 context 进入注意力窗口,再用压缩(DeepSeek-V4 CSA+HCA)、淘汰(Continuum/SAGA/SideQuest)、调度(ThunderAgent/HexAGenT)管理它。RLM 提出 decompose-and-recurse 的对立路线——把 prompt 绑成 REPL 变量,root 永不读全文,靠符号递归子调用处理 [2512.24601] [2512.24601]。这与 CMV 对 autocompaction "98% 损失" 的批判、RLM 对 compaction "对 dense-access 任务有损"(OOLONG-Pairs 仍是 0.1)的批判同向 [2512.24601],但解法走到了更远的"整篇不裁剪、留在环境里"。
二者并非简单对立而是适用区间互补:RLM 独占的生态位是 information-dense + super-window + long-output 三者同时成立的任务(OOLONG-Pairs 是典型,depth=3 达 76.0 而 compaction 仅 0.1)[2512.24601] [2512.24601];而在窗口内(≤32K)且延迟/吞吐敏感的 agent serving 场景,fit-and-manage 的 KV cache 复用收益是 RLM 全程 blocking sub-call 实现无法提供的 [2512.24601]。一个潜在的统一形态是分层混合:root 用 decompose-and-recurse scaffold,leaf sub-model 用 position-robust 基座(IN2 式训练)+ fit-and-manage KV 管理 [2512.24601]。
PEEK 在这条轴上再插入第三点:它既不在窗口内压缩、也不替代 RLM 的 recurse-and-discard,而是在 decompose-and-recurse 之上"持久化跨调用的 orientation 知识"——一个 cache-policy / cross-invocation-memory 的角度 [2605.19932]。它与 SideQuest 共享"让模型自己管理上下文"的共识(Distiller 用模型而非启发式给轨迹打 helpful/harmful/neutral/stale 标签)[2605.19932],但把这条共识落到 semantic 层的 prompt-resident artifact 上、而非 KV 字节。其适用边界也清晰:只在"反复查询同一份持久语料"成立——在 per-task 证据几乎不相交(FanOutQA 仅 1.1% 问题对共享证据页)的 multi-document 检索上,orientation 知识无法跨语料复用,PEEK 自承收益有限 [2605.19932]。
Lost in the Middle 可能是 causal decoder + residual connections 的固有几何性质——U 型偏差在模型初始化时就存在 [2601.15300]。Gated Attention 和 Attention Residuals 提供了有效补偿(GPQA +7.5,scaling law 节省 ~1.25× compute)[2603.15031],但补偿本身增加参数和计算量(Block-AttnRes I/O 增 1.8×)[model]。
为什么困难:这不是"没人试"而是存在理论约束。在 causal masking 下,第一个 token 代数上不可避免地获得更高权重;residual connections 锚定 recency bias。要根治需要改变基础架构(bidirectional / non-autoregressive),但这与 LLM 的 autoregressive 生成范式冲突。线性注意力 (KDA) 通过 recurrent state 绕过了部分约束 [2510.26692],但 NoPE 方案需要 KDA 的 data-dependent gate 隐式补偿 RoPE 的语义功能——Massive Values 研究确认这些功能载体是 RoPE 低频维度的 Q/K concentrated massive values [2502.01563],KDA 的 DPLR 约束(a=b=k)能否完全替代这一机制缺乏理论解释 [model]。Recursive Language Models 试图用"根本不进窗口"绕过这一困境,但其 sub-call 仍把切片喂进 sub-model 的窗口——退化被递归地推给下一层而非消除,且 RLM 未证明下一层免疫(未报告 sub-call 输入长度 vs 准确率曲线)[2512.24601]。
需要哪些类别协同:model(新注意力范式)+ algorithm(理论分析框架)+ framework(适配新 KV 形状)。
预估难度:5+ 年。零开销补偿方案可能不存在;最优 compute-quality tradeoff 尚未被理论刻画。
理想的 KV cache 淘汰应淘汰"未来最久不会用到的 token"(Semantic Bélády's Algorithm)。但判断"什么将来有用"本身需要理解任务的完整语义——这正是 agent 正在执行的推理过程。
为什么困难:现有方案的形式化保证程度参差不齐。PBKV 的 Lipschitz 退化保证(Theorem 5.1)是目前唯一的形式化 regret bound,但 GNN predictor 需要 per-workload 训练(~1K traces),且退化后仅保证优于生命周期感知而非 Bélády optimal [2605.06472]。SAGA 的 competitive ratio 1.31× 是 empirical average-case,formal bound 松至 20.5×,在 adversarial workload 下无下界保证 [2605.00528]。Continuum 的 expected utility maximization 完全没有 competitive ratio 或 regret bound [2511.02230]。SideQuest 的辅助线程 GPU 开销未量化,且其 hindsight 标注无法捕获因过早 evict 而导致失败的 counterfactual 路径 [2602.22603]。
需要哪些类别协同:agent(语义理解)+ framework(高效淘汰执行)+ model(低开销语义信号提取)+ algorithm(形式化 regret 框架)。
预估难度:2–3 年达到实用。PBKV 的分层淘汰已在特定工作负载上接近最优,但统一的形式化框架(涵盖 TTL、AEG、GNN、LLM 语义四种决策机制)可能需要新的理论工具。
三种主流注意力范式产生完全不同的 KV cache 形状:MLA 的 per-token latent、KDA 的 fixed-size recurrent state、CSA+HCA 的压缩条目 [model]。现有的 KV cache 管理系统(Continuum、SAGA、PBKV)都假设标准的 per-token KV 格式。位置编码的三路分化(RoPE+YaRN、NoPE、Partial RoPE)进一步加剧碎片化 [model]。
为什么困难:框架层的 prefix caching(Radix Tree、STE)、eviction(TTL、LRU、GNN)、传输(KVServe 压缩)都依赖于 KV cache 是 token 序列这一假设。适配 recurrent state 需要重新定义"cache hit"的语义——一个 recurrent state 不能部分命中,KVFlow 的 STE 距离度量对其完全失效 [2507.07400]。适配压缩 KV 需要理解不同层的压缩比差异。V4 的框架适配需要 CSA compressor + Lightning Indexer + HCA compressor + SWA + Attention Sink 的完整体系同时 work [model]。
需要哪些类别协同:model(统一 KV 接口标准)+ framework(多形状 cache manager)+ agent(工作流级缓存策略适配)。
预估难度:1–2 年。DeepSeek-V4 和 Kimi Linear 的部署已在推动各自团队的框架适配,但跨团队的统一接口标准尚不存在。
现有方案在 context eviction 粒度上差异巨大:Continuum 是 turn-level(TTL 到期则整轮 KV 驱逐)[2511.02230],SideQuest 是 token-level(逐 token 语义淘汰)[2602.22603],CMV 是 session-level(三遍裁剪保留结构)[2602.22402],Claude Code 的 5 层 compaction 按 conversation segment 操作 [2604.14228],Dynamic Context Discovery 在 context assembly 阶段做文件粒度的惰性加载 [blog-dynamic-context-discovery],PEEK 则在 跨调用 粒度维护一份常数大小的 orientation map、并由 Evictor 按 section-value 层级(Parsing Schema → Reusable Results → Domain Constants 先淘汰,Roadmap 与 Understanding 最后保护)在预算 B 内淘汰 [2605.19932]。
为什么困难:最优粒度取决于任务类型,但更深层的问题是层间一致性:应用层的 context compaction(Claude Code)和 serving 层的 KV eviction(Continuum/SAGA)各自独立决策,可能互相冲突。Claude Code 在 serving 请求到达之前已做了大量裁剪——Continuum 保留的 KV cache 对应的是已被 compact 过的 context,保留的价值需要重新评估 [2511.02230]。反过来,如果 SAGA 驱逐了 SideQuest 认为有语义价值的 KV,语义判断被浪费 [2602.22603]。PEEK 又在此之上引入"跨调用"这一层——它常驻的 orientation map 是一份与 turn/token/session 都不重叠的 prompt-resident text artifact [2605.19932],理论上可与 SideQuest 式 per-query KV 驱逐正交叠加,但两层各自独立决策、谁都不知道对方淘汰了什么,没有论文测过组合 Pareto [2605.19932]。统一的多层 eviction 协议——让应用层、serving 层、token 层、跨调用层共享 eviction 意图——是一个未被解决的系统设计问题。
需要哪些类别协同:agent(任务类型识别 + 应用层 context 策略)+ framework(多粒度 eviction 机制 + 层间协议)。
预估难度:1–2 年。组件技术已存在,需要的是系统集成和标准化。
SAGA 的 AEG 推断在结构化 benchmark(SWE-bench)上达 87% 准确率 [2605.00528],但 ReAct 循环模式固定(think→act→observe),推断不难。对更复杂的 workflow(multi-agent、tree-of-thought、动态子任务生成),推断准确率可能大幅下降。PBKV 需要 ~1K 训练轨迹 [2605.06472]。ThunderAgent 的指数衰减在 memoryless 假设下最优,但论文自己的主要实验 benchmark(ToolOrchestra + HLE)使用远程 API(重尾分布),此时理论最优性可能不成立 [2602.13692]。
为什么困难:这是在线学习的经典 exploration-exploitation 问题,但 agent 工作流的状态空间远大于传统 bandit 设定。工作流模式随时间漂移(新工具、新 agent 策略、不同用户习惯),需要持续适应。
需要哪些类别协同:agent(工作流模式挖掘)+ framework(在线自适应调度)+ algorithm(bandit/RL 理论)。
预估难度:2–3 年。Continuum 的 per-tool CDF 是最简方案但信息不足;PBKV 的 GNN 更丰富但需 per-workload 训练。理想的方案可能是 Continuum 做 fast-path + SAGA/PBKV 做 slow-path 的混合架构 [2605.00528]。
整体评估:研究前沿 → 早期生产
趋势方向:快速加速。Agent workload 的爆发式增长驱动了从模型到框架的全栈创新。2025 年 11 月到 2026 年 5 月的 7 个月内,该领域产出了 14+ 篇系统论文。主要商业 agent 系统(Claude Code、Cursor、Windsurf、Kimi K2.6 的 12h agentic RL rollout [model])的部署规模正在为这些研究提供真实工作负载验证。
| Topic | 关系 |
|---|---|
| agent-system (agent serving infrastructure) | 强关联。agent-system 侧重 serving infrastructure 的全栈设计(KV cache 调度、集群路由、SLO 管理),本 topic 侧重 context 从创建到淘汰的完整生命周期。重叠区域是 KV cache 管理——SAGA、PBKV、Continuum、HexAGenT 同时属于两个 topic。分界点:KV cache 的 scheduling 和 eviction policy 属于本 topic;KV cache 的 storage engine、network transfer(DualPath/PrfaaS/KVServe)和 MoE execution(ZeRO-Prefill)属于 agent-system。ThunderAgent 横跨两者——其 program 一等公民抽象属于 agent-system,其指数衰减函数属于本 topic。 |
| attention-optimization (注意力机制优化) | 中等关联。DeepSeek-V4 的 CSA+HCA、Kimi Linear 的 KDA、Attention Residuals 等注意力优化技术影响位置偏置的严重程度和 KV cache 的形状。如果 KV 形状碎片化(§7.3)成为核心瓶颈,"多形状 KV cache 的框架统一适配"可独立为新 topic。当前分界点:注意力机制本身的设计属于 attention-optimization;注意力机制产生的 KV cache 如何在 agent 场景下管理属于本 topic。 |
| persistent-execution-paradigm (持久化执行) | 弱关联。TileRT/TokenSpeed 的 persistent Engine Kernel 消除 GPU 端的 kernel launch overhead [framework],本 topic 管理 LLM context 端的信息冗余。两者都在对抗"不必要的状态重建",但操作层级不同(GPU kernel vs LLM context)。TileRT 的 BS=1 极致低延迟优化可以缩短 Helium cost model 中的 decode latency,间接扩大工作流调度的窗口 [2603.16104]。 |
| rl-training-infra (RL 训练基础设施) | 弱-中关联。Agent RL rollout(如 Kimi K2.6 的 12h/4000+ tool call 训练)产生极端的 context 生命周期需求。TensorHub 解决 trainer→rollout 权重传输 [2602.13692],ThunderAgent 解决 rollout 推理吞吐,两者分别覆盖 RL pipeline 的不同瓶颈段且理论上可叠加。当 agentic RL 对 context 管理的需求超越推理场景时,可能需要新 topic。 |
| long-context / context-rot (长上下文退化与绕过) | 强关联。RLM 把 context rot 作为立论起点,但用 decompose-and-recurse 绕过而非在窗口内修复 [2512.24601]。其退化诊断簇(NoLiMa、Intelligence Degradation、Lost-in-Between)与本 topic §1 的位置偏置分析完全重叠。分界点:长上下文退化的"诊断与基座级修复"属 long-context / context-rot topic;退化在 agent context 生命周期中如何被管理(fit-and-manage)或绕过(decompose-and-recurse)属本 topic。RLM 横跨两者——其"把 P 移出窗口"的存在性论证属 long-context,其在 agent 工作流中作为 context 处理策略的定位属本 topic [2512.24601]。 |
| agent-memory (agent 记忆系统) | 强关联。PEEK 把"关于反复查询的外部语料的 orientation 知识"主动维护成常驻 prompt 的 context map,填补 active×external-context 象限 [2605.19932];它与 Pancake 的 passive 向量记忆底座、CMV 的 agent-task DAG 快照、SideQuest/Q4 的 KV 层记忆共同构成 agent-memory 的分层栈 [2605.19932]。分界点:记忆"管什么对象"(轨迹/KV/外部语料 orientation)跨入 agent-memory;这些记忆如何嵌入 agent 的 context 生命周期(load→use→evict)属本 topic。PEEK 横跨两者——其 2×2 设计空间(active/passive × agent-task/external-context)属 agent-memory,其作为 RLM 之上 context 处理策略的定位属本 topic [2605.19932]。 |
潜在 topic 融合方向:如果 agent serving 系统开始在 KV cache 层面实现 context eviction(即 SAGA 的 WA-LRU 被集成到 vLLM/SGLang),那么 attention-level 的 KV 压缩(CSA+HCA)和 system-level 的 KV 淘汰(SAGA/PBKV)可能在 serving infrastructure 层面统一,推动本 topic 与 agent-system 的局部合并。同时,HexAGenT 将 workflow-aware 调度与 DP 负载均衡(BalanceRoute 的 intra-decode 优化 [algorithm])联合的趋势,可能催生"全局 workflow 优化 + 局部 decode 均衡"的统一调度 topic。
| Entity | Categories | Role in topic | Key contribution | ||||
|---|---|---|---|---|---|---|---|
| [2404.16811] | algorithm | 位置偏置修复 | IN2 训练证明 LITM 可通过数据合成修复(VaL 85.9 超 GPT-4-Turbo) | ||||
| [2412.10079] | algorithm | 位置偏置诊断 | 发现多跳 QA 双层退化:绝对位置 + 证据间距;CoT 在弱模型上崩溃 | ||||
| [2502.05167] | algorithm | 位置偏置 benchmark | ROUGE-L 0.07 去字面匹配,frontier 模型有效长度 ≤8K | ||||
| [2506.08371] | algorithm | 解码层修复 | PCD 对比解码,衰减率 (ln B'/ln B)^{2/d}<1,但 throughput 减半 | ||||
| [2601.15300] | algorithm | 临界点量化 | Qwen2.5-7B cliff @ 43.2%,三瓶颈框架 | ||||
| [2511.05850] | algorithm | 单针 LITM 消除 | Gemini 2.5 Flash 在 1M context 单针检索 100%(严格限于单针+事实查询) | ||||
| [2605.16637] | algorithm | 工作流调度 | HexAGenT workflow DAG + 异构 PD placement,Req99 最大 −80.5% | ||||
| [blog-dynamic-context-discovery] | algorithm | 惰性加载 | Agent 上下文统一为文件系统惰性对象,MCP token −46.9% | ||||
| [2502.01563] | model | 注意力机理分析 | RoPE 低频 massive values 是上下文理解功能信号 | ||||
| [2510.26692] | model | 线性注意力 | KDA 首次公平对比下全面超越全注意力,KV cache −75%,NoPE 消除外推 | ||||
| [2603.15031] | model | 残差优化 | Attention Residuals 深度 softmax 聚合,scaling law 节省 1.25× compute | ||||
| [deepseek-v4] | model | 压缩注意力 | CSA+HCA 在 1M 下 KV cache 仅 MLA 的 10%,FLOPs 仅 27% | ||||
| [2511.02230] | agent | KV TTL | 首次识别 per-turn queueing delay 独立于 reload cost;8.18× 真实环境改善 | ||||
| [2602.22603] | agent | 语义淘汰 | LLM 辅助线程做语义级 KV 淘汰,56–65% token 降幅,non-completion ≈0 | ||||
| [2602.22402] | agent | 会话裁剪 | DAG 版本控制 + 三遍裁剪,均值 20% token 缩减 | ||||
| [2604.14228] | agent | 生产架构分析 | Claude Code 1.6% 决策 + 98.4% 基础设施;5 层 compaction 与 cache 经济学耦合 | ||||
| [2605.00528] | agent | 工作流调度 | AEG + WA-LRU 达 Bélády 1.31×(formal 20.5×);~30% 吞吐代价 | ||||
| [2605.06472] | agent | GNN 预测 | "确定性护栏+概率系统"分层设计,Lipschitz 退化保证,命中率 27%→69% | ||||
| [2604.11378] | agent | 理论框架 | U | 连续谱统一分类 70 个项目;Agent Loop = | U | =1 scheduler | |
| [2511.00739] | agent | CPU 瓶颈 | CPU 工具执行占 E2E 35–88%;COMB 微批 3.9× P50 降低 | ||||
| [2603.18897] | agent | 投机执行 | Pattern mining + 投机工具执行,E2E −48.5%;Top-1 仅 27.8% 但 overall 93.8% | ||||
| [2512.24601] | agent | REPL 递归外置 | 把长 prompt 移出窗口绑成 REPL 变量、符号递归子调用;OOLONG-Pairs 0.1→76.0,处理 >10M token,1,000 样本 +28% | ||||
| [2605.19932] | agent | 跨调用 orientation 缓存 | 在 RLM 之上把可复用 orientation knowledge 缓存为常数大小 context map(Distiller/Cartographer/Evictor 维护);反复查询 +6.3–34.0%,比 ACE 低 1.7–5.8× 成本,跨 base LM/backbone 可移植 | ||||
| [2602.13692] | framework | 程序级调度 | Program 一等公民;指数衰减唯一最优(memoryless 假设);否定朴素 PD | ||||
| [2603.16104] | framework | 模板化缓存 | TRT 双层前缀统一(27× metadata 缩减);nested-sequence vs MILP 0.9% gap | ||||
| [2509.02121] | framework | DAG 整合 | DB pipeline 映射到 serving;epoch DP 2s = oracle;Request Coalescing +154% | ||||
| [2507.07400] | framework | 工作流缓存 | Workflow-aware STE,但静态 graph 假设致命级脆弱 | ||||
| [2601.22705] | framework | 准入控制 | AIMD 双信号(usage+hit-rate),但不兼容 PD 分离且无公平性保证 | ||||
| [2603.13281] | framework | 跨模型 KV 共享 | Frozen encoder + LoRA decoder 训练时约束保证 KV cache identity,N 模型 → 1 份 KV,与 SideQuest/PBKV 正交叠加 | ||||
| [2604.03143] | framework | KV 共享 | Collective KV cache sharing 跨 agent | ||||
| [2602.21477] | framework | 记忆索引 | Hierarchical memory system for multi-agent | ||||
| [kvserve] | framework | KV 压缩传输 | Service-aware 压缩,up to 10× KV 压缩,可与 KVFlow prefetch 叠加 | ||||
| [model] | model (survey) | 跨论文综合 | KV cache 形状连续谱:KDA→CSA→MLA→GQA;三路位置编码分化 | ||||
| [agent] | agent (survey) | 跨论文综合 | Agent-aware KV cache 管理 5 条技术路线;信号谱 | ||||
| [framework] | framework (survey) | 跨论文综合 | Agentic workflow serving 6+ 系统;PD 分离争议 | ||||
| [algorithm] | algorithm (survey) | 跨论文综合 | 三层任务难度递进;调度粒度 vs 算法复杂度 trade-off |