Leyline: KV Cache Directives for Agentic Inference

agent 2606.01065 — Cross-paper Synthesis

相关论文 #

Leyline (2606.01065) 的核心问题是:agent 在多轮执行中会改历史,而传统 prefix/radix 复用默认历史只追加不改写,导致编辑后 KV 位置语义失配。它把 edit 抽象成 (span, replacement, mode) 指令,并用 MLA 上的 delta-rotation 在 serving 内核层修正下游位置 [2606.01065] [2606.01065]

同一 related set 可分三类。第一类是 workflow 调度与驻留(Autellix、Continuum、Orla、SAGA、HexAGenT),重点是 program/workflow 层的排队、公平性、异构放置和 turn-gap 期间的 TTL 保留 [2502.13965] [2511.02230] [2603.13605] [2605.00528] [2605.16637]。第二类是 token/KV 粒度管理(PBKV、SideQuest、IntentKV),核心是哪些 token 该留以及删改后 prefix 身份如何保持 [2605.06472] [2602.22603] [2606.09916]。第三类是多模型共享 prefill(PrefillShare),关注跨模型冗余 prefill 消除,和 Leyline 的单轨迹编辑后正确复用是正交维度 [2602.12029]

delta #

相对这组工作,Leyline 的关键 delta 不是更会保留 KV,而是把 KV 变更语义本身做成一等控制面原语:上层声明改什么,底层保证怎么改仍与 full-context 对齐 [2606.01065]

第一,和 Autellix/Continuum/Orla/SAGA/HexAGenT 相比,Leyline 把优化边界从排队与驻留决策推进到编辑后的位置正确性,即 correctness-after-edit,而不是 only keep-resident [2511.02230] [2605.16637]。第二,和 PBKV/SideQuest/IntentKV 相比,Leyline 不是主要学习删谁,而是提供可组合 edit contract(amortize/forget)与旋转修正内核,让策略与内核职责可分离 [2602.22603] [2606.09916] [2606.01065]。第三,和 PrefillShare 相比,Leyline 面向单会话/单轨迹内历史突变后的正确复用,而非跨模型共享;两者叠加时,一层减少重复 prefill,一层减少 edit 引发的重算 [2602.12029] [2606.01065]

可攻击面 #

  1. 端到端瓶颈迁移风险:若 workload 是 tool/CPU-heavy,Leyline 在 replay/prefill 上的收益可能被工具等待淹没;相关工作已展示 agent pipeline 中 CPU/tool 可占高比例 [2605.00528] [2603.13605]
  2. 内核适配敏感性:Leyline 的闭式修正依赖 MLA 与 RoPE 实现细节;跨模型、多编辑场景正确率分化意味着接口可迁移不等于内核无痛迁移 [2606.01065] [2606.01065]
  3. 与调度策略耦合未闭环:edit 后 KV 如何与 TTL/优先级/公平性联动尚缺系统策略,特别是在多租户时 pin 住多久、何时降级到 forget 仍是开放点 [2511.02230] [2605.16637]
  4. policy 正确发指令难题:当出现重叠 span、回滚、晚到 tool 输出时,directive correctness 与可回退验证链路复杂化;若缺少在线 gate,缓存污染会比纯重放更隐蔽 [2606.01065] [2602.22603]
  5. 生态位 #

    Leyline 的最佳定位是 agent serving 栈中的 KV 变更 ISA/控制面原语层:它不替代 workflow 调度器,也不替代 token 价值判别器,而是定义改历史的可执行语义与正确性契约。

    可组合形态是:上层用 Autellix/SAGA/HexAGenT/Orla 处理 workflow 编排与跨机调度 [2502.13965] [2605.00528] [2605.16637] [2603.13605];中层用 Continuum 类 TTL 策略处理 turn-gap 驻留 [2511.02230];细粒度 token 管理由 IntentKV/PBKV/SideQuest 决策删谁,Leyline 执行怎么安全改 [2606.09916] [2605.06472] [2602.22603];多模型场景再叠加 PrefillShare 的共享 prefill [2602.12029]

    未探索方向 #

    1. Directive-aware TTL:将 amortize/forget、span 类型与编辑频度映射为 TTL/pin 先验,联合优化 correctness 与 queueing delay [2606.01065] [2511.02230]
    2. Leyline x IntentKV/PBKV 双层策略:让上层模型先选 retained set,再由 directive 层执行可审计 splice,比较删谁和怎么改解耦后是否提升稳定性 [2606.09916] [2605.06472] [2606.01065]
    3. Workflow-aware edit scheduling:把 HexAGenT/SAGA 的 workflow 紧急度信号引入 cache-edit admission,决定何时编辑、何时直接重放,以优化整体 SLO 而非单次 edit 成本 [2605.16637] [2605.00528]
    4. 跨模型可移植验证基准:围绕 RoPE pairing、多次编辑漂移、fallback 触发阈值构建统一 benchmark,明确 Leyline 在不同 backbone 的安全工作区间 [2606.01065] [2602.12029] [2602.22603]