**1. 把「要不要训练」当成实验变量,而不是设计前提。** 本簇里所有跨表示复用工作都预设了某种训练:PrefillShare 训 decode 模块(cache-conditioned fine-tuning,且必须用冻结 base 现算的 $C_{\text{base}}$ 喂训练,否则精度崩塌)[ref:L2:2602.12029#7-实现-cross-reference];本篇 Tabl
K3 的 L2 读 Table 1 得出的结论是增益押在宽度维稀疏扩张上(激活参数 +220%、专家池 +133%、每 token 专家数 +100%)[ref:L2:kimi-k3#训练配方分解]。但把 K2 的配置代入同一套算术,参数增长的方向恰好相反。
| 相关论文 | 相对本篇的 delta | 类型 |
RAG 把 Wikipedia 切成 21M 个不相交的 100-word chunk,MIPS 取 top-K 直接拼进 BART
| 维度 | GPT-3 (2005.14165) | 后续论文的 delta |
**New in 2110.14168, still not superseded by any peer here:**
ReAct 的核心 delta 是**把推理接地(grounding)**:CoT 是"静态黑箱",只用内部表示推理;ReAct 用 observation 纠偏,把 HotpotQA 幻觉率从 CoT 的 56% 压到 0% [ref:L2:2210.03629#2-q1-q2-q3]。2412.10079 则揭示了 ReAct 所依赖的 CoT 组件的**脆弱性边界**——CoT 收益强绑定
| 维度 | Toolformer | ReAct |
Reflexion 的贡献是**算法层**:把 scalar reward 放大成 verbal self-reflection 存进 episodic memory,policy 参数化为 $\theta=\{M_a, mem\}$(LLM + 文本 memory)而非权重 [ref:L2:2303.11366#§2-q1-q2-q3]。所有 8 个 peer 的贡献都是**系统层**——它们不
**AutoGen 是唯一的「编程模型」论文,其余全是「系统/协议」论文**——这是最大的 delta,也决定了它们几乎无法在同一指标上直接比较。
**vs MLA(DeepSeek-V2)—— 同痛点、反解法。**
**vs DeepSeek-V2 (2405.04434) — orthogonal-complementary, mild tension.**
**What is genuinely new in SGLang:**
**What's genuinely new in CachedAttention.**
**Genuinely new in Parrot:**
| 维度 | Llama 3 (2407.21783) | Qwen2.5-Omni (2503.20215) | DreamerV3 (2301.04104) |
**What's genuinely new in RAPTOR relative to the cluster:**
**本篇独有的增量(none of the peers do this):**
两篇都用合成数据改变模型的**条件性行为**,但优化方向相反:
ISE 的真正 delta 不是"加一个 embedding 表"——BERT 早有 segment embedding。真正的新点是:**在 decoder-only、autoregressive、instruction-tuning 的现代 LLM 里,把 system/user/data/**output** 四段作为一个学习出来的 priority bias,且只花 $H\times D=
- **相对 SageAttention 系(B 组)**:三者都是 training-free、profiling-once、plug-and-play 的推理加速。但 SageAttention 的杠杆是**降低单个 matmul 的比特宽度**(INT8/FP4)来利用 Tensor Core 峰值 [ref:L2:2410.02367#§2-q1-q2-q3][ref:L2:2505.11
**What's genuinely new (contradictory to the field's consensus):** every prior
**§2.1 相对 FlashAttention 家族 — 新在"边界",不在"内部"**
1. **RL-trained *generative* curator as a separable role.** ActiveContext models context
**Genuinely new (relative to this cluster):**
| 维度 | NoLiMa (2502.05167) | Massive Values (2502.01563) | Ψ-RAG (本篇) |
**vs NoLiMa(最有价值的对照)——同一"揭露评测捷径"的方法论,作用在不同维度:**
**New (no peer has it):**
**Genuinely new (relative to the whole cluster).**
**新 (genuinely new vs the whole cluster).** Every KV/serving peer holds a fixed premise:
**New (genuinely first-mover).** SmoothAgent is the only paper in the cluster to name and attack
| 维度 | DreamerV3 | WSA1 | delta 性质 |
**What is genuinely new in SMetric (vs the cluster):**
**vs Kimi K2 — synthetic agentic-trajectory 制造的两种终点**
| 轴 | DreamerV3 [ref:L2:2301.04104#2-q1-q2-q3] | LingBot-VA (本篇) |
DreamerV3 在 abstract latent 空间学 dynamics $p(s_{t+1}\mid s_t,a_t)$,actor-critic 在想象轨迹上训练,但**推理时需要在潜空间做 rollout/search**
DreamerV3's entire agent trains its actor-critic **inside imagined latent
| 维度 | DreamerV3 [ref:L2:2301.04104#q2-方法] | τ₀-WM [ref:L2:2606.01027#q2-方法-method] |
Both learn a latent world model and condition control on it, so the delta is
**DreamerV3 独有、cluster 中无人企及的:**
**Halo 独有的新意(none of the peers do all three):**
**Genuinely new in ThunderAgent:**
**What is genuinely new in Pancake:**
**What is genuinely new in Orla:**
1. **Clairvoyant + query-optimizer 组合**。所有 serving 邻居 (Autellix, TokenCake, Continuum) 都是 *reactive/online*:Autellix 显式 non-clairvoyant [ref:L2:2502.13965#§2-q1-痛点-q2-方法-q3-结果],Continuum 靠历史统计预测 tool
**Genuinely new in Chimera:**
**New relative to the entire cluster.** ForkKV is the only entity here that treats the KV cache as
**New (vs the whole cluster).** Scepsy is the only entity here that (a) supports **multiple heterogeneous LLMs** in one workflow *and* (b) does **automatic GPU allocation** (fractional shares + TP + r
**Genuinely new in SAGA:**
**What is genuinely new in PBKV:**
**Genuinely new in HexAGenT:**
**The anti-prediction reframing.** ConServe's core novelty is not a mechanism but a
**新增 (what's genuinely new in Maestro):**
**新 (genuinely new in CacheWise).**
**PAIWorld 的真正 delta(相对全簇)**:不是提出新的世界模型范式、也不是新的 RoPE、也不是新的
**What is genuinely new in ABot-M0.5:**
DreamerV3 的持久状态是 RSSM 里的 8-块块对角 GRU,其长程一致性靠**实证**(开环预测 45 帧一致)支撑,论文明确无收敛/误差界 [ref:L2:2301.04104#4-作者证明]。Kairos 的 delta 是:同一个"持久记忆"对象被**证明**为收缩映射 ($\rho<1$),从而 excess risk 有显式 sufficiency bound $(L\var
相对 Autellix/Continuum/HexAGenT 这类 workflow 调度论文,KVCOMM 的增量不在 queue discipline,而在**单次调用内部的 cache 可迁移性**:它假设通信已发生,进一步解决“通信后如何避免重复 prefill”。换言之,前者优化何时跑、在哪跑;KVCOMM 优化同一模型族内跨上下文能否直接复用 [ref:L2:2502.13965#§1
TokenCake的独特增量不是“只做 KV 缓存策略”,而是把**时间维(offload/upload)**与**空间维(reserved/shared partition)**并行建模,并用同一压力快照协议强制两类决策一致 [ref:L2:2510.18586#2-q1-q2-q3]。
相对这组工作,Leyline 的关键 delta 不是更会保留 KV,而是把 KV 变更语义本身做成一等控制面原语:上层声明改什么,底层保证怎么改仍与 full-context 对齐 [ref:L2:2606.01065#2-q1-q2-q3(痛点-方法-结果)]。
两篇都得出"LRU 反了"这个反直觉结论,但对"如何预测未来复用"给出互补答案:
| 维度 | FlowKV | Mooncake |
1. **CPU 瓶颈的系统性诊断与量化**。CLO 首次将 KVCache offloading 系统的性能损失分解为三个 CPU 端因素(缓存管理 36.2%、PCIe 利用率低下、同步开销 5.5%–13.5%),并给出 per-layer latency breakdown 的定量分析 [ref:L2:2511.14510#Q1-痛点]。此前 RetroInfer/PQCache/Infi
2601.19910 的核心价值是**量化**——它不设计系统,而是建立分析框架($\kappa_{\text{crit}} = \kappa_M \times \kappa_{HW}$)来精确刻画 KV offloading 何时将 prefill 从 compute-bound 转为 memory-bound [ref:L2:2601.19910#§2-Q2]。其他论文要么直接设计解决方案(F
vLLM 将 KV cache 管理抽象为类 OS 虚拟内存的分页系统,解决了 GPU HBM 内的碎片问题(有效利用率从 20–38% 提升到接近 100%)[ref:L2:2309.06180#q1-痛点]。但 vLLM 的 paged layout 在跨存储层时制造了新问题:将碎片化的内存 blocks swap 到 SSD 生成了数十万次小粒度随机 I/O [ref:L2:2605.033
1. **信息不对称的形式化**:NetKV 首次将"调度器无网络可见性 vs 运营商无推理可见性"的信息鸿沟形式化为 Network Cost Oracle 接口 [ref:L2:2606.03910#core-contribution]。prior work(Mooncake Conductor、llm-d、Dynamo)均未显式建模网络拓扑。
**vs SSD(2603.03251)— 隐藏 draft vs 消灭 draft 成本**
**delta-1|相对 moe-lb-interai25:把"搬权重的 min–max"降级为"分流量的 min–max",换来关键路径可承受。**
**1. 层次 delta:DeepSpec 是"训练+离线评测",其余全是"推理/serving 侧"。** 这是最根本的区别。DSpark、SSD、SPECTRE、RTP-LLM 四篇都在优化**在线解码回路**(何时草、验多长、切什么模式、怎么调度);SGLang 是承载这些回路的运行时。只有 DeepSpec 站在回路**之前**——它不产出 benchmark 数字,而是产出"可复现能力
退化簇 A 的四篇都在 *神经网络内部* 解决问题——2404.16811 改训练数据分布 [ref:L2:2404.16811#§2-q1-q2-q3],2601.15300 建议 context ≤ 40% 容量做运营约束 [ref:L2:2601.15300#§5-实验与数据],2510.05381 提出 retrieve-then-recite 把长输入压成短 prompt [ref:L2
| 维度 | PEEK (2605.19932) | 最近邻 peer | delta 性质 |
SIA 在 agent 的推理-行动循环中投机发起 tool call(行动层投机),通过 clock-based SFT 训练 3B 模型理解异步中断语义 [ref:L2:2605.13360#§1-tl-dr]。IdleSpec 则在工具执行等待期间投机生成 plan candidates(规划层投机),不修改模型,仅通过 prompt engineering + Thompson sampl
IdleSpec 与其他投机方案最本质的区别在优化目标。Speculative Interaction [ref:L2:2605.13360#§1-tl-dr]、Speculative Tool Calls [ref:L2:2512.15834#§1-tl-dr]、PASTE [ref:L2:2603.18897#tl-dr] 都以延迟降低为目标(1.3–2.2× 加速、48.5% E2E 减少)
RTP-LLM 的核心调度创新是统一 hash map,将跨 worker 前缀匹配从 $O(B \times W)$ 降至 $O(B)$ [ref:L2:2605.29639#q2-方法]。Mooncake 使用类似的 hash-based prefix dedup(block size 512 tokens,prefix chain hash)[ref:L2:2407.00079#§7-实现-
1. **跨学科映射的不可替代性**:综述将海马体–新皮层协调机制系统对应为 context window + memory bank 双存储架构 [ref:L2:2512.23343#§2-痛点-方法-结果]。四篇系统论文虽然引用认知科学概念,但均无此级别的系统跨学科对应。
| 维度 | 2602.12430 | 2605.07358 |
SkillRouter 的核心假设是 **full-text retrieval 信号足以完成 routing**——用 bi-encoder embedding similarity + listwise cross-encoder reranking 实现 74.0% Hit@1 [ref:L2:2603.22455#§5-实验与数据]。SkillsInjector 则直接挑战这一假设:它的
SkillReducer 和 SkillRouter 操作在完全不同的管线位置。SkillRouter 在**上游路由层**消费完整 body 文本来选择技能 [ref:L2:2603.22455#q2-方法],选择完成后只将 name + description 传给下游 agent。SkillReducer 在**下游执行层**压缩被选中技能的 body 以减少 context window
| 维度 | ECS 独有 | 相关论文覆盖情况 |
**认知语言学理论锚定**。SSL 是这一 cluster 中唯一显式锚定于认知科学理论的工作——Scheduling 层对应 Memory Organization Packets (Schank 1980),Structural 层对应 Script Theory (Schank & Abelson 1977),Logical 层对应 Conceptual Dependency (Schank
**增量贡献**:2605.07358 将 2602.12430 的三层渐进加载架构泛化为四阶段生命周期分类学(representation → acquisition → retrieval/selection → evolution),覆盖 122 篇论文 vs 2602.12430 覆盖约 30 篇核心工作。形式化定义 $S = (M, \mathcal{R}, \mathcal{C})$
| 维度 | SLIM | MUSE-Autoskill | Library Drift | Exp. Compression |
**多变体输出 vs 单输出**: MOCHA 是四篇中唯一产出 Pareto front(平均 3.6 个 non-dominated 变体)的工作 [ref:L2:2605.19330#§5-实验与数据]。SkillReducer 对每个 skill 产出单一压缩版本 [ref:L2:2603.29919#§5-实验与数据];SkillRouter 不修改 skill 内容 [ref:L2:2
2602.12430 的安全治理框架(G1–G4 验证门控 + T1–T4 信任等级)完全面向**对抗性安全**——检测 prompt injection、data exfiltration、agent hijacking [ref:L2:2602.12430#§5-实验与数据]。2605.19362 的核心增量是揭示:**通过所有安全审计的 skill 仍可能在用户理解层面失败**。一个 T4
Library Drift 的 Ratchet 和 MUSE-Autoskill 从 skill 生命周期的两端入手解决退化问题,形成清晰的互补关系:
| 维度 | Mem-π | MemSkill |
**新增**:MUSE 将 skill 创建嵌入 ReAct runtime loop(而非 SLIM 的离线 o3 生成),使 skill 生成利用实时推理上下文 [ref:L2:2605.27366#q2-方法]。MUSE 引入 per-skill `.memory.md` 作为经验积累机制,而 SLIM 仅有 lifecycle logs 追踪 MEC history [ref:L2:260
SSL 将 skill 文档映射为三层类型化 JSON 图(Scheduling / Structural / Logical),目标是暴露**证据**以支持检索和风险评估 [ref:L2:2604.24026#q2-方法]。SaP 将 skill 文档重构为 typed pseudocode(typed contract + concrete action template),目标是提供**可直
SkillRouter 和 SkillsInjector 都解决"从大池子里选 skill"的问题,但在三个维度上分叉:
FaRM 将 RDMA 视为已就绪的高速通道,用 PhyCo 2GB 大页解决 NIC 页表扩展性 [ref:L2:farm-nsdi14#§5-实验与数据],用 connection multiplexing 绕过 QP 数量限制。KRCore 的核心 delta 是将 RDMA 控制面本身作为优化目标:NIC 固件主导 87% 的 QP 创建耗时 [ref:L2:2201.11578#q2-方
**FlashAttention 的核心原创贡献**:将 IO-awareness 原则引入 attention——通过 tiling + online softmax + recomputation,将 HBM 读写从 $\Theta(Nd + N^2)$ 降至最优的 $\Theta(N^2 d^2 / M)$,同时证明此 IO 复杂度渐近不可改进 [ref:2205.14135#作者证明]。
**FastServe 的核心贡献**是识别 LLM serving 的 "semi information-agnostic" 特性——input length 已知(决定 prefill time)但 output length 未知(决定 decode time)——并设计了利用这一中间状态的 skip-join MLFQ 调度器 [ref:2305.05920#痛点-方法-结果]。
**FA2 的独特贡献**是识别并解决了 FA1 的 GPU utilization 瓶颈——FA1 已达渐近最优 IO 复杂度,但 GPU 利用率仅 30–50% [ref:2307.08691#痛点-方法-结果]。FA2 通过三项互相耦合的工程优化将利用率提升至 73%:
**vLLM 的核心贡献**是将 OS 虚拟内存思想引入 KV cache 管理——固定大小 block 非连续存储 + block table 映射 + copy-on-write 共享,将内存有效利用率从 20.4%–38.2% 提升至接近 100% [ref:2309.06180#痛点-方法-结果]。
FastDecode 和 NEO 共享同一核心 insight:decode attention 是 memory-bandwidth-bounded,CPU 带宽差距远小于算力差距 [ref:2403.11421#核心三问] [ref:2411.01142#核心三问]。但两者在设计哲学上根本分歧:
V3 继承 V2 的 MLA+DeepSeekMoE 核心架构,扩展到 671B 总参 / 37B 激活 [ref:L2:2412.19437#核心三问]。关键增量:
Mooncake 的核心增量是 **三层分离**:(1) prefill 与 decode 实例分离,(2) KVCache 从 GPU 移至 CPU DRAM/SSD,(3) 全局 Conductor 调度替代 vLLM 的本地调度。vLLM 的 PagedAttention 仅管理单实例 GPU 内存,无法跨机复用 prefix cache [ref:2407.00079#实验与数据]。Moo
**FA3 的独特贡献**是将 attention kernel 的设计从**同步执行模型**推进到**异步流水线模型**——利用 Hopper GPU 的 TMA + WGMMA 异步能力,实现数据搬运和计算的完全 overlap [ref:2407.08608#痛点-方法-结果]。
NEO 对 FastDecode 的三项核心批判形成其设计动机 [ref:2411.01142#核心三问]:
| 维度 | Context Length Hurts (2510.05381) | Intelligence Degradation (2601.15300) |
**FlowMesh vs Helium [ref:L2:2603.16104#core-contribution]**:Helium 采用数据库查询优化视角,将 agentic workflow 中的 LLM 调用建模为 query plan 节点,优化 prefix caching hit rate 和 batch scheduling。FlowMesh 更进一步:不仅调度推理请求,还将 tr
| 维度 | Seedance 1.5 Pro (2512.13507) | Seedance 2.0 (2604.14148) |
本篇使用 SLM(xLAM 1B/3B/8B)作为投机模型预测下一个 tool call [ref:L2:2512.15834#q2-方法]。PASTE 直接后继了这一思路,但做了两个根本性改进:
RouteLLM 训练轻量路由器将请求二元分派到 strong/weak 模型,threshold $\alpha$ 作为 cost-quality 旋钮 [ref:L2:2406.18665#q2-方法]。OI-MAS 在三个维度做了本质扩展:
| 维度 | TTT-Discover | AVO |
**vllm-mlx vs Agent Memory Q4 [ref:2603.04428#core-contribution]**:两者在 Apple Silicon 上形成完美的上下层互补。vllm-mlx 提供 serving layer (continuous batching, OpenAI API, content-based prefix caching);Agent Memory
| 维度 | RouteLLM | CASTER | Delta |
FaRM 的 RDMA ring buffer 针对定长消息(16–512 byte KV 操作)[ref:L2:farm-nsdi14#§5-实验与数据]。OnePiece 的核心 delta 是将 ring buffer 扩展到变长消息(AIGC 中间张量大小跨越数 KB 到数百 MB),通过分离 buffer region(变长数据)和 size region(定长元数据 + busy bi
| 维度 | GORGO | BalanceRoute |
| 维度 | AgentAssert | Qualixar OS |
| 维度 | SkillFortify | Qualixar OS |
| 维度 | AgentAssay | AgentAssert |
FA 系列的演化体现了 **算法-硬件 co-design 的必然性**:
CPU-Slowdowns 和 Blink 独立得出了相同的核心诊断——CPU 是 LLM 推理的隐藏瓶颈。两者的 root cause 分析高度互补:
| 维度 | AgentOpt 视角 | Claude Code 设计 |
CPU-Slowdowns 是诊断,Blink 是处方。CPU-Slowdowns 发现 CPU oversubscription 导致 shared-memory broadcast dequeue 膨胀 19×(12ms → 228ms),且此问题与 TP degree 成正比 [ref:L2:2603.22774#§5-实验与数据]。Blink 的解法是将整个 CPU 从关键路径移除——根本
**CodeComp vs SideQuest [ref:2602.22603#core-contribution]**:SideQuest 用一个 parallel auxiliary LRM thread 做 semantic reasoning 决定哪些 tool response 已 stale——本质上是 **runtime, model-driven, dynamic eviction
FaRM 假设 RDMA 连接已建立,用 connection multiplexing 管理 QP 数量 [ref:L2:farm-nsdi14#q2-方法]——$q$ 个线程共享一个 QP,通过调节 $q$ 平衡并行度和 NIC 缓存压力。KRCore 证明这种绕行不够:随着集群规模扩大,即使用 multiplexing 仍面临 QP 创建吞吐瓶颈(verbs: 712 QPs/s)[ref:
FaRM 的 bypass 策略是在端侧替换传输协议:TCP/IP → RDMA [ref:L2:farm-nsdi14#q2-方法]。RackSched 的 bypass 策略是在网络设备上嵌入计算逻辑:软件调度器 → 交换机数据面调度器。核心 delta:FaRM 通过 RDMA 让每个数据操作更快(10× throughput)[ref:L2:farm-nsdi14#q3-结果],RackS
| 维度 | NEO (2411.01142) | FastDecode (2403.11421) | vLLM (2309.06180) | APEX (本篇) |
1. **首篇 4-protocol 全景对比**:KB 中已有论文涉及 MCP 使用(Claude Code、OpenHarness、OpenAI Agents SDK),但无任何文献系统对比 MCP/ACP/A2A/ANP 的架构差异和互补关系 [ref:L2:2505.02279#q2-方法]
- **2506.08371 (PCD / Posterior Salience Attenuation)**: K2 的 MuonClip 在训练侧用 per-head QK-Clip 抑制注意力 logit 爆炸;PCD 在推理侧用 positional contrastive decoding 修正 RoPE 引起的远距 token 衰减。两者从训练/推理两端攻击同一根因:注意力分数的数值失
GDN(Gated DeltaNet)使用 scalar $\alpha_t \in [0,1]$ 控制全部特征维度的统一遗忘率。Kimi Linear 的 KDA 将其升级为 per-channel $\text{Diag}(\boldsymbol{\alpha}_t)$,每个 $d_k$ 维度拥有独立遗忘率 [ref:L2:2510.26692#q2-方法]。
DynaServe 的 micro-request 抽象统一了 prefill 和 decode 的 co-location/disaggregation 决策空间 [ref:L2:2504.09285#核心三问],但 co-location 的两端仍然是同质的推理任务。Harli 的根本创新在于跨越了 workload 类型边界:将 compute-bound 的 PEFT finetuning
两者的训练范式几乎相同——freeze base → cache-conditioned fine-tuning——但推理路径存在关键分歧:
**8 模块质量保障流水线**是 Qualixar OS 在整个 agent 类别中独一无二的贡献。9 篇现有 agent 论文中无一涉及 judge 评估的 Goodhart 效应检测或评分分布漂移监控 [ref:L2:2604.06392#§5-实验与数据]。Claude Code 用人类审批(93% approval rate)作为质量兜底 [ref:L2:2604.14228#§5-实验与
FaaSMoE 的核心 delta 是 **将 MoE expert 的 stateless 特性与 FaaS 的 event-driven scale-to-zero 特性做结构映射**,提出 orchestrator-expert 二平面解耦 + 可配置 expert-block 粒度的框架,在多租户场景下消除 per-tenant expert 冗余驻留 [ref:2604.26881#Q2
BalanceRoute 解决的是 **PD-disaggregated LLM serving 中 decode tier 的 DP load balancing**——在 barrier-synchronized decode 步骤中,通过分段线性 F-score 将请求分配给多个 DP worker,使步延迟由最重 worker 决定的代价最小化。以下 8 篇论文从不同切面与之关联:
MARLIN 操作于 Kubernetes/vLLM 之上的 meta-scheduling 层,将 8 个全球分布 DC(每个含 1,000 节点)作为原子调度单元 [ref:2605.13496#q2-方法]。这与 KB 中所有其他调度工作形成鲜明对比:
| 维度 | FilM-7B (2404.16811) | 最近的可比工作 | Delta |
两者都对 attention 机制做了"不改模型权重"的推理时干预,但方向相反:
本篇发现位置偏置跨模型稳定存在 [ref:2412.10079#实验与数据],但未解释**为什么**。Massive Values 论文提供了一个可能的微观机制:RoPE 在 Q/K 矩阵的低频维度产生 concentrated massive values,这些大值是上下文知识理解的关键 [ref:2502.01563#core-contribution]。
| 比较维度 | ConCCL (2412.14335) | Autellix (2502.13965) | FilM-7B (2404.16811) | PCD (2506.08371) |
综述在 system-level scheduling 部分覆盖了 RadixAttention 和 FastServe [ref:2412.19442#实验与数据],但这些方法假设**单轮请求独立**。Continuum 揭示了 agent workload 的根本不同:tool call 间隙仅 ~1s 但被当作请求结束驱逐 KV,per-turn queueing delay 累积占总延迟
本篇 (2502.01563, "Massive Values in Self-Attention") 发现 RoPE-based LLM 的 Q/K 低频维度存在 concentrated massive values,是上下文知识理解的专用信号通道。以下 8 篇相关工作从"长上下文现象诊断→机制解释→修复方案→评测方法"形成一条完整的研究脉络。
FilM-7B 的 VaL Probing 已经揭示了 NIAH 的 U 形缺陷 [ref:L2:2404.16811#q1-痛点],但 VaL Probing 的诊断维度是 *位置*(前向/后向/双向检索),而 NoLiMa 的诊断维度是 *词面重叠*。两者暴露的是同一枚硬币的两面:
所有相关工作中,只有 Autellix 识别并形式化了 **program-level HoL blocking**——长 program 的新 LLM call 在 MLFQ 中进入最高优先级队列,反复挤占短 program。PLAS/ATLAS 的 key insight 是新 call 必须继承 program 累计 service 而非从零开始 [ref:L2:2502.13965#q2-
Qwen2.5-Omni 的 TMRoPE 将 RoPE 维度分为 temporal/height/width [16,24,24],为 audio 每 40ms 分配绝对时间 ID [ref:2503.20215#架构-/-方法图]。这一设计与 PCD 发现的 RoPE 频率分工假设(高频负责 local、低频负责 global)高度一致 [ref:2506.08371#core-contrib
| 维度 | SageAttention2++ | SGLang |
PCD 在整个 RoPE/attention 生态中占据了一个极其精确的细分位置:**training-free、inference-time、decoding-space 的长上下文修复**。
SLA 处于 "DiT 高效注意力" 与 "混合注意力架构" 两条研究主线的交叉点。以下 8 篇按关联强度排序。
UniVideo 发现 self-attention(MMDiT 架构)仅需训练 MLP connector 即可实现高质量 MLLM-DiT 对齐,而 cross-attention 即使解冻整个 DiT 仍表现不佳 [ref:2510.08377#架构-方法图]。这与长上下文文献形成有趣对照:
LongCat 的最大理论贡献是将 GRPO 与 flow matching velocity field 建立显式联系:$dR/dv_\theta \approx -\frac{3}{2}\hat{A}\epsilon$ [ref:2510.22200#核心三问]。由此推导出固定 SDE 时间步、loss 重加权、max group std 三项改进。
MI300X 论文揭示了 AMD Infinity Fabric mesh 在 2-GPU 配置下仅提供 48 GB/s 实测带宽(vs H100 NVSwitch 的 366 GB/s,7.6× 差距)[ref:2510.27583#5-实验与数据]。这对 Autellix 的 locality-aware load balancer 有直接影响:Autellix 假设 intra-progra
fabric-lib 工作在 NIC/网络层(libibverbs / libfabric),解决的是 **inter-node** 400 Gbps 线速通信问题 [ref:L2:2510.27656#§5-实验与数据]。Iris 工作在 GPU kernel 内部(Triton compiler),解决的是 **intra-node** Infinity Fabric 896 GB/s 互连上
本篇的独特贡献在于**将 NUMA 拓扑感知引入 attention kernel 调度**——这是一个其他所有相关论文都未触及的层面。它在 FlashAttention2 之上仅增加 ~15 行 Triton swizzle 代码,却在 MI300X 上实现最高 50% 的 forward 加速 [ref:2511.02132#实验与数据]。
Iris 工作在 GPU kernel 内部(Triton compiler + Iris RMA 原语),通信媒介是 AMD Infinity Fabric XGMI,scope 限于单节点 8 GPU [ref:2511.02168#8-system-scope]。fabric-lib 工作在 NIC driver 层(libibverbs / libfabric),通信媒介是 400 Gbp
FilM-7B 的贡献在于**诊断性解法**——用 IN2 训练数据消除位置偏置,并用 VaL Probing 定量验证(Avg 85.9, Gap 13.9)[ref:2404.16811#实验与数据]。2511.05850 的贡献在于**对前沿闭源模型的外部审计**——确认 Gemini 2.5 Flash 已内化了类似能力,但无法归因具体机制。
HipKittens 提出了 pinned register tiles、per-instruction swizzle、wave scheduling primitives 三位一体的编程模型 [ref:2511.08083#核心贡献]。所有 SageAttention 系列 (2410.02367, 2411.10958, 2505.11594, 2505.21136) 和 AVO (2603
2512.02189 首次报告 FP4 在 B200 上达到 7700 TFLOPS (96.2% 峰值) [ref:2512.02189#实验与数据],延迟仅比 FP16 多 1.4 cycle (12.6 vs 11.2)。这一数据直接重塑了 2502.01563 的量化策略建议:该论文发现 Q/K 中的 massive values 对上下文理解至关重要,保护 massive values
2601.15300 的方法论核心在于 **natural length distribution analysis**——不对文本做任何 truncation/padding,直接利用 NarrativeQA 的天然长度分布覆盖 5%–95% 上下文区间 [ref:2601.15300#实验与数据]。这与 2502.01563 的分析方法形成互补:后者通过 **disruption 实验** 识
本综合分析将 Kimi K2.5 与八篇相关工作交叉对比,覆盖长上下文理解/退化、agent 调度基础设施、推理侧长上下文修复、以及统一多模态架构四条线索。
六篇相关论文全部面向数据中心 GPU 集群或服务端部署。本篇是唯一一篇在固定 RAM 边缘设备(Apple M4 Pro, 24 GB)上做多 agent KV cache 管理的工作 [ref:2603.04428#2-q1-q2-q3]。这不仅是部署目标的差异——边缘设备的 40× token 处理速度劣势(260 tok/s vs 10,000+ tok/s)使 prefill 成本从"40
AttnRes 识别并解决 **PreNorm dilution**——第 $i$ 层输出在第 $l$ 层的相对贡献衰减为 $\sim 1/l$ [ref:2603.15031#痛点·方法·结果]。这是 depth-axis 的信息稀释。与之对比:
Seedance 2.0 采用 **cross-modal joint denoising**:视频 DiT 与音频 DiT 在每个扩散去噪步通过 cross-modal attention 交换信息,从生成过程的底层实现 AV 同步 [ref:2604.14148#core-contribution]。UniVideo 则采用 **dual-stream frozen-MLLM + MMDiT*
KVDrive 的核心新增是 **attention-aware 缓存策略 + 2D MCKP 窗口分配**。DualPath 将 KV-Cache 视为黑盒字节流做带宽聚合 [ref:2602.21548#2-核心三问],KVDrive 则利用 attention score 语义识别 critical entries,实现有选择的搬运——窗口 ×3 即可将传输量从 >500 MB 降至 <12
所有 7 篇相关工作输出的都是某种 **action decision**(保留多久、驱逐谁、准入几个、从哪加载)。本篇输出的是 **action obligation**:当 accepted claim 的 predicate 被违反时,运行时必须从 13 种 contract outcomes 中选择一种显式响应 [ref:2605.24259#架构-方法图]。这是类型系统与 policy
SideQuest 的根本创新不在于 KV cache eviction 本身,而在于 **eviction 决策的信息源**。所有相关工作都使用 LLM 外部的信号(attention score、workflow DAG、tool 延迟分布、token 结构)做决策,SideQuest 是唯一让 LLM 自身推理哪些 token 已过期的方案 [ref:2602.22603#q1-q2-q3]
1. **Values-to-Implementation 全链追踪**:唯一一篇从人类价值观 (5 values) → 设计原则 (13 principles) → 具体实现的完整逆向追踪。其他论文提出系统但不追溯设计意图 [ref:L2:2604.14228#核心技术壁垒]。
1. **"文件系统就是惰性接口"的极简主义** —— 博客的核心主张是*没有新抽象*:不是检索索引、
所有 8 篇相关工作都在**模型内**或**模型执行基础设施层**优化——DualPath 优化 KV 加载路径,PPD 优化 turn-level 路由,MFS 优化网络 flow 调度,TensorHub 优化权重传输,PrfaaS 优化跨 DC prefill 放置,ZeRO-Prefill 优化 MoE 并行策略,TileRT 优化 kernel 执行,KVServe 优化 KV 传输压缩
在所有 8 篇相关实体中,TileRT 是唯一以 **batch=1 单请求延迟** 为首要优化目标的系统。其他系统均面向高并发/高吞吐场景:
TileRT 是唯一以 **batch=1 TPOT** 为核心指标的框架。`ModelArgs.max_batch_size = 1` 是硬编码架构决策 [ref:tile-ai-tilert#作者证明],所有 tile 调度、CUDA graph 捕获、temp var 布局均为单请求优化。相关论文全部面向吞吐或 SLO 达标率:
ZeRO-Prefill 的核心 delta 是 **AsyncEP + 饱和阈值 T 的 frontend-backend co-design** ——将 MoE 的分布式执行从"activation 路由到 expert"反转为"expert weight 流入计算节点",利用 prefill 大 batch 的 compute window 完全隐藏 weight AllGather,同时用
KVServe 的核心 delta 是在 PD 分离架构的 KV 传输路径上引入**模块化、service-aware 的在线压缩**——这是一个在 8 篇相关实体中独此一家的切入角度。
TokenSpeed 的核心 delta 是将 KV cache 资源安全从 runtime check 提升到 compile-time guarantee——C++ `std::variant<13 states>` 配合 RAII move 语义,使 KV cache 双重释放或遗漏在编译期就是错误 [ref:L2:tokenspeed#核心三问]。这在整个相关论文集合中是独一无二的:
两篇论文在目标函数上有根本分歧。μCUTLASS 的 thesis 是 LLM 的推理能力被 CUDA/CUTLASS 模板的复杂度浪费,因此用 DSL 压缩搜索空间、用 SOL roofline 约束搜索方向 [ref:L2:2603.29010#q1-痛点];AVO 的 thesis 是 LLM coding agent 有足够自主能力进行多步工程推理,应当给予完整自由度而非限制在 DSL 空
Both target LLM-agent-driven GPU kernel optimization (March 2026), but the deltas are structural:
1. **优化粒度从 per-request 升级到 per-round**:所有先前工作(prefix caching, CacheBlend, KVServe 等)以单请求为优化单位。TokenDance 首次将 "同一同步轮内的 N 个 agent" 作为第一类调度与缓存单位 [ref:L2:2604.03143#core-contribution]。这不是增量改进——是优化抽象层级的跃迁。
TensorHub 的核心 delta 是 **Reference-Oriented Storage (ROS)** ——从存储层面彻底消除数据所有权,将 GPU 上已有的模型权重副本直接作为可 RDMA 读取的不可变引用,结合 pipeline replication 实现带宽随参与者线性增长的 DAG 传输拓扑。
SGH 是 8 篇论文中唯一提出**统一分类框架**的工作。$|\mathcal{U}|$ 连续谱(从 Agent Loop 的 $|\mathcal{U}|=1$ 到 graph executor 的 $|\mathcal{U}|\ge 1$)是一个有用的概念工具,将 70 个开源 agent 项目放到同一尺度上比较 [ref:L2:2604.11378#core-contribution]。其
PrfaaS 的核心 delta 是将 PD disaggregation 从"单集群 RDMA 岛"扩展到"跨 DC commodity Ethernet"——前提是混合注意力架构把 $\Phi_{\text{kv}}$ 压低 4–13×,使跨 DC KV 传输从 infeasible 变为 compute-bound。
TileRT 将整个 transformer 模型 AOT 编译为单个 Engine Kernel,以 warp/block/GPU 三级特化消除 inter-kernel idle [ref:tilert-speed-scaling-law#core-contribution]。Fleet 同样使用 persistent megakernel 消除 kernel launch 开销,但核心贡献不
GPUOS 的核心 delta 是 **persistent kernel + runtime dynamic operator injection 的组合**——在消除 kernel launch overhead 的同时保持了 production-grade 的灵活性(零停机热更新 operator、PyTorch eager mode 透明集成)。相比 Fleet 的静态 megakern
DeepSeek-V4 的核心 delta 是在万亿参数 MoE 模型上实现了**压缩 attention + 稳定训练 + 端到端确定性的三角闭环**。CSA+HCA 的 hybrid compressed attention 将 1M context 下的 KV cache 压到 V3.2 的 7-10%,mHC 通过 doubly stochastic 约束保证深层残差流的非扩张性(这在压缩
K2 的核心贡献是 MuonClip optimizer + 15.5T tokens 零 spike 训练 + agentic 数据合成 pipeline [ref:L2:2507.20534#§2-q1-q2-q3]。K2.6 在架构和预训练上**完全没有改变**——config.json 逐字相同 [ref:L2:kimi-k2-6#key-findings]。真正的 delta 是:
| 维度 | Hermes Agent | OpenAI Agents SDK |
OpenAI SDK 与 Hermes Agent 代表了 agent 框架设计的两极:
SSD 的**独特贡献**是将 speculative decoding 从"speculation → verification → speculation"的串行流水线重构为并行流水线,具体通过三个紧密耦合的机制实现:
MFS 的独特贡献是**跨 stage 的 flow 优先级仲裁**——将 TTFT SLO 逐层具体化为 per-flow deadline,并通过 RMLQ(Reverse MLQ)实现 Defer-and-Promote 策略 [ref:2603.17456#核心三问]。这在 related work 中没有对应物:
PASTE 是唯一一篇攻击 **tool 执行等待时间本身**(而非 KV cache 管理或排队调度)的工作。其核心 delta:
DualPath 的核心 delta 是将 PD 分离架构中的存储 NIC 带宽从单点瓶颈转化为全局可调度资源池——DE 端空闲的 SNIC 被纳入 KV-Cache 加载路径,配合 CNIC-centric 流量隔离,在不引入新硬件的前提下使存储 I/O 吞吐翻倍。
agent 上下文管理领域的其他所有工作——Continuum 的 KV cache TTL [ref:2511.02230#Q2 方法]、SideQuest 的辅助线程 eviction [ref:2602.22603#Q2 方法]、SAGA 的 WA-LRU [ref:L2:2605.00528#q2-方法]、PBKV 的分层淘汰 [ref:2605.06472#Q2 方法]——全部在 **s
| Delta 维度 | AIConfigurator | 最强对手 | 差异来源 |
**Intra-request parallelism via prompt splitting** 是所有 peers 中独有的:将下一轮 prompt 分为 tool-independent(50-80%)和 tool-dependent 两部分,在 tool 执行期间提前 prefill [ref:2601.12967#核心三问]。其他系统要么优化 inter-request(DualPat
Concur 的根本创新是**将 KV-cache 重新定义为共享有限资源(类比网络带宽),并在 agent 粒度而非 request 粒度做准入控制** [ref:L2:2601.22705#core-contribution]。这在框架类论文中是独特的——其他工作要么增加 KV 供给(DualPath 增带宽 [ref:2602.21548#核心三问]、KVServe 压缩体积),要么改变 K
moe-lb-interai25 的独特贡献在于将 expert replication/reallocation 问题形式化为 ILP(min-max load + migration cost 联合目标),并提供多项式时间近似解 [ref:L2:moe-lb-interai25#core-contribution]。这是增量而非范式突破——在已知的 dynamic expert placeme
在整个 related cluster 中,**本文是唯一从 CPU 侧量化 agentic workload 瓶颈的工作**。其余 7 篇(除 CMV 外)均聚焦 GPU 侧资源管理:
GLM 的核心 delta 是**在 agent 语义层面重新定义 KV-cache 管理策略**——其他论文要么只做 serving 层优化(DualPath、MFS、KVServe),要么只做 application 层优化(PPD 的路由决策),而 GLM 把两层绑定:agent 边界 = cache priority 边界 [ref:L2:2511.01633#core-contribut
Continuum 的根本性贡献不是 TTL 机制本身(TTL 是成熟概念),而是**首次识别 per-turn queueing delay 是 agent serving 的主导瓶颈,且与 KV reload cost 是独立的两个问题**。
Justitia 的核心 delta 是把 **网络调度的 Virtual-Time Fair Queuing (WFQ) + memory-centric KV token-time 成本度量** 组合应用到 LLM 应用级调度,在保证 finish-time fairness 的前提下实现近 SJF 效率。
Qwen3-Omni 对前代的改进不是渐进式调参,而是系统性重构 [ref:2509.17765#2-q1-q2-q3]:
**Application-layer graph 下沉到 cache eviction 决策**:KVFlow 是第一个将 workflow DAG 拓扑信息(而非历史访问模式)注入到 KV-cache eviction policy 的工作。其 Agent Step Graph 抽象通过 `max+1`/`min+1` aggregation function 统一了 DAG、cycle、co
**Pie vs vLLM [ref:2309.06180#core-contribution]**:vLLM 在 monolithic loop 中提供 PagedAttention 和 continuous batching,KV cache 由系统全局策略管理。Pie 将 KV 的 alloc/dealloc/export/import 暴露为 per-inferlet API,把 appl
HexGen-Flow 是 **首个将"SLO 预算沿 workflow DAG 反向传播"系统化的 agentic serving 调度器** [ref:L2:2505.05286#core-contribution]。其核心 delta 是三重的:
DynaServe 的核心 delta 是 **micro-request 抽象**——在任意 token 边界(而非仅 prefill/decode 边界)分割请求。这将 colocation 和 disaggregation 统一为同一泛化空间的特例 [ref:L2:2504.09285#核心三问]。
JITServe 的核心 delta 是 **Goodput-as-first-class-objective + imprecise-info-tolerant scheduling**——在请求长度和依赖图均不精确的条件下,用"保守上界估计 + 在线精化 + GMAX 两步解耦调度"实现可证明竞争比的多类型 SLO 调度。
PPD 的核心 delta 是发现并量化了 append-prefill 与 full prefill 对 decode 干扰的量级差异(2% vs 48% TPOT degradation at batch 200),并将这一微架构观察转化为可操作的 per-request 动态路由决策 [ref:2603.13358#实验与数据]。
DeepSeek-V3 的核心 delta 是将 MoE 大模型训练的全栈系统工程——DualPipe 双向 pipeline、FP8 混合精度、自定义 all-to-all kernel、auxiliary-loss-free 负载均衡——整合为一个统一的高效训练框架,以不到 $5.576M 训出 GPT-4o 级别 671B 模型。
SageAttention2 在 Llama3.1 100K token 推理中 NIAH 表现与 full-precision 完全一致 [ref:2411.10958#实验与数据],这与 2601.15300 发现的 Qwen2.5-7B 在 43.2% 容量处的悬崖式退化形成对比 [ref:2601.15300#实验与数据]。关键区别在于:退化的根源是 attention dispersio
HybridFlow 的核心 delta 是在 LLM 系统设计中首次提出并实现**层次化混合编程模型**——single-controller 编排 inter-model dataflow + multi-controller 执行 intra-model distributed computation。这一范式分离使 RLHF 算法开发者可以用 8 行 Python 代码定义 PPO dat
FlexRLHF 的核心 delta 是**首次系统性地将 RLHF 训练中的四个模型从 co-located 绑定中解放出来**,通过 Interleaving(按模型无依赖性分组放置)和 Disaggregated(按训练/推理角色物理分离)两种策略,在 2023 年底就识别并验证了"训练-推理分离"这一后来成为行业共识的设计原则。