ICaRus: Identical Cache Reuse across Models for Multi-Model LLM Serving

framework 2603.13281 — Cross-paper Synthesis

L3 Relate · ICaRus (2603.13281) #

1. 相关论文 #

相关实体关系类型关联理由
PrefillShare (2602.12029)极度相似/竞品同一核心 idea:freeze base prefill → shared KV cache → task-specific decode。PrefillShare 在 ICaRus 之后发表,明确引用 ICaRus 为 predecessor,声称消除了 ICaRus 的 encoder-decode 并行开销
TokenDance (2604.03143)同层互补同为 multi-agent KV cache 共享,但解决不同子问题:ICaRus 解跨模型(不同 LoRA)共享,TokenDance 解跨 agent 实例(同一模型、不同位置)共享
KVFlow (2507.07400)正交组合KVFlow 优化 prefix cache 的驱逐策略,ICaRus 消除跨模型 KV 冗余。两者可叠加:ICaRus 减少 cache 份数,KVFlow 决定何时 evict 剩余份
KV Cache Survey (2412.19442)Taxonomy 定位Survey 的三层 taxonomy 中,ICaRus 跨 Model-level (参数共享) 与 System-level (服务架构),是少数同时改动训练和推理的方案
Concur (2601.22705)下游受益者Concur 用 AIMD 控制避免 KV thrashing;ICaRus 从根源上消除 N× KV 增长,使 Concur 的 admission control 转变为保护 decode 带宽而非保护 KV memory
DroidSpeak (predecessor)直接前驱选择性共享"非敏感"层的 KV,敏感层仍需重算。ICaRus 消除了 layer-selection 决策:全部层共享,复杂性归零

2. 本篇 vs 相关论文的 delta #

ICaRus vs PrefillShare #

两者的训练范式几乎相同——freeze base → cache-conditioned fine-tuning——但推理路径存在关键分歧:

Delta 判定: PrefillShare 的 decode-only 模式如果成立,则 per-token decode 成本为 ~1× 而非 ICaRus 的 ~2×。但 ICaRus 的 encoder 并行为 decoder 提供了"ground-truth KV"——理论上更准确但更贵。PrefillShare 的 accuracy 报告与 ICaRus 相当,暗示 encoder 并行可能是过度设计。

ICaRus vs TokenDance #

维度ICaRusTokenDance
共享场景不同任务模型 (LoRA variants) 处理同一 prompt同一模型的 N 个 agent 实例处理重叠 prompt
KV identity严格相同 (frozen encoder guarantee)近似相同 (91-97% block overlap, needs diff)
MechanismEncoder freezing + LoRA decoderMaster-Mirror block-sparse diff
Storage savingN× → 1× (exact)11-17× per-agent compression
Accuracy costNone (Qwen3) or slight loss (LLaMA)3.3-11.9% deviation from reference

ICaRus 提供 exact KV identity [2603.13281],TokenDance 提供 approximate compression [2604.03143]。两者解决的问题表面相似但结构不同:ICaRus 要求所有模型共享 base encoder(训练时约束),TokenDance 接受任意已有模型但付出近似代价。

ICaRus vs KVFlow #

KVFlow 在单模型场景下优化 prefix cache eviction [2507.07400]:利用 workflow 结构预测未来 cache hit,proactively prefetch。ICaRus 的贡献完全正交——它消除了"每个模型一份 cache"的前提假设。在 ICaRus + KVFlow 联合部署下:ICaRus 确保只维护一份 KV cache,KVFlow 优化该份 cache 的 eviction/prefetch 策略,两者收益可叠加。

ICaRus vs DroidSpeak #

DroidSpeak 按 layer-level 敏感性选择性共享 KV cache:非敏感层直接复用 base-model cache,敏感层仍需对每个 fine-tuned model 重新计算 [2603.13281]。ICaRus 的核心 delta:

  1. 全层共享:不做 layer selection,复杂性从 O(L × N) 降到 O(1)
  2. 训练时约束:通过 encoder freezing + KV-sharing-aware training 在训练阶段保证共享安全性,而非在推理时做事后近似
  3. 无精度折中:DroidSpeak 敏感层重算引入 mixed-precision semantics;ICaRus 的共享是精确的
  4. 3. 可攻击面 #

    Attack 1: "Implicit regularization" 解释缺乏理论基础 #

    ICaRus 声称 frozen encoder 提供"隐式正则化"使 Qwen3 上 accuracy 超过 full fine-tuning [2603.13281]。但:

    • 该效应仅在 Qwen3 上显著;LLaMA-3.1-8B 实际下降 1.8 points [2603.13281]
    • 没有 ablation 隔离正则化效应(如对比不同 LoRA rank 的过拟合曲线)。
    • "Implicit regularization" 是 post-hoc 解释而非 a priori prediction——若 LLaMA 也有此效应,为何 GSM8K 反而下降?

    攻击力度: 中。Accuracy parity 是可接受的;accuracy improvement 的因果解释不可信。

    Attack 2: Decode 2× compute overhead 未被正面量化 #

    ICaRus 论证 decode 阶段内存访问仍为 ~1× [2603.13281],但:

    • 未提供 per-token decode latency 的实测对比(Table 1 只有 asymptotic complexity)。
    • 在 compute-bound regime (large batch, short sequence) 下,2× compute 无法被 memory-bound 论点掩盖。
    • Fig 4 的 end-to-end gains 来自 prefill 消除(N× → 1×),可能掩盖了 decode 阶段的额外开销。

    攻击力度: 高。核心 claim "decode latency comparable to single model" 缺乏 microbenchmark 证据。

    Attack 3: LoRA rank 128 是否是 cherry-picked #

    所有实验使用 LoRA rank=128, α=256 [2603.13281]。这接近于 full fine-tuning 的参数量级(8B model, rank 128 → ~200M adapter params)。

    • 不清楚 lower rank (16/32) 是否仍能维持 accuracy——如果不能,则 ICaRus 的 "lightweight adapter" narrative 被削弱。
    • PrefillShare 使用类似 LoRA 但未公布 rank,暗示该参数可能是结果稳健性的关键变量。

    攻击力度: 中。Rank 128 在实践中是合理的,但缺少 rank ablation 是实验设计的明确缺陷。

    Attack 4: No head-to-head with DroidSpeak #

    ICaRus 在 related work 中定位 DroidSpeak 为直接前驱 [2603.13281],但实验中没有 DroidSpeak baseline 对比。只有概念论证("无需 layer selection")而非量化 delta。

    攻击力度: 低-中。DroidSpeak 没有开源实现使对比困难,但作为 positioning claim 的核心 baseline 应当被包含。

    4. 生态位 #

    Paradigm positioning #

    ICaRus 开创了 "training-time cache identity guarantee" 范式:通过在训练阶段约束模型结构(encoder freezing),在推理阶段获得系统级保证(KV cache identity across models)。这与之前的 inference-time approximation 范式(DroidSpeak layer selection, CacheBlend PIC)形成对立:

    范式代表训练改动推理精度系统复杂度
    Inference-time approximationDroidSpeak, CacheBlend近似高 (layer selection, diff)
    Training-time guaranteeICaRus, PrefillShareEncoder freezing + cache-conditioned FT精确低 (直接复用)
    Round-aware compressionTokenDance近似中 (Master-Mirror)

    ICaRus + PrefillShare 共同确立了 training-time guarantee 范式的可行性。在 framework category survey 中,这与主线 B (Agentic Workflow Serving) 高度相关:当 agent 数 N 增大时,ICaRus 的 O(1) KV memory 优势超线性增长 [2603.13281]

    Adoption barriers #

    1. Training pipeline 改动: 需要所有 task models 从同一 frozen base 开始 LoRA 训练。不能复用已有的 full-FT models。
    2. vLLM 非 trivial 改动: 需要修改 model loading、attention kernel (concatenated queries)、LoRA hot-swap 机制。非 config flag 级别。
    3. 生态约束: 绑定单一 base model,无法混合不同 base models (e.g., LLaMA + Qwen)。
    4. 在 framework category 中的位置 #

      在 §2 Taxonomy 中,ICaRus 属于 Serving-Agentic × End-to-End 格——与 Scepsy、Sutradhara 同列,但更进一步要求 training-time coordination。在 §3 主线 B (Agentic Workflow Serving) 中,它与 TokenDance 形成互补关系:TokenDance 解决 intra-model multi-instance 冗余,ICaRus 解决 inter-model KV 冗余。

      5. 未探索方向 #

      方向 1: ICaRus + TokenDance 联合 → multi-model × multi-instance #

      ICaRus 消除 inter-model KV 冗余,TokenDance 消除 intra-round position-shifted 冗余。联合使用时:对 N models × M instances 的场景,KV memory 从 O(N×M×L) 降至 O(L) (ICaRus 消除 N) 再经 Master-Mirror 压缩 (TokenDance 消除 M 的存储)。目前无人实现此组合。

      方向 2: Adaptive encoder depth — 部分层 frozen, 部分层 shared-LoRA #

      ICaRus 冻结全部 encoder 层;DroidSpeak 按敏感性选择性共享。中间地带——前 K 层 frozen(保证 cache identity),后 L-K 层用 shared LoRA adapter——可能在 accuracy-sensitive 场景(如 LLaMA 上的数学任务)中找到更优 trade-off。训练时仍可保证前 K 层 cache 共享,后 L-K 层付出 per-model 存储但提升精度。

      方向 3: Disaggregated ICaRus — prefill 节点 ≠ decode 节点 #

      ICaRus 当前在同一节点运行 encoder + decoder。结合 PD 分离 (DualPath [2602.21548], PrfaaS [2604.15039]) 的趋势:

      • Prefill node: 运行 frozen encoder,产出 KV cache,与任何 decoder 模型无关
      • Decode node: 加载任意 task-specific LoRA adapter,接收 KV cache hand-off

      这将 ICaRus 的 "single-model prefill" 优势在分布式架构下放大:一个 prefill 集群服务所有 task models 的 KV 生成需求,decode 集群按需加载 adapter。PPD 的路由策略可直接适配 [2603.13358]

      方向 4: Speculative decode with shared encoder #

      ICaRus 的 encoder 是 frozen base model。如果同时部署一个小模型 (draft model) 做 speculative decoding,draft model 可以直接复用 base encoder 的 KV cache(因为 frozen encoder 产出是 model-independent)。这意味着 speculation verification step 可以 zero-cost access KV cache——传统 speculative decoding 中 verification 需要重算 KV,ICaRus 下直接命中。

      方向 5: Dynamic model routing with zero KV penalty #

      当前 semantic router (如 vLLM Semantic Router [vllm-project-semantic-router]) 路由到不同模型时需考虑 KV cache locality penalty。ICaRus 使 KV cache 与 task model 解耦:路由任何请求到任何 task model 的 KV 成本为零。这使 model routing 从 "KV-cache-aware scheduling" 简化为纯 accuracy-aware routing,降低 router 的决策空间复杂度。