| 相关实体 | 关系类型 | 关联理由 |
|---|---|---|
| PrefillShare (2602.12029) | 极度相似/竞品 | 同一核心 idea:freeze base prefill → shared KV cache → task-specific decode。PrefillShare 在 ICaRus 之后发表,明确引用 ICaRus 为 predecessor,声称消除了 ICaRus 的 encoder-decode 并行开销 |
| TokenDance (2604.03143) | 同层互补 | 同为 multi-agent KV cache 共享,但解决不同子问题:ICaRus 解跨模型(不同 LoRA)共享,TokenDance 解跨 agent 实例(同一模型、不同位置)共享 |
| KVFlow (2507.07400) | 正交组合 | KVFlow 优化 prefix cache 的驱逐策略,ICaRus 消除跨模型 KV 冗余。两者可叠加:ICaRus 减少 cache 份数,KVFlow 决定何时 evict 剩余份 |
| KV Cache Survey (2412.19442) | Taxonomy 定位 | Survey 的三层 taxonomy 中,ICaRus 跨 Model-level (参数共享) 与 System-level (服务架构),是少数同时改动训练和推理的方案 |
| Concur (2601.22705) | 下游受益者 | Concur 用 AIMD 控制避免 KV thrashing;ICaRus 从根源上消除 N× KV 增长,使 Concur 的 admission control 转变为保护 decode 带宽而非保护 KV memory |
| DroidSpeak (predecessor) | 直接前驱 | 选择性共享"非敏感"层的 KV,敏感层仍需重算。ICaRus 消除了 layer-selection 决策:全部层共享,复杂性归零 |
两者的训练范式几乎相同——freeze base → cache-conditioned fine-tuning——但推理路径存在关键分歧:
Delta 判定: PrefillShare 的 decode-only 模式如果成立,则 per-token decode 成本为 ~1× 而非 ICaRus 的 ~2×。但 ICaRus 的 encoder 并行为 decoder 提供了"ground-truth KV"——理论上更准确但更贵。PrefillShare 的 accuracy 报告与 ICaRus 相当,暗示 encoder 并行可能是过度设计。
| 维度 | ICaRus | TokenDance |
|---|---|---|
| 共享场景 | 不同任务模型 (LoRA variants) 处理同一 prompt | 同一模型的 N 个 agent 实例处理重叠 prompt |
| KV identity | 严格相同 (frozen encoder guarantee) | 近似相同 (91-97% block overlap, needs diff) |
| Mechanism | Encoder freezing + LoRA decoder | Master-Mirror block-sparse diff |
| Storage saving | N× → 1× (exact) | 11-17× per-agent compression |
| Accuracy cost | None (Qwen3) or slight loss (LLaMA) | 3.3-11.9% deviation from reference |
ICaRus 提供 exact KV identity [2603.13281],TokenDance 提供 approximate compression [2604.03143]。两者解决的问题表面相似但结构不同:ICaRus 要求所有模型共享 base encoder(训练时约束),TokenDance 接受任意已有模型但付出近似代价。
KVFlow 在单模型场景下优化 prefix cache eviction [2507.07400]:利用 workflow 结构预测未来 cache hit,proactively prefetch。ICaRus 的贡献完全正交——它消除了"每个模型一份 cache"的前提假设。在 ICaRus + KVFlow 联合部署下:ICaRus 确保只维护一份 KV cache,KVFlow 优化该份 cache 的 eviction/prefetch 策略,两者收益可叠加。
DroidSpeak 按 layer-level 敏感性选择性共享 KV cache:非敏感层直接复用 base-model cache,敏感层仍需对每个 fine-tuned model 重新计算 [2603.13281]。ICaRus 的核心 delta:
ICaRus 声称 frozen encoder 提供"隐式正则化"使 Qwen3 上 accuracy 超过 full fine-tuning [2603.13281]。但:
攻击力度: 中。Accuracy parity 是可接受的;accuracy improvement 的因果解释不可信。
ICaRus 论证 decode 阶段内存访问仍为 ~1× [2603.13281],但:
攻击力度: 高。核心 claim "decode latency comparable to single model" 缺乏 microbenchmark 证据。
所有实验使用 LoRA rank=128, α=256 [2603.13281]。这接近于 full fine-tuning 的参数量级(8B model, rank 128 → ~200M adapter params)。
攻击力度: 中。Rank 128 在实践中是合理的,但缺少 rank ablation 是实验设计的明确缺陷。
ICaRus 在 related work 中定位 DroidSpeak 为直接前驱 [2603.13281],但实验中没有 DroidSpeak baseline 对比。只有概念论证("无需 layer selection")而非量化 delta。
攻击力度: 低-中。DroidSpeak 没有开源实现使对比困难,但作为 positioning claim 的核心 baseline 应当被包含。
ICaRus 开创了 "training-time cache identity guarantee" 范式:通过在训练阶段约束模型结构(encoder freezing),在推理阶段获得系统级保证(KV cache identity across models)。这与之前的 inference-time approximation 范式(DroidSpeak layer selection, CacheBlend PIC)形成对立:
| 范式 | 代表 | 训练改动 | 推理精度 | 系统复杂度 |
|---|---|---|---|---|
| Inference-time approximation | DroidSpeak, CacheBlend | 无 | 近似 | 高 (layer selection, diff) |
| Training-time guarantee | ICaRus, PrefillShare | Encoder freezing + cache-conditioned FT | 精确 | 低 (直接复用) |
| Round-aware compression | TokenDance | 无 | 近似 | 中 (Master-Mirror) |
ICaRus + PrefillShare 共同确立了 training-time guarantee 范式的可行性。在 framework category survey 中,这与主线 B (Agentic Workflow Serving) 高度相关:当 agent 数 N 增大时,ICaRus 的 O(1) KV memory 优势超线性增长 [2603.13281]。
在 §2 Taxonomy 中,ICaRus 属于 Serving-Agentic × End-to-End 格——与 Scepsy、Sutradhara 同列,但更进一步要求 training-time coordination。在 §3 主线 B (Agentic Workflow Serving) 中,它与 TokenDance 形成互补关系:TokenDance 解决 intra-model multi-instance 冗余,ICaRus 解决 inter-model KV 冗余。
ICaRus 消除 inter-model KV 冗余,TokenDance 消除 intra-round position-shifted 冗余。联合使用时:对 N models × M instances 的场景,KV memory 从 O(N×M×L) 降至 O(L) (ICaRus 消除 N) 再经 Master-Mirror 压缩 (TokenDance 消除 M 的存储)。目前无人实现此组合。
ICaRus 冻结全部 encoder 层;DroidSpeak 按敏感性选择性共享。中间地带——前 K 层 frozen(保证 cache identity),后 L-K 层用 shared LoRA adapter——可能在 accuracy-sensitive 场景(如 LLaMA 上的数学任务)中找到更优 trade-off。训练时仍可保证前 K 层 cache 共享,后 L-K 层付出 per-model 存储但提升精度。
ICaRus 当前在同一节点运行 encoder + decoder。结合 PD 分离 (DualPath [2602.21548], PrfaaS [2604.15039]) 的趋势:
这将 ICaRus 的 "single-model prefill" 优势在分布式架构下放大:一个 prefill 集群服务所有 task models 的 KV 生成需求,decode 集群按需加载 adapter。PPD 的路由策略可直接适配 [2603.13358]。
ICaRus 的 encoder 是 frozen base model。如果同时部署一个小模型 (draft model) 做 speculative decoding,draft model 可以直接复用 base encoder 的 KV cache(因为 frozen encoder 产出是 model-independent)。这意味着 speculation verification step 可以 zero-cost access KV cache——传统 speculative decoding 中 verification 需要重算 KV,ICaRus 下直接命中。
当前 semantic router (如 vLLM Semantic Router [vllm-project-semantic-router]) 路由到不同模型时需考虑 KV cache locality penalty。ICaRus 使 KV cache 与 task model 解耦:路由任何请求到任何 task model 的 KV 成本为零。这使 model routing 从 "KV-cache-aware scheduling" 简化为纯 accuracy-aware routing,降低 router 的决策空间复杂度。