| 相关实体 | 关系类型 | 关联理由 |
|---|---|---|
| DualPath (2602.21548) | KV-cache I/O 优化 | 同为解决 agentic workload 下 KV-cache 存储/传输瓶颈;DualPath 解 storage→GPU I/O 带宽不均,TokenDance 解 multi-agent 内存冗余 |
| PPD (2603.13358) | PD 分离路由优化 | 同处 multi-turn/multi-agent serving 栈;PPD 解 Turn 2+ 的冗余 KV 重算和重传,TokenDance 解同一轮内 N 份近似 KV 的冗余存储与计算 |
| MFS (2603.17456) | 网络调度优化 | 同在 disaggregated serving 中处理通信瓶颈;MFS 调度网络 flow 优先级减少争用,TokenDance 从 KV 内容层面消除冗余 |
| TensorHub (2604.09107) | RL training 权重传输 | 同为 "multi-instance 数据共享" 范式——TensorHub 用 reference-passing 去重 RL 权重传输,TokenDance 用 Master-Mirror 去重 multi-agent KV cache;共同思路:不复制、只引用 |
| PrfaaS (2604.15039) | 跨 DC PD serving | 同关注 KV cache 传输代价;PrfaaS 用混合注意力降 KV throughput 使跨 DC 可行,TokenDance 用 block-sparse diff 压缩 per-agent 存储;正交可叠加 |
| ZeRO-Prefill (2605.02960) | MoE prefill 优化 | 同为 "反转传统数据流方向以消除冗余"——ZeRO-Prefill 反转 activation routing → weight streaming,TokenDance 反转 per-request PIC → per-round collective reuse |
| TileRT (tilert-speed-scaling-law) | Persistent kernel / decode 优化 | 代表 "消除执行边界" 路线;TokenDance 同一侧(消除请求间的冗余边界),但在 KV 存储层而非 kernel 层 |
| KVServe (kvserve) | KV-cache 压缩传输 | 同关注 KV-cache 体积优化;KVServe 用量化+编码压缩单份 KV 传输,TokenDance 用 structural dedup 压缩 N 份 KV 存储。两者正交——可先 Master-Mirror 去重再 KVServe 压缩剩余 |
| 维度 | TokenDance 相对于先前 SOTA 的性质 |
|---|---|
| vs prefix caching | 非增量:prefix caching 需要 bit-aligned prefix,TokenDance 基于 content hash 跨位置匹配 |
| vs CacheBlend (per-request PIC) | 增量:站在 CacheBlend 肩膀上,把 PIC 的 per-request O(N) 摊销为 per-round O(1) |
| vs Mooncake/DualPath (存储侧) | 正交:DualPath 解 I/O 路径问题,TokenDance 解数据冗余问题,可叠加 |
| vs KVServe (压缩侧) | 正交:KVServe 对 single-cache 做 quantization+codec 压缩,TokenDance 做 structural dedup;先去重再压缩最优 |
TokenDance 的全部收益建立在"multi-agent 按同步轮运行且 $O$ 块跨 agent 91–97% 重叠"的假设上 [2604.03143]。但:
TokenDance 声称"本身不引入额外误差",但:
TokenDance 代表了一个明确的新范式点:"请求间结构作为一等优化对象"。
在 LLM serving 优化的时间线上:
PagedAttention (请求内内存管理, 2023)
→ Prefix Caching (请求间 exact prefix, 2023-24)
→ PIC/CacheBlend (请求间 position-independent, 2024-25)
→ TokenDance (请求间 round-level structural dedup, 2026)
这条线的每一步都向 更大的优化单位 推进。TokenDance 是这条线上 2026 年的最新代表。
Master-Mirror 去重(11–17×结构压缩)后,对 Master 的 dense cache 再做 KVServe 式 quantization+codec 压缩(~4–10×)[kvserve]。理论复合压缩比可达 44–170×。关键需解决:fused restore 的 ping-pong buffer 是否兼容 quantized Master。
在 PD 分离集群中,用 DualPath 的 dual-path loading 加速 Master cache 的 I/O [2602.21548],用 TokenDance 的 diff 压缩减少 per-agent 的传输量。两者正交但需要统一的 KV metadata 管理(目前 DualPath 绑 3FS trie,TokenDance 绑 LMCache segment hash)。
TokenDance 当前假设完全 All-Gather。推广方向:对 DAG 拓扑的 agent workflow,定义 "partial broadcast group"——每个 group 内做 collective reuse + Master-Mirror,group 间做 diff propagation。挑战:group 动态变化时的 Master 选择和 reuse plan 失效处理。
ZeRO-Prefill 的 AsyncEP 在 prefill 大 batch 下用 weight streaming 替代 AllToAll [2605.02960]。若 multi-agent prefill 也是大 batch(N agents × prompt length),可以在 AsyncEP backend 上叠加 TokenDance 的 collective reuse——共享 compute window 同时隐藏 expert weight AllGather 和 collective RoPE+diff 的计算。
DeepSeek-V3 的 MLA 将 K/V 压缩为低维 latent [2604.03143]。Master-Mirror 的 block-sparse diff 作用在 latent 空间时,差异块可能更少(latent 维度更低 → 数值分辨率更粗 → 量化后差异更小)。但 MLA 的 compressed KV 需要 decompression 才能做 attention——fused restore 需要 decompress + merge diff 两步,增加了 CUDA kernel 复杂度。这是一个值得专门探索的方向。
当前 Master 选择基于 deviation score heuristic [2604.03143]。更激进的方向:用轻量 RL 学习 Master 选择策略——输入是 N 个 agent 的 prompt embedding 摘要,输出是最优 Master index,reward 是 diff 稀疏度。在 agent 数目 >10 时潜在收益更大。