| Related Entity | Relation | Why Related |
|---|---|---|
| DeepSeek-V3 (2412.19437) | successor | V3 继承 V2 的 MLA+DeepSeekMoE 架构,新增 DualPipe、FP8 训练、auxiliary-loss-free load balancing |
| DeepSeek-V4 (deepseek-v4) | successor | V4 用 hybrid CSA+HCA attention 替代 MLA,将 KVCache 和 FLOPs 在 1M context 下进一步压缩至 V3.2 的 10%/27% |
| Kimi Linear (2510.26692) | alternative | 以 KDA(channel-wise gated delta rule)+ MLA 混合替代纯 MLA,实现 75% KVCache 节约和 6.3× decode 加速 |
| Kimi K2 (2507.20534) | successor | 解决 Muon optimizer 在 MoE 上的 attention logit 爆炸问题(MuonClip),验证 MLA 在 1T 规模的稳定性 |
| ZeRO-Prefill (2605.02960) | system-opt | 专为 MoE prefill 设计的 AsyncEP 策略,解决 DeepSeek 系列 MoE 模型的分布式 prefill 效率问题 |
DeepSeek-V2 通过 MLA 和 DeepSeekMoE 定义了开源高效 LLM 的新标杆。V3 [2412.19437] 和 V4 [deepseek-v4] 分别在训练效率和推理效率上延续并超越了 V2 的方法论。Kimi Linear [2510.26692] 从注意力机制维度提出了 MLA 的替代方案。K2 [2507.20534] 验证了 MLA 架构在不同优化器下的稳定性挑战。
V3 继承 V2 的 MLA+DeepSeekMoE 核心架构,扩展到 671B 总参 / 37B 激活 [2412.19437]。关键增量:
V2 → V3 的演化表明 MLA+DeepSeekMoE 是一个 可持续 scaling 的架构基座,非一次性优化。
V4 是 V2 MLA 架构的 代际替代——用 hybrid CSA+HCA attention 替代纯 MLA [deepseek-v4]:
| 维度 | V2 (MLA) | V4 (CSA+HCA) |
|---|---|---|
| KVCache/token | $(d_c + d_h^R) = 576$ 元素 | CSA: 4× 压缩 + sparse top-k; HCA: 128× 压缩 |
| 1M context FLOPs | V3.2 baseline | V4-Pro = 27% of V3.2 |
| 1M context KVCache | V3.2 baseline | V4-Pro = 10% of V3.2 |
| Attention 机制 | Low-rank KV joint compression + decoupled RoPE | Compressed sparse + heavily compressed dense |
| 位置编码 | Decoupled RoPE on shared key | 未知(论文未完全披露) |
V4 的设计哲学是 "先压缩再稀疏"——将 MLA 的低秩压缩推广为沿序列维度的显式压缩 + 基于重要性的 top-k 选择。这暗示 V2 的 MLA 在超长上下文(>128K)下效率不足——虽然 KVCache 比 MHA 小 93.3%,但仍然是序列长度的线性函数。V4 的 CSA 将 KVCache 与序列长度解耦至 $O(\sqrt{N})$ 级别。
Kimi Linear 从完全不同的角度挑战 MLA——用线性注意力(KDA)替代 softmax attention [2510.26692]:
| 维度 | V2 (MLA) | Kimi Linear (KDA:MLA 3:1) |
|---|---|---|
| 每 token decode cost | $O(d_c)$ KVCache 读取 + softmax attention | $O(1)$ per token(KDA 层)+ $O(n)$(MLA 层,仅 25%) |
| KVCache 节约 | 93.3% vs MHA | 75% vs pure MLA |
| 1M context TPOT | 11.48ms (MLA baseline) | 1.84ms (6.3×) |
| 质量 | Stronger than MHA(Table 9) | Stronger than pure MLA baseline(Table 1) |
Kimi Linear 的 3:1 KDA-to-MLA 混合架构保留了 25% MLA 层以维持长程精确检索能力。这表明 MLA 不必是 100% 使用的——混合策略可能是更优的 Pareto 选择。PrfaaS [2604.15039] 已利用 KDA:MLA 混合降低跨 DC KVCache 传输需求,验证了混合架构的系统层面收益。
K2 暴露了 MLA 在不同优化器下的隐藏稳定性问题:Muon optimizer 导致 attention logit 爆炸(>1000)[2507.20534]。V2 使用 AdamW 训练未遇此问题,但 Muon 的 token efficiency 显著更高。K2 的 MuonClip(per-head QK rescaling)专门为 MLA 的 compressed Q/K 设计——$W_{qc}^h \leftarrow \sqrt{\gamma_h} \cdot W_{qc}^h$——这是 MLA 特有的稳定性挑战。V2 论文未预见此问题。
ZeRO-Prefill 解决 DeepSeek 系列 MoE 模型的 prefill serving 效率问题 [2605.02960]。V2 在 §3.1.3 描述了训练基础设施但未详细讨论推理部署的分布式策略。ZeRO-Prefill 的 AsyncEP(weight streaming 替代 activation routing)在 Qwen3-235B 上实现 1.35-1.37× 吞吐提升——这类优化同样适用于 V2/V3 的 160/256 routed expert 配置。
DeepSeek-V2 是 "高效 MoE + 高效 attention = 经济 AI" 范式的开创者。其生态位可从三个维度定位:
架构影响:MLA 已成为开源 LLM 社区的标准组件——V3、V4、K2、PrfaaS 都以 MLA 或其混合变体为基础。DeepSeekMoE 的 "共享专家 + 细粒度路由专家" 结构同样被广泛采用。
推理生态:MLA 对推理系统有深远影响——(1) KVCache 缓存的是 $\mathbf{c}_t^{KV}$(512 维 latent)而非完整 K/V,需要推理框架适配 [2405.04434];(2) $W^{UK}$ 吸收优化使 decode 阶段无需显式重建 K/V,但 prefill 阶段仍需完整计算;(3) Mooncake、PrfaaS 等 serving 系统需要适配 MLA 的异构 KVCache 格式。
演化轨迹:V2 (MLA, 2024-05) → V3 (MLA + DualPipe, 2024-12) → V4 (CSA+HCA, 2026-04) 展示了从 "低秩压缩" 到 "压缩+稀疏+混合" 的架构演化。MLA 本身可能是过渡态——V4 的 CSA 在长上下文效率上已远超 MLA。