DeepSeek-AI | 2026-04 | https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/resolve/main/DeepSeek_V4.pdf Category: model | Tags: MoE, long-context, compressed-attention, sparse-attention, mHC, Muon-optimizer, FP4-QAT, million-token
DeepSeek-V4 系列包含两款原生支持百万 token 上下文的 MoE 语言模型:V4-Pro(1.6T 总参/49B 激活) 和 V4-Flash(284B 总参/13B 激活)。核心创新在于 hybrid CSA+HCA attention 架构——CSA 将 KV cache 沿序列维度 4× 压缩后再做 sparse top-k 选择,HCA 以 128× 更激进的压缩率做 dense attention——配合 mHC(Manifold-Constrained Hyper-Connections) 增强残差连接稳定性,以及 Muon optimizer 加速收敛。在 1M token 场景下,V4-Pro 的单 token 推理 FLOPs 仅为 V3.2 的 27%,KV cache 仅为 10%;V4-Flash 更分别低至 10% 和 7%。V4-Pro-Max 在 Knowledge、Reasoning、Agent、Long-Context 四个维度全面重新定义了开源模型 SOTA——SimpleQA 超出开源第二名 20 个百分点,Codeforces rating 3206 超过 GPT-5.4,Putnam-2025 达到 120/120 满分,首次在 1M 学术 benchmark 上超越 Gemini-3.1-Pro。

Paper's Figure 1 (caption: "Left: benchmark performance of DeepSeek-V4-Pro-Max and its counterparts. Right: inference FLOPs and KV cache size of DeepSeek-V4 series and DeepSeek-V3.2.").
Reasoning model 的 test-time scaling 范式依赖于大量中间推理 token 的生成。但 vanilla attention 的二次复杂度使得超长上下文(>128K)的计算和内存成本急剧膨胀:
DeepSeek-V3.2 虽然性能强大(671B/37B,MLA attention),但其 KV cache 和 FLOPs 在 1M context 下仍然是 V4 的 10× 和 3.7×。打破这一效率墙是本文的核心动机。

Paper's Figure 2 (caption: "Overall architecture of DeepSeek-V4 series. We use hybrid CSA and HCA for attention layers, DeepSeekMoE for feed-forward layers, and strengthen conventional residual connections with mHC.").
DeepSeek-V4 保留 V3 的 DeepSeekMoE 和 MTP 框架,在三个关键维度升级:

Paper's Figure 3 (caption: "Core architectures of CSA. It compresses the number of KV entries to 1/m times, and then applies DeepSeek Sparse Attention for further acceleration.").
CSA 的设计逻辑是"先压缩、再稀疏",两步叠加获得极高的效率增益:
效率分析:CSA 综合压缩率 = m × (n/top_k) ≈ 序列长度/256(V4-Pro)或 /128(V4-Flash),在 1M 序列下仅保留约千级 KV entries 参与每个 query 的 attention。

Paper's Figure 4 (caption: "Core architectures of HCA. It performs heavier compression, where the KV entries of m' (≫ m) tokens will be consolidated into one.").
HCA 是 CSA 的极端压缩对应物,采用 更大压缩率 m'=128 但保持 dense attention(不做稀疏选择):
设计直觉:CSA 提供精细化的局部+稀疏全局关注,HCA 提供粗粒度但完整的全局覆盖。两者交错排列(interleaved),在不同层分别捕获不同粒度的长程依赖。
mHC 解决标准 Hyper-Connections (HC) 的数值不稳定问题。HC 将残差流宽度扩展 n_hc=4 倍,通过三组线性映射(pre A_l, residual B_l, post C_l)更新隐状态:
$$X_{l+1} = B_l X_l + C_l F_l(A_l X_l)$$
核心约束:将 B_l 限制在 doubly stochastic matrices 的 Birkhoff polytope M 上:
投影方式:通过 Sinkhorn-Knopp 算法(t_max=20 次迭代)将 exp(B̃_l) 投影到 M。参数动态生成,分解为 input-dependent(通过 RMSNorm + 投影矩阵)和 input-independent(静态偏置 + gating 因子 α 初始化为小值)两部分。
代价控制:mHC 的 wall-time 开销仅占 overlapped 1F1B pipeline stage 的 6.7%,通过 fused kernel + selective recomputation + DualPipe 调整实现。
Muon 用于除 embedding/prediction head/RMSNorm/mHC 静态参数以外的所有模块(这些仍用 AdamW)。核心是 Newton-Schulz 迭代近似正交化:

Paper's Figure 6 (caption: "Illustration of the KV cache Layout for DeepSeek-V4.").
| 指标 | V4-Pro vs V3.2 (1M) | V4-Flash vs V3.2 (1M) | vs BF16 GQA8 baseline (1M) |
|---|---|---|---|
| FLOPs (单 token) | 27% (3.7× 降低) | 10% (10× 降低) | — |
| KV cache | 10% (9.5× 降低) | 7% (14× 降低) | ~2% |
混合精度存储进一步压缩:RoPE 维度 BF16,其余 FP8,Lightning indexer attention 用 FP4。FP4 routed expert 权重在未来硬件上理论效率可再提升 1/3。
CSA/HCA 的压缩是序列维度上的真实存储缩减——压缩后原始 KV 即被丢弃,长期只存压缩条目。容易产生的误解是"c=512 和 MLA 的 latent 512 维一样,没省"——但省的不是 head 维度,而是条目数量。
每原始 token 的 KV 存储对比:
| 每 token 存储的 KV 条目数 | 每条目维度 | 折合每 token 存储 | |
|---|---|---|---|
| V3 MLA | 1 条/token | 576 (512 latent + 64 RoPE) | 576 floats |
| V4 CSA 层 | 1 条/4 tokens | 512 | ~128 floats/tok |
| V4 HCA 层 | 1 条/128 tokens | 512 | ~4 floats/tok |
压缩的生命周期——推理时分两级管理:
┌───────────────────────────────────────────┐
│ State Cache(固定大小,per request 预分配) │
│ ┌──────────────┬────────────────────────┐ │
│ │ SWA KV │ 未压缩尾部 │ │
│ │ 最近 128 tok │ <m 个待压缩 token │ │
│ │ 未压缩,每层存 │ 凑齐 m 个后压缩→下方 │ │
│ └──────────────┴────────────────────────┘ │
├───────────────────────────────────────────┤
│ Classical KV Cache(分块增长) │
│ ┌──────┬──────┬──────┬──────┐ │
│ │ Blk 0│ Blk 1│ Blk 2│ ... │ │
│ │ CSA 压缩条目 + HCA 压缩条目 + Indexer KV │ │
│ └──────┴──────┴──────┴──────┘ │
│ 每块 = lcm(m, m') 个原始 token 的压缩产物 │
└───────────────────────────────────────────┘
DSA Indexer 也在压缩粒度上操作——这是另一个关键细节。Indexer 不需要看到所有原始 KV:
这意味着在 1M context 下,indexer 只需对 250K 条压缩 key 评分(FP4 精度),而非 1M 条原始 key。再 top-1024 后仅 1024 条参与 core attention——整个链路从存储到计算都在压缩粒度上运行。
| 场景 | 指标 | V4-Pro-Max | 对比最佳闭源 | 条件 |
|---|---|---|---|---|
| Knowledge | SimpleQA-Verified | 57.9 | Gemini-3.1-Pro 75.6 | 开源 SOTA,超第二名 20pp |
| Knowledge | Chinese-SimpleQA | 84.4 | Gemini-3.1-Pro 85.9 | 接近持平 |
| Knowledge | MMLU-Pro | 领先 Kimi/GLM | — | 略超 |
| Reasoning | LiveCodeBench-v6 | 93.5 | Gemini-3.1-Pro 91.7 | 超越 |
| Reasoning | Codeforces | 3206 | GPT-5.4 3168 | 超越,人类排名第 23 |
| Reasoning | Putnam-2025 | 120/120 | — | 满分 |
| Reasoning | Apex Shortlist | 90.2 | Gemini-3.1-Pro 89.1 | 超越 |
| Agent | SWE-Verified | 80.6 | Opus-4.6 80.8 | 持平 |
| Agent | Terminal Bench 2.0 | 67.9 | GPT-5.4 75.1 | 仍有差距 |
| Agent | MCPAtlas | 73.6 | Opus-4.6 73.8 | 持平 |
| Long-Context | MRCR 1M | 超 Gemini-3.1-Pro | — | 1M 学术 benchmark SOTA |
| Long-Context | CorpusQA | 超 Gemini-3.1-Pro | — | 全面领先 |
| 指标 | V3.2-Base (37B/671B) | V4-Flash-Base (13B/284B) | V4-Pro-Base (49B/1.6T) |
|---|---|---|---|
| MMLU | 87.8 | 88.7 | 90.1 |
| MMLU-Pro | 65.5 | 68.3 | 73.5 |
| SimpleQA-Verified | 28.3 | 30.1 | 55.2 |
| HumanEval | 62.8 | 69.5 | 76.8 |
| LongBench-V2 | 40.2 | 44.7 | 51.5 |
V4-Flash 以不到 V3.2 一半的激活参数在多数 benchmark 上超越 V3.2;V4-Pro 进一步在 knowledge-intensive 任务上实现跨越式提升。
| 参数 | V4-Flash | V4-Pro |
|---|---|---|
| Transformer 层数 | 43 | 61 |
| Hidden dim d | 4096 | 7168 |
| 总参数 / 激活参数 | 284B / 13B | 1.6T / 49B |
| 前两层 attention | Pure SWA | HCA |
| 后续层 attention | Interleaved CSA + HCA | Interleaved CSA + HCA |
| CSA m / top-k | 4 / 512 | 4 / 1024 |
| HCA m' | 128 | 128 |
| Attention heads n_h | 64 | 128 |
| KV dim c / d_c | 512 / 1024 | 512 / 1536 |
| Output groups g / d_g | 8 / 1024 | 16 / 1024 |
| Sliding window n_win | 128 | 128 |
| Indexer heads n_h^I / dim c_I | 64 / 128 | 64 / 128 |
| MoE: shared + routed experts | 1 + 256 | 1 + 384 |
| Expert intermediate dim | 2048 | 3072 |
| Active experts / token | 6 | 6 |
| Hash routing 前 N 层 | 3 | 3 |
| MTP depth | 1 | 1 |
| mHC n_hc / t_max | 4 / 20 | 4 / 20 |
与 V3 的关键差异:
CSA 的数据流分为四个阶段:
Stage 1 — KV 压缩:
输入 H ∈ R^(n×d) 通过两组投影产生 KV entries C_a, C_b ∈ R^(n×c) 和压缩权重 Z_a, Z_b ∈ R^(n×c)。每 m 个连续 entry 用 softmax(Z + B) 加权求和为一个压缩 entry,其中 B ∈ R^(m×c) 是可学习位置偏置。两组 entry 有 overlap(偏移 m/2),实际每个压缩 entry 融合 2m=8 个原始 entry。最终序列长度从 n 降到 n/m。
Stage 2 — Lightning Indexer:
用低秩方式(c^Q_t → W → indexer queries)产生 n_h^I=64 个 indexer head 的查询向量。每个 head 对所有压缩 entry 计算索引分数(weighted ReLU-gated dot product),跨 head 加权聚合后 top-k 选择保留最重要的压缩 entry 子集。FP4 精度下计算 indexer attention,BF16 量化 index scores 后 top-k,99.7% recall rate。
Stage 3 — Shared KV MQA:
在 top-k 选定的压缩 entry 上做 MQA。每个压缩 entry 同时作为 key 和 value。Query 从共享压缩潜变量 c^Q_t 产生。SWA 的 n_win=128 个未压缩 token 的 KV entries 与压缩 entry 拼接参与 attention。
Stage 4 — Grouped Output Projection:
n_h × c 维的 attention 输出分 g 组,每组投影到 d_g 维中间输出,再投影到最终 d 维。
HCA 结构与 CSA 共享核心组件,但有两个关键差异:
1M token 序列经 HCA 压缩后仅 ~7800 个 entry,足以在 dense attention 下高效计算。HCA 层提供粗粒度全局覆盖,与 CSA 层的精细稀疏关注互补。
mHC 的完整计算流程:
为什么是 doubly stochastic:doubly stochastic matrix 的谱范数 ≤ 1,保证残差映射是非扩张的。Birkhoff polytope M 对矩阵乘法封闭,意味着深度堆叠 ∏B_l 仍然有界。这从数学上保证了深层网络的梯度不会指数膨胀。

Paper's Figure 5 (caption: "Illustration of our EP scheme with related works. Comet overlaps Dispatch with Linear-1, and Linear-2 with Combine, separately. Our EP scheme achieves a finer-grained overlapping.").
MoE 层分解为 4 阶段:Dispatch(通信)→ Linear-1(计算)→ Linear-2(计算)→ Combine(通信)。
核心 insight:总通信时间 < 总计算时间,因此理论上通信可完全隐藏于计算之下。
实现方式:将 expert 分割为多个 wave,每个 wave 是一小批 expert。一个 wave 的计算与下一个 wave 的通信并行进行。稳态时,当前 wave 计算、下一 wave 传输、已完成 wave 的结果回传三者并发执行。
性能:
对硬件的四个建议:
复杂模型架构本会产生数百个细粒度 Torch ATen 算子。TileLang 将绝大多数替换为融合 kernel:
目标:训练可复现性 + pre-training/post-training/inference 三条 pipeline 的 bitwise 对齐。
FP4(MXFP4, E2M1)QAT 在 post-training 阶段引入:
应用范围:
部署一致性:推理和 RL rollout(无反向传播)直接使用真实 FP4 量化权重,确保训练-部署一致。
继承 V3 推理框架,核心差异在 KV Cache 管理:
异构 KV Cache 布局(Figure 6):
On-Disk KV Cache(三种策略):
基于 V3 数据增强:
| 参数 | V4-Flash | V4-Pro |
|---|---|---|
| 训练 token 数 | 32T | 33T |
| 最大 batch size | 75.5M tokens | 94.4M tokens |
| Peak LR | 2.7×10⁻⁴ | 2.0×10⁻⁴ |
| End LR | 2.7×10⁻⁵ | 2.0×10⁻⁵ |
| LR warmup | 2000 steps linear | 2000 steps linear |
| LR schedule | Maintained → cosine decay | Maintained → cosine decay |
| 序列长度调度 | 4K → 16K → 64K → 1M | 4K → 16K → 64K → 1M |
| Dense attention warmup | 首 1T tokens | 更长的 warmup |
| Sparse attention 引入 | 64K 阶段 + indexer warmup | 同上 |
| MTP loss weight | 0.3 → 0.1 (LR decay 时) | 同 |
| Balance loss weight | 0.0001 | 同 |
万亿参数 MoE 模型的 loss spike 与 MoE 层的 outlier 直接相关,routing 机制放大了 outlier 的影响。两个有效技术:
Anticipatory Routing:将 backbone 和 routing 网络的参数更新解耦。在 step t,用当前参数 θ_t 计算特征,但 routing indices 来自 θ_{t-Δt}(提前 Δt 步计算并缓存)。基础设施优化将额外开销控制在 ~20%。自动检测触发——仅在 loss spike 发生时启用,稳定后回退到标准训练。
SwiGLU Clamping:将 SwiGLU 的线性分量 clamp 到 [-10, 10],gate 上界 cap 到 10。实验证明有效消除 outlier 且不影响性能。
采用 V3.2 的 domain specialist 范式:每个领域模型经过初始 fine-tuning + GRPO RL 优化。
Reasoning Efforts(三种模式):
| 模式 | 特性 | 适用场景 |
|---|---|---|
| Non-think | 快速直觉式响应 | 常规任务 |
| Think High | 有意识的逻辑分析 | 复杂问题 |
| Think Max | 推理能力推向极限 | 最高难度 |
标记界定推理内容Generative Reward Model (GRM):难验证任务不再用标量 reward model,而是用 Generative Reward Model + rubric-guided RL data。Actor 网络本身就是 GRM,同时优化评判和生成能力。
Interleaved Thinking(V4 的上下文管理创新):

Paper's Figure 7 (caption: "Thinking management of DeepSeek-V4 series.").
Quick Instruction:在输入末尾追加 special token 触发辅助任务(搜索决策、标题生成、查询提取、来源权威性评估、域分类、URL 提取),复用已有 KV cache,避免维护独立小模型。多个任务可并行执行。
多教师 OPD 替代 V3.2 的 mixed RL 阶段,将 10+ 个 domain specialist 合并为统一模型:
目标函数:student π_θ 与各 expert π_{E_i} 的 reverse KL divergence 加权和。Reverse KL 要求从 student 自身做 on-policy 采样。
关键改进:摒弃先前工作的 token-level KL 估计(高方差、不稳定),采用 full-vocabulary logit distillation——保留完整 logit 分布,获得稳定梯度估计。
Teacher 调度:支持无限数量的万亿参数教师模型。教师权重 offload 到集中式分布式存储;按需加载,ZeRO-like 参数分片。仅缓存最后一层 hidden states(非 full logits),prediction head 实时重建 logits。训练样本按 teacher index 排序——每个 mini-batch 中每个 teacher head 仅加载一次,设备内存中最多一个 head。
| 维度 | DeepSeek-V3/V3.2 | DeepSeek-V4 |
|---|---|---|
| Attention | MLA (Multi-head Latent Attention) | Hybrid CSA + HCA |
| KV cache (1M) | 基准 100% | V4-Pro 10%, V4-Flash 7% |
| FLOPs (1M) | 基准 100% | V4-Pro 27%, V4-Flash 10% |
| 残差连接 | Standard residual | mHC (4× 宽度, doubly stochastic) |
| Optimizer | AdamW | Hybrid AdamW + Muon |
| MoE activation | Sigmoid | Sqrt(Softplus) |
| Active experts | 8 | 6 |
| FFN 前 N 层 | Dense FFN | Hash routing MoE |
| 精度 | FP8 training | FP8 + FP4 QAT (post-training) |
| 最大上下文 | 128K → 扩展 | 原生 1M |
| Post-training | Mixed RL | Specialist + OPD |
| 推理框架 | PagedAttention-compatible | 异构 KV cache + on-disk |
代码来源:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/inference/model.py
| 代码构件 | 对应图 | 关键实现细节 |
|---|---|---|
Transformer.__init__ | A1 | h = embed(x).unsqueeze(2).repeat(1,1,hc_mult,1) 创建 4 份副本 |
Block.forward | A2 | 每个 Block 对 Attn 和 FFN 各做一次 hc_pre / hc_post |
Attention.forward | A3/A4 | compress_ratio 决定层类型: 0=SWA, 4=CSA, 128=HCA |
Compressor.forward | A3/A4 | overlap = (compress_ratio == 4): CSA 有 overlap, HCA 无 |
Indexer.forward | A5 | 自有 Compressor 用 rotate=True (Hadamard) + FP4 |
Block.hc_pre/hc_post | A6 | hc_split_sinkhorn 是 kernel 调用, 分裂出 pre/post/comb |
Gate.forward | A2 | sqrtsoftplus = sqrt(softplus(x)), bias 仅影响选 expert 不影响权重 |
Expert.forward | A2 | SwiGLU: silu(gate)×clamp(up), shared expert 无 clamp |