DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

model deepseek-v4 — Cross-paper Synthesis

DeepSeek-V4 vs 相关论文:跨篇综合 #

相关论文 #

本篇选取 5 篇相关论文,覆盖从 attention 架构创新、端到端模型训练到 kernel/infra 优化的完整层次,与 DeepSeek-V4 形成多维对比。

DeepSeek-V3 (2412.19437) — V4 的直系前代。V4 继承了 V3 的 DeepSeekMoE(fine-grained routed experts + shared expert)、Multi-Token Prediction(MTP depth=1)以及 DualPipe 流水线调度。然而 V4 在三个核心轴上做了替换级升级:attention 从 MLA 切换为 hybrid CSA+HCA,残差连接从标准 residual 替换为 mHC(Birkhoff polytope 约束),optimizer 从纯 AdamW 切换为 hybrid AdamW+Muon。V3 在 H800 上训练 14.8T token 花费 $5.576M 且零 loss spike——这套训练稳定性工程成果被 V4 直接继承并扩展为 Anticipatory Routing 和 SwiGLU Clamping。V3 的 MLA 将 KV cache 压缩到 512 维已是当时 SOTA,但在 1M context 下仍占 V4 的 10× 存储;V4 通过 CSA 的 4× 压缩 + sparse top-k 选择和 HCA 的 128× 极端压缩,将每 token 推理 FLOPs 降到 V3.2 的 27%(V4-Pro)或 10%(V4-Flash),实现了效率的质变而非量变。Kind: predecessor。

Kimi Linear (2510.26692) — 替代路径的 efficient attention 架构。Kimi Linear 的核心 KDA(Kimi Delta Attention)是 linear attention 变体——递推状态 $S_t$ 通过 per-channel diagonal gate 和 delta rule 更新,状态大小固定为 128×128/head,与序列长度无关。在层级 hybrid 设计上,Kimi Linear 用 KDA:MLA=3:1 的交错比例,20 个 KDA 层搭配 7 个 NoPE-MLA 层。相比之下,V4 的 CSA+HCA 都基于 softmax attention 的压缩变体,不是 linear attention——CSA 先做 4× KV 压缩再 sparse top-k 选择,HCA 做 128× 压缩 + dense attention。两者都实现了 ~75% 的 KV cache 节省和 1M context 支持,但路径截然不同:Kimi Linear 通过 recurrence(O(1) state per layer)实现恒定 cache,V4 通过压缩+稀疏(O(n/m) KV entries)实现对数级缩减。Kimi Linear 的 48B/3B 规模远小于 V4-Pro 的 1.6T/49B,且 MLA 层使用 NoPE 而非 RoPE,完全回避了位置编码外推问题——V4 则用 Partial RoPE(仅最后 64 维)来保持位置感知。Kimi Linear 在 decode 吞吐上报告 +75% 提升,与 V4 的效率提升幅度可比,但两者优化维度不同:KDA 省在 state 固定大小,CSA+HCA 省在 KV 条目数压缩。Kind: related。

Kimi K2.6 (kimi-k2-6) — 同代竞争对手。K2.6 的核心特点是"架构不动、创新全在训练和编排"——其 config.json 与 K2.5 逐字相同(61L·d=7168·MLA·384E top-8·YaRN 64×→262K context),真正的变化在长程 agentic coding RL(单次 4000+ 工具调用、12-13 小时自主执行)、Agent Swarm 3× 扩容(300 sub-agent × 4000 steps)和 INT4 默认量化发布。V4 走了相反的路线——通过根本性的架构创新(CSA+HCA + mHC + Muon)实现效率提升,同时用 Specialist + OPD 的 post-training 范式取代 K2.6 的长程 RL。在 benchmark 上两者各有胜负:V4-Pro-Max 在 SWE-Verified (80.6)、MCPAtlas (73.6) 上与 K2.6 持平,但 V4 在 SimpleQA-Verified (57.9) 等知识类和 1M 长上下文任务上大幅领先。K2.6 的长程 coding 能力(Terminal-Bench 2.0 66.7)仅次 Gemini 3.1 Pro,而 V4 (67.9) 虽略领先但 gap 不大。两者代表了"架构创新 vs 训练/编排创新"的 2026 年分野。Kind: competitor。

Fleet (2604.15379) — Chiplet-aware megakernel 推理运行时。Fleet 解决了 AMD MI300/MI350 八颗 XCD 各自 4 MB 私有 L2 导致的 cache 浪费问题,通过新增 Chiplet-task 抽象 + 持久化 megakernel + 两级事件同步 + M-major 协作式 tile 遍历,在 Qwen3-8B decode 上实现 1.3-1.5× 加速。V4 面临类似但不同的问题:其 MoE fused kernel 需要将 expert parallelism 的 Dispatch/Linear-1/Linear-2/Combine 四阶段做 fine-grained overlap,把通信完全隐藏在计算之下(实现 1.50-1.96× 加速)。两者共享"把多 die GPU 上的隐式硬件约束变成显式软件资源"的设计哲学——Fleet 通过 Chiplet-task 显式管理 XCD-local L2,V4 通过 wave 粒度 expert 调度显式管理 all-to-all 通信。V4 还使用 batch-invariant deterministic kernel 保证训练可复现性,这在 Fleet 的推理场景中不需要但在 MoE 训练中至关重要。Fleet 目前仅验证 dense transformer,对 MoE 的 M-major 协作假设会被 expert routing 打破——而 V4 的 MoE fused kernel 恰好解决了这个问题。Kind: related。

HipKittens (2511.08083) — AMD 上的 tile-based kernel DSL。HipKittens 为 AMD GPU 提供了系统化的 C++ 嵌入式 tile 编程框架,通过 8-wave ping-pong 调度、显式寄存器 pinning、bank-conflict-free swizzle 和 chiplet-aware XCD 调度,在 GEMM/attention 上匹配或超越 AMD 手写汇编。V4 则选择了 TileLang DSL 作为其 kernel 开发工具——TileLang 在 IR 层共同生成设备 kernel 和 host launcher(CPU 端开销 <1μs),集成 Z3 SMT solver 做整数表达式形式分析,默认禁用 fast-math 以保证数值可复现性。两者都在解决"kernel 生产力"问题,但侧重点不同:HipKittens 追求在 AMD 硬件上逼近手写汇编的极致性能(64.4% peak utilization on MI355X),TileLang 则追求在保持数值确定性的前提下快速迭代复杂 attention 架构(CSA/HCA 的数百个细粒度算子通过 fusion 替换为少数 kernel)。HipKittens 的 chiplet-aware XCD scheduling (Algorithm 1) 与 Fleet 互补,而 TileLang 的 SMT-solver-assisted formal analysis 和 bitwise reproducibility 保证则是 V4 端到端确定性训练的基础。Kind: related。

本篇 vs 相关论文的 delta #

DeepSeek-V4 的核心 delta 是在万亿参数 MoE 模型上实现了压缩 attention + 稳定训练 + 端到端确定性的三角闭环。CSA+HCA 的 hybrid compressed attention 将 1M context 下的 KV cache 压到 V3.2 的 7-10%,mHC 通过 doubly stochastic 约束保证深层残差流的非扩张性(这在压缩 attention 架构下比标准 attention 更关键),Muon optimizer 加速收敛且避免 exploding logits。三者缺一不可:没有 mHC,compressed attention 的信息通过残差流传递时会数值不稳定;没有 Muon,万亿参数 MoE 的收敛速度不足以完成 33T token 的预训练;没有 batch-invariant deterministic kernel,pre-training/post-training/inference 的 bitwise 对齐无法实现,OPD 的 full-vocabulary logit distillation 也无法保证梯度估计的稳定性。

维度DeepSeek-V4DeepSeek-V3Kimi LinearKimi K2.6FleetHipKittens
优化目标百万 token 上下文推理效率 + SOTA 质量万亿参数 MoE 训练效率($5.576M 训完 671B)线性注意力超越 full attention长程 agentic coding 稳定性Chiplet GPU decode 延迟AMD kernel 生产力
核心抽象Hybrid compressed attention (CSA+HCA) + mHC 残差DualPipe 双向 pipeline + MLAKDA recurrence + NoPE-MLA hybrid长程 RL trajectory reward + Agent SwarmChiplet-task (XCD + L2)Tile-based 8-wave ping-pong
Attention 架构CSA (4× 压缩 + sparse top-k) + HCA (128× 压缩 + dense), interleavedMLA (低秩 KV 压缩到 512 dim)KDA (linear, 128×128 fixed state) + MLA (NoPE)MLA (继承 DeepSeek-V3)N/A (使用下游 attention)N/A (通用 attention kernel)
KV Cache 压缩1M 下 V3.2 的 7-10%;FP8/FP4 混合精度存储512 dim latent(vs GQA8 约 14×)KDA 层 O(1) + MLA 层 576 fp/tok, 总体减 ~75%MLA 576 fp/tok(同 K2.5)不涉及不涉及
训练优化器Hybrid AdamW + Muon(10 次 Newton-Schulz 迭代)纯 AdamW(BF16 moment)MuonClip + WSDMuonClip(推测沿用 K2.5)N/A (推理)N/A (kernel)
长上下文支持原生 1M(4K→16K→64K→1M 渐进训练)128K(YaRN 扩展)1M(NoPE + KDA gates)262K(YaRN factor=64)不涉及不涉及
Post-training 策略Specialist + multi-teacher OPD(10+ teacher, full-vocab logit distillation)SFT + 简单 RLSFT 两段 + Kimi K1.5 RL长程 agentic coding RL(4-13h rollout, 4000+ tool calls)N/AN/A
Agent 能力SWE-Verified 80.6, MCPAtlas 73.6, 67% internal pass rateSWE-Bench 42.0(open-source 最佳但远逊闭源)N/A(小规模模型)SWE-Bench Pro 58.6(开源 SOTA), Terminal-Bench 66.7间接利好 agent serving (bs=1-8 延迟减半)间接利好(faster kernels)
Kernel/Infra 创新TileLang DSL + Z3 SMT solver + batch-invariant deterministic kernels + MoE fused EP kernel (1.5-1.96×)DualPipe + 自定义 all-to-all kernel (PTX) + FP8 框架KDA Triton chunkwise kernel (DPLR a=b=k, ~2× faster)compressed-tensors INT4 dequant + GEMM fusionChiplet-task + 两级事件同步 + M-major L2 协作8-wave ping-pong + register pinning + XCD scheduling
硬件目标NVIDIA GPU(继承 V3 集群)+ 面向未来 FP4 硬件2048× H800未披露(推测 H800/H100)8× H200 单节点 (INT4)AMD MI350X (8 XCD)AMD MI325X/MI355X (CDNA3/4)

跨篇洞察 #

1. "压缩 vs 线性 vs 编排"的三岔路口。 2026 年的 efficient attention 竞争呈现出三条清晰路线:V4 走"softmax attention 内的压缩+稀疏"(CSA+HCA),保留了 softmax attention 的建模能力但通过 KV 压缩和 sparse selection 大幅削减计算量;Kimi Linear 走"linear attention 替换 softmax"(KDA),用固定大小的 recurrent state 从根本上消除序列长度依赖;K2.6 走"架构不动、RL/编排做极限",证明 1T MoE + MLA 的架构瓶颈可以被长程 agentic RL 和异构 agent 编排绕过。三条路线在 1M context 支持和 agent 能力上殊途同归但代价不同:V4 需要 CSA/HCA 的复杂实现 + mHC 稳定性保障,Kimi Linear 需要 chunkwise kernel 的数值正确性 + NoPE 的位置编码代替,K2.6 需要 4-13 小时的长程 RL rollout 基础设施。未来的赢家可能是三者的融合——V4 已经暗示会探索"sparse embedding"新维度,Kimi 可能在 K3 中切到 Kimi Linear 架构,而 K2.6 的长程 RL 方法论可以叠加到任何底模之上。

2. Kernel 生产力成为架构创新的限速因子。 V4 的 CSA+HCA 引入了数百个细粒度 Torch ATen 算子——如果没有 TileLang 将它们融合为少数 kernel,这套架构在训练和推理中根本无法高效运行。类似地,Kimi Linear 的 KDA 依赖 Triton chunkwise kernel 的 DPLR 约束优化(~2× 加速),HipKittens 为 AMD 提供了第一套系统化 tile DSL,Fleet 用 Mirage MPK 实现持久化 megakernel。这说明 2025-2026 年 "attention 架构创新"和"kernel DSL 生态"已经深度耦合——没有高效 kernel 工具链的架构创新无法落地,没有新架构驱动的 kernel DSL 缺乏创新动力。V4 的 TileLang + SMT solver + bitwise reproducibility 组合可能是目前工具链最完备的方案,但它与 NVIDIA 生态深度绑定;HipKittens/Fleet 在 AMD 端的进展表明 chiplet-aware kernel 优化正在形成独立生态。

3. 端到端确定性正在从"nice-to-have"变成"must-have"。 V4 投入了大量工程在 batch-invariant attention、deterministic MoE backward、mHC MatMul 确定性上——目标是 pre-training/post-training/inference 三条 pipeline 的 bitwise 对齐。这不是学术洁癖:OPD 的 full-vocabulary logit distillation 要求 student 和 teacher 的 forward pass 在给定相同输入时产生完全相同的 logits,否则梯度估计会有方差;FP4 QAT 要求 rollout 和 inference 使用完全相同的量化权重,否则 train-deploy 对齐失效。DeepSeek-V3 没有显式强调确定性(使用 cuBLAS + standard attention),但 V4 用 DeepGEMM 端到端替换 cuBLAS 并放弃 split-k,代价是极端的工程投入。Fleet 和 HipKittens 目前都不考虑确定性(推理场景不需要),但如果它们要扩展到 training kernel,确定性保证将成为必要条件。这个趋势暗示未来的 kernel DSL 可能会把 deterministic 作为一等编译选项。

4. MoE 与 chiplet 的天然亲和尚未被充分开发。 Fleet 论文明确指出其 M-major 协作不适用 MoE(因为每 token 走不同 expert),但外部分析指出 MoE 的 expert 稀疏激活与 chiplet 私有 L2 天然亲和——不同 expert 驻留不同 XCD 的 L2,gating network 做 expert→XCD affinity routing。V4 的 MoE fused kernel 已经实现了 expert 分割为 wave 的 fine-grained overlap,但假设的是 NVIDIA 的 monolithic L2;如果 V4 的后续版本迁移到 AMD MI350/MI400,Fleet 的 Chiplet-task 抽象 + V4 的 MoE EP scheme 的交叉有望产生新的 expert-chiplet affinity 优化——每颗 XCD 持久化缓存一组 expert 权重,routing 时优先将 token 发送到已缓存其目标 expert 的 XCD。这是一个两篇论文都未探索但价值极高的方向。

5. Post-training 范式正在经历从"混合 RL"到"Specialist + Distillation"的转型。 V3.2 使用 mixed RL 阶段,V4 将其完全替换为 domain-specific specialist training + OPD(On-Policy Distillation)。K2.6 走了另一条路——把 RL rollout horizon 从分钟推到小时级。V4 的 OPD 的关键创新在 full-vocabulary logit distillation(而非 token-level KL 估计),配合 teacher 调度基础设施(支持无限数量万亿参数 teacher、只缓存最后一层 hidden states)。这暗示了一个更广泛的趋势:当底模足够强时,post-training 的瓶颈从"怎么做 RL"转移到"怎么高效蒸馏多个 specialist 到一个统一模型"。V4 的 OPD 和 K2.6 的长程 RL 可能最终会合流——先用长程 RL 训练 domain specialist,再用 OPD 合并。