AMD CDNA 4 Architecture White Paper

hardware amd-cdna4-whitepaper — Cross-paper Synthesis

AMD CDNA 4 Architecture — L3 Cross-Paper Synthesis #

1. 相关论文 #

Entity关系理由
amd-cdna3-whitepaper直接前代CDNA 4 继承 chiplet 架构但升级 XCD 至 3nm + 引入 MXFP
nv-blackwell-whitepaper同代竞品B200 是 MI355X 的直接竞争对手 (2025)
2511.08083Kernel 优化HipKittens 是首个针对 MI355X 的高性能 tile-based DSL
2604.15379运行时框架Fleet 在 MI350 上验证了 Chiplet-task 抽象的端到端收益
gpu-arch-comparison-2025综合对比将 CDNA 4 与同代 Blackwell 正面对比

2. 本篇 vs 相关论文的 Delta #

CDNA 4 的 AI 优先宣言:大胆移除 TF32 硬件、FP64 Matrix 减半,腾出面积给 MXFP 格式和矩阵资源翻倍 [amd-cdna4-whitepaper]

vs Blackwell B200 (同代竞品)

vs CDNA 3 (前代)

HipKittens 验证

HipKittens 在 MI355X 上通过 8-wave ping-pong 调度达到 1,610 TFLOPS BF16 GEMM (接近峰值),证明了 CDNA 4 架构的可编程性 [2511.08083]。其核心发现——wave specialization 在 AMD 上反生产力(静态寄存器分配使 producer wave 浪费一半寄存器)——对 CDNA 4 kernel 开发有指导意义。

Fleet 验证

Fleet 在 MI350 上的 Qwen3-8B decode 实验证明 Chiplet-task 抽象可将 L2 hit rate 提升至 51-61%,HBM 读降低 18-37% [2604.15379]

3. 可攻击面 #

  1. TF32 移除的兼容性风险:大量现有 CUDA 代码依赖 cuBLAS 的 TF32 默认模式(零改动加速 FP32)。CDNA 4 转为 BF16 软件模拟 [amd-cdna4-whitepaper],某些依赖 TF32 精度特性的模型可能需要重新验证。
    1. 互联差距难以弥补:NVLink5 1,800 GB/s + NVL72 是系统级优势 [nv-blackwell-whitepaper]。AMD 的 1,075 GB/s IF 在节点内尚可,但缺乏任何跨节点 GPU 直联方案——大规模训练中 AllReduce 延迟可能成倍落后。
      1. MXFP4/6 的生态就绪度:MXFP 格式需要框架级支持(per-32-element scaling 的量化工具链) [amd-cdna4-whitepaper]。截至 2026 年 PyTorch/JAX 对 MX 格式的原生支持仍处于早期。
        1. 1,400W TDP 的实际约束:MI355X 比 B200 多 40% 功耗 [amd-cdna4-whitepaper]。在数据中心 TCO 计算中,电费和冷却成本可能抵消 spec 上的计算优势。
        2. 4. 生态位 #

          CDNA 4 (MI355X) 的生态位是 "显存+MX格式驱动的 AI 推理平台"

          • 288GB 显存 + MXFP4 (10 PF) 使单卡可推理 ~400B FP8 模型或 ~800B MXFP4 模型
          • MXFP6 (AMD 独有) 提供 FP8/FP4 之间的精度-性能最优折中
          • 8-way CPX 分区(36GB/分区)支持多租户推理
          • vLLM/SGLang Day 0 支持降低采纳门槛

          范式定位:CDNA 4 标志着 AMD 从"HPC/AI 双重定位"明确转向"AI 优先"——FP64 减半是不可逆的战略信号。在 AI 精度持续下探的趋势中,MXFP6 作为 AMD 独有的中间精度可能成为差异化武器。

          5. 未探索方向 #

          1. MXFP6 的训练应用:当前 MXFP6/4 主要面向推理。若能开发 MXFP6 训练方案(forward FP8, backward MXFP6),在训练场景也能利用 10 PF 吞吐 [amd-cdna4-whitepaper]
            1. LDS 160KB 驱动的 Attention 创新:160KB LDS + 256B/cycle 带宽使得在 LDS 内完成更大 attention tile 成为可能 [amd-cdna4-whitepaper]。一种 "LDS-resident FlashAttention" 可能消除大部分 L2/HBM 读写。
              1. 2-IOD 拓扑的 NUMA-aware megakernel:Fleet 已证明 Chiplet-task 抽象的价值 [2604.15379],但 CDNA 4 从 4-IOD 简化为 2-IOD 使得 NPS2 成为最大分区模式 [amd-cdna4-whitepaper]。专门针对 2-IOD 对称拓扑设计的调度策略可能比通用方案更优。
                1. 跨厂商 MX 互操作:AMD (MXFP) 和 NVIDIA (NVFP4) 在 4-bit 格式上不兼容(block size 32 vs 16, scale 格式不同)。一个在框架层透明处理格式转换的方案可降低多硬件部署成本。