AMD CDNA Architecture White Paper

hardware amd-cdna1-whitepaper — Cross-paper Synthesis

AMD CDNA 1 Architecture — L3 Cross-Paper Synthesis #

1. 相关论文 #

Entity关系理由
amd-cdna2-whitepaper直接后继CDNA 2 继承并扩展 CDNA 1 的 Matrix Core,新增 FP64 Matrix 和 MCM 封装
amd-cdna3-whitepaper架构演进Chiplet 3D 堆叠是 CDNA 1 monolithic 路线的第三代迭代
nv-ampere-a100-whitepaper同代竞品A100 与 MI100 同为 2020 年 7nm 数据中心 GPU,定义了 TC/Matrix Core 基线
gpu-arch-comparison-2025综合对比将 CDNA 1 置于 AMD/NVIDIA 五年四代架构演进的起点
2510.27583实测验证MI300X 实测暴露的频率降额问题可追溯至 CDNA 架构的 CU 功耗密度设计

2. 本篇 vs 相关论文的 Delta #

CDNA 1 的历史定位:AMD 首次将 GPU 从图形通用架构分化为计算专用(CDNA)和图形专用(RDNA),引入 Matrix Core Engine 和 MFMA 指令族 [amd-cdna1-whitepaper]

vs A100 (同代竞品)

vs CDNA 2 (直接后继)

CDNA 1 独有贡献

3. 可攻击面 #

  1. 无 FP8/INT4 支持:CDNA 1 在 2020 年仅支持 FP32/FP16/BF16/INT8,而 A100 同期已提供 INT4 TC (1,248 TOPS) 和 2:4 稀疏 [nv-ampere-a100-whitepaper]。AMD 在低精度路线上落后整整一代。
    1. 仅 32GB 显存:MI100 的 32GB HBM2 在 LLM 时代来临前看似足够,但实际上严重限制了其在大模型推理中的生命周期。同期 A100 提供 80GB (2.5x)。
      1. MFMA 大矩阵形状的代价:CDNA 选择 16×16×4 等大 MMA 形状(vs NVIDIA 4×4×4),对大 GEMM 有利但小矩阵效率低 [amd-cdna1-whitepaper]。这一设计决策在推理时代(小 batch decode)成为劣势。
        1. 仅 4 个 ACE 限制并发:4 个异步计算引擎仅支持 4 个 concurrent stream [amd-cdna1-whitepaper],远不如 NVIDIA 的多 context 并行能力。
        2. 4. 生态位 #

          CDNA 1 (MI100) 的生态位是 "AMD 计算 GPU 的概念验证"

          • 证明了移除图形固定功能、专注计算的商业可行性
          • 为 CDNA 2 驱动 Frontier Exascale 超算铺平道路
          • 建立了 ROCm + HIP 生态的早期基础

          采纳证据:MI100 主要部署在 HPC/科学计算场景(DOE 实验室、学术超算中心),未在 AI 训练领域获得显著采纳——2020 年 AI 训练市场被 A100 + CUDA 生态主导。

          范式定位:CDNA 1 不是范式突破,而是范式跟随——跟随 NVIDIA V100/A100 定义的 "矩阵加速 + HBM + 高速互联" 数据中心 GPU 模板,但在执行细节上做了差异化选择(更大 MMA shape、Wavefront 64)。

          5. 未探索方向 #

          1. MFMA shape 自适应:CDNA 1-4 始终使用固定大 shape MFMA。一个混合方案(大 shape 用于 prefill GEMM、小 shape 用于 decode attention)可能在同一代硬件上同时优化两种工作负载。
            1. 图形单元的选择性保留:CDNA 完全移除了图形单元,但视频编解码(VCN)保留了。若保留轻量光栅化单元用于 GPU 上的稀疏索引生成,可能为稀疏注意力提供硬件加速。
              1. 超越 4-ACE 的细粒度并发:Fleet [2604.15379] 后来通过持久化 megakernel 绕过了 kernel launch 限制,但硬件层面的更多 ACE 或硬件调度器增强可能从根本上解决并发瓶颈。