AMD CDNA 1 Architecture — L3 Cross-Paper Synthesis #
1. 相关论文 #
| Entity | 关系 | 理由 |
| amd-cdna2-whitepaper | 直接后继 | CDNA 2 继承并扩展 CDNA 1 的 Matrix Core,新增 FP64 Matrix 和 MCM 封装 |
| amd-cdna3-whitepaper | 架构演进 | Chiplet 3D 堆叠是 CDNA 1 monolithic 路线的第三代迭代 |
| nv-ampere-a100-whitepaper | 同代竞品 | A100 与 MI100 同为 2020 年 7nm 数据中心 GPU,定义了 TC/Matrix Core 基线 |
| gpu-arch-comparison-2025 | 综合对比 | 将 CDNA 1 置于 AMD/NVIDIA 五年四代架构演进的起点 |
| 2510.27583 | 实测验证 | MI300X 实测暴露的频率降额问题可追溯至 CDNA 架构的 CU 功耗密度设计 |
2. 本篇 vs 相关论文的 Delta #
CDNA 1 的历史定位:AMD 首次将 GPU 从图形通用架构分化为计算专用(CDNA)和图形专用(RDNA),引入 Matrix Core Engine 和 MFMA 指令族 [amd-cdna1-whitepaper]。
vs A100 (同代竞品):
vs CDNA 2 (直接后继):
CDNA 1 独有贡献:
- 奠定了 AMD 计算 GPU 的基础架构范式:MFMA 指令族 + Wavefront 64 + 4-SIMD CU + LDS 64KB
- 这些基础架构选择一直延续至 CDNA 4 (gfx950)
3. 可攻击面 #
- 无 FP8/INT4 支持:CDNA 1 在 2020 年仅支持 FP32/FP16/BF16/INT8,而 A100 同期已提供 INT4 TC (1,248 TOPS) 和 2:4 稀疏 [nv-ampere-a100-whitepaper]。AMD 在低精度路线上落后整整一代。
- 仅 32GB 显存:MI100 的 32GB HBM2 在 LLM 时代来临前看似足够,但实际上严重限制了其在大模型推理中的生命周期。同期 A100 提供 80GB (2.5x)。
- MFMA 大矩阵形状的代价:CDNA 选择 16×16×4 等大 MMA 形状(vs NVIDIA 4×4×4),对大 GEMM 有利但小矩阵效率低 [amd-cdna1-whitepaper]。这一设计决策在推理时代(小 batch decode)成为劣势。
- 仅 4 个 ACE 限制并发:4 个异步计算引擎仅支持 4 个 concurrent stream [amd-cdna1-whitepaper],远不如 NVIDIA 的多 context 并行能力。
4. 生态位 #
CDNA 1 (MI100) 的生态位是 "AMD 计算 GPU 的概念验证":
- 证明了移除图形固定功能、专注计算的商业可行性
- 为 CDNA 2 驱动 Frontier Exascale 超算铺平道路
- 建立了 ROCm + HIP 生态的早期基础
采纳证据:MI100 主要部署在 HPC/科学计算场景(DOE 实验室、学术超算中心),未在 AI 训练领域获得显著采纳——2020 年 AI 训练市场被 A100 + CUDA 生态主导。
范式定位:CDNA 1 不是范式突破,而是范式跟随——跟随 NVIDIA V100/A100 定义的 "矩阵加速 + HBM + 高速互联" 数据中心 GPU 模板,但在执行细节上做了差异化选择(更大 MMA shape、Wavefront 64)。
5. 未探索方向 #
- MFMA shape 自适应:CDNA 1-4 始终使用固定大 shape MFMA。一个混合方案(大 shape 用于 prefill GEMM、小 shape 用于 decode attention)可能在同一代硬件上同时优化两种工作负载。
- 图形单元的选择性保留:CDNA 完全移除了图形单元,但视频编解码(VCN)保留了。若保留轻量光栅化单元用于 GPU 上的稀疏索引生成,可能为稀疏注意力提供硬件加速。
- 超越 4-ACE 的细粒度并发:Fleet [2604.15379] 后来通过持久化 megakernel 绕过了 kernel launch 限制,但硬件层面的更多 ACE 或硬件调度器增强可能从根本上解决并发瓶颈。