AMD vs NVIDIA GPU Architecture Comparison — L3 Cross-Paper Synthesis #
1. 相关论文 #
| Entity | 关系 | 理由 |
| amd-cdna4-whitepaper | 数据来源 | 提供 AMD 最新代 MI355X 的完整规格 |
| nv-blackwell-whitepaper | 数据来源 | 提供 NVIDIA 最新代 B200 的完整规格 |
| 2510.27583 | 实测验证 | 揭示 MI300X spec-vs-reality 差距的首要原因 |
| 2512.02189 | 实测验证 | 验证 Blackwell 微架构的实际性能达成率 |
| 2511.08083 | 软件验证 | HipKittens 证明 AMD 硬件可通过正确的 kernel 达到接近峰值 |
| 2604.15379 | 系统验证 | Fleet 证明 chiplet 架构通过正确抽象可释放性能 |
| 2511.02132 | 架构影响 | Chiplet NUMA 效应对 attention 性能的实测影响 |
2. 本篇 vs 相关论文的 Delta #
综合对比的核心发现:FP8 峰值算力已收敛(~5 PF),竞争焦点转向互联规模、能效比和软件生态 [gpu-arch-comparison-2025]。
Spec vs Reality 的关键差异:
- MI300X spec 领先 H100 (+32% FP8),但端到端仅达 37-66% of H100 [2510.27583]
- B200 FP4 达 96% peak (7,700 TFLOPS),高峰值利用率 [2512.02189]
- HipKittens 在 MI355X 达到 BF16 GEMM 1,610 TFLOPS (接近峰值) [2511.08083],证明 AMD 硬件在正确优化下可释放性能
对比文献的互补贡献:
- 本文是静态 spec 对比;2510.27583 填补了 "spec→实测" 的 gap
- 本文未覆盖软件优化;2511.08083 和 2604.15379 展示了 AMD 特有的优化路径
- 本文的 Ops:Byte 分析(表 4)被 2511.02132 的 NUMA 分析所深化——高 Ops:Byte 在 chiplet 上更严重(per-XCD HBM 带宽仅 0.66 TB/s)
矛盾与调和:
本文声称"MI300X 在 AI 性能上首次全面超越 H100" [gpu-arch-comparison-2025],但 2510.27583 的实测显示端到端推理仅达 H100 的 37-66% [2510.27583]。
矛盾根源:本文基于理论峰值(2100 MHz boost),实测论文发现持续负载频率降至 52-58% (1083-1217 MHz)。两者在各自前提下都正确——spec 对比有效展示硬件潜力,实测揭示了当前软硬件栈释放该潜力的程度。HipKittens [2511.08083] 的近峰值 GEMM 成绩表明,在正确的 kernel 优化下 AMD 硬件可接近理论值,差距主要在系统级软件栈成熟度。
3. 可攻击面 #
- 未包含端到端 workload benchmark:纯 spec 对比无法反映软件生态差距 [gpu-arch-comparison-2025]。NVIDIA 的 cuBLAS/cuDNN/TensorRT-LLM/NCCL 优化深度是 spec 表格无法量化的。
- Blackwell 规格基于技术简报估算:部分 B200 数据(如 SM 数、boost clock)为反推估算值 [gpu-arch-comparison-2025]。NVIDIA 未发布完整白皮书——某些微架构参数(如 TMEM 容量)仍未知。
- 忽略了 NVL72 vs 8-GPU 的质变:表格中"NVLink 域: 72 vs 8"看似 9x 差距,但实际影响是非线性的——NVL72 使 13.5TB 统一显存 + 130TB/s 内部带宽成为可能 [nv-blackwell-whitepaper],这是完全不同的计算范式。
- Ops:Byte 趋势分析未考虑 cache 层级:表中 Ops:Byte 使用 HBM 带宽计算,但 MI300X 的 256MB Infinity Cache 和 Blackwell 的 96MB L2 提供了显著的带宽放大 [amd-cdna3-whitepaper]。有效 Ops:Byte 在 cache 命中时大幅降低。
4. 生态位 #
本文的生态位是 "KB 内的硬件架构 baseline 参考":
- 为所有硬件相关分析提供统一的代际对比框架
- 量化了 AMD/NVIDIA 在各维度的领先/落后程度
- 识别了竞争焦点转移趋势(算力→系统架构→软件)
参考价值:作为内部综合分析(非外部论文),其价值在于将 7 份独立白皮书的数据统一到同一对比框架中,避免了每次讨论都需要从头查阅各白皮书。
5. 未探索方向 #
- TCO (Total Cost of Ownership) 对比:硬件 spec 之外,每 token 成本、每 PFLOPS/$ 投入、部署时间线等 TCO 维度才是采购决策的关键。一个包含电费、冷却、机架密度、运维人力的 TCO 模型可能改变 spec 对比的结论。
- 动态工作负载下的性能对比:现有对比都是静态峰值。实际 AI 部署中的动态负载(prefill/decode 交替、bursty request、多租户混合)下两种架构的表现差异可能与稳态不同。
- 可编程性-性能的 Pareto 前沿:AMD 需要 HipKittens 级别的深度优化才能接近峰值 [2511.08083],而 NVIDIA 的 cuBLAS 开箱即用达到 ~90%。将"达到 X% 峰值所需的工程投入"纳入对比可能更真实地反映两个平台的实际可用性。