AMD, NVIDIA | 2020-2025 | White Papers Comparison Study Category: hardware | Tags: gpu-architecture, cdna, ampere, hopper, blackwell, comparison Read: 2026-04-16
基于7份官方白皮书的深度解读,系统性对比AMD CDNA 1/2/3/4与NVIDIA Ampere/Hopper/Blackwell四代数据中心GPU架构的演进路径、技术取舍与竞争格局。
本研究覆盖了2020-2025年间AMD和NVIDIA数据中心GPU架构的完整演进。AMD从CDNA 1(MI100)的单die Matrix Core架构,经CDNA 2(MI250X)的MCM双GCD封装驱动Frontier Exascale超算,到CDNA 3(MI300X)的革命性chiplet 3D堆叠,再到CDNA 4(MI355X)的MXFP微缩放格式全面拥抱。NVIDIA则从Ampere(A100)的TF32/MIG/Sparsity奠基,经Hopper(H100)的FP8+Transformer Engine突破,到Blackwell(B200)的双Die+FP4+NVL72机架级互联。
在最新一代,双方FP8峰值算力已基本持平(~5 PFLOPS)。AMD凭借chiplet架构和更大显存(288 vs 192GB)在LLM推理场景崛起为强有力竞争者。NVIDIA则在NVLink生态(1.8TB/s per GPU, 72-GPU域)和软件栈成熟度上保持系统性优势。竞争焦点正从纯算力转向互联规模、能效比和软件生态。
| 指标 | CDNA 1 MI100 | CDNA 2 MI250X | CDNA 3 MI300X | CDNA 3 MI325X | CDNA 4 MI355X |
|---|---|---|---|---|---|
| 年份 | 2020 | 2021 | 2023 | 2024 | 2025 |
| 工艺 | 7nm | 7nm | 5nm+6nm | 5nm+6nm | 3nm+6nm |
| CU数 | 120 | 220 | 304 | 304 | 256 |
| FP16 Matrix TF | 184.6 | 383 | 1,307 | 1,307 | 2,516 |
| FP8 Matrix TF | - | - | 2,615 | 2,615 | 5,033 |
| 显存 GB | 32 | 128 | 192 | 256 | 288 |
| 带宽 TB/s | 1.23 | 3.2 | 5.3 | 6.0 | 8.0 |
| 指标 | Ampere A100 | Hopper H100 | Blackwell B200 |
|---|---|---|---|
| 年份 | 2020 | 2022 | 2024 |
| 工艺 | 7nm | 4N | 4NP |
| SM数 | 108 | 132 | ~192 |
| FP16 TC TF | 312 | 989.4 | ~2,500 |
| FP8 TC TF | - | 1,978.9 | ~5,000 |
| 显存 GB | 80 | 80 | 192 |
| 带宽 TB/s | 2.04 | 3.35 | 8.0 |
| 指标 | AMD MI355X | NVIDIA B200 | 优势方 |
|---|---|---|---|
| FP8 TC | 5.0 PF | ~5.0 PF | 平局 |
| FP4/MXFP4 | 10 PF | ~10 PF | 平局 |
| 显存 | 288 GB | 192 GB | AMD +50% |
| 带宽 | 8.0 TB/s | 8.0 TB/s | 平局 |
| GPU互联 | 1,075 GB/s | 1,800 GB/s | NV +67% |
| NVLink域 | 8 GPU | 72 GPU | NV 9x |
| TDP | 1,400W | 1,000W | NV |
AMD选择chiplet异构集成(8个小XCD + 2个IOD 3D堆叠),优势是良率高、工艺可独立演进(计算die用最新3nm,IO die用成熟6nm)。NVIDIA选择双die统一GPU(NV-HBI 10TB/s连接两个接近光刻极限的大die),优势是die内通信延迟低、编程模型透明。两种路径都在解决同一个问题:如何在光刻极限下继续扩大芯片规模。
AMD: FP32/FP16/BF16/INT8 → +FP64 Matrix → +FP8/TF32/Sparsity → +MXFP8/6/4(移除TF32硬件)
NV: FP16/INT8 → +TF32/FP64 TC/BF16/Sparsity → +FP8/TE → +FP4/MX/2nd TE
NVIDIA始终领先1代引入新数据类型。AMD在CDNA4做了大胆取舍:砍FP64 Matrix换AI性能。
NVIDIA系统性优势:NVLink5(1.8TB/s vs AMD 1.075TB/s)、NVSwitch(节点内全互联)、NVL72(72-GPU机架级域130TB/s)、NVLink Switch System(跨节点256 GPU)。AMD在节点内8-GPU全互联做得不错,但缺乏跨节点GPU直联方案。
| GPU | FP16 TOPS | BW TB/s | Ops:Byte | FP8 TOPS | Ops:Byte |
|---|---|---|---|---|---|
| MI100 | 184.6 | 1.23 | 150 | - | - |
| A100 | 312 | 2.04 | 153 | - | - |
| H100 | 989.4 | 3.35 | 295 | 1,979 | 590 |
| MI300X | 1,307 | 5.3 | 247 | 2,615 | 493 |
| MI355X | 2,516 | 8.0 | 315 | 5,033 | 629 |
| B200 | ~2,500 | 8.0 | ~313 | ~5,000 | ~625 |
Ops:Byte持续攀升意味着更多workload变memory-bound。
推理市场: AMD凭显存容量优势已建立竞争力
训练市场: NVIDIA的NVLink/NVSwitch生态+软件栈仍具系统性优势
竞争焦点: 从纯算力转向互联规模、能效比、软件生态的全栈竞争