hardware Survey

10 papers

Hardware 品类综述:数据中心 GPU 架构演进 (2020–2025) #

1. 现状快照 #

2025 年数据中心 GPU 进入 AMD CDNA 4 (MI355X) vs NVIDIA Blackwell (B200) 正面对决时代。双方 FP8 峰值算力已基本持平(~5 PFLOPS),竞争焦点从纯算力转向互联规模、显存容量、能效比和软件生态的全栈博弈 [gpu-arch-comparison-2025]。AMD 凭借 chiplet 封装路线和 288 GB 显存在推理市场崛起;NVIDIA 凭借 NVLink5 + NVL72 机架级互联和 CUDA 全栈生态在训练市场保持系统性优势 [nv-blackwell-whitepaper]。精度格式已下探至 FP4/MXFP4,两家均提供硬件原生 4-bit 浮点支持 [amd-cdna4-whitepaper] [nv-blackwell-whitepaper]


2. Taxonomy #

三个正交维度组织全部 10 篇论文/白皮书:

维度 A:文档类型 — 官方白皮书 vs 独立实测 #

类型论文特征
厂商白皮书amd-cdna1, amd-cdna2, amd-cdna3, amd-cdna4, nv-ampere-a100, nv-hopper-h100, nv-blackwell理论峰值、架构设计意图、ISA 变更
独立实测2510.27583, 2512.02189实际利用率、微架构参数逆向、端到端 workload 性能
跨厂商对比综合gpu-arch-comparison-2025基于多份白皮书的系统性横向分析

维度 B:厂商 × 架构代际 #

代际AMDNVIDIA年份
Gen 1 (奠基)CDNA 1 / MI100 [amd-cdna1-whitepaper]Ampere / A100 [nv-ampere-a100-whitepaper]2020
Gen 2 (扩展)CDNA 2 / MI250X [amd-cdna2-whitepaper]Hopper / H100 [nv-hopper-h100-whitepaper]2021–2022
Gen 3 (FP8)CDNA 3 / MI300X [amd-cdna3-whitepaper]2023–2024
Gen 4 (FP4/MX)CDNA 4 / MI355X [amd-cdna4-whitepaper]Blackwell / B200 [nv-blackwell-whitepaper]2024–2025

维度 C:关注层面 — 计算 vs 互联 vs 内存 vs 软件 #

关注层面主要论文
计算架构与 Tensor/Matrix Coreamd-cdna1, amd-cdna2, amd-cdna3, amd-cdna4, nv-ampere-a100, nv-hopper-h100, nv-blackwell, 2512.02189
互联与规模化nv-hopper-h100 (NVLink Switch 256-GPU), nv-blackwell (NVL72), amd-cdna4 (IF mesh), 2510.27583 (RCCL vs NCCL)
内存层次与带宽2510.27583 (MI300X HBM 实测), 2512.02189 (TMEM 实测), amd-cdna3 (Infinity Cache), nv-blackwell (96 MB L2)
软件栈与实际利用率2510.27583 (hipBLASLt 效率 80–85%), 2512.02189 (PTX 微基准方法论), gpu-arch-comparison-2025 (生态对比)

3. 主线与分支 #

主线 1:AMD CDNA 架构代际演进 #

CDNA 1 (MI100, 2020):7nm 单 die,120 CU,首次引入 Matrix Core Engine 和 MFMA 指令族,将 GPU 从图形通用架构分化为计算专用架构(移除所有图形固定功能单元),FP16 Matrix 184.6 TFLOPS,32 GB HBM2 (1.23 TB/s) [amd-cdna1-whitepaper] [amd-cdna1-whitepaper]

CDNA 2 (MI250X, 2021):7nm MCM 双 GCD 封装,220 CU,新增 FP64 Matrix Core(95.7 TFLOPS),128 GB HBM2e (3.2 TB/s),封装内 400 GB/s 双向互联实现近线性扩展,驱动 Frontier——全球首台 Exascale 超算 [amd-cdna2-whitepaper] [amd-cdna2-whitepaper]

CDNA 3 (MI300X/MI325X, 2023–2024):5nm+6nm chiplet 3D 堆叠(8 XCD + 4 IOD),304 CU,首次支持 FP8 (OCP E4M3/E5M2) 和 TF32,FP8 达 2,615 TFLOPS,192–256 GB HBM3/3E,256 MB Infinity Cache 提供 17.2 TB/s 带宽放大 [amd-cdna3-whitepaper]。单 XCD 仅 0.66 TB/s HBM 带宽,数据局部性至关重要 [amd-cdna3-whitepaper]

CDNA 4 (MI355X, 2025):3nm+6nm chiplet(8 XCD + 2 IOD),256 CU(per-CU 矩阵吞吐翻倍),FP8 达 5.0 PFLOPS,MXFP4/MXFP6 达 10 PFLOPS,LDS 扩容至 160 KB/CU (2.5x),288 GB HBM3E (8.0 TB/s)。大胆移除 TF32 硬件并将 FP64 Matrix 减半,标志 AI 优先的明确转向 [amd-cdna4-whitepaper] [amd-cdna4-whitepaper]

主线 2:NVIDIA 架构代际演进 #

Ampere (A100, 2020):7nm 单 die 826mm²,108 SM,第三代 Tensor Core 引入 TF32 和 FP64 TC,首创 2:4 结构化稀疏和 MIG 多实例 GPU,FP16 TC 312 TFLOPS,80 GB HBM2e (2.04 TB/s),40 MB L2 [nv-ampere-a100-whitepaper]

Hopper (H100, 2022):4N 定制工艺 814mm²,132 SM,第四代 TC 引入 FP8 + Transformer Engine 自动精度管理,TMA 硬件 tensor 搬运,Thread Block Clusters + DSMEM 跨 SM 协作,FP8 达 1,979 TFLOPS,80 GB HBM3 (3.35 TB/s),NVLink 4 900 GB/s + NVLink Switch 256-GPU 域 [nv-hopper-h100-whitepaper]

Blackwell (B200, 2024–2025):4NP 双 die 统一 GPU(NV-HBI 10 TB/s),208B 晶体管,第五代 TC 支持 FP4 + NVFP4 两级微缩放 + TMEM 新存储层次,FP4 达 9,000 TFLOPS,192 GB HBM3e (8.0 TB/s),NVLink5 1.8 TB/s + NVL72 机架级 72-GPU 域 (130 TB/s) [nv-blackwell-whitepaper]

分支 1:独立微架构实测 #

2510.27583 (MI300X 实测) 和 2512.02189 (Blackwell 微基准) 构成了独立验证层——将厂商白皮书的理论声明转化为实测数据。MI300X 仅达理论峰值的 45% [2510.27583],Blackwell 达 96–99% [2512.02189],揭示了理论 spec 与实际性能的巨大差异。

分支 2:跨厂商对比综合 #

gpu-arch-comparison-2025 系统性汇总了四代架构的演进轨迹,提炼出 Ops:Byte 攀升趋势、封装哲学分歧、精度下探路径等宏观洞见 [gpu-arch-comparison-2025]


4. 跨论文对比表 #

4.1 旗舰 GPU 核心指标对比 #

GPU年份工艺CU/SMFP16 TC (TF)FP8 TC (TF)FP4/MXFP4 (TF)HBM (GB)BW (TB/s)互联 BWTDP (W)FP8 利用率代码开源可复现性
MI100 (CDNA 1)20207nm120 CU184.632 HBM21.233×IF300未报告部分 (ROCm)部分
A100 (Ampere)20207nm108 SM31280 HBM2e2.04600 GB/s NVLink400未报告未公开部分
MI250X (CDNA 2)20217nm220 CU383128 HBM2e3.2800 GB/s IF500未报告部分 (ROCm)部分
H100 (Hopper)20224N132 SM989.41,97980 HBM33.35900 GB/s NVLink700~93% [2510.27583]未公开部分
MI300X (CDNA 3)20235nm+6nm304 CU1,3072,615192 HBM35.3896 GB/s IF75045% [2510.27583]部分 (ROCm)可复现
MI325X (CDNA 3)20245nm+6nm304 CU1,3072,615256 HBM3E6.0896 GB/s IF未报告未报告部分 (ROCm)部分
B200 (Blackwell)20244NP144 SM2,2504,5009,000192 HBM3e8.01,800 GB/s NVLink51,00096–99% [2512.02189]未公开可复现
MI355X (CDNA 4)20253nm+6nm256 CU2,5165,03310,066288 HBM3E8.01,075 GB/s IF1,400未报告部分 (ROCm)不可

:"代码开源"指硬件驱动/kernel 库的开源程度(AMD ROCm 为开源,NVIDIA CUDA 为闭源);"可复现性"指独立第三方能否复现白皮书/论文中的性能声明。2510.27583 和 2512.02189 为可复现的独立实测。MI355X 尚未有独立实测数据,标为"不可"。

4.2 Ops:Byte 比率演进 #

GPUFP16 Ops:ByteFP8 Ops:ByteMXFP4 Ops:Byte含义
MI100150大部分 GEMM compute-bound
A100153类似 MI100
H100295591Memory-bound 阈值大幅提高
MI300X247493略低于 H100,decode 更友好
MI355X3156291,258极端 compute-bound 阈值
B2002815631,125与 MI355X 接近

[gpu-arch-comparison-2025] [amd-cdna4-whitepaper] [nv-blackwell-whitepaper]


5. Strength-weakness matrix #

论文/白皮书StrengthWeaknessBest-for
amd-cdna1-whitepaper首次 CDNA/RDNA 分化,MFMA 指令族奠基无 FP8,32 GB 显存过小,无稀疏理解 AMD 计算 GPU 架构起点
amd-cdna2-whitepaperMCM 双 GCD 首创,FP64 Matrix 95.7 TF 领先,驱动 Frontier仍 7nm,无 FP8,双 GCD 编程模型额外复杂HPC FP64 密集工作负载,Exascale 系统设计参考
amd-cdna3-whitepaper革命性 chiplet 3D 堆叠,192–256 GB 显存,FP8 + Infinity Cache跨 XCD 通信延迟高,LDS 仅 64 KB,无 Transformer EngineLLM 推理(显存容量优势),chiplet 架构研究
amd-cdna4-whitepaperMXFP6 独有精度,LDS 160 KB,288 GB 显存,5 PF FP8FP64 减半,TF32 移除,互联落后 NVLink5 67%,TDP 1,400W大模型推理(显存+MXFP4/6),AI 优先场景
nv-ampere-a100-whitepaperTF32 零改动加速,MIG 多实例,2:4 稀疏首发,40 MB L280 GB 显存对 LLM 不足,INT4 TC 实用性低定义数据中心 GPU 标准,训推一体部署
nv-hopper-h100-whitepaperFP8 + Transformer Engine 自动化,TMA 硬件搬运,NVLink Switch 256-GPU80 GB 显存瓶颈(催生 H200),700W 液冷需求LLM 训练基础设施主力,FP8 生态推动
nv-blackwell-whitepaper双 Die NV-HBI 突破光刻极限,NVL72 机架级域,FP4 + TMEM技术简报缺完整微架构参数,1,000W TDP,NVL72 部署门槛高万亿参数 MoE 推理/训练,机架级系统设计
2510.27583首个系统性 MI300X 多维度实测,频率-效率分离方法论精妙仅 Llama 70B 一个模型,AMD/NV 框架不对等(vLLM vs TRT-LLM)GPU 采购决策,AMD 软件栈优化目标量化
2512.02189首篇 Blackwell PTX 微基准,TMEM/tcgen05/FP4 微架构参数实测单 GPU 测量未覆盖 dual-die NUMA,CUDA 13.0 preliminaryKernel 优化指导,模拟器参数输入,Blackwell 迁移规划
gpu-arch-comparison-2025四代架构系统性横向对比,Ops:Byte 趋势提炼Blackwell 部分规格为估算,未含实际 workload benchmark架构选型宏观决策,技术趋势追踪

6. 核心 trade-off 轴 #

6.1 算力 vs 带宽(Ops:Byte 持续攀升) #

Ops:Byte 从 A100 的 153 (FP16) 攀升到 MI355X/B200 的 ~315/281 (FP16) 和 629/563 (FP8),MXFP4 更高达 1,258 [gpu-arch-comparison-2025] [amd-cdna4-whitepaper]。除大矩阵 GEMM(M≥1,258 for MXFP4),几乎所有操作 memory-bound [nv-blackwell-whitepaper]FP4 的真正价值不在峰值 TFLOPS,而在用更少 bit 传输相同语义信息——8 TB/s 带宽可传输 2x FP4 元素 vs FP8 [nv-blackwell-whitepaper]

6.2 理论峰值 vs 实际利用率 #

MI300X 理论 FP8 2,615 TFLOPS 但实际仅达 45%(~1,180 TFLOPS),H100/B200 达 93–96% [2510.27583]。频率-效率分离实验量化原因:运行频率从 2,100 MHz 降至 ~1,200 MHz(~42% 降频)× 软件效率 80–85% ≈ 47% [2510.27583]。Blackwell 所有精度 96–99% 理论峰值利用率 [2512.02189]。差距根因是软件栈成熟度而非硬件设计 [2510.27583]

6.3 显存容量 vs 互联带宽 #

AMD 每代提供更大显存:MI355X 288 GB vs B200 192 GB (+50%) [gpu-arch-comparison-2025]。NVIDIA 以 NVL72 的 13.5 TB 聚合显存回应 [nv-blackwell-whitepaper]。单卡推理 AMD 288 GB 可容纳 ~400B FP8 模型 [amd-cdna4-whitepaper];大规模训练 NVLink5 (1.8 TB/s) + NVL72 (130 TB/s) 是 IF (1,075 GB/s, 8-GPU 域) 无法匹配的 [amd-cdna4-whitepaper]

6.4 AI 算力 vs HPC 性能 #

CDNA 4 将 FP64 Matrix 从 163.4 TF 削减至 78.6 TF(减半),移除 TF32 硬件 [amd-cdna4-whitepaper]。Blackwell FP64 仅 37 TF(可能已移除 FP64 TC)[nv-blackwell-whitepaper]。两家都在用 HPC 性能换 AI 算力。AMD FP64 起点更高,减半后仍保持 78.6 TF [gpu-arch-comparison-2025]

6.5 功耗与能效 #

TDP 从 A100 400W → H100 700W → B200 1,000W / MI355X 1,400W。FP8 能效:B200 4.50 TFLOPS/W vs MI355X 3.60 TFLOPS/W,NVIDIA 领先 25% [amd-cdna4-whitepaper] [nv-blackwell-whitepaper]。MI350X 风冷版 1,000W 下 FP8 4.61 TFLOPS/W 反优于 MI355X 液冷版——额外 400W 仅换 ~9% 性能 [amd-cdna4-whitepaper]。B200 训练能效比 H200 提升 42%(22.2 vs 15.6 tok/s/W)[2512.02189]

6.6 FP32 Accumulator 精度 vs 吞吐 #

Blackwell FP32 accumulator 使 Tensor Core 吞吐减半(FP16→FP16 为 964.8 TFLOPS,FP16→FP32 仅 482.4 TFLOPS),accumulator datapath 是吞吐瓶颈而非乘法单元 [2512.02189]。推理用 FP16 accumulator、训练用 FP32 accumulator 是硬件决定的最佳实践——2x 差距无法通过软件绕过。


7. 冲突与调和 #

7.1 MI300X 理论优势 vs 实际性能倒挂 #

MI300X FP8 理论峰值领先 H100 32%(2,615 vs 1,979 TFLOPS)[amd-cdna3-whitepaper],但端到端 Llama 70B FP8 推理仅达 H100 的 37–66% [2510.27583]

矛盾根源:白皮书报告理论峰值(boost clock × CU × ops/clk),而实测揭示 (1) MI300X 运行时频率降至 boost clock 的 52–58%(功耗管理限制),(2) hipBLASLt 软件效率仅 80–85%。两个因素相乘 0.58×0.82≈0.48,解释了 45% 利用率 [2510.27583]。NVIDIA 不存在类似降频问题(实测频率接近 boost clock),且 cuBLASLt 优化深度远超 hipBLASLt [2510.27583]

反直觉结论:MI300X 上 FP16 推理可能优于 FP8,因 FP16 更大 memory footprint 恰好落在 MI300X 高带宽区间 [2510.27583]。这与 NVIDIA 平台上 FP8 总是优于 FP16 的经验相矛盾,根因是 MI300X 在小 array size(<64 MiB)下 memory bandwidth 低于 H100 [2510.27583]

7.2 Chiplet vs Dual-Die 封装路线之争 #

AMD chiplet 路线的跨 XCD 通信需经过 IOD,大矩阵尺寸下 MI300X 出现性能回落(利用率从 50% 降至 ~40%)[2510.27583]。NVIDIA 双 die 方案(NV-HBI 10 TB/s)对软件完全透明 [nv-blackwell-whitepaper]

矛盾根源:两者在解决同一个问题(光刻极限下如何继续扩大芯片规模),但工程取舍不同 [gpu-arch-comparison-2025]。AMD 优先良率和工艺独立演进(计算 die 3nm,IO die 6nm),代价是跨 die 通信延迟;NVIDIA 优先 die 内通信性能和软件透明性,代价是封装复杂度和成本。CDNA 4 将 IOD 从 4→2 减少了跨 IOD 跳数约 14% [amd-cdna4-whitepaper],但未消除根本的 NUMA 效应。Blackwell 的 dual-die NUMA 效应也未被系统量化 [2512.02189]

7.3 精度格式标准化之争 #

NVIDIA NVFP4(16 元素 E4M3 scale + 全 tensor FP32 scale)vs OCP MXFP4(32 元素 power-of-2 scale)[nv-blackwell-whitepaper]。AMD 完全拥抱 OCP MX 标准 [amd-cdna4-whitepaper]

矛盾根源:NVIDIA 认为 16 元素微块 + 两级缩放精度更高(fine-grained),适合保持 LLM 推理质量;OCP 标准偏向互操作性和生态统一(32 元素,simpler)。MXFP6 是 AMD 独有中间精度,与 MXFP4 共享 10 PF 吞吐但提供 50% 更多尾数位 [amd-cdna4-whitepaper],NVIDIA 无等价格式。行业标准尚未收敛。

7.4 Blackwell 微基准 vs 白皮书参数差异 #

2512.02189 实测 B200 FP4 达 7,702.5 TFLOPS(96.3% 峰值),而白皮书标 9,000 TFLOPS [2512.02189] [nv-blackwell-whitepaper]

矛盾根源:白皮书标注的是全 GPU 160 SM(包含 disabled SM)的理论值,而 B200 产品仅启用 144 SM。微基准使用的是单 SM 吞吐外推到 148 SM 的结果(论文配置),与产品 144 SM 配置进一步差异。两者在各自假设下都正确 [2512.02189]


8. Gaps #

以下为"没人做但技术上可做"的空白(根本性困难留给 L4/topic):

  1. MI355X 独立第三方实测:CDNA 4 已发布但缺乏 2510.27583 级别的系统性多维度实测。MI300X 的 45% 利用率教训 [2510.27583] 在 MI355X 上能否改善,需要 MXFP kernel + ROCm 新版本的端到端验证。
    1. Blackwell dual-die NUMA 效应量化:所有微基准在单 SM 或单 die 上测量,NV-HBI 跨 die 通信对实际 LLM workload 的延迟/吞吐影响未被系统量化 [2512.02189]。技术上可通过设计跨 die 数据访问的微基准实现。
      1. FP4 per-layer 精度退化分布:FP4 perplexity +7.7–9.1% 是模型级平均值 [2512.02189],per-layer 退化分布未分析。技术上可通过 layer-wise sensitivity analysis 实现,指导 mixed-precision 策略(哪些层用 FP4,哪些需 FP8)。
        1. MXFP6 端到端 LLM 推理验证:MXFP6 理论上是严格最优点(同 MXFP4 吞吐 + 更高精度)[amd-cdna4-whitepaper],但缺乏精度-性能 benchmark 和与 NVFP4 的正面对比。
          1. FP6 软件生态:Blackwell 硬件支持 FP6 但缺乏软件工具链 [2512.02189],AMD 有 MXFP6 ISA 支持 [amd-cdna4-whitepaper]——两家 6-bit 格式实际可用性均待验证。
            1. MoE 和长上下文推理场景的架构适配:端到端评测仅覆盖 Llama 70B dense 模型 [2510.27583],MoE expert 并行和 >32K 上下文场景对不同架构(NVL72 vs 8-GPU IF mesh)的偏好未系统研究。
              1. 跨节点 AMD GPU 直联方案:AMD 缺乏 NVL72 等价的 GPU-to-GPU switch fabric [amd-cdna4-whitepaper]。技术上 Infinity Fabric Switch 是可行方向,但未见公开产品路线图。
                1. MI300X 与 MI355X 的功耗-TCO 量化:2510.27583 未量化 power/TCO 差异 [2510.27583],而 MI355X 1,400W vs B200 1,000W 在大规模部署中对 TCO 影响显著。

                2. 9. Practical recommendation #

                  场景 1:单卡 LLM 推理(70B–400B 参数) #

                  选 MI355X,因 288 GB HBM3E 可单卡容纳 ~400B FP8 模型或 ~800B MXFP4 模型 [amd-cdna4-whitepaper]。B200 的 192 GB 在 >200B 模型时需多卡。MXFP6 提供比 MXFP4 更好的精度-性能折中 [amd-cdna4-whitepaper]前提:需验证 MI355X 实际利用率是否已改善(MI300X 的 45% 教训 [2510.27583])。

                  场景 2:大规模分布式训练(>100 GPU) #

                  选 NVIDIA Blackwell (NVL72),因 NVLink5 (1.8 TB/s) + NVL72 (72-GPU 域 130 TB/s) 提供 AMD 无法匹配的互联规模 [nv-blackwell-whitepaper]。Tensor parallelism 可扩展至 72-way,expert parallelism 在 NVLink 域内完成 All-to-All 通信 [nv-blackwell-whitepaper]。Transformer Engine 自动化 FP8 混合精度降低用户负担 [nv-hopper-h100-whitepaper]

                  场景 3:Memory-bound decode 推理(长输出、大 batch) #

                  MI300X/MI325X 可能是性价比之选(如果 AMD 硬件采购价更低)。MI300X 在 decode-dominated 场景可达 H100 的 66–80% [2510.27583],结合 192–256 GB 显存和更大 HBM 绝对带宽(实测 4.3 TB/s vs H100 的 3.0 TB/s)[2510.27583],TCO 优势可能弥补性能差距。注意使用 FP16 而非 FP8 [2510.27583]

                  场景 4:HPC 科学计算(FP64 密集) #

                  选 MI300X (CDNA 3),其 FP64 Matrix 163.4 TFLOPS 大幅领先 B200 的 37 TFLOPS (4.4x) [amd-cdna3-whitepaper] [nv-blackwell-whitepaper]。CDNA 4 已将 FP64 减半至 78.6 TF [amd-cdna4-whitepaper],CDNA 3 仍是 FP64 王者。Frontier 超算验证了 MI250X 的 HPC 可行性 [amd-cdna2-whitepaper]

                  场景 5:多租户推理服务(云 GPU 切分) #

                  选 NVIDIA A100/H100,因 MIG 提供硬件级 GPU 分区隔离(最多 7 实例),每实例独立 SM、L2、显存 [nv-ampere-a100-whitepaper]。AMD CPX 模式支持最多 8 分区 [amd-cdna4-whitepaper],但 MIG 的软件生态更成熟。H100 Secure MIG 还支持机密计算 [nv-hopper-h100-whitepaper]

                  场景 6:预算有限、需要最大模型容量 #

                  选 MI325X (CDNA 3),256 GB HBM3E + 成熟的 ROCm/vLLM 支持 [amd-cdna3-whitepaper],在 CDNA 4 实际利用率尚未验证前是更安全的 AMD 选择。


                  10. 参考 #

                  ID标题类型关键贡献
                  amd-cdna1-whitepaperAMD CDNA Architecture White Paper白皮书首个计算专用 GPU 架构,Matrix Core + MFMA 指令族
                  amd-cdna2-whitepaperAMD CDNA 2 Architecture White Paper白皮书MCM 双 GCD 封装,FP64 Matrix Core,驱动 Frontier Exascale
                  amd-cdna3-whitepaperAMD CDNA 3 Architecture White Paper白皮书Chiplet 3D 堆叠,FP8/TF32,Infinity Cache,192–256 GB HBM3/3E
                  amd-cdna4-whitepaperAMD CDNA 4 Architecture White Paper白皮书MXFP8/6/4,per-CU 矩阵翻倍,LDS 160 KB,288 GB HBM3E
                  nv-ampere-a100-whitepaperNVIDIA A100 Tensor Core GPU White Paper白皮书TF32 + MIG + 2:4 稀疏,奠定数据中心 GPU 标准
                  nv-hopper-h100-whitepaperNVIDIA H100 Tensor Core GPU White Paper白皮书FP8 + Transformer Engine + TMA + NVLink Switch 256-GPU 域
                  nv-blackwell-whitepaperNVIDIA Blackwell Architecture Technical Brief白皮书双 Die NV-HBI + FP4/NVFP4 + TMEM + NVL72 机架级互联
                  2510.27583AMD MI300X GPU Performance Analysis独立实测MI300X 多维度实测:45% 利用率,频率-效率分离方法论
                  2512.02189Microbenchmarking NVIDIA's Blackwell Architecture独立实测Blackwell PTX 微基准:TMEM/tcgen05/FP4 微架构参数实测
                  gpu-arch-comparison-2025AMD vs NVIDIA 数据中心 GPU 架构全面对比综合对比四代架构横向对比,Ops:Byte 趋势,竞争格局判断

Papers in hardware (10)

2510.27583 · Synthesis
2512.02189 · Synthesis
gpu-arch-comparison-2025 · Synthesis
amd-cdna4-whitepaper · Synthesis
nv-blackwell-whitepaper · Synthesis
amd-cdna3-whitepaper · Synthesis
nv-hopper-h100-whitepaper · Synthesis
amd-cdna2-whitepaper · Synthesis
amd-cdna1-whitepaper · Synthesis
nv-ampere-a100-whitepaper · Synthesis