NVIDIA Blackwell 架构

NVIDIA GB300 NVL72

新一代 AI 超级计算平台

72 颗 Blackwell Ultra GPU(B300)通过第五代 NVLink 全互联,为万亿参数大模型训练与推理提供前所未有的算力密度。

了解更多

核心数据一览

0
GPU
Blackwell Ultra(B300)
0
NVLink
第五代 NVLink 总带宽
0
Fast Memory
20 TB HBM3e + 17 TB LPDDR5X
0
FP4
Tensor Core(稀疏)

产品总览

GB300 NVL72 是 NVIDIA 面向超大规模 AI 工作负载打造的液冷机架级系统。它将 72 颗 Blackwell Ultra GPU(B300)、 36 颗 Grace CPU 与 NVLink 交换架构整合在单一 NVIDIA MGX 48RU 机架内,实现前所未有的计算密度。

360° 交互式机架展示

拖拽旋转 · 滚轮缩放 · 点击探索每一个组件

GB300 NVL72 预览
3D 模型即将加载
0%
准备加载…

模型加载失败

拖拽旋转|滚轮缩放|双击重置
鼠标拖拽旋转 · 滚轮缩放 · 双击重置视角

核心组件

每个模块都经过精心设计,共同构成强大的 AI 计算平台

Compute Tray

Compute Tray

每个计算托盘集成 2 颗 Blackwell Ultra GPU(B300)与 1 颗 Grace CPU,提供高密度计算与内存带宽。

NVLink Switch Tray

NVLink Switch Tray

NVLink 交换托盘实现 72 GPU 全互联,提供 130 TB/s 双向带宽,消除 GPU 间通信瓶颈。

Power Shelf

Power Shelf

冗余电源模块,配备 6 或 8 个 33 kW Power Shelf,为整个机架提供稳定、高效的电力供应,支持热插拔维护。

SN2201 管理交换机

SN2201 管理交换机

NVIDIA Spectrum 管理交换机负责集群内网络管理、监控带外通信与系统编排。

技术亮点

GB300 全液冷散热架构
01

全液冷架构

采用直接液冷(DLC)技术,冷却液直达 GPU 与 CPU 芯片表面。相较传统风冷,液冷方案 将散热效率提升 4 倍以上,同时大幅降低数据中心 PUE,使 GB300 NVL72 能够在单一 机架内释放卓越的计算功率。

NVLink Switch Tray
02

第五代 NVLink

第五代 NVLink 技术将单 GPU 带宽提升至 1.8 TB/s(双向),72 GPU 总带宽高达 130 TB/s。结合 NVLink Switch 全互联拓扑,任意两颗 GPU 之间都可以最大带宽直接通信, 彻底消除大规模并行训练的通信瓶颈。

Grace CPU + Blackwell GPU 晶片板
03

Grace CPU

NVIDIA Grace CPU 采用 Arm Neoverse V2 架构,36 颗 Grace CPU 共计 2,592 个高性能核心与 LPDDR5X 内存,整机提供 17 TB CPU 内存容量。Grace 与 Blackwell GPU 通过 NVLink-C2C 高速互联,CPU-GPU 间数据搬运延迟极低。

技术规格

规格项目 ASUS XA GB721-E2 / NVIDIA GB300 NVL72
GPU 72 × NVIDIA Blackwell Ultra GPU(B300)
CPU 36 × NVIDIA Grace CPU,2,592 Arm Neoverse V2 核心
GPU 显存 20 TB HBM3e(288 GB/GPU)
CPU 内存 17 TB LPDDR5X
Fast Memory 37 TB(GPU HBM3e + CPU LPDDR5X)
GPU 显存带宽 最高 576 TB/s(整机)
NVLink 第五代 NVIDIA NVLink,130 TB/s
单 GPU NVLink 1.8 TB/s
FP4 Tensor Core 1,440 PFLOPS(稀疏)/ 1,080 PFLOPS(稠密)
FP8/FP6 Tensor Core 720 PFLOPS
计算 Tray 18 × Compute Tray
NVLink Switch Tray 9 × NVLink Switch Tray
Power Shelf 6 或 8 × 33 kW
散热 Rack-scale 液冷
机架 NVIDIA MGX 48RU Rack

权威测试验证体系

每台 GB300 NVL72 出厂前均需通过完整的硬件诊断与性能压测,确保 AI 生产环境零故障运行

NVIDIA PD 压测报告

NVIDIA FieldDiag(PD 全项测试)

测试目的

覆盖 GPU 连通性验证、显存完整性检测、NVLink 链路质量评估、电源稳定性测试等 20+ 项硬件诊断。EyeGrade 测试模拟高速信号传输的眼图质量,ThetaBgStart/Stop 验证满载温度控制能力。

AI 业务关联

PD 压测中的 EyeGrade/Theta 场景直接模拟大语言模型(LLM)推理时的显存高频访问模式,确保 72 颗 GPU 在持续高负载下无隐性故障。

DCGMi diag(-r 4 全项诊断)

NVIDIA DCGM(Data Center GPU Manager)

测试目的

Level 4 全面诊断覆盖 GPU 计算单元完整性、显存 ECC 错误检测、NVLink 连通性与带宽验证、PCIe 链路稳定性、电源管理响应等。

AI 业务关联

任何一项不通过都可能导致分布式训练中的"慢节点"问题——单卡故障拖慢整个训练集群,直接影响模型收敛时间和训练成本。

NCCL-tests(All Reduce 带宽)

NVIDIA NCCL(集合通信库)性能基准测试

测试目的

测量 72 颗 GPU 之间 All Reduce 集合通信的实际带宽和延迟,验证 NVLink 130 TB/s 总带宽在真实通信模式下的有效利用率。

AI 业务关联

大模型训练中梯度同步(All Reduce)是最频繁的多卡通信操作。NCCL 带宽不足会导致 GPU 等待通信完成而空转,直接降低训练吞吐量(tokens/sec)。

GPU-burn(稳定性压力测试)

GPU-burn 持续满载压力测试

测试目的

72 颗 GPU 同时满功率运行数小时,监控温度、功耗、ECC 错误率,验证液冷散热系统在极限负载下的散热能力和硬件稳定性。

AI 业务关联

AI 推理服务 7×24 小时持续运行,GPU-burn 模拟最严苛的持续满载场景。通过此测试意味着设备可稳定支撑"Token 工厂"全天候生产。

为什么 Token Factory 需要配套存储与管理服务器

GB300 NVL72 是 AI 工厂的"生产车间",但一座完整的工厂还需要原材料仓库和生产调度中心

GB300 NVL72 是纯计算节点,72 颗 GPU 专注于 AI 推理和训练计算。但要构建一个完整的"Token 工厂"(持续生成 AI 推理结果的生产系统),还需要:

存储服务器:提供高速数据集读取(训练数据不可能全部放入 GPU 显存)、模型 Checkpoint 持久化(防止训练中断丢失进度)、KV Cache 共享(多请求复用推理中间结果,提升吞吐)
管理服务器:负责集群编排(决定哪些 GPU 执行哪个任务)、任务调度(排队、优先级、资源隔离)、监控告警(实时感知 GPU 状态,自动故障转移)
外部接口层 数据湖 / 对象存储 训练 Pipeline 模型服务 API 管理 / 控制层(管理服务器) Kubernetes / Ray 调度 资源编排 监控告警 RoCEv2 / InfiniBand 计算层 GB300 NVL72 72 × Blackwell Ultra GPU 36 × Grace CPU 1,440 PFLOPS FP4 37 TB Fast Memory 网络层 RoCEv2 / InfiniBand 互连 130 TB/s NVLink 存储层 并行文件系统 Lustre / GPFS NVMe-oF 训练数据集 模型 Checkpoint KV Cache 共享

GB300 NVL72 计算层

AI 工厂的"生产车间"

执行 AI 推理和训练计算,每秒产出百万级 Token

高速存储层

"原材料仓库"

存储训练数据、保存模型快照、缓存推理中间结果

管理服务器

"生产调度中心"

分配任务、监控设备健康、自动处理故障

高速网络

"工厂传送带"

连接各组件,确保数据高速流转不卡顿