NVIDIA Blackwell 架构
72 颗 Blackwell Ultra GPU(B300)通过第五代 NVLink 全互联,为万亿参数大模型训练与推理提供前所未有的算力密度。
了解更多
每个计算托盘集成 2 颗 Blackwell Ultra GPU(B300)与 1 颗 Grace CPU,提供高密度计算与内存带宽。
NVLink 交换托盘实现 72 GPU 全互联,提供 130 TB/s 双向带宽,消除 GPU 间通信瓶颈。
冗余电源模块,配备 6 或 8 个 33 kW Power Shelf,为整个机架提供稳定、高效的电力供应,支持热插拔维护。
NVIDIA Spectrum 管理交换机负责集群内网络管理、监控带外通信与系统编排。
覆盖 GPU 连通性验证、显存完整性检测、NVLink 链路质量评估、电源稳定性测试等 20+ 项硬件诊断。EyeGrade 测试模拟高速信号传输的眼图质量,ThetaBgStart/Stop 验证满载温度控制能力。
PD 压测中的 EyeGrade/Theta 场景直接模拟大语言模型(LLM)推理时的显存高频访问模式,确保 72 颗 GPU 在持续高负载下无隐性故障。
Level 4 全面诊断覆盖 GPU 计算单元完整性、显存 ECC 错误检测、NVLink 连通性与带宽验证、PCIe 链路稳定性、电源管理响应等。
任何一项不通过都可能导致分布式训练中的"慢节点"问题——单卡故障拖慢整个训练集群,直接影响模型收敛时间和训练成本。
测量 72 颗 GPU 之间 All Reduce 集合通信的实际带宽和延迟,验证 NVLink 130 TB/s 总带宽在真实通信模式下的有效利用率。
大模型训练中梯度同步(All Reduce)是最频繁的多卡通信操作。NCCL 带宽不足会导致 GPU 等待通信完成而空转,直接降低训练吞吐量(tokens/sec)。
72 颗 GPU 同时满功率运行数小时,监控温度、功耗、ECC 错误率,验证液冷散热系统在极限负载下的散热能力和硬件稳定性。
AI 推理服务 7×24 小时持续运行,GPU-burn 模拟最严苛的持续满载场景。通过此测试意味着设备可稳定支撑"Token 工厂"全天候生产。
GB300 NVL72 是纯计算节点,72 颗 GPU 专注于 AI 推理和训练计算。但要构建一个完整的"Token 工厂"(持续生成 AI 推理结果的生产系统),还需要:
执行 AI 推理和训练计算,每秒产出百万级 Token
存储训练数据、保存模型快照、缓存推理中间结果
分配任务、监控设备健康、自动处理故障
连接各组件,确保数据高速流转不卡顿