英伟达近日对其最新的Rubin GPU架构进行了深度解析,展示了其在多机架、多系统以及数据中心层面实现大规模计算的重大突破。作为该公司技术演进的重要里程碑,该款加速器在稀疏NVFP4运算下能够提供高达50 PetaFLOPS的计算能力。
在满血配置下,Rubin GPU集成了多达224个流式多处理器(SM)以及288 GB的HBM4内存。凭借3360亿个晶体管,英伟达还为其配备了拥有第三代Transformer引擎的896个张量核心。为了释放庞大的原始算力,英伟达将GPU资源划分至带有集中式L2缓存的图形处理器集群中,并辅以GigaThread引擎来协调工作流和优化资源利用率。此外,MIG控制分区功能允许该GPU被分割为多个虚拟GPU,其工作原理类似于现代CPU处理虚拟核心的方式。

在内存配置方面,英伟达携手内存合作伙伴,通过12层堆叠模块提供了288 GB的HBM4内存。专用的HBM控制器与物理层配合,实现了高达每秒22 TB的峰值内存带宽,在行业中极具竞争力。其张量内存管理器经过升级以提升数据传输效率,而整个GPU的纵向扩展与通信则由NVLink 6全权管理。借助NVLink 6,全互联GPU通信的架构带宽达到了每秒3600 GB,同时NVLink-C2C芯片到芯片互联技术则实现了每秒1800 GB的CPU与GPU通信带宽。英伟达还内置了拥有每秒256 GB带宽的PCIe Gen 6交换机,用于同外部设备进行数据交互。

纵向扩展通信是英伟达的核心优势之一,它使GPU能够在机架级系统中与其他GPU实现高效无碍的通信。传统GPU间通信往往需要协调与同步,当系统因等待数据传输而陷入停滞时便会产生延迟。针对这一痛点,Rubin架构引入了设备发起通信机制,允许每个GPU独立管理数据传输,从而消除了外部优化的需求并有效降低了延迟。

此类高性能系统往往伴随着巨大的功耗,单台NVL72机架便集成了72颗GPU。针对Vera Rubin NVL72系统,英伟达开发了智能功率平滑技术,将所有系统组件整合进单一的固定功率包络之内。例如在运行人工智能工作负载时,功率需求可能会在等待CPU的空闲状态与满负荷运转的GPU之间剧烈波动。通过智能功率平滑技术,Vera Rubin NVL72系统的平均功耗相较上一代Grace Blackwell NVL72降低了约10%,峰值50毫秒功率更是削减了大约20%,其功耗预算优化还进一步得到了英伟达DSX MaxLPS技术的加持。