第2章. AI 系统硬件概述
本作品已使用人工智能进行翻译。欢迎您提供反馈和意见:translation-feedback@oreilly.com
想象将相当于一台超级计算机的AI硬件浓缩到单个机架中。NVIDIA的最新架构正是如此实现。本章将深入解析 如何将CPU与GPU融合为强大的超级芯片,再通过超高速互连技术将数十个芯片串联,打造出盒装式AI超级计算机。我们将剖析核心硬件组件——Grace CPU与Blackwell GPU,解析其深度集成与海量内存池如何为AI工程师带来革命性便利。
随后我们将扩展视野,解析将72个GPU如单一机器般互联的网络架构。过程中将重点展示计算性能、内存容量及能效方面的飞跃性突破,正是这些特性赋予系统超凡能力。最终您将领略这项尖端硬件如何实现训练与部署数万亿参数模型——这在过去堪称不可能的任务。
CPU与GPU超级芯片
英伟达扩展 人工智能的策略始于单一整合的CPU+GPU超级芯片模块。从Hopper架构起,英伟达开始将基于ARM的CPU与一个或多个GPU封装在同一单元中,通过高速接口紧密连接。由此形成的单一模块如同统一计算引擎般协同运作。
首款超级芯片是 ,采用Grace Hopper(GH200)架构,将单颗Grace CPU与单颗Hopper GPU配对。随后推出的Grace Blackwell(GB200)超级芯片则在同一封装内集成了单颗Grace CPU与双颗Blackwell GPU。如图2-1所示,Grace CPU位于模块中心,两颗Blackwell GPU芯片环绕其四周。
图2-1. NVIDIA Grace Blackwell超级芯片模块,包含一个Grace CPU(中心)和两个Blackwell B200 GPU(左上和右上),集成于单一模块中,共享统一内存空间,并通过名为NVLink-C2C(芯片间)的定制高速链接连接
在传统系统中,CPU和GPU拥有独立的内存池,通过相对较慢的总线(如PCIe)进行通信,这意味着数据需要反复复制传输。 NVIDIA的超级芯片通过名为NVLink-C2C(芯片间)的定制高速链接消除了这一障碍,实现了CPU与GPU的直接连接。
在GB200超级芯片中,NVLink-C2C可在Grace CPU与Blackwell GPU间提供高达~900 GB/s的传输速率。相比之下,PCIe Gen5 x16(Blackwell B200)单向传输速率约为64 GB/s,PCIe Gen6 x16(Blackwell Ultra B300)单向传输速率约为128 GB/s。NVLink-C2C的互连速度比典型PCIe快一个数量级。更重要的是,它具备缓存一致性。
缓存一致性意味着CPU与GPU共享统一的内存架构( ),因此始终读取相同数据值。实际应用中,超级芯片上的Grace CPU与Blackwell GPU可直接访问彼此内存,如同操作单一巨型内存池。GPU可读写CPU存储器中的数据,反之亦然,无需显式复制。NVIDIA将这种统一内存架构称为统一CPU-GPU内存或扩展GPU内存(EGM),它有效消除了CPU内存与GPU内存之间的界限。
每颗Grace Blackwell超级芯片 搭载海量内存:Grace CPU配备数百GB LPDDR5X DRAM,而每颗Blackwell ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access