英伟达NVLink:从游戏双卡到AI集群的“高速公路”进化史
如果你在2015年前后组装过一台高端游戏电脑,可能还对“SLI桥接器”那个小小的金属条有印象。当时,为了在《孤岛危机》里获得更流畅的帧率,发烧友们会不惜重金购买两块甚至三块显卡,用这个桥接器把它们连起来。那个不起眼的桥接器,正是今天驱动着全球最强大人工智能算力集群的NVLink技术最原始的雏形。从连接两块游戏显卡的“小桥”,到如今在数据中心里编织起数万颗GPU的“神经网络”,NVLink的进化之路,本身就是一部计算需求如何重塑硬件互联的微型史诗。这篇文章,我们就来深入聊聊这条“高速公路”是如何被设计、拓宽,并最终成为AI时代算力基础设施的绝对核心。
1. 从“桥接”到“高速公路”:NVLink的诞生逻辑
要理解NVLink为什么会出现,得先回到那个PCIe总线“一统江湖”的时代。在个人电脑和早期服务器领域,PCIe(Peripheral Component Interconnect Express)是连接CPU、GPU、网卡、存储控制器等所有高速设备的标准通道。它就像城市里的主干道,所有数据车辆都得在上面跑。
然而,随着GPU从单纯的图形处理器演变为通用并行计算单元(GPGPU),数据流量发生了质变。早期的GPU计算,数据从CPU内存搬到GPU显存,算完再搬回来,这条“主干道”还算够用。但当深度学习兴起,模型参数动辄数百GB,需要在多个GPU之间频繁交换中间计算结果(例如梯度信息)时,PCIe的带宽和延迟就成了严重的瓶颈。
一个直观的对比:在典型的ResNet-50模型训练中,反向传播阶段需要在GPU间同步梯度。如果通过PCIe 3.0 x16(双向带宽约32 GB/s)进行,通信开销可能占到单次迭代时间的30%以上。这意味着,GPU有近三分之一的时间在“堵车”。
英伟达的工程师们意识到,必须为GPU之间,以及GPU与CPU之间,修建一条专属的“高速公路”。这条公路不能是共享的,需要有更高的车道数(带宽)、更短的收费站距离(延迟)和更智能的交通规则(协议)。于是,基于早期SLI技术的积累,NVLink在2014年正式亮相。
其核心设计目标非常明确:
- 突破带宽瓶颈:提供数倍于同期PCIe标准的点对点带宽。
- 降低通信延迟:优化物理层和协议层,实现极低的端到端延迟。
- 支持缓存一致性:让多个处理器能够像访问本地内存一样高效、正确地访问共享内存,这是构建大规模统一内存系统的基石。
- 灵活的拓扑结构:不仅能连接两个设备,更要能扩展成支持多个设备互联的网络。
与IBM POWER架构CPU的早期合作,是NVLink迈出数据中心的第一步。IBM的POWER CPU本身具备高内存带宽,与NVLink GPU的结合,使得CPU和GPU能够以前所未有的速度共享数据,这直接催生了橡树岭国家实验室的“Summit”等早期顶级超算系统。这些系统证明了,为


361

被折叠的 条评论
为什么被折叠?



