节点内互连:NVLink、NVSwitch 与 PCIe
节点内 GPU 之间通过 NVLink/NVSwitch 全互连,带宽比 PCIe 高一个数量级,这决定了张量并行通常只在节点内做。本章给出各代互连的带宽、拓扑,以及 CPU–GPU 之间 PCIe 的瓶颈位置。
- 张量并行放节点内、流水/数据并行跨节点,是由互连带宽决定的
- NVSwitch 使 all-to-all 通信在节点内接近线速
- Grace Hopper 类 CPU–GPU 一致内存改变了 offload 的成本
节点内 GPU 之间通过 NVLink/NVSwitch 全互连,带宽比 PCIe 高一个数量级,这决定了张量并行通常只在节点内做。本章给出各代互连的带宽、拓扑,以及 CPU–GPU 之间 PCIe 的瓶颈位置。