拓扑:胖树、轨道优化与并行映射
胖树(fat-tree)提供全带宽但成本高,轨道优化(rail-optimized)拓扑让同号 GPU 之间只经过一跳交换机。本章解释如何把数据/流水/张量并行组映射到拓扑上,使最重的通信走最短路径。
- 同一 all-reduce 组内的 GPU 应尽量在同一轨道
- 超额认购比(oversubscription)决定跨 pod 通信的实际带宽
- 拓扑感知的进程放置能带来 10–30% 的端到端提升
胖树(fat-tree)提供全带宽但成本高,轨道优化(rail-optimized)拓扑让同号 GPU 之间只经过一跳交换机。本章解释如何把数据/流水/张量并行组映射到拓扑上,使最重的通信走最短路径。