跳转到内容

拓扑:胖树、轨道优化与并行映射

胖树(fat-tree)提供全带宽但成本高,轨道优化(rail-optimized)拓扑让同号 GPU 之间只经过一跳交换机。本章解释如何把数据/流水/张量并行组映射到拓扑上,使最重的通信走最短路径。

  • 同一 all-reduce 组内的 GPU 应尽量在同一轨道
  • 超额认购比(oversubscription)决定跨 pod 通信的实际带宽
  • 拓扑感知的进程放置能带来 10–30% 的端到端提升