张量并行
Megatron 风格的张量并行把线性层按列/行切分,每层前后各需一次 all-reduce。因通信频繁,它通常只在节点内使用。本章给出 MLP 与注意力的切分方式、通信量,以及序列并行如何补上 LayerNorm/Dropout 的冗余。
- TP 度通常 ≤ 节点内 GPU 数
- 每层两次 all-reduce,对延迟敏感
- 序列并行消除 TP 中的激活冗余
Megatron 风格的张量并行把线性层按列/行切分,每层前后各需一次 all-reduce。因通信频繁,它通常只在节点内使用。本章给出 MLP 与注意力的切分方式、通信量,以及序列并行如何补上 LayerNorm/Dropout 的冗余。