跳转到内容

第四卷 · 分布式训练

一个模型放不进一块 GPU 之后,所有问题都变成”怎么切、切完怎么通信”。本卷按并行维度逐一讲解,最后给出组合它们的方法论。

  • 第一部分 · 并行维度:数据并行与 ZeRO / FSDP、张量并行、流水线并行、序列与上下文并行、MoE 与专家并行。
  • 第二部分 · 实践:混合并行与配置方法论、激活内存:重计算与卸载、训练容错与弹性。

第二、三卷。