跳转到内容

分布式训练与并行

  • Shoeybi et al. (2019) “Megatron-LM”——张量并行(→ 第四卷)
  • Rajbhandari et al. (2020) “ZeRO”——优化器状态/梯度/参数分片(→ 第四卷)
  • Huang et al. (2019) “GPipe”;Narayanan et al. (2021) “Efficient Large-Scale Language Model Training on GPU Clusters”(→ 第四卷)
  • Liu et al. (2023) “Ring Attention”;Jacobs et al. (2023) “DeepSpeed-Ulysses”(→ 第四卷)
  • Fedus et al. (2022) “Switch Transformers”;DeepSeek-V3 技术报告(→ 第四卷 MoE)
  • Hoffmann et al. (2022) “Training Compute-Optimal Large Language Models”(Chinchilla,→ 第一卷)