分布式训练与并行
- Shoeybi et al. (2019) “Megatron-LM”——张量并行(→ 第四卷)
- Rajbhandari et al. (2020) “ZeRO”——优化器状态/梯度/参数分片(→ 第四卷)
- Huang et al. (2019) “GPipe”;Narayanan et al. (2021) “Efficient Large-Scale Language Model Training on GPU Clusters”(→ 第四卷)
- Liu et al. (2023) “Ring Attention”;Jacobs et al. (2023) “DeepSpeed-Ulysses”(→ 第四卷)
- Fedus et al. (2022) “Switch Transformers”;DeepSeek-V3 技术报告(→ 第四卷 MoE)
- Hoffmann et al. (2022) “Training Compute-Optimal Large Language Models”(Chinchilla,→ 第一卷)