集群、可靠性与规模化
- Jiang et al. (2024) “MegaScale”(字节,万卡训练实践,→ 第九卷)
- Meta (2024) Llama 3 技术报告中的基础设施章节(→ 第九卷)
- Jeon et al. (2019) “Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training”(→ 第八卷)
- Weng et al. (2022) “MLaaS in the Wild”(阿里 PAI 集群分析,→ 第八、十卷)
- Google (2023) “Resiliency at Scale: Managing Google’s TPUv4 Machine Learning Supercomputer”(→ 第九卷)