跳转到内容

集群、可靠性与规模化

  • Jiang et al. (2024) “MegaScale”(字节,万卡训练实践,→ 第九卷)
  • Meta (2024) Llama 3 技术报告中的基础设施章节(→ 第九卷)
  • Jeon et al. (2019) “Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training”(→ 第八卷)
  • Weng et al. (2022) “MLaaS in the Wild”(阿里 PAI 集群分析,→ 第八、十卷)
  • Google (2023) “Resiliency at Scale: Managing Google’s TPUv4 Machine Learning Supercomputer”(→ 第九卷)