跳转到内容
AI Infra 百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 全景与基础
第二卷 · 硬件与算力
第三卷 · 网络与通信
第四卷 · 分布式训练
第五卷 · 编译器与内核
第六卷 · 推理与服务
第七卷 · 存储与数据管道
第八卷 · 调度与集群
第九卷 · 可观测性与可靠性
第十卷 · 效率与成本
第十一卷 · 平台与 MLOps
第十二卷 · 安全与治理
术语表
参考文献与延伸阅读
导读
第一部分 · 网络结构
RDMA:InfiniBand 与 RoCE
拓扑:胖树、轨道优化与并行映射
第二部分 · 集合通信
NCCL 与集合通信算法
拥塞、抖动与网络故障
选择主题
深色
浅色
自动
第三卷 · 网络与通信
第三卷 · 网络与通信
千卡以上训练的时间有相当比例花在等待通信上。本卷讲清楚字节如何从一块 GPU 的显存到另一台机器的显存,以及集合通信的代价模型。
本卷结构
Section titled “本卷结构”
第一部分 · 网络结构
:RDMA:InfiniBand 与 RoCE、拓扑:胖树、轨道优化与并行映射。
第二部分 · 集合通信
:NCCL 与集合通信算法、拥塞、抖动与网络故障。
前置
Section titled “前置”
第二卷第二部分。