跳转到内容

AI Infra 百科

从一块 GPU 到一座集群,一座图书馆,而不是一本书
第一卷第一卷 · 全景与基础AI 基础设施的分层地图、负载特征、规模法则与统一度量——其他各卷的坐标系。进入阅读 →第二卷第二卷 · 硬件与算力GPU 微架构、内存层次与 HBM、节点内互连、加速器格局、功耗与散热。进入阅读 →第三卷第三卷 · 网络与通信RDMA、InfiniBand 与 RoCE,集合通信算法,拓扑与并行映射,拥塞与故障。进入阅读 →第四卷第四卷 · 分布式训练数据/张量/流水/序列/专家并行的原理与代价,ZeRO 与 FSDP,混合并行配置。进入阅读 →第五卷第五卷 · 编译器与内核CUDA 编程模型、Triton、torch.compile 与 XLA、FlashAttention、混合精度与 FP8。进入阅读 →第六卷第六卷 · 推理与服务KV cache 与 PagedAttention、连续批处理、量化、投机解码、分布式推理与服务框架。进入阅读 →第七卷第七卷 · 存储与数据管道训练数据管道与 tokenization、检查点、对象存储与并行文件系统、数据加载性能。进入阅读 →第八卷第八卷 · 调度与集群Kubernetes 与 GPU 调度、Slurm、Ray,gang scheduling 与抢占,多租户与配额。进入阅读 →第九卷第九卷 · 可观测性与可靠性指标与 Profiler、Straggler 与静默错误、故障恢复、SLO 与容量规划。进入阅读 →第十卷第十卷 · 效率与成本MFU 与利用率分析、训练成本模型、推理 $/token、能耗与 PUE。进入阅读 →第十一卷第十一卷 · 平台与 MLOps实验管理、模型注册与发布、评测基础设施、模型 CI/CD、数据与特征版本。进入阅读 →第十二卷第十二卷 · 安全与治理多租户隔离、数据治理与合规、模型供应链、推理安全与滥用防护。进入阅读 →术语表术语表横向工具书:所有卷共用的概念索引。进入阅读 →附录参考文献与延伸阅读按主题整理的论文、书籍、技术博客与开源项目,标注各卷对应章节。进入阅读 →

每卷独立成册,左侧只显示本卷目录;卷与卷之间互相引用。全文搜索覆盖全部卷。