Kubernetes 与 GPU 调度
Kubernetes 通过 device plugin 暴露 GPU,但默认调度器不理解 NVLink 拓扑、不支持 gang scheduling。本章介绍 Volcano、Kueue、Koordinator 等扩展如何补齐这些能力,以及 GPU 共享(MIG、时间片)的选项。
- 分布式训练必须 gang 调度:要么全起、要么不起
- 拓扑感知避免把一个作业的 GPU 撒在不同交换机下
- MIG 适合推理与小实验,训练很少用
Kubernetes 通过 device plugin 暴露 GPU,但默认调度器不理解 NVLink 拓扑、不支持 gang scheduling。本章介绍 Volcano、Kueue、Koordinator 等扩展如何补齐这些能力,以及 GPU 共享(MIG、时间片)的选项。