跳转到内容

Kubernetes 与 GPU 调度

Kubernetes 通过 device plugin 暴露 GPU,但默认调度器不理解 NVLink 拓扑、不支持 gang scheduling。本章介绍 Volcano、Kueue、Koordinator 等扩展如何补齐这些能力,以及 GPU 共享(MIG、时间片)的选项。

  • 分布式训练必须 gang 调度:要么全起、要么不起
  • 拓扑感知避免把一个作业的 GPU 撒在不同交换机下
  • MIG 适合推理与小实验,训练很少用