跳转到内容

SLO 与容量规划

TTFT 与 TPOT 的 P50/P99、每 GPU 的并发上限、排队时间共同决定需要多少实例。本章给出从流量模型到实例数的容量规划方法,以及自动扩缩容对冷启动(模型加载)的处理。

  • P99 延迟由最长请求与调度决定
  • 模型加载时间决定扩容的最小提前量
  • 预留 + 弹性是常见的成本/可靠性折中