跳转到内容
AI Infra 百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 全景与基础
第二卷 · 硬件与算力
第三卷 · 网络与通信
第四卷 · 分布式训练
第五卷 · 编译器与内核
第六卷 · 推理与服务
第七卷 · 存储与数据管道
第八卷 · 调度与集群
第九卷 · 可观测性与可靠性
第十卷 · 效率与成本
第十一卷 · 平台与 MLOps
第十二卷 · 安全与治理
术语表
参考文献与延伸阅读
导读
第一部分 · 可观测性
指标、Profiler 与追踪
SLO 与容量规划
第二部分 · 故障
Straggler 与静默错误
故障检测、隔离与恢复
选择主题
深色
浅色
自动
第九卷 · 可观测性与可靠性
›
第一部分 · 可观测性
›
SLO 与容量规划
SLO 与容量规划
TTFT 与 TPOT 的 P50/P99、每 GPU 的并发上限、排队时间共同决定需要多少实例。本章给出从流量模型到实例数的容量规划方法,以及自动扩缩容对冷启动(模型加载)的处理。
本章要点
Section titled “本章要点”
P99 延迟由最长请求与调度决定
模型加载时间决定扩容的最小提前量
预留 + 弹性是常见的成本/可靠性折中
相关阅读
Section titled “相关阅读”
服务框架对比