跳转到内容
AI Infra 百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 全景与基础
第二卷 · 硬件与算力
第三卷 · 网络与通信
第四卷 · 分布式训练
第五卷 · 编译器与内核
第六卷 · 推理与服务
第七卷 · 存储与数据管道
第八卷 · 调度与集群
第九卷 · 可观测性与可靠性
第十卷 · 效率与成本
第十一卷 · 平台与 MLOps
第十二卷 · 安全与治理
术语表
参考文献与延伸阅读
导读
第一部分 · 利用率
MFU 与利用率分析
集群级利用率
第二部分 · 成本
训练成本模型
推理成本:$/token
能耗与 PUE
选择主题
深色
浅色
自动
第十卷 · 效率与成本
›
第一部分 · 利用率
›
集群级利用率
集群级利用率
集群的 GPU 有三种状态:未分配、分配但空闲、真正在算。本章讨论如何测量每一层的浪费、常见原因(排队碎片、交互式开发占坑、作业失败重跑),以及组织层面的改进措施。
本章要点
Section titled “本章要点”
真实利用率 = 分配率 × 分配后使用率 × MFU
交互式开发环境是空闲的主要来源
让浪费可见比任何调度算法都有效
相关阅读
Section titled “相关阅读”
多租户、配额与成本分摊