跳转到内容

第六卷 · 推理与服务

推理成本决定一个模型能不能被大规模使用。本卷围绕”在给定延迟 SLO 下最大化每张 GPU 的 tokens/s”这一目标组织。

  • 第一部分 · 内存与批处理:KV Cache 与 PagedAttention、连续批处理与调度。
  • 第二部分 · 优化技术:量化:权重、激活与 KV cache、投机解码、分布式推理:Prefill/Decode 分离。
  • 第三部分 · 服务框架:服务框架对比:vLLM、SGLang、TensorRT-LLM 等。

第一卷第一部分、第二卷第一部分。