跳转到内容
AI Infra 百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 全景与基础
第二卷 · 硬件与算力
第三卷 · 网络与通信
第四卷 · 分布式训练
第五卷 · 编译器与内核
第六卷 · 推理与服务
第七卷 · 存储与数据管道
第八卷 · 调度与集群
第九卷 · 可观测性与可靠性
第十卷 · 效率与成本
第十一卷 · 平台与 MLOps
第十二卷 · 安全与治理
术语表
参考文献与延伸阅读
导读
第一部分 · 内存与批处理
KV Cache 与 PagedAttention
连续批处理与调度
第二部分 · 优化技术
量化:权重、激活与 KV cache
投机解码
分布式推理:Prefill/Decode 分离
第三部分 · 服务框架
服务框架对比:vLLM、SGLang、TensorRT-LLM 等
选择主题
深色
浅色
自动
第六卷 · 推理与服务
›
第二部分 · 优化技术
›
投机解码
投机解码
草稿模型一次生成多个候选 token,目标模型并行验证并按接受—拒绝规则保证输出分布不变。本章解释其正确性证明、接受率与加速比的关系,以及 Medusa、EAGLE 等自草稿变体。
本章要点
Section titled “本章要点”
加速比取决于接受率与草稿/目标计算比
输出分布与目标模型严格一致
批量大时收益下降