分布式推理:Prefill/Decode 分离
Prefill 计算密集、Decode 带宽密集,放在同一 GPU 上会互相干扰。分离式架构把两者部署在不同实例并传输 KV cache。本章讨论其收益、KV 传输的网络要求,以及与张量/流水并行的组合。
- 分离后可为两阶段分别选择并行策略与硬件
- KV cache 传输需要高带宽互连
- 大模型推理本身也需要多卡并行
Prefill 计算密集、Decode 带宽密集,放在同一 GPU 上会互相干扰。分离式架构把两者部署在不同实例并传输 KV cache。本章讨论其收益、KV 传输的网络要求,以及与张量/流水并行的组合。