量化:权重、激活与 KV cache
权重量化(GPTQ、AWQ)减少显存与带宽,激活量化(SmoothQuant)让矩阵乘法用低精度 Tensor Core,KV cache 量化延长可服务的上下文。本章比较各方法的适用场景、精度损失评估与推理引擎支持情况。
- Decode 是带宽受限的,权重量化直接换来速度
- 离群值通道是激活量化的主要难点
- 量化后必须重新评测,困惑度不足以反映任务表现
权重量化(GPTQ、AWQ)减少显存与带宽,激活量化(SmoothQuant)让矩阵乘法用低精度 Tensor Core,KV cache 量化延长可服务的上下文。本章比较各方法的适用场景、精度损失评估与推理引擎支持情况。