混合精度与 FP8
BF16 训练已是标配,FP8 通过每张量/每块缩放进一步减半内存与带宽。本章解释各格式的动态范围与精度、损失缩放的必要性、哪些算子必须保持高精度,以及 FP8 训练的稳定性问题。
- BF16 范围大精度低,FP16 相反,FP8 需要显式缩放
- 优化器状态与主权重通常保持 FP32
- FP8 在注意力与 LayerNorm 附近的溢出风险
BF16 训练已是标配,FP8 通过每张量/每块缩放进一步减半内存与带宽。本章解释各格式的动态范围与精度、损失缩放的必要性、哪些算子必须保持高精度,以及 FP8 训练的稳定性问题。