跳转到内容

混合精度与 FP8

BF16 训练已是标配,FP8 通过每张量/每块缩放进一步减半内存与带宽。本章解释各格式的动态范围与精度、损失缩放的必要性、哪些算子必须保持高精度,以及 FP8 训练的稳定性问题。

  • BF16 范围大精度低,FP16 相反,FP8 需要显式缩放
  • 优化器状态与主权重通常保持 FP32
  • FP8 在注意力与 LayerNorm 附近的溢出风险