FlashAttention 与算子融合
FlashAttention 不改变注意力的数学,而是通过分块与在线 softmax 避免把 注意力矩阵写回 HBM,把内存复杂度从 降到 。本章讲清楚其分块策略、反向传播的重计算,以及 v2/v3 针对新硬件的改进。
- 加速来自减少 HBM 访问,不是减少 FLOPs
- 反向传播重算注意力矩阵而非存储它
- v3 利用 Hopper 的异步 Tensor Core 与 FP8
FlashAttention 不改变注意力的数学,而是通过分块与在线 softmax 避免把 注意力矩阵写回 HBM,把内存复杂度从 降到 。本章讲清楚其分块策略、反向传播的重计算,以及 v2/v3 针对新硬件的改进。