跳转到内容

FlashAttention 与算子融合

FlashAttention 不改变注意力的数学,而是通过分块与在线 softmax 避免把 N×NN\times N 注意力矩阵写回 HBM,把内存复杂度从 O(N2)O(N^2) 降到 O(N)O(N)。本章讲清楚其分块策略、反向传播的重计算,以及 v2/v3 针对新硬件的改进。

  • 加速来自减少 HBM 访问,不是减少 FLOPs
  • 反向传播重算注意力矩阵而非存储它
  • v3 利用 Hopper 的异步 Tensor Core 与 FP8