跳转到内容

内存层次与 HBM

HBM3e 提供 ~5–8 TB/s,但相对于 Tensor Core 的算力仍然是”内存墙”。本章给出各级存储的容量与带宽量级,解释 FlashAttention 为何通过减少 HBM 读写而非减少 FLOPs 获得加速。

  • 内存墙:算力增长快于带宽增长
  • L2 与共享内存的复用是内核优化的核心
  • 容量决定能放下多大的模型/多长的 KV cache