内存层次与 HBM
HBM3e 提供 ~5–8 TB/s,但相对于 Tensor Core 的算力仍然是”内存墙”。本章给出各级存储的容量与带宽量级,解释 FlashAttention 为何通过减少 HBM 读写而非减少 FLOPs 获得加速。
- 内存墙:算力增长快于带宽增长
- L2 与共享内存的复用是内核优化的核心
- 容量决定能放下多大的模型/多长的 KV cache
HBM3e 提供 ~5–8 TB/s,但相对于 Tensor Core 的算力仍然是”内存墙”。本章给出各级存储的容量与带宽量级,解释 FlashAttention 为何通过减少 HBM 读写而非减少 FLOPs 获得加速。