GPU 架构:SM、Tensor Core 与 warp
GPU 由数十到上百个流式多处理器(SM)组成,每个 SM 内有多个 Tensor Core、大量寄存器与共享内存。本章解释 warp 调度、占用率(occupancy)、Tensor Core 的矩阵指令形状,以及为何小矩阵、奇怪的维度会浪费算力。
- Tensor Core 按固定 tile(如 16×8×16)工作,维度要对齐
- 占用率不是越高越好,寄存器与共享内存是权衡
- 算术强度决定一个核是计算受限还是访存受限(roofline)
GPU 由数十到上百个流式多处理器(SM)组成,每个 SM 内有多个 Tensor Core、大量寄存器与共享内存。本章解释 warp 调度、占用率(occupancy)、Tensor Core 的矩阵指令形状,以及为何小矩阵、奇怪的维度会浪费算力。