CUDA 编程模型
本章用最少的篇幅讲清 CUDA 的执行层次、内存空间(全局/共享/寄存器/常量)、同步原语与 stream,并用一个矩阵乘法从朴素版优化到 tiling 版,展示访存优化带来的数量级提升。
- 合并访存(coalescing)是第一优化
- 共享内存 tiling 提高数据复用
- stream 与事件实现计算通信重叠
本章用最少的篇幅讲清 CUDA 的执行层次、内存空间(全局/共享/寄存器/常量)、同步原语与 stream,并用一个矩阵乘法从朴素版优化到 tiling 版,展示访存优化带来的数量级提升。