加速器格局:GPU、TPU、ASIC 与国产芯片
TPU 以脉动阵列与静态编译换取能效,GPU 以通用性换取生态,推理 ASIC 以牺牲灵活性换取 $/token。本章比较主要加速器在算力、内存、互连、软件栈成熟度上的差异,以及国产芯片的现状与适配成本。
- 软件栈成熟度往往比峰值算力更决定实际吞吐
- 互连带宽是大模型时代选型的第一指标
- 国产芯片适配的主要成本在算子覆盖与通信库
TPU 以脉动阵列与静态编译换取能效,GPU 以通用性换取生态,推理 ASIC 以牺牲灵活性换取 $/token。本章比较主要加速器在算力、内存、互连、软件栈成熟度上的差异,以及国产芯片的现状与适配成本。