跳转到内容

加速器格局:GPU、TPU、ASIC 与国产芯片

TPU 以脉动阵列与静态编译换取能效,GPU 以通用性换取生态,推理 ASIC 以牺牲灵活性换取 $/token。本章比较主要加速器在算力、内存、互连、软件栈成熟度上的差异,以及国产芯片的现状与适配成本。

  • 软件栈成熟度往往比峰值算力更决定实际吞吐
  • 互连带宽是大模型时代选型的第一指标
  • 国产芯片适配的主要成本在算子覆盖与通信库