torch.compile、Inductor 与 XLA
torch.compile 通过 TorchDynamo 捕获 Python 字节码、AOTAutograd 生成前后向图、Inductor 生成 Triton/C++ 代码。XLA 走的是 JAX/TPU 的静态图路线。本章比较两者的适用场景、graph break 的成因与常见性能坑。
- graph break 是 torch.compile 收益打折的主要原因
- 动态 shape 支持仍是编译器的难点
- XLA 在 TPU 上几乎是必选项,在 GPU 上收益视情况