跳转到内容

规模法则与算力需求

训练 FLOPs ≈ 6 × 参数量 × token 数。本章从这个近似出发,推导给定预算下的参数/数据最优配比(Chinchilla),并给出从 FLOPs 到 GPU·小时的换算链条。

  • C6NDC \approx 6NDNN 参数量,DD 训练 token 数
  • Chinchilla:每参数约 20 token 为计算最优,推理成本考虑下应”过训练”
  • 从 FLOPs 到 GPU 时间要除以峰值算力与 MFU