规模法则与算力需求
训练 FLOPs ≈ 6 × 参数量 × token 数。本章从这个近似出发,推导给定预算下的参数/数据最优配比(Chinchilla),并给出从 FLOPs 到 GPU·小时的换算链条。
- : 参数量, 训练 token 数
- Chinchilla:每参数约 20 token 为计算最优,推理成本考虑下应”过训练”
- 从 FLOPs 到 GPU 时间要除以峰值算力与 MFU
训练 FLOPs ≈ 6 × 参数量 × token 数。本章从这个近似出发,推导给定预算下的参数/数据最优配比(Chinchilla),并给出从 FLOPs 到 GPU·小时的换算链条。