评测基础设施
大模型评测涉及数百个基准、多种采样设置与巨大的推理量。本章讨论评测框架(lm-eval-harness 等)、缓存与增量评测、评测结果的版本管理,以及防止基准泄漏进训练数据。
- 评测推理成本可能超过训练本身的相当比例
- 固定采样参数与提示模板,否则不可比
- 去污染(decontamination)应在数据管道中完成
大模型评测涉及数百个基准、多种采样设置与巨大的推理量。本章讨论评测框架(lm-eval-harness 等)、缓存与增量评测、评测结果的版本管理,以及防止基准泄漏进训练数据。