跳转到内容

训练数据管道与 tokenization

原始文本经过去重、过滤、tokenization、打包成定长序列后才能喂给模型。本章讨论离线预处理与在线处理的取舍、序列打包(packing)对注意力掩码的影响、以及数据顺序与课程学习。

  • 离线 tokenization 换取训练时的确定性与速度
  • Packing 提高利用率但需要正确的掩码/位置编码
  • 数据顺序影响可复现性,需固定 shuffle 种子