腾讯混元团队对 Qwen、LLaMA、OLMo2 等多个模型家族(1.8B–14B)和 10 个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本 —— 模型在训练中见过,loss 也降下去了,但回头重测就是答不对。Loss 收敛只代表”大部分样本学会了”,那些始终学不会的样本被淹没了。与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4 等都有专门的数据质量研究),但 SFT 阶段几乎没人追问”模型到底学会了什么、没学会什么”。
腾讯混元团队对 Qwen、LLaMA、OLMo2 等多个模型家族(1.8B–14B)和 10 个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本 —— 模型在训练中见过,loss 也降下去了,但回头重测就是答不对。Loss 收敛只代表”大部分样本学会了”,那些始终学不会的样本被淹没了。与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4 等都有专门的数据质量研究),但 SFT 阶段几乎没人追问”模型到底学会了什么、没学会什么”。