阿里 Qwen、上交大等提出预训练动态数据选择范式 OPUS

在 GPT2 Large/XL 30B 使用 FineWeb-Edu 的预训练设置中,OPUS 在 10 个基准上对比从高质量数据随机选择取得平均 3.18% 的准确率提升 … 更贴近产业的 CPT 场景里,OPUS 在 Qwen3-8B-Base 上继续训练 SciencePedia:仅用 0.5B tokens 就达到最优表现,并且超过随机选择训练 3B tokens 的对照,等价于约 6× 的数据效率增益 … 更重要的是,OPUS 并不排斥已有的数据工程手段,反而天然适合与静态过滤协同:静态过滤负责把明显低价值样本挡在门外,OPUS 负责在剩余候选中根据训练动态做细粒度选择。

原文连接

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧