上海 AI Lab 与上交大抛出 NCP 预训练新范式,8.9B 隐空间模型用一半 Token 追平对手

他们提出全新预训练任务下一个概念预测(NCP),并顺势推出全球首个 8.9B 规模的离散隐空间基座模型 NCP-ArchPreview,把训练效率的账本重新算了一遍。模型基于 5.73T 的 Dolma-3 语料预训练,却只用掉 51.3% 的 Token 预算就追平了 OLMo-3-7B 的最终预训练 Loss,等效收敛速度提升 1.95 倍,计算帕累托效率系统性提升 1.74 倍。对于想要在模型微调和推理加速上找新突破口的研究者来说,这套隐空间思路无疑是一份刚出炉的路线图。

原文连接