删掉 99.95% 训练信号,效果反而更好 极端稀疏监督刷新大模型后训练逻辑

来自亚马逊和杜克大学的研究团队一项最新研究发现:一条包含数千个 token 的推理轨迹,有时只训练其中一个 token,就已经足以明显提升模型的推理能力。

原文连接