IQuest 研究:早期收敛快不等于最终效果好,调度策略决定 MuonH 上限

研究团队延续”角有效学习率”概念,设计实验动态调整非 Hyperball 优化器(MuonWD)的学习率,使其每一步的角有效学习率与 MuonH 完全相同。进一步的预训练实验表明,对 MuonH 采用更激进的学习率衰减虽可加速早期收敛,但可能损害最终性能,凸显了学习率调度的重要性。

原文连接