研究团队延续”角有效学习率”概念,设计实验动态调整非 Hyperball 优化器(MuonWD)的学习率,使其每一步的角有效学习率与 MuonH 完全相同。进一步的预训练实验表明,对 MuonH 采用更激进的学习率衰减虽可加速早期收敛,但可能损害最终性能,凸显了学习率调度的重要性。
研究团队延续”角有效学习率”概念,设计实验动态调整非 Hyperball 优化器(MuonWD)的学习率,使其每一步的角有效学习率与 MuonH 完全相同。进一步的预训练实验表明,对 MuonH 采用更激进的学习率衰减虽可加速早期收敛,但可能损害最终性能,凸显了学习率调度的重要性。