为打破这一瓶颈,马里兰大学研究团队提出了一种全新的训练范式「Agentic 批判性学习」(Agentic Critical Training,ACT),不再让模型死记硬背,而是通过强化学习(RL)让模型学会自主判断动作优劣,从而让 Agent 真正拥有「自我反思」的能力 … [鼓掌 ] 行动生成训练:在专家轨迹上继续用 GRPO 训练模型直接生成动作 … 令人意外的是,仅在 Agent 数据上训练 ACT 的模型,在通用推理基准 MATH-500 和 GPQA-Diamond 上也取得了比原始模型更好的成绩,而 IL 训练却导致推理能力大幅下降。
暂无讨论,说说你的看法吧

