这正是多轮语言智能体强化学习中的时间信用分配难题:终点奖励告诉模型”这条轨迹最后对不对”,却没有告诉它”中间哪一步值得被强化”。当前的主流方案是让同一个模型在训练时阅读任务相关的程序性技能,再回头给无技能轨迹中的 token 打分。针对这个问题,来自中国科学技术大学与阿里巴巴集团的研究团队提出 ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping),把训练期的特权技能转化为与回报相关的 token 级信用,并直接接入原生的 reward-to-advantage-to-policy 路径。

