个性化智能体强化学习框架 PARPO 上线,8B 模型盲测第一

针对个性化智能体强化学习中的挑战,中国科学技术大学与阿里巴巴集团的研究团队提出 PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式放进 Agentic RL 的训练期优化目标。优化器侧,个性化分支通过指数移动平均维护用户级历史锚点,让当前奖励与该用户自己的历史中心比较,而不是与所有用户混合后的均值比较,缓解异质偏好下的 reward-center 与 reward-scale 失配。PSGM 改变 rollout 输入,偏好奖励模型提供个性化监督,PARPO 将两类奖励转成两条 advantage 轨道。

原文连接