传统基础模型受限于一次训练、静态部署的固有范式,在真实交互中缺乏持续学习与自我优化的能力。Agent 自进化(Self-Evolution)正是为突破这一瓶颈而生,它旨在让 AI 系统像生物一样,通过与环境的持续交互获取反馈,积累经验并重构自身,实现动态适应与能力成长。其核心在于建立”执行→反馈→优化改进→再执行”的闭环机制,且进化对象不局限于模型参数,更涵盖 Prompt、Skill、记忆及工作流等非参数化组件,赋予 Agent 更高的灵活性与自驱力。
1. 什么是自进化
自我进化是指通过与环境交互、获取反馈,持续优化自身的 AI 自主范式;旨在让 AI 系统像生物一样具备适应能力,通过持续的经验积累和自我重构实现进化。框架核心定义如下:
• 动态适应机制:建立”执行→反馈→自我调整→执行”闭环机制,使智能体能在运行过程中根据环境变化或内部信号主动改进。
• 多维进化对象:进化不仅限于模型参数更新,还涵盖上下文(prompt 与记忆)、工具及系统架构等非参数化组件,有较大的灵活性。
• 自主性与自驱力:强调智能体具备主动探索、自我反思及评估能力,可基于交互反馈优化。

2. 自进化核心机制
自我进化两个核心问题:进化什么、如何进化。
2.1. 进化什么
自进化可以针对智能体系统的不同层级:
• Agent 系统进化——Skill、Harness、Memory、Aflow、Environment 等进化。
• 模型参数进化(将经验内化为模型权重)——基于反馈进行微调/强化学习、自我归因、自蒸馏。


2.2. 如何进化
2.2.1. Agent系统进化
2.2.1.1. Skill进化
2.2.1.1.1. Skill轨迹生成
2.2.1.1.1.1. Trace2Skill
Trace2Skill 核心是通过批量分析多个 Agent 执行轨迹,将成功与失败经验归纳为可泛化的 Skill。其关键机制如下:
• 轨迹批量生成:首先使用初始 Skill(人工或 LLM 草稿)生成大量目标任务轨迹,并按成功与失败分类。
• 并行多智能体补丁提议:调度一组分析子智能体,并行处理每条轨迹并生成技能修改补丁,互不干扰。让 Agent 通过 ReAct 的方式在一批用户任务上运行,产生大量的执行轨迹。这个过程是完全可以并行的,效率会比较高,比如,在实践中,使用一个 122B 参数的 LLM 生成 200 条包含 50+ 个轮次的 Agent 轨迹,所需时间不到两个小时。
• 无冲突补丁整合:通过分层合并 + 归纳推理,把海量补丁整合成一套无冲突、通用的技能。
该方法强调先观察、后总结的批处理式知识沉淀,避免单点更新导致的方向偏差,适用于需要从大量实践中提炼通用解决方案的场景。


2.2.1.1.2. Skill群体进化
2.2.1.1.2.1. EvoSkill
EvoSkill 通过”执行→提案→构建→验证”闭环机制,实现 Agent 在能正向提升的方向上自进化。EvoSkill 核心原理是将传统的手工调试过程转化为由三个专用子智能体协同工作的系统,让它们相互协作、互相验证,自动完成 Skill 的分析和进化:
• 执行者(Executor):基于当前待优化的 Skill,去执行具体任务,并产生完整的 Agent 运行轨迹和最终答案。
• 提案者(Proposer):深入分析执行者产生的轨迹,判断结果是否正确。如果失败,需要精准定位问题根源,并提出具体的优化方向和改进提案;如果成功,它也会总结有效模式。
• 搭建者(Builder):接收分析师提出的优化建议,真正动手编写或修改 Skill 文档,将其落实为可执行的代码或指令规则。
这种设计使 Skill 进化具备明确的方向性,避免盲目修改导致性能退化,实现基于量化反馈的可持续优化,为构建具备长期自主进化能力的智能体系统提供了可落地的范式。

2.2.1.1.2.2. SkillOpt
SkillOpt 将 Skill 的优化过程类比为深度学习中的模型训练,把 Skill 文本视为”可训练的外部参数”,通过构建一个闭环的文本空间训练流程实现 Skill 的系统性、可控化自进化。SkillOpt 核心原理如下:
• 首先使用目标模型执行任务并收集轨迹,然后由专门的”优化器 Agent”对成功与失败案例进行小批量反思,生成结构化的编辑操作(如添加、删除、替换),并引入类似学习率的约束控制每次更新的幅度。
• 同时所有修改必须经过独立验证集的严格门控测试,只有性能显著提升的候选 Skill 才被接受,否则作为负反馈存入缓冲区用于后续学习。
• 同步引入动量机制和元更新策略,在多轮迭代中保留长期趋势,并维护一个仅对优化器可见的”元记忆”来指导自身优化策略的演进。
SkillOpt 实现了类似 SGD 优化神经网络权重的精细化文本调优,使 Skill 进化具备明确方向性、稳定性与可解释性,推动提示工程从经验主义走向科学化训练范式。

2.2.1.1.3. Skill评估更新
2.2.1.1.3.1. coEvoSkill
coEvoSkill 通过多智能体协同与竞争机制,实现 Skill 的集体演化和持续优化。它把 Skill 进化设计成一个生成者与验证者的双边闭环:生成器负责改 Skill,验证器负责出题、诊断、升级测试,真实环境再提供黑盒 pass/fail,把自进化从单边自省变成了带对抗性的共同进化。其关键机制如下:
• 基于任务上下文动态激活相关 Skill 代理,各代理生成局部策略后通过投票、加权集成或 LLM 仲裁的方式达成协同。
• 引入跨代理的竞争反馈机制,评估各 Skill 的实际贡献并据此调整其权重与结构。
• 所有交互轨迹被持续记录并用于后续的离线分析,通过归纳成功模式与失败根因,驱动新一轮的技能迭代。
• 基于共享经验池与元控制器协调知识流动,并支持 Skill 能的组合、拆解与迁移。
该系统实现”个体优化-群体协同-整体进化”的闭环,使 Skill 不仅能够自我改进,还能在协作中涌现出更高阶的能力,推动智能体系统向更灵活、鲁棒和自适应的方向发展。

2.2.1.1.4. SkillRL协同进化
2.2.1.1.4.1. SkillRL
SkillRL 将强化学习与 Skills 进化深度融合,在 RL 训练过程中一边用奖励信号更新 LLM 模型,一边从失败案例中蒸馏新知识实时扩充和优化 Skill 库——两者互相促进,形成”递归共进化循环”。SkillRL 的核心原理是将强化学习与 Skill 库动态进化深度融合,实现策略优化与知识沉淀协同演进:
• 不再将 Skill 视为静态提示,而是通过双向蒸馏机制从 Agent 轨迹中自动提炼可复用的知识:成功轨迹被归纳为通用策略,失败轨迹则转化为避坑指南。
• 这些 Skill 被组织成一个分层结构的 Skill Bank,包含通用 Skill、任务特定 Skill 和常见错误三类,支持高效检索与按需注入。
• 创新性提出递归演化机制——在 RL 训练过程中,系统定期评估性能,对低效任务类别触发新一轮分析,生成新技能并加入 Skill Bank,使后续策略训练能基于最新知识进行决策。这种”策略提升→暴露深层问题→技能进化→策略再提升”的闭环,实现了 Skill 与模型能力的共同成长。
SkillRL 方案结合基于语义相似度的检索注入机制和强化学习框架,构建了会自我教学、持续进化的智能体系统,解决静态 Skill 库无法跟上策略演进而导致知识滞后的根本问题。

2.2.1.1.4.2. D2Skill
D2Skill 核心原理是通过双粒度技能建模 + 对比驱动效用评估 + 动态闭环管理,实现策略与 Skill 库协同进化:
• 双粒度技能:任务技能指导全局规划,步骤技能纠正局部操作,覆盖全决策链。
• 对比学习机制:并行采样技能组与基线组,以性能差构建事后效用信号,用于 Skill 估值、奖励塑形与策略优化。
• 反思生成技能:失败触发轨迹对比分析,自动提炼新 Skill 注入知识库。
• 动态管理闭环:语义 + 效用两阶段检索,定期剪枝低效 Skill,确保 Skill 库高质可用。
该框架让技能可生长、可评估、可复用,推动智能体从参数学习迈向经验沉淀的持续进化。

2.2.1.1.4.3. GIGPO 算法
SkillRL 和 D2Skill 框架都用到了 GiGPO 算法。GiGPO(Group-in-Group Policy Optimization)的核心创新在于保留 GRPO “Critic-free” 特性的同时,通过数据挖掘引入Step-level 优势估计。它不需要额外的 Value Model,而是利用 Rollout 数据中天然存在的状态重复现象来构建细粒度奖励信号,信号由两层 Advantage 加权融合而成:
第一层:Episode-level Advantage(轨迹级)
• 做法:与标准 GRPO 一致。在同一个 Task Group 内,比较各条完整轨迹的总回报(Return),进行 Group-wise 归一化。
• 作用:提供全局的好坏判断,告诉模型”哪条路径整体更优”。
第二层:Step-level Advantage(步级/状态级)
• 锚点发现(Anchor State):在多轮 Rollout 中,Agent 经常会回到相同的环境状态(如点击同一个搜索结果、回到同一个房间)。GiGPO 离线地通过 Hash 聚合这些相同状态下的不同 (action, reward) 对,构成 Step-level Group。
• 局部比较:在同一个 Anchor State 组内,计算折扣奖励并进行归一化。
• 作用:提供局部的动作优劣排序,告诉模型”在当前这个具体状态下,哪个动作比另一个更好”,解决了长序列中的 Credit Assignment 难题。
融合优化:将两层优势按权重线性叠加,得到每一步的最终优势,再直接代入 Clipped PPO Objective 进行更新。默认两层权重各占 50%

其中 Aepisode 为轨迹级(Group-wise 归一化的整条轨迹回报),Astep 为同一 Anchor State 组内折扣奖励归一化后的步级优势。
| 维度 | GRPO | GiGPO |
| 优势估计粒度 | 粗粒度:仅 Episode-level(整条轨迹对比) | 双层粒度:Episode-level + Step-level(同状态下动作对比) |
| Credit Assignment | 困难:稀疏奖励下,难以区分长轨迹中哪一步导致了成功/失败 | 精准:利用 Anchor State 将长期回报分解到具体决策点 |
| 额外开销 | 无 Critic,低显存 | 几乎零额外开销(无 Critic,无额外 Forward,但需离线 Hash 分组) |
| 数据利用率 | 仅利用轨迹间的方差 | 同时利用轨迹间方差 + 同一状态下的动作方差 |
| 收敛特性 | 在长序列/稀疏奖励任务中易抖动、收敛慢 | 提供更密集的梯度信号,收敛更稳、更快 |
| 核心依赖 | 依赖同一 Prompt 下的多次采样 | 依赖环境状态的可重复访问性(Revisitable States) |
为什么 GiGPO 极度适配 Agentic 场景? GiGPO 专门针对 LLM Agent 在多轮、长序列、交互式环境中的痛点而设计:
• 解决 Agent 训练中的”信用分配”死结:Agent 任务通常长达 50+ 步且奖励极度稀疏(仅结尾给分)。GRPO 只能告诉模型”这条 50 步的轨迹对了”,但无法指出是第 3 步选对了商品还是第 48 步点对了提交。GiGPO 通过 Anchor State 机制,自动在长轨迹中切分出无数个”局部考场”,让模型能在每一步都获得类似 Dense Reward 的监督信号。
• 完美契合 Agent 环境的”状态重访”特性:与传统文本生成不同,Agent 在与环境交互时,状态空间是有限的且高度结构化的。即使策略不成熟,Agent 也会频繁回到相同状态。这种在传统 RL 中被视为”探索效率低”的现象,在 GiGPO 中反而变成了免费的监督信号源。
• 保持了 LLM 训练的工程友好性:Agent 训练本就因为环境交互慢、序列长而昂贵。如果为了细粒度信号引入 Critic Network(如传统 PPO),显存和计算成本会翻倍。GiGPO 证明了”不需要 Critic 也能做细粒度 RL”,它完全复用 Rollout 数据,不增加任何模型参数和推理开销,使得在消费级显卡或有限集群上训练高性能 Agent 成为可能。
• 动态适配学习过程:GiGPO 的结构具有自适应性。训练早期策略差,状态重复率高,Step-group 大,提供强基础信号;随着策略收敛,状态访问变精准,Step-group 自然聚合得更合理。
GiGPO 是 GRPO 在 Agentic 领域的针对性升维。它没有抛弃 GRPO 简单高效的优点,而是巧妙地利用了 Agent 环境”状态可重复”的先验知识,以极低的边际成本换取了关键的步级优化信号,是目前解决 LLM Agent 长序列稀疏奖励训练难题的最优解之一。
2.2.1.2. Agent自进化
2.2.1.2.1. Harness进化
Harness 是围绕模型的运行时控制层,负责组织上下文、工具访问、权限、执行、反馈、记忆和恢复。它的关键价值在于时间尺度不对称性:Harness 状态可以在部署期间被频繁、低成本地检查、修订和治理,而模型权重则不能。
在单个任务内部,agent 循环(行动→观察→决策→重复)只需要成功一次就够了。但学习不同:它需要在多个窗口之间积累跨会话的经验。Loop 循环运行在 harness 之上,harness 决定这个 Loop 循环能保留什么。
EvoAgentX 给一个自然语言目标,先自动生成多 Agent 工作流,然后用进化算法迭代优化。它同时优化三个层面,三条优化线并行进化:
• Prompt 文本:用 TextGrad 调整每个 Agent 的指令措辞。
• 工作流拓扑:用 AFlow 搜索 Agent 间的连接方式。
• 配置参数:用 MIPRO 优化工具选择和参数设定。
三条线并行进化,每一代的最优方案保留,变异出新方案,再评估、再筛选。


2.2.1.2.2.元进化智能体
当改进过程本身成为优化对象时,就进入了元进化(Meta-Evolution)regime。HyperAgents 系统由 Task Agent(干活 Agent)和 Meta Agent(改进 Agent)两部分组成,统一写在可编辑程序中。Meta Agent 不仅能改 Task Agent 的代码,还能改自己的代码,改进策略本身也在进化。
同时实验发现系统自己发明了持久化记忆和性能追踪机制,没人预设这些改进功能,Agent 判断用这种方式改进效率更高,就写代码给自己改进了。
同时,该方案跨领域迁移性强:把在论文审稿和机器人任务上进化出的 HyperAgent,直接拿去做 IMO 数学评分,原版 DGM 的迁移效果约等于 0,而 DGM-H 的 imp@50 达 0.630。原因在于 HyperAgents 学到通用改进策略,如持久化记忆、趋势分析等,这些在新领域仍然管用。

2.2.2.模型参数进化
当 Harness 经验变得稳定且通用时,需要考虑参数路径——将经验内化为模型权重:
• Internalize priors:内外经验,避免重复支付上下文编排开销。
• Transfer beyond context:策略更新可跨任务、会话、用户迁移。
• Collective evolution:集体进化、协同更新,让单个智能体经验成为共享先验。

2.2.2.1.反馈进化
• 邮件生成后训练:基于人工修正后回复数据,进行基于 GRPO 的验证奖励后训练。
• 邮件评估后训练:基于业务标注反馈数据,进行基于强化学习的对抗奖励后训练。


2.2.2.2.自我归因
AgentEvolver通过 LLM 回溯评估每步贡献,精准区分关键决策与无效步骤,它把进化分三个阶段:
• 自我提问(Self-Questioning):Agent 自主探索环境,自己生成训练任务,无需人工准备数据。
• 自我导航(Self-Navigating):用 ReMe 经验池管理模块,把跨任务成功经验存储起来,后续任务直接调用。
• 自我归因(Self-Attributing):用 ADCA-GRPO 算法做轨迹级别的因果信用分配,分析每一步操作的因果贡献,比如第 3 步帮了多少忙,第 7 步拖了多少后腿。
AgentEvolver 的自归因机制,像给智能体配备了精准复盘教练,通过 LLM 推理能力,为每个步骤分配差异化奖励,让学习更高效。其核心逻辑分为两步:
• 第一步:LLM 回溯评估,给步骤”打分”。智能体将”任务描述、完整轨迹、最终得分”输入 LLM,让 LLM 按规则评估每个步骤的贡献:若最终成功,”促进任务的步骤”标为 GOOD,”无关/有害步骤”标为 BAD;若最终失败,”纠正错误的步骤”标为 GOOD,”导致错误的步骤”标为 BAD。这种二进制标签无需复杂校准,却能清晰区分步骤价值。
• 第二步:融合过程与结果,构建复合奖励。先将 GOOD/BAD 标签量化为 +1/-1 的”过程奖励”,并按轨迹级标准化(避免长轨迹主导统计);再结合”结果奖励”(如任务完成与否的终端奖励),通过公式融合——其中α控制过程奖励的权重,既保证智能体关注步骤正确性,又不偏离最终目标。
这种设计让样本利用率大幅提升:在 AppWorld 中,智能体达到传统 RL 基线 90% 的性能,所需训练步骤减少 55%;在 BFCL-v3 中更是减少 67%(如表 6)——这意味着同样的样本量,自归因能让智能体学到更多。

2.2.2.3.自蒸馏
论文 OPSD《Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models》提出了名为 On-Policy Self-Distillation 的训练新范式,其核心是让同一个模型”自己教自己”——用它看到正确答案后的更强判断力,去指导它在没有答案时的生成过程。
| 角色 | 输入 | 行为 | 作用 |
| 学生策略(Student Policy) | 仅题目 | 正常采样生成回答 | 模拟真实推理过程(on-policy 轨迹) |
| 教师策略(Teacher Policy) | 题目 + 答案 | 对学生的每一步输出进行评估,给出更优的 token 分布 | 提供细粒度监督信号 |
训练流程
• 采样:学生模型基于题目生成一条完整回复轨迹
• 评估:学生计算自己每步输出 token 的概率分布;教师在同一上下文中,结合标准答案,预测每个位置应输出的 token 分布
• 优化目标:最小化两者之间的 Jensen-Shannon Divergence (JSD),实现 token 级别的知识迁移。梯度仅回传给学生模型,教师模型作为目标网络(可使用初始模型或移动平均)

3. 有效自进化
以上我们探讨了自进化的核心机制,然而,理论上的”可进化”到落地上的”有效进化”,还有比较长的路要走!自进化机制在落地时也存在不少问题:
• 方向不可控(过拟合风险):单轮对话轨迹往往带有偶然性、特异性甚至极端 Case。若直接基于单次轨迹更新,Skill 极易为了迎合个别 Badcase 而变得臃肿、发散,导致”顾此失彼”,泛化能力大幅下降,出现”越优化越差”的现象。
• 质量不稳定(缺乏验证):缺乏客观的量化评估体系,Skill 的迭代如同”盲人摸象”。在没有严格验证闭环的情况下,我们无法区分是 Skill 本身的质量提升,还是环境噪声导致的指标波动,导致线上服务稳定性难以保障。
因此,我们需要做好 Agent 数据流反馈与评估体系,形成科学、方向可控的进化机制!
附:参考文献
- Self-Improvements in Modern Agentic Systems: A Survey
- Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
- EvoSkill: Automated Skill Discovery for Multi-Agent Systems
- SkillOpt: Executive Strategy for Self-Evolving Agent Skills
- CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification
- SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
- Dynamic Dual-Granularity Skill Bank for Agentic RL
- Group-in-Group Policy Optimization for LLM Agent Training
- AgentEvolver: Towards Efficient Self-Evolving Agent System
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
本文作者@AliExpress技术。原文链接:https://mp.weixin.qq.com/s/AKvtr7IQ9oCGf5xldKeBNw
