大模型灾难性遗忘新解法:秩 1 联想记忆实现无损持续学习 | ICML’26

他们把每一次模型更新,拆解为最小的 rank-1″记忆原子”,让持续学习变成一座参数化记忆库的”little by little”增量生长 —— 新知识一点点添进去,旧本领稳稳留在原地,还不需要额外的路由器来指挥。在 CLIP 上(X-TAIL 基准,10 个连续任务),MoRAM 在 Average、Last 两项指标上都取得了最优表现,同时很好地保留了模型对未见任务的零样本(zero-shot)能力 —— 细粒度的原子让新知识被”隔离”地学习,不会覆盖旧知识。在 LLM 上(TRACE 基准,三个模型家族),MoRAM 在 LLaMA-2-7B、Gemma-2B、LLaMA-3.2-1B 上都拿到了最低的遗忘率 —— 其中反向迁移(BWT,衡量遗忘)比最强的 LoRA 类基线还低 2~6 倍。

原文连接