大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26
AI技术研报 2026-08-05 10:30
+7320 阅读

想象一个刚上岗的实习生。教他做A任务,他学得很好;接着教他做B任务,他又学会了——但回过头再让他做A,他却忘得七七八八。


大模型也有同样的毛病。一个预训练好的模型本身“知识渊博”,可一旦在新任务上继续微调,它往往会覆盖掉原有的能力。这就是持续学习(Continual Learning, CL)领域绕不开的灾难性遗忘(catastrophic forgetting)


于是一个核心问题浮出水面:怎么教一个庞大而静态的预训练模型学会新技能,同时不破坏它已有的通用知识,还能稳定地持续扩容?


来自澳大利亚新南威尔士大学(UNSW)Artificer AI Lab的研究团队,给出了一个新答案。他们把每一次模型更新,拆解为最小的rank-1「记忆原子」,让持续学习变成一座参数化记忆库的“little by little”增量生长——新知识一点点添进去,旧本领稳稳留在原地,还不需要额外的路由器来指挥。


该工作已被ICML 2026接收,方法命名为MoRAM(Mixture of Rank-1 Associative Memory)。在CLIP与多个大语言模型基准上,MoRAM都取得了更优的稳定性—可塑性平衡,以及更低的遗忘。


大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26


现有做法卡在哪儿?粒度太「粗」


近年来一个流行的思路,是把LoRA适配器当作“专家(expert)”,套上混合专家(Mixture-of-Experts, MoE)框架:每来一个新任务,就新增一个专家、冻结旧的,再用一个路由器决定每个输入该交给谁。


听起来很合理,但随着专家越攒越多,问题也随之而来。根因只有一个:专家的粒度太粗了。一个高秩(high-rank)LoRA专家,本质上把大量互不相关的知识“打包”塞进了一个不可拆分的整块。


由此带来三个连锁反应:


  • 干扰(Interference):一个粗粒度专家里塞了太多子空间。为某个输入激活它,会不可避免地连带触发一堆不相关的子空间,干扰到其他任务的知识。
  • 冗余(Redundancy):新专家没法复用旧专家里的“某一小块”知识。一旦现有组合覆盖不了新任务,就只能整块重新学——白白浪费容量。
  • 路由崩溃(Routing Collapse):专家不够专精,路由器就越来越分不清谁是谁。专家一多,路由开始漂移、老专家被误路由,遗忘随之加速。


一句话:路由器是看得见的失败点,但真正的病根,是这些不可拆分的固定秩专家太“粗”了。


MoRAM:把知识拆到最小,让记忆自己说话


MoRAM换了一个视角。


早在上世纪,Kohonen就指出:一个权重矩阵,本身就可以看作一套“线性联想记忆”(Linear Associative Memory)——由一组组“键–值(key-value)”对构成,输入进来时,通过内容匹配把对应的值“读”出来。


顺着这个视角,一个秩为r的更新,其实就是往这套记忆里写入了r个新的(键,值)条目。那么,与其把更新当成一个笨重的整块,不如把它拆到最小单元——每一个都是一次rank-1(秩1)的参数化更新,团队称之为一个记忆原子(memory atom)


大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26

MoRAM架构总览:每个新任务冻结旧原子、增添新的rank-1原子,稀疏自激活联合检索


于是,持续学习被重新定义为:不断扩张一座由细粒度原子单元组成的参数化记忆库。每个原子都是一次学习快照(learning snapshot),推理时按输入内容精准检索、按需取回。


它的运作可以拆成三步——、记、用


  • 学:每来一个新任务,就往记忆库里添加一小批rank-1原子,同时冻结所有旧原子。知识一点点地加进去,“little by little”。
  • 记:每个原子独立、可复用,互不覆盖。旧任务的记忆稳稳地留在原地。
  • 用:推理时,每个原子用自身的“键”判断自己跟当前输入有多相关——不需要额外的路由器。相关的被激活,不相关的保持沉默。


这带来一个关键的范式转变:从“地址式路由(学习该把数据发给谁)”,变成“内容寻址式检索(输入自动触发对的记忆)”。路由器这个“病根”被直接绕开了——每个记忆原子,用自己的内容为自己代言。


实验:CLIP与LLM上都更能「学新不忘旧」


团队在视觉-语言模型(CLIP)和大语言模型(LLM)两条战线上做了大量实验。


在CLIP上(X-TAIL基准,10个连续任务),MoRAM在Average、Last两项指标上都取得了最优表现,同时很好地保留了模型对未见任务的零样本(zero-shot)能力——细粒度的原子让新知识被“隔离”地学习,不会覆盖旧知识。


大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26

X-TAIL基准上的Transfer/Average/Last对比(红色最优,蓝色次优)


在LLM上(TRACE基准,三个模型家族),MoRAM在LLaMA-2-7B、Gemma-2B、LLaMA-3.2-1B上都拿到了最低的遗忘率——其中反向迁移(BWT,衡量遗忘)比最强的LoRA类基线还低2~6倍。同一套配置,跨模型家族稳定生效,无需逐个调参。


大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26

TRACE基准上的Overall Performance(OP↑)与Backward Transfer(BWT↓)


更有意思的是可视化。把每个原子的激活画出来,可以看到三件事:


  • 专精:飞机的图像块会强烈激活某几个特定原子,其余原子几乎不动。
  • 不遗忘:学完后续任务后,回看第一个任务的输入,激活模式几乎纹丝不动——旧原子依然只回应旧内容。
  • 知识复用:一个学到“蓝天”概念的旧原子,会在后来“汽车”任务里、当画面重新出现天空时被再次唤醒——不需要新增专家,旧原子本身就是复用机制。


大模型灾难性遗忘新解法:秩1联想记忆实现无损持续学习 | ICML'26

MoRAM原子激活可视化:专精、不遗忘、知识复用三种行为


为什么这件事很重要?


MoRAM让大模型的持续适配变得更高效、更可靠。它只更新最相关的少量低秩子空间,因而计算和存储开销都很低,让教育、医疗、金融等场景下的端侧个性化更具可行性;同时,因为它把大部分预训练参数留在原地,也更好地保住了模型在安全攸关场景里的稳定性。


学习,不再是“学一个忘一个”,而是little by little,一点点地生长出一座越来越丰富的参数化记忆。


论文标题:MoRAM: Little by Little — Continual Learning via Incremental Mixture of Rank-1 Associative Memory Experts
论文作者:Haodong Lu, Chongyang Zhao, Minhui Xue, Lina Yao, Kristen Moore, Dong Gong
论文地址:https://openreview.net/pdf?id=P247k4ELcn
项目主页:https://artificer-ai-lab.github.io/MoRAM/
团队主页(UNSW Artificer AI Lab):https://donggong1.github.io/


文章来自于"量子位",作者 "MoRAM 团队"。

1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群