想象一个刚上岗的实习生。教他做A任务,他学得很好;接着教他做B任务,他又学会了——但回过头再让他做A,他却忘得七七八八。
大模型也有同样的毛病。一个预训练好的模型本身“知识渊博”,可一旦在新任务上继续微调,它往往会覆盖掉原有的能力。这就是持续学习(Continual Learning, CL)领域绕不开的灾难性遗忘(catastrophic forgetting)。
于是一个核心问题浮出水面:怎么教一个庞大而静态的预训练模型学会新技能,同时不破坏它已有的通用知识,还能稳定地持续扩容?
来自澳大利亚新南威尔士大学(UNSW)Artificer AI Lab的研究团队,给出了一个新答案。他们把每一次模型更新,拆解为最小的rank-1「记忆原子」,让持续学习变成一座参数化记忆库的“little by little”增量生长——新知识一点点添进去,旧本领稳稳留在原地,还不需要额外的路由器来指挥。
该工作已被ICML 2026接收,方法命名为MoRAM(Mixture of Rank-1 Associative Memory)。在CLIP与多个大语言模型基准上,MoRAM都取得了更优的稳定性—可塑性平衡,以及更低的遗忘。

近年来一个流行的思路,是把LoRA适配器当作“专家(expert)”,套上混合专家(Mixture-of-Experts, MoE)框架:每来一个新任务,就新增一个专家、冻结旧的,再用一个路由器决定每个输入该交给谁。
听起来很合理,但随着专家越攒越多,问题也随之而来。根因只有一个:专家的粒度太粗了。一个高秩(high-rank)LoRA专家,本质上把大量互不相关的知识“打包”塞进了一个不可拆分的整块。
由此带来三个连锁反应:
一句话:路由器是看得见的失败点,但真正的病根,是这些不可拆分的固定秩专家太“粗”了。
MoRAM换了一个视角。
早在上世纪,Kohonen就指出:一个权重矩阵,本身就可以看作一套“线性联想记忆”(Linear Associative Memory)——由一组组“键–值(key-value)”对构成,输入进来时,通过内容匹配把对应的值“读”出来。
顺着这个视角,一个秩为r的更新,其实就是往这套记忆里写入了r个新的(键,值)条目。那么,与其把更新当成一个笨重的整块,不如把它拆到最小单元——每一个都是一次rank-1(秩1)的参数化更新,团队称之为一个记忆原子(memory atom)。

于是,持续学习被重新定义为:不断扩张一座由细粒度原子单元组成的参数化记忆库。每个原子都是一次学习快照(learning snapshot),推理时按输入内容精准检索、按需取回。
它的运作可以拆成三步——学、记、用:
这带来一个关键的范式转变:从“地址式路由(学习该把数据发给谁)”,变成“内容寻址式检索(输入自动触发对的记忆)”。路由器这个“病根”被直接绕开了——每个记忆原子,用自己的内容为自己代言。
团队在视觉-语言模型(CLIP)和大语言模型(LLM)两条战线上做了大量实验。
在CLIP上(X-TAIL基准,10个连续任务),MoRAM在Average、Last两项指标上都取得了最优表现,同时很好地保留了模型对未见任务的零样本(zero-shot)能力——细粒度的原子让新知识被“隔离”地学习,不会覆盖旧知识。

在LLM上(TRACE基准,三个模型家族),MoRAM在LLaMA-2-7B、Gemma-2B、LLaMA-3.2-1B上都拿到了最低的遗忘率——其中反向迁移(BWT,衡量遗忘)比最强的LoRA类基线还低2~6倍。同一套配置,跨模型家族稳定生效,无需逐个调参。

更有意思的是可视化。把每个原子的激活画出来,可以看到三件事:

MoRAM让大模型的持续适配变得更高效、更可靠。它只更新最相关的少量低秩子空间,因而计算和存储开销都很低,让教育、医疗、金融等场景下的端侧个性化更具可行性;同时,因为它把大部分预训练参数留在原地,也更好地保住了模型在安全攸关场景里的稳定性。
学习,不再是“学一个忘一个”,而是little by little,一点点地生长出一座越来越丰富的参数化记忆。
论文标题:MoRAM: Little by Little — Continual Learning via Incremental Mixture of Rank-1 Associative Memory Experts
论文作者:Haodong Lu, Chongyang Zhao, Minhui Xue, Lina Yao, Kristen Moore, Dong Gong
论文地址:https://openreview.net/pdf?id=P247k4ELcn
项目主页:https://artificer-ai-lab.github.io/MoRAM/
团队主页(UNSW Artificer AI Lab):https://donggong1.github.io/
文章来自于"量子位",作者 "MoRAM 团队"。
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner