ARTICLE SIGNAL
大模型无损持续学习突破:MoRAM深度解析与AI前沿
探讨大模型灾难性遗忘的最新解法,ICML'26接收的MoRAM技术通过秩1联想记忆实现无损持续学习。深入解析LLM,大模型,AI新闻,人工智能等前沿AI资讯,探索参数化记忆库如何提升AI变现潜力。
type
status
date
slug
summary
tags
category
icon
password
网址
想象一个刚上岗的实习生:你教他做A任务,他学得又快又好;接着你教他做B任务,他也顺利掌握了。但当你回过头让他再做A任务时,他却忘得一干二净。在人工智能领域,特别是当我们训练大模型时,同样面临着这个令人头疼的问题。
一个预训练好的LLM(大语言模型)本身拥有渊博的知识,但一旦在垂直领域的新任务上进行微调,它往往会不可逆转地覆盖掉原有的通用能力。这就是持续学习(Continual Learning)领域中著名的“灾难性遗忘”(Catastrophic Forgetting)。如何在不破坏已有知识的前提下,让庞大的预训练模型不断吸收新技能?
近期,澳大利亚新南威尔士大学(UNSW)研究团队提出了一种全新解法——MoRAM(Mixture of Rank-1 Associative Memory),该研究已被ICML 2026高分接收。作为专业的AI资讯门户,今天我们将为您深度拆解这项可能改变AGI发展轨迹的硬核AI新闻。
传统持续学习的瓶颈:粗粒度专家的“副作用”
近年来,为了解决大模型的遗忘问题,业界流行一种基于MoE(混合专家)框架的LoRA适配器方案。其核心逻辑是:每遇到一个新任务,就新增一个“专家”(Expert)并冻结旧专家,同时训练一个路由器(Router)来决定输入该分配给谁。
这种方法在openai的早期模型或各类开源模型中都有过尝试,但随着任务的增加,系统很快会面临崩溃。根本原因在于:专家的粒度太“粗”了。一个高秩(high-rank)的LoRA专家本质上是将大量互不相关的知识强行打包,这引发了三个致命的连锁反应:
- 干扰(Interference):由于知识被粗放打包,激活某个专家处理特定输入时,会不可避免地触发不相关的子空间,从而干扰其他任务的知识。
- 冗余(Redundancy):新任务无法复用旧专家中“某一块”有用的知识。如果现有的粗粒度专家无法完全匹配新任务,模型只能重新学习一整个新专家,造成极大的算力浪费。
- 路由崩溃(Routing Collapse):随着专家数量激增,路由器越来越难以分辨每个专家的专长。一旦路由器发生漂移,旧知识的遗忘便会加速。
MoRAM的核心机制:将知识拆解为“记忆原子”
面对传统架构的困境,MoRAM团队从上世纪Kohonen提出的“线性联想记忆”(Linear Associative Memory)中汲取灵感,完成了一次优雅的范式转换。
如果一个权重矩阵可以看作是由一组组“键-值(key-value)”对构成的记忆库,那么一次秩为r的更新,实际上就是写入了r个新的条目。MoRAM放弃了笨重的“整块更新”,将每一次模型更新拆解为最小的单元——秩为1(rank-1)的参数化更新。团队将这种极细粒度的单元称为“记忆原子”(Memory Atom)。
通过这种设计,大模型的持续学习变成了一座参数化记忆库的增量生长过程。其运作机制可以精准概括为三个步骤:
- 学(Learn):面对新任务,模型向记忆库中添加一小批rank-1原子,同时冻结所有旧原子。知识如同搭积木般“little by little”地累积,互不干涉。
- 记(Remember):每个记忆原子高度独立且可复用。旧任务的记忆被稳妥地保存在原地,彻底杜绝了覆盖现象。
- 用(Use):这是MoRAM最巧妙的一环。在推理时,每个原子利用自身的“键”来评估与当前输入的相关性。相关的原子被激活,不相关的保持沉默。这种“内容寻址式检索”彻底抛弃了容易崩溃的外部路由器。
实验验证:在多模态与LLM上的卓越表现
无论是多模态的CLIP模型,还是当红的chatGPT同级别开源大语言模型,MoRAM都展现出了惊人的“学新不忘旧”能力。
在针对CLIP的X-TAIL基准测试(包含10个连续任务)中,MoRAM不仅在平均性能和最终性能上取得最优,还完美保留了模型对未见任务的零样本(zero-shot)能力。细粒度的记忆原子让新知识被安全地“隔离”学习。
而在针对LLM的TRACE基准测试中,MoRAM在LLaMA-2-7B、Gemma-2B等多个模型家族上均取得了最低的遗忘率。其反向迁移(衡量遗忘的核心指标)比目前最强的LoRA基线模型还要低2到6倍。更重要的是,同一套超参数配置可以跨模型稳定生效,极大降低了调参成本。
通过原子激活的可视化分析,研究人员还发现了MoRAM的三大特性:
1. 专精:特定的输入(如飞机的图像块)只会强烈激活特定的几个原子。
2. 不遗忘:学习完后续几十个任务后,重新输入第一个任务的数据,旧原子的激活模式纹丝不动。
3. 知识复用:一个在早期任务中学到“蓝天”概念的原子,会在后期“汽车”任务中遇到天空背景时被自动唤醒。
持续学习的未来:从理论到商业变现的广阔前景
MoRAM的出现不仅仅是一篇顶会论文,它为AI变现和端侧大模型的落地提供了极具价值的工程指导。
在教育、医疗、金融等需要高度个性化且数据持续更新的场景中,MoRAM使得大模型的持续适配变得极其高效。因为它每次只更新最相关的少量低秩子空间,计算和存储开销被压缩到了极致。同时,由于绝大部分预训练参数被安全保留,模型在安全攸关场景下的稳定性得到了根本保障。
对于广大的AI开发者和提示词工程师(Prompt Engineer)而言,理解模型底层的记忆机制,有助于我们设计出更高效的提示词。未来,大模型的学习将不再是“狗熊掰棒子”般的学一个忘一个,而是真正像人类一样,一点点生长出丰富且稳固的知识网络。
在claude、OpenAI等巨头不断推陈出新的今天,掌握最前沿的AI技术动态是保持竞争力的关键。想要获取更多深度的AI日报、掌握大模型的最新玩法,欢迎持续关注专业的AI资讯门户,我们将为您带来最及时、最硬核的AI前沿解析与实战指南。
Loading...