一份面向公众的研究综述 · 结论先行,论证与数据在后,全部文献见 SOURCES.md
写给所有读者的开场白:今天的 AI 学东西更像一次性铸造,而不是持续成长——先用海量资料"教"一遍,然后定型投入使用。此后若再教它新东西,新知识往往会覆盖旧知识,因为它的全部本领都写在同一批共享的内部数值上,为学新而调整这些数值,就难免抹掉旧的。人恰恰相反:我们一辈子不断学习,旧本领大多保得住,而且学得越多、再学新东西越快。如果这个差距被解决,AI 将不再是需要定期从头重造的产品,而更像一位随经验成长的同事——共事越久,越懂你的世界。这份报告解释:为什么现在做不到,难点到底在哪,哪些研究路线最有希望。
证据标签说明:本文对每个关键论断标注证据强度。
- 【已确立】:多个独立研究重复验证,或有严格理论证明,领域内基本无争议;
- 【有争议】:有公开发表的证据支持,但存在相互冲突的结果或未决的解释分歧;
- 【推测】:合理外推或作者综合判断,尚无直接证据,读者应视为假说。
本文只使用公开发表的文献(期刊、会议、arXiv 预印本、公开报告),正文中以 [S编号] 引用,完整书目见 SOURCES.md。初稿文献检索截至 2025 年;2026-09 补充纳入一批经逐条核验的公开文献(SOURCES.md 第 F 节,S100–S127),会议名称仅在直接核验后标注。
术语约定:每个专业术语在首次出现处均附有通俗解释(括号内)。若中途翻阅遇到陌生词,可回到其首次出现处查看定义。
第〇部分:结论先行
出发的问题是:一个真正强大的 AI 应当像人一样,终其一生持续学习。今天没有任何系统做到这一点。要做到,必须解决哪些根本问题?哪些方向最有希望?
十二条核心结论:
- 今天的深度学习在结构上是"两阶段"的——先训练、后冻结使用——这与终身学习的要求直接冲突。这不是工程细节,而是根本缺陷。(深度网络:由大量可调数值层层堆叠而成的学习系统;这些可调数值叫参数或权重,模型的全部知识就存在其中。)一旦让标准深度网络持续学习(不停用、边用边学,而不是一次性训练),它会同时暴露两种失败:忘掉旧的(灾难性遗忘)和学不动新的(可塑性丧失;可塑性=还能被新经验改变、学会新东西的能力)。两者都有扎实的实验证据。【已确立】[S1][S23]
- 灾难性遗忘自 1989 年就已知,至今没有通用解。 它的机制是清楚的:分布式表示(每条知识分散写在许多共享数值上,而不是各占一格)意味着新旧知识共用参数,学新任务时的梯度更新(训练中对参数的逐步微调)会覆写旧任务依赖的权重。三类缓解手段——正则化(给参数改动加"惩罚",不许离旧状态太远)、重放(留一小份旧数据,学新时混进去复习)、结构隔离(给新任务划拨独立的网络部件)——各有代价,没有一种在无任务边界、数据只过一遍、存储受限的真实设定下全面成立。【已确立】[S1][S3][S13]
- 可塑性丧失是近年才被充分确认的"另一半"问题,且更为致命。 Dohare 等在 Nature(2024)证明:标准深度学习方法在持续学习设定下会逐渐丧失学习能力,最终不如浅层网络;仅靠梯度下降(沿"错误减少最快"的方向反复微调参数的标准训练算法)不够,需要持续注入随机性(如持续反向传播:持续随机重置一小部分不再起作用的神经元,让网络保有"新鲜细胞")才能无限期保持可塑性。【已确立,但"随机性是否必需"这一强论断有待更多独立检验→有争议的部分见正文】[S23]
- 理论上,"不用记忆、只靠巧妙的参数更新"的完美持续学习基本无望。 Knoblauch 等(ICML 2020)证明最优持续学习一般需要完美记忆且为 NP 难(计算复杂度理论中公认无法高效求解的一类问题);这解释了为什么重放/记忆类方法在实证中系统性地强于纯正则化方法。任何认真的终身学习方案都必须包含某种形式的记忆。【已确立(定理本身);对实践的约束力属合理推断】[S18]
- 损失几何给了"就近学习"一个真实但有限的机会窗口。(损失:衡量模型犯错程度的分数,训练就是把它压低;"损失几何"研究参数空间里这个分数的地形。)过参数化(参数远多于"刚好够用")网络的好解不是孤点,而是连成一片的低损失区域(模式连通性);从同一预训练模型(先在海量通用数据上训练出的底座)出发微调(用新数据接着训练)得到的多个解甚至由直线相连,可以直接加权平均合并(model soups、任务算术)。这解释了为什么 EWC、LoRA、正交投影、模型合并这类"待在旧解附近学新"的方法效果不错——尤其在强预训练模型之上。【已确立】[S32][S33][S34][S40][S48][S49]
- 但"就近学习"有原则性上限:约束会累积耗尽容量,而真正的新知识要求特征改变,不能永远线性化。 正交投影类方法(只沿不影响旧任务的方向更新参数)的可用方向随任务数递减;EWC 依赖的 Fisher 估计(对"哪些参数对旧任务重要"的数学估计)在长序列上失真;类增量场景(最难的设定:不告诉模型现在是哪个任务)下纯正则化方法系统性失败;惰性(NTK)区的学习(参数几乎不动、模型近似线性的训练状态)恰恰放弃了深度学习最有价值的特征学习(网络自己发明新的内部概念)。"就近学习"是强预训练模型上的短中期策略,不是终身学习的完整答案。【已确立(各失效点)+ 综合判断】[S13][S37][S38][S46]
- 大脑的答案不是单一机制,而是一套多时间尺度的系统架构:互补学习系统(海马快学、皮层慢固化)、睡眠重放、突触内部的多时间尺度状态、稀疏编码与神经调质门控。(海马:大脑中快速记录具体事件的区域;新皮层:缓慢提炼规律的区域;突触:神经元之间强度可调的连接,相当于大脑的"权重";固化:把易失的新记忆转成持久记忆的过程;稀疏编码:任一时刻只让少数神经元活跃;神经调质:多巴胺等化学信号,控制"何时该学、学多快"。)其中最可迁移的洞见是:记忆必须分层,固化必须是主动过程,"学多快"本身要被调控。【已确立(生物机制);"可迁移"属有依据的推断】[S61][S86][S88][S89][S90]
- 当前实证上最能打的工程路线是"记忆系统 + 重放 + 慢速固化"的组合,而不是任何单一算法。 重放是持续学习基准(标准化测试集)上最稳健的方法族;检索增强(RAG)(模型回答前先到外部资料库查资料,而不是全凭记在参数里的知识)把事实性知识外置,绕开了权重更新;LLM(大语言模型)持续预训练用"学习率(每次参数调整的步幅)再升温 + 小比例旧数据重放"已能接近重训效果。【已确立(各单项);组合优先级为作者判断】[S13][S64][S74]
- 上下文内学习(ICL)是一种真实但短暂的持续学习,它提示了一条架构级出路:把"学习"变成推理的一部分。(上下文内学习:不改任何参数,只把示例放进对话窗口,模型就能现学现用;推理:模型被使用、生成输出的阶段,区别于训练阶段。)研究表明 Transformer 计算一次输出的过程(前向传播)可以隐式地执行梯度下降——等于在"脑内"临时学习;测试时训练(TTT 层、Titans)把这一点显式化,让模型在使用中持续更新一个快速记忆模块。这是当前最有想象空间的架构方向之一,但尚未在真正的终身尺度上验证。【已确立(机制研究)/【推测】(作为终身学习路线)】[S67][S68][S69][S70]
- 领域的标准框架部分问错了问题。 主流基准把持续学习定义为"在受限条件下逼近多任务联合训练(把所有任务数据攒在一起同时训练——被当作理想上限)"——目标是不掉分。但终身学习的真正目标是知识积累与复利:学得越多,学新东西越快(前向迁移:旧知识帮到新学习),旧知识还能被新经验改善(后向迁移)。几乎没有基准直接度量"学习加速度";一个朴素基线(最简单的对照方法。GDumb:只存样本、考前重训)能击败大批复杂方法,说明现有评测没有测到真正的能力。【已确立(GDumb 等证据)+ 观点(框架批评)】[S15][S16][S17]
- 神经发生的教训:连生物学自己都还在争论。(神经发生:大脑长出新的神经元。)成人海马是否终身产生新神经元,2018 年两篇顶刊结论直接相反(Sorrells: 检不出;Boldrini: 持续到 79 岁)。对 AI 的启示是方向性的(注入新鲜可塑性单元有价值——这恰是持续反向传播所做的),而非可以照抄的蓝图。【有争议(生物事实)】[S23][S94][S95]
- 最有希望的方向排序(作者综合判断,理由见第六部分):① 面向 LLM 的互补学习系统(检索式情景记忆〔对具体经历的记忆,区别于对规律的记忆〕+ 周期性固化入权重);② 保持可塑性的优化器与架构(持续反向传播家族);③ 规模化持续预训练的"配方科学";④ 把学习内置于推理的架构(TTT/快速权重);⑤ 几何引导的模型合并与低秩更新(冻结模型主体,只训练一小块附加参数,LoRA 即此类)。真正的瓶颈不在任何单点技术,而在缺少一个诚实的、开放式的终身学习评测与理论目标函数。【推测(排序本身)】
第一部分:问题定义——持续学习到底在问什么
1.1 两难的原型:稳定性 vs 可塑性
一个学习系统面对源源不断的新经验,有两种对称的死法:太"稳定",新东西学不进去;太"可塑",新东西把旧东西冲掉。Grossberg 在 1980 年就把这命名为稳定性–可塑性两难(stability–plasticity dilemma)[S4],并在 ART 架构中第一次尝试正面解决 [S5]。这不是深度学习特有的毛病,而是任何用共享资源存储知识的系统的普遍约束。
深度网络把这个两难表现得极端:McCloskey 与 Cohen(1989)发现,顺序训练的连接主义网络(神经网络的早期叫法)学习第二个任务时会灾难性地摧毁第一个任务的性能 [S1],Ratcliff(1990)做了系统定量刻画 [S2]。French(1999)指出根源:分布式表示的威力恰恰来自参数共享与重叠,而重叠就是干扰的来源——遗忘不是 bug,是分布式表示这枚硬币的反面 [S3]。【已确立】
1.2 标准形式化及其度量
现代文献通常这样设定:任务序列 T₁, T₂, …, Tₖ 依次到来,学习器每次只能看当前任务的数据,目标是在全部见过的任务上都表现好。Lopez-Paz 与 Ranzato(2017)给出了沿用至今的三个指标 [S15]:
- 平均准确率(ACC):全部学完后在所有任务上的平均表现;
- 后向迁移(BWT):学新任务对旧任务性能的影响(负值=遗忘,正值=温故知新);
- 前向迁移(FWT):旧知识对尚未学习的任务的帮助。
van de Ven 等进一步把场景分为三类 [S12][S13]:任务增量(测试时告诉你是哪个任务)、域增量(任务不变、数据分布变)、类增量(要在所有见过的类别中做判别,且不告诉你任务身份)。这个区分极其重要,因为方法的成败强烈依赖场景:正则化类方法(EWC 等)在任务增量下尚可,在类增量下系统性失败;类增量基本只有重放和结构方法能撑住 [S13]。【已确立】
1.3 这个框架问对问题了吗?——我们的论点
部分问对,部分问错。 以下三点批评均有公开证据支撑:
第一,现行基准度量的是"不退步",不是"会积累"。 标准指标以"多任务联合训练"为隐含天花板:一个把所有数据攒起来一起训的模型就是最优解,持续学习被定义为在"不能攒数据"的约束下逼近它。但终身学习的原始动机(Ring 1994 [S6]; Thrun & Mitchell 1995 [S7])是复利式的知识积累:学得越多,学新东西越快、越好——第 1000 个任务的学习曲线应当远陡于第 1 个。这对应 FWT,而 FWT 在绝大多数论文里是被顺带一提的次要指标,且鲜有工作展示随任务数增长的学习加速。一个只会"不忘"而不会"越学越快"的系统,不是人们想要的终身学习者。【观点,但指标现状可查证】[S15]
第二,朴素基线的胜利暴露了评测的失真。 Prabhu 等(2020)的 GDumb 什么持续学习技巧都不用:贪心地往一个小缓冲区里存样本,测试前用缓冲区从头重训一个模型——就这样击败了当时大批专门设计的方法 [S17]。Farquhar 与 Gal(2018)更早就指出,常用协议(多次遍历数据、测试时已知任务身份、只用两三个任务的短序列)使评测偏向根本不解决真问题的方法 [S16]。后续在固定算力预算下的重新评估进一步发现:许多已发表方法的增益在预算对齐比较中消失,简单方法(重放+合理分配算力)常常胜出 [S124]。如果基准能被"不学习"的方法打穿、增益经不起预算对齐,说明基准没有测到目标能力。【已确立】
第三,真实的终身学习没有任务边界,而"任务"这个概念本身可能是错误抽象。 现实经验流是连续、非平稳、无标注切分的。Task-free 设定(Aljundi 等 2019 [S19])、在线持续学习(单遍数据流;实证综述见 Mai 等 [S122])和 general continual learning(Buzzega 等 2020 [S55])朝正确方向走了一步,但仍是少数派。Silver 与 Sutton(2025)的"经验时代"论述把要求提得更高:智能体应栖居于终身经验流,目标、记忆与学习贯穿整个流,而不是被切成一次次短会话 [S20]。按这个标准,今天几乎全部持续学习文献研究的是真问题的一个玩具投影。【观点;引文立场为公开发表】
同时要为标准框架说句公道话:玩具投影不等于无用。灾难性遗忘和可塑性丧失在最干净的小设定里就已出现,机制研究(第二、三部分)正是靠这些受控设定取得的。批评的对象是把基准分数当成终身学习进展本身,而不是受控实验方法论。
1.4 一个理论锚点:没有免费的记忆
Knoblauch 等(ICML 2020)从集合论角度证明:能在最坏情况下避免灾难性遗忘的最优持续学习器,一般需要解 NP 难问题,并且需要完美记忆(至少保留每个"等价类"的一个样本)[S18]。两个推论:
因此,问题从"要不要记忆"变成"记什么、以什么形式记(原始样本/生成模型/权重/外部库)、何时固化、何时丢弃"。这是本文第四、六部分的主线。【已确立(定理);推论为有依据的解读】
还有一个目标层面的细节值得单独指出:"零遗忘"未必是正确目标。 在目标本身随时间变化的场景里,遗忘过时的知识可能恰恰是对的——例如推荐系统中,用户兴趣漂移后,过时的偏好不仅无用还有害,PESO 在该场景中明确以此为设计出发点 [S117]。这提示应区分干扰(新学习无意间破坏仍然有效的旧知识,坏)与修订(有意覆盖已失效的旧知识,好)——现有指标几乎都把两者混在同一个"遗忘"数字里。【已确立(该文的公开论证);"干扰/修订之分应进入指标"为作者观点】
第二部分:两种失败——灾难性遗忘与可塑性丧失
2.1 灾难性遗忘的机制
深度学习时代的系统实证从 Goodfellow 等(2013)开始 [S24]。机制层面目前最清晰的图景:
- 共享参数被覆写:新任务的梯度不"知道"哪些权重承载旧功能,大学习率、长训练、任务间表征重叠都会加剧覆写 [S3][S24]。
- 遗忘集中在深层:Ramasesh 等(2021)发现,靠近输出的深层表示漂移是遗忘的主要来源,浅层特征相对稳定;任务间语义相似度以非单调方式影响遗忘 [S29]。【已确立】
- 规模是缓解剂而非解药:Ramasesh 等(2022)发现,模型越大、预训练越充分,微调造成的遗忘越轻——大模型倾向于用更"正交"的方式容纳新任务 [S30];Mirzadeh 等(2021)独立发现加宽网络显著减少遗忘(加深则不然)[S106]。这与第三部分的几何图景一致。但注意:是"更轻",不是"消失";LLM 持续微调中的遗忘仍被反复观测到(Luo 等 2023 [S76])。【已确立】
- 平坦度相关:收敛到更平坦的极小点(小学习率衰减、适当正则)遗忘更少 [S39]。【已确立(相关性);因果性有争议】
2.2 可塑性丧失:另一半问题
灾难性遗忘讲的是"忘旧",可塑性丧失讲的是"学不动新"。这个问题长期被忽视,因为标准范式只训练一次。证据链近年迅速齐全:
- 温启动惩罚:Ash 与 Adams(2020)发现,在旧模型上继续训练新数据,泛化差于从头重训——哪怕数据只是变多了 [S25]。
- 深度强化学习(RL,让智能体靠试错和奖励信号学会行为的训练范式)中的首因偏差与休眠神经元:早期数据把网络"定型",降低后续学习能力(Nikishin 等 2022 [S26]);ReLU 单元(最常用的一类人工神经元)随训练大量死亡/休眠——输出恒为零、不再参与学习,周期性重置它们能显著提升性能(Sokar 等 2023 [S27])。
- 决定性证据——Dohare 等(Nature 2024) [S23]:在 Continual ImageNet(数千个顺序二分类任务)、缓慢漂移的回归任务(回归:预测连续数值)、以及持续变化的 RL 环境中,标准反向传播的学习能力随任务数持续衰退,最终不如一个浅层网络。伴随现象:死单元比例上升、权重幅值增长、表示的有效秩下降(即网络内部实际用到的独立维度越来越少,表达能力萎缩)。关键论断:在他们测试的范围内,只有持续注入随机多样性的算法能无限期保持可塑性——他们的"持续反向传播"按效用持续随机重置一小部分低效用单元,即可在监督与 RL 设定下长期维持学习能力。【已确立(现象与他们的实验范围内的结论)】
值得单独标注的是其强推论——"基于梯度下降的方法不够,持续深度学习需要非梯度的随机成分" [S23]。这是一个全称命题,而现有证据是存在性的(所试过的确定性方法都失败了)。L2 Init(向初始参数而非原点正则化 [S31])等确定性方法在较温和的非平稳性下也能维持可塑性,说明边界还没画清。我们标注:现象【已确立】,机制解释(曲率丢失、秩坍缩、死单元 [S27][S28])【已确立但不完整】,"随机性必需"【有争议】。
2.3 两种失败是同一枚硬币
把两者放回 Grossberg 的两难 [S4]:遗忘=稳定性不足,可塑性丧失=系统为求稳定(权重增大、表示固化)付出的代价在时间上的累积。任何只解决一半的方法都会在另一半上付账:冻结参数保护旧知识→加速可塑性耗尽;随机重置单元恢复可塑性→局部破坏旧知识。终身学习的核心不是消灭其中一个,而是找到能同时在两条轴上长期维持的机制——这正是大脑用多时间尺度架构解决的问题(第五部分)。【综合判断】
第三部分:几何视角——在参数空间里"就近学习"能走多远
3.1 低损失区域比想象中大得多
过参数化网络的一个反直觉事实:好解不是孤岛,而是连成一片的大陆。
- 模式连通性:Garipov 等与 Draxler 等(2018,独立同期)发现,两次独立训练得到的极小点(损失最低的参数组合)之间存在损失几乎不升高的简单曲线通道 [S32][S33]。【已确立】
- 线性模式连通性(LMC):Frankle 等(2020)发现,若两个解共享训练早期的起点,它们之间常常直线相连而损失不升;网络在训练早期就"稳定"进某个盆地(损失地形中的一片低洼区) [S34]。【已确立】
- 模除置换后可能只有一个盆地:Entezari 等(2022)猜想,考虑神经元置换对称(把网络里两个神经元连同各自连线互换,功能完全不变——所以同一个解有海量"换名"版本)后,SGD(随机梯度下降,标准训练算法)的解基本都落在同一线性连通盆地;Git Re-Basin(2023)通过置换对齐实证支持了这一点的很大一部分 [S35][S36]。【有争议(猜想的普适范围)】
对持续学习最直接的结果来自 Mirzadeh 等(2021):同初始化条件下,多任务联合训练的解与持续学习的解线性连通——也就是说,不忘旧任务的好解就躺在持续学习轨迹的"隔壁",遗忘的本质是优化器没有被约束住、走出了那条线性走廊 [S40]。【已确立】
两个补充刻画让这幅"低损失大陆"图景更完整:高维损失地形的大尺度结构分析表明低损失区域呈楔形大面积延展 [S110];而"内在维度"实验表明许多任务实际只需要在一个远低于参数总数的子空间里就能解出 [S111]——解空间的富余正是"附近就有好解"的容量基础。【已确立(各实验);两者与持续学习的连接为综合解读】
3.2 惰性训练:为什么"隔壁"常常够用
NTK 理论(Jacot 等 2018 [S37])与惰性训练分析(Chizat 等 2019 [S38])表明:足够宽的网络在训练中参数移动极小,函数变化近似于在初始点的线性化模型中进行。宽网络+强预训练把模型推向"局部线性、局部可解"的状态:新任务往往只需在旧解附近的一个线性子空间里就能解出。这为整个"就近学习"家族提供了统一的理论直觉。【已确立(理论);对实际预训练模型的适用度是近似】
在这一框架内,遗忘本身已经有了可计算的理论刻画:Doan 等(2020)用 NTK 重叠矩阵——新旧任务在核特征空间中的重叠程度——定量预测任务间干扰 [S107];Bennani 等(2020)给出了 NTK 区内正交梯度下降(OGD)的泛化保证 [S108];Evron 等(2022)在线性回归中精确刻画了顺序学习最坏情况下的遗忘量 [S109]。这条理论线索的含义:至少在(近似)线性区,"哪些任务组合会互相破坏"原则上是可以事先算出来的——这直接连到第六部分的 P7。【已确立(各定理/结果,均在线性或 NTK 假设下)】
3.3 "就近学习"方法家族的全景
按"如何定义'附近'"分类:
- 软约束(各向异性弹簧):最朴素的形式是 L2-SP——直接向出发点(预训练参数)做 L2 正则,迁移学习文献早已确立其有效性 [S101];EWC 把这根"弹簧"改为按 Fisher 信息加权的各向异性版本,重要参数拴得紧、次要参数拴得松 [S41];SI 在线累积重要性 [S42];MAS 用无监督(不需要标注答案)的敏感度估计 [S43]。
- 函数空间的"就近":LwF 不约束参数,而是约束行为——用蒸馏让新模型在新数据上继续模仿旧模型的输出 [S100]。参数距离与函数距离并不等价(见 3.4),所以这是一个实质不同的"附近"定义。
- 硬约束(正交子空间):OGD 把新梯度投影到旧任务梯度的正交补 [S44];OWM 用正交投影算子并在 Nature Machine Intelligence 上展示了上百任务的顺序学习 [S45];GPM 显式维护旧任务的核心梯度子空间 [S46];O-LoRA 把同一思想搬到 LLM 的低秩适配器上,让各任务的 LoRA 子空间相互正交 [S114]。
- 低维增量:LoRA 冻结主干、只训低秩修正 [S47]——"附近"被参数化为一个低秩流形;天然支持"每个新领域一个适配器"。大规模实证直接确认了这笔交易的两面:LoRA 学得更少、忘得也更少(Biderman 等 2024 [S113])——限制更新自由度同时买到了保持与代价。
- 权重空间算术:任务向量(微调解减预训练解)可以相加获得多任务能力、相减实现遗忘 [S48];同一起点的多个微调解可直接平均(model soups [S49])或按 Fisher 信息加权合并 [S116];TIES 进一步定位并消解合并时的参数干扰(符号冲突、冗余)[S115];微调解与原解插值可兼得新旧性能(WiSE-FT [S50])。这些只在共享预训练起点(同一线性盆地)时成立。
- 持续化的合并与锚定(最新进展):上述合并多是"一次性"的;新一代工作把它变成随时间滚动的过程——SLAO 用正交初始化+时间感知缩放,把每个新任务的更新持续合并进单个 LoRA,内存不随任务数增长(ICLR 2026 [S118]);PESO 维护一个持续演化的 LoRA,用近端项把当前适配器锚定在其最近的冻结状态附近,并明确论证在其推荐场景中过时知识应当被覆盖(ICLR 2026 [S117])。
- 反向的"就近":L2 Init 把参数拴向初始化点而不是旧解——目的不是防遗忘而是保可塑性 [S31]。同一几何工具,两个方向的用法,恰好对应两难的两端。
顺带一提,"限制每步更新的幅度"这个原则比持续学习更普遍:强化学习中的信赖域方法就是同一思想,近期一篇关于循环脉冲网络无梯度优化的公开预印本(arXiv:2601.21572 [S127])用按信号能量自适应缩放的信赖域来稳定训练——它是强化学习/优化方向的工作,与持续学习仅间接相关,此处仅作原则相通的旁注。
3.4 它在哪里断裂
【已确立】的失效点:
- 容量耗尽:正交投影每学一个任务就占用一块子空间,可用维度单调递减;任务足够多之后要么开始干扰、要么学不动。这是硬约束方法的算术必然,GPM 等论文自己就有讨论 [S46]。
- 重要性估计漂移:EWC 的 Fisher 是在旧解处的局部二次近似,离得越远越失真;长序列上惩罚项累积也会过约束(Progress & Compress 对此有分析 [S57])。
- 场景失配:类增量设定下,正则化方法整体接近失败——它们保得住表示,保不住"新旧类别之间的判别边界",后者需要新旧数据同时在场(或重放)才能校准 [S13]。
- 合并的前提是同一盆地:任务算术与 soups 对不同初始化的模型直接失效,需要置换对齐且效果打折 [S35][S36][S48]。
- 损失接近 ≠ 机制接近:"机制性模式连通性"研究表明,由低损失路径相连的两个解可能采用完全不同的内部计算机制(例如依赖不同的特征)[S112];Ramasesh 等也表明参数移动很小时深层表示仍可大幅漂移 [S29]。所以"参数待在附近"并不保证"模型在旧数据上的行为待在附近"——这正是 LwF 类函数空间约束 [S100] 与参数空间约束的分野。"附近"该用哪种度量(各向同性 L2 [S101]、Fisher 加权 [S41]、还是函数空间距离 [S100])本身就是未决问题。
- 最根本的:惰性区学习=放弃特征学习 [S38]。真正的新知识(新的表示原语,而不是旧特征的重新组合)要求参数离开线性化邻域。一个永远待在预训练解附近的系统,上限就是"预训练特征的重新混合"。
结论:几何解释了"就近学习"为什么在强预训练模型上惊人地好用(低损失大陆宽阔、局部近似线性),也解释了它为什么必然不够(大陆再大也有海岸线;线性化学不出新特征)。它是终身学习的重要构件——尤其是"围绕一个强基座做可合并的模块化更新"这条工程路线——但不是完整答案。【综合判断,各支撑点已确立】
📦 附:我们的玩具实验(仅作示意)
为直观感受本部分的几条论断,我们(通过一个配套的可复现实验仓库)跑了一个刻意做小的对照实验。它是示意性质的演示,不是与上述文献同等地位的证据:数据集极小、随机种子很少、不做统计显著性声明,以下只报告定性方向。
- 设置:5 个任务的"置换数字"流(sklearn 8×8 手写数字,类 MNIST 的微缩版;每个任务对像素做一次固定重排);numpy 实现的多层感知机,宽度 32/128/512;方法:朴素微调、向上一任务权重的 L2 惩罚(L2-to-previous)、EWC、小重放缓冲、只允许秩 4 的低秩更新。指标:每个任务的参数移动距离、遗忘量、前向迁移、相邻任务解之间线性插值路径上的损失壁垒。CPU 上约 20 秒跑完。
- 定性结果:重放最强(最终准确率最高、遗忘最低)——与第四部分的文献格局 [S13] 和记忆必要性的理论 [S18] 方向一致;L2-to-previous 与 EWC 都胜过朴素微调,其中 L2-to-previous 在全秩方法中参数移动最小——与"就近学习有效"的图景一致;加宽网络普遍提高最终准确率、降低微调/L2/重放的遗忘——方向上与过参数化/"附近有好解"的解释 [S30][S106] 一致;秩 4 低秩更新移动最少但欠拟合——正是 3.3/3.4 所述"限制自由度买保持、付学习能力"权衡([S113] 在大规模上的同款现象)的微缩版。
- 局限:玩具数据集、任务高度同构(置换任务间几乎无语义冲突,回避了类增量的难点)、种子数少。它的全部价值是:第三部分的定性预测在一个 20 秒可复现的最小设定里就能观察到——而不是为任何方法的优劣提供新证据。
第四部分:系统路线——重放、双系统、外部记忆与 LLM 时代
4.1 重放:最不优雅、最有效
重放(rehearsal)存一小部分旧数据混入新训练;思想可追溯到 Robins(1995),他同时提出了不存真数据、用网络自己生成"伪样本"复习的伪重放 [S51]。现代谱系:iCaRL(类增量+样本管理)[S52]、GEM/A-GEM(用旧样本梯度约束更新方向)[S15][S54]、强化学习设定下的经验重放 [S102]、DER(重放 logits——模型输出的原始打分,比只重放"正确答案"携带更多信息;一个极强的简单基线)[S55]、生成式重放(训练生成模型合成旧数据)[S53]、类脑生成式重放(重放内部表示而非原始像素,类增量下大幅改进)[S103]。
实证格局非常一致:在类增量等困难场景中,重放类方法是最稳健的方法族 [S13][S14]。这不是巧合——Knoblauch 的定理说记忆是必需的 [S18],重放就是记忆的最朴素形态。生成式重放理论上摆脱了存储原始数据的负担,但把问题转嫁给了"生成模型自己也要持续学习"的递归难题,在复杂分布上尚未真正成立。【已确立(格局);生成式重放的评价为综合判断】
4.2 互补学习系统:大脑给出的架构答案
McClelland、McNaughton 与 O'Reilly(1995)的经典理论 [S61]:大脑用两个学习系统解决两难——海马以稀疏表示快速记住具体情景;新皮层以重叠分布式表示缓慢学习统计结构;海马在离线期(睡眠/静息)反复向皮层重放,让皮层以不干扰旧知识的交错方式吸收新经验。Kumaran 等(2016)的更新版明确指出这对 AI 智能体设计的直接含义:快慢双系统 + 交错重放 + 情景记忆支持一次性学习 [S62]。【已确立(理论地位与神经证据,见第五部分)】
工程对应物早已存在,只是常不被这样称呼:
- 结构隔离 = 给"快系统"独立容量:Progressive Networks 每任务加一列 [S56];PackNet 用剪枝(剪掉不重要的连接)腾出容量 [S58];HAT 学任务掩码(按任务开关不同的神经元)[S59];XdG 用稀疏情境门控让不同任务激活几乎不重叠的单元,配合突触稳固可在 500 个任务上保持 90%+ 准确率 [S60]。预训练模型时代的轻量版是提示学习:冻结整个主干,只学一小组可检索的"提示向量"(L2P [S104]、DualPrompt [S105])——把"新任务的容量"缩小到几乎不占参数。
- 快学+慢固化 = Progress & Compress:活跃列快速学新任务,再蒸馏(让一个网络学习模仿另一个网络的输出,从而把知识压缩转移过去)进受 EWC 保护的知识列 [S57]。
- 睡眠的直接机器版:Tadros 等(2022)在人工神经网络中插入"睡眠阶段"(噪声输入 + 局部 Hebbian 规则——赫布法则:"一起激活的神经元,连接会加强"),自发重放使已被遗忘的旧任务恢复,表示变得更稀疏、重叠更少 [S82]。Hinton 等 1995 年的 wake-sleep 算法是这一思想的先声 [S81]。【已确立(各论文结果);睡眠机制的普适工程价值【推测】】
4.3 把知识放在权重外面:外部记忆与检索
另一条思路:既然往权重里写新知识这么危险,那就别写。
- 可微外部记忆(可微:整个读写过程都能被梯度训练):DNC 证明神经网络可以学会读写一个外部存储器 [S63]。
- kNN-LM:推理时检索最近邻显著改进语言建模,说明"参数化知识+非参数记忆"的混合天然有效 [S65]。
- RAG:检索增强生成如今是为 LLM 注入新知识/私有知识的默认工业方案——更新知识=更新文档库,零遗忘、零训练 [S64]。
限度同样清楚:检索解决陈述性知识(事实、文档)极好,但程序性能力(技能、推理模式、品味)不在可检索的颗粒度上;检索库无限增长的管理、以及"检索到了但用不好"的整合问题,都指向仍需某种固化机制把高频使用的记忆压缩进权重。【已确立(方法有效性);限度分析为综合判断】
4.4 上下文内学习:每次前向传播都是一次小型持续学习
GPT-3 确立了 ICL 现象:不更新任何权重,只在上下文中给示例,模型就能"学会"新任务 [S69]。机制研究表明这不只是查表:Transformer 的前向传播可以隐式实现梯度下降 [S70],在受控线性设定下 ICL 隐式执行标准学习算法 [S71]。
这给终身学习提供了一个重要视角:上下文就是一块零遗忘、即写即用、但会随会话蒸发的快速记忆——功能上惊人地像海马的角色。它的三个天花板:容量(上下文窗口)、持久性(会话结束即消失)、成本(注意力的平方开销)。测试时训练路线正是要把这块"蒸发性记忆"变成持久机制:TTT(2020)在测试时用自监督损失(自监督:不需要人工标注,从数据自身构造练习题)更新模型 [S66];TTT 层(2024)把循环网络的内部状态本身做成一个在推理中被梯度更新的小模型 [S67];Titans 加上"惊讶度驱动写入+自适应遗忘"的神经长期记忆模块,扩展到 200 万 token(token:模型处理文本的基本单位,约为一个词或词的一部分)以上的上下文 [S68]。【已确立(各结果);"这是通往终身学习的架构雏形"【推测】】
4.5 LLM 的持续预训练与微调:目前最接近实用的战场
- 领域自适应持续预训练(DAPT/TAPT)证明"接着练"有一致收益 [S72];Ke 等给出防遗忘的持续预训练方法 [S73];Gupta 等(2023)系统研究了学习率重新升温(re-warming)这一关键环节 [S119]。
- Ibrahim 等(2024)的大规模实证给出了目前最实用的配方:重新升温再衰减学习率 + 混入少比例(如 5%)旧分布数据,即可在数百 B token 的新分布上接近"合并数据从头重训"的效果,且适用于弱漂移与强漂移(英→德)两种设定 [S74]。这实际上是重放+可塑性管理在万亿参数尺度上的胜利。【已确立】
- 微调侧:指令微调模型顺序学习大量任务时,只需 1% 旧任务重放就能保持能力(Scialom 等 2022 [S75]);但 1B–7B 模型持续微调中遗忘依然显著、且随模型在该范围内增大而更明显(Luo 等 2023 [S76])——与"规模缓解遗忘"[S30][S106] 的关系尚未理清。【有争议】
- 知识编辑(超网络式的 MEND [S121];定位-改写式的 ROME/MEMIT [S77][S78])能定点改写事实关联,但规模化失败的方式已被精确刻画:随着顺序编辑增多,模型先经历渐进遗忘(可编辑性下降、旧编辑被忘、下游能力滑坡),随后某次"致瘫编辑"触发突然的灾难性崩溃(Gupta 等 2024 [S120])。"外科手术式写入"目前不可无限累积。【已确立】
- 全景综述见两份 LLM 持续学习综述 [S125][S126]。
4.6 从经验中学习的智能体
Voyager 在 Minecraft 中展示了一种回避权重更新的终身学习:把学到的行为沉淀为代码技能库,复用与组合技能持续变强 [S79];Reflexion 把失败经验写成语言化反思存入情景记忆 [S80]。这类"经验→文本/代码→检索"的循环是目前 LLM 智能体积累能力的主流方式。它的天花板与 4.3 相同:能力沉淀在权重之外,基座本身不成长。Silver 与 Sutton 的"经验时代"论点 [S20] 正是主张跨过这道坎:让智能体从终身经验流中直接学习(含权重更新),这把本文讨论的全部难题(遗忘、可塑性、固化)重新推回台前。【已确立(系统演示);路线判断为公开发表的立场+作者认同】
第五部分:大脑如何做到不遗忘——以及哪些机制可迁移
生物学习系统运行数十年而不灾难性遗忘,是"终身学习可行"的唯一存在性证明。机制盘点(总览见 Kudithipudi 等 2022 [S22]):
5.1 突触层:记忆写在多时间尺度里
- 树突棘的稳定性:树突棘是神经元接收连接的微小突起,突触多建在其上。学习形成的一部分树突棘可稳定保持终生,是长期记忆的结构基座(Yang 等 2009 [S83]);不同任务的可塑性被分配到不同树突分支,在亚细胞尺度上实现了"结构隔离"(Cichon & Gan 2015 [S85])。【已确立】
- 级联/多状态突触:Fusi 等(2005)与 Benna & Fusi(2016)的计算模型表明,单个突触内部若有一串快到慢的隐变量(级联状态),记忆容量与寿命可以同时大幅提升,遗忘呈幂律而非指数 [S89][S90]。这是对深度学习最具体的启示之一:标量权重太贫乏,每个权重应当自带多时间尺度状态。(EWC 的惩罚项、优化器动量、甚至 L2 Init,都可视为该思想的粗糙近似。)【已确立(模型);迁移判断为推断】
- 元可塑性:突触改变自身"可被改变的难易度"(Abraham & Bear 1996 [S91])——学习率不是全局超参数,而是每个突触的受调控状态变量。【已确立(生物学);机器对应物散见于各方法】
5.2 系统层:固化是主动的离线过程
- 海马在睡眠中重放清醒期的活动序列(Wilson & McNaughton 1994 [S86]),是 CLS 理论 [S61][S62] 的直接证据;记忆固化需要时间窗口,期间可被干扰(McGaugh 2000 [S87])。【已确立】
- 睡眠既做正向工作(促进学习相关的新棘形成,分支特异,Yang 等 2014 [S84]),也可能做全局收敛工作(突触稳态假说 SHY:睡眠期间全局突触降标,腾出下一天的可塑性空间,Tononi & Cirelli 2014 [S88])。SHY 与"睡眠选择性强化"之间的张力在神经科学内部仍有争论。【有争议(SHY 的强版本)】
- 对 AI 的翻译:训练不应是在线流水;系统需要周期性的"离线整理"阶段——重放、蒸馏、压缩、正则重置。Tadros 等的睡眠样重放 [S82]、Progress & Compress 的压缩阶段 [S57]、乃至 LLM 持续预训练里的重放混合 [S74],都是这一原则的碎片化实现。【推断】
5.3 编码层:稀疏、分离与门控
- 稀疏编码是感觉皮层的基本策略(Olshausen & Field 1996 [S92]);海马齿状回的模式分离进一步降低相似经验的表示重叠。表示重叠低 → 干扰小,这与 ML 侧"遗忘由表示重叠驱动" [S3][S29] 严丝合缝。
- 直接的迁移成功案例:XdG 的稀疏情境门控 [S60] 与 OWM 的情境依赖处理模块 [S45],都明确以此为灵感,并拿到了数百任务级的结果。【已确立】
- 代价同样真实:稀疏/分离与泛化、迁移此消彼长——完全不重叠的表示之间无法共享知识。大脑的解法看起来是"按需混合":海马极稀疏、皮层高重叠,快慢分工。【已确立(权衡的存在);"按需混合"表述为概括】
5.4 调控层:何时学、学多快,本身是被控制的信号
去甲肾上腺素/多巴胺等神经调质按"惊讶度、新颖性、奖励"门控可塑性(Aston-Jones & Cohen 2005 [S99])。机器侧的对应物正在出现:Titans 按"惊讶度"决定写入记忆的强度 [S68];各类重要性加权 [S41][S42][S43] 是其静态近似。把"学习率"从超参数升格为由系统自身估计的、逐参数逐时刻的控制信号,是被生物学强烈暗示、而 ML 尚未系统化的方向。【推断/推测】
5.5 神经发生:一个诚实的警示
成人海马神经发生曾被视为"注入新可塑性单元"的漂亮机制(Eriksson 等 1998 [S93])。但 2018 年,Sorrells 等(Nature)在成人样本中检不出新生神经元 [S94],Boldrini 等(Cell Stem Cell)却报告其持续到 79 岁 [S95]——方法学争论(死后延迟、标志物降解、立体计数)至今未完全了结。【有争议】
两点教训:(1)引用"大脑如何如何"作为 AI 方案依据时必须核对生物学证据的当前状态;(2)有趣的是,无论生物事实如何,"持续注入新鲜的、未定型的单元"在机器侧已被独立证明有效——这正是持续反向传播 [S23] 与休眠神经元重置 [S27] 所做的事。工程不需要等生物学吵完。
5.6 人脑也不是无懈可击的对照组
人类同样遗忘,也同样有顺序效应——但方向相反:Flesch 等(2018)发现人类在分块(先学完 A 再学 B)训练下比交错训练学得更好,而标准神经网络恰恰相反 [S96]。这说明大脑并非"抗遗忘的神经网络",而是带着强先验、门控与固化机制的不同类型的系统。神经科学对 AI 的正确用法是提取计算原则(多时间尺度、离线固化、稀疏门控、调质控制),而不是复制零件(Hassabis 等 2017 [S97]; Richards 等 2019 [S98])。【已确立(实验);方法论立场为公开发表的观点】
第六部分:开放的根本问题(按重要性排序)与最有希望的方向
以下 8 个问题按"对实现终身学习 AI 的瓶颈程度"排序(排序本身是作者判断【推测】,每条的证据基础单独标注)。每条含:为什么根本、当前最佳证据、一个具体可证伪的研究步骤。
P1. 终身学习的目标函数是什么?——理论空白
- 为什么根本:领域连"学习器应当优化什么"都没有共识。是逼近多任务联合解?最小化受计算/内存约束的长期后悔(regret:每一步决策与"事后看来最优"之间差距的累计)?最大化知识复利(未来学习的加速度)?还是在目标本身漂移时允许并奖励正确的遗忘(区分干扰与修订,见 1.4;公开论证的例子是推荐场景 [S117])?不同答案导出完全不同的方法与评测。现状是用"平均准确率不掉"代打,而 1.3 节的证据表明这个代打指标可以被不学习的方法(GDumb [S17])打穿、也经不起算力预算对齐 [S124]。
- 最佳证据:Knoblauch 的 NP 难+完美记忆定理是仅有的几块理论基石之一 [S18];FWT/BWT 指标框架 [S15];评测批评 [S16][S17][S124]。
- 可证伪的一步:构造一个明确以"学习加速度"为主指标的基准——长任务流(≥500 个任务)上度量第 k 个任务达到阈值性能所需样本数 n(k),检验假说"现有任何方法都不能使 n(k) 随 k 持续下降"。若某方法做到了,它就是第一个展示知识复利的系统;若全部失败,则证明现有方法族在最重要的维度上为零进展。
P2. 可塑性丧失的充要条件——随机性是否必需?
- 为什么根本:如果 Dohare 等的强论断("梯度方法不够,需要非梯度随机成分" [S23])成立,那么整个基于纯梯度优化的持续学习路线都有天花板,架构与优化器需要重新设计。
- 最佳证据:Nature 2024 的系统实验 [S23];机理研究(死单元 [S27]、曲率/秩 [S28]);确定性反例候选 L2 Init [S31]。
- 可证伪的一步:在 Continual ImageNet 与缓慢漂移回归的原始协议上,系统对比确定性方法(L2 Init、逐参数自适应正则、二阶方法)与随机重置类方法,运行到 ≥5000 任务。假说"存在纯确定性优化器长期维持可塑性"是直接可判定的;无论结果如何都重要。
P3. "就近学习"的容量边界——一个盆地能装下多少知识?
- 为什么根本:第三部分表明当前最实用的路线(LoRA、合并、任务算术、正交投影、持续合并)全部依赖"新知识可以在旧解附近容纳"。没有人知道这个假设在多少任务、多大分布漂移后失效,以及失效是否可预测。
- 最佳证据:线性连通性 [S34][S40]、合并有效性 [S48][S49][S115][S116]、"学得少忘得少"的低秩权衡 [S113]、正交子空间递减的算术 [S46][S114]、持续合并的最新进展与其自述的局限 [S117][S118]、类增量下正则化失败 [S13]、"损失连通≠机制相同"的警示 [S112]。
- 可证伪的一步:以固定预训练模型为起点,顺序做低秩/正交更新,直接测量:(a)剩余可用子空间维度、(b)与"每次全量重训"解的性能差、(c)线性连通性何时断裂,作为任务数与漂移强度的函数。产出第一条"盆地容量曲线"。假说"容量耗尽点可由谱量(Fisher/NTK 矩阵的特征值分布)提前预测"可直接检验;检验时应同时报告参数空间与函数空间两种距离(见 3.4)。
P4. 记忆的分工与固化策略——什么进权重、什么进外部库、何时转移?
- 为什么根本:理论(P1 中的定理 [S18])与生物学(CLS [S61][S62])都说必须有记忆分层,但"固化策略"——哪些外部记忆、在什么时机、以什么方式蒸馏进权重——目前完全靠手工设计。这是把 RAG 式系统升级为真正成长型系统的关键缺口。
- 最佳证据:重放的稳健性 [S13]、RAG/kNN-LM 的有效性 [S64][S65]、睡眠样固化的概念验证 [S82]、LLM 持续预训练配方 [S74]。
- 可证伪的一步:固定总计算预算,在一个长程流式问答+技能混合基准上对比:纯 RAG / 纯持续微调 / RAG+周期性"睡眠"固化(把高频检索条目蒸馏进权重)。假说"固化混合方案在同预算下同时胜过两个纯方案"可判定;若纯 RAG 不败,说明权重固化对陈述性知识可能根本不必要——同样是重大结论。
P5. 规模化持续预训练的科学——遗忘的 scaling law
- 为什么根本:对 LLM 而言,"终身学习"的现实形态就是持续预训练。目前只有配方(再升温 [S119]+重放 [S74]),没有规律:遗忘量如何随模型规模、重放比例、漂移强度、token 预算变化?[S30][S106] 说规模/宽度缓解遗忘,[S76] 在 1B–7B 观察到相反趋势,矛盾未解;知识编辑路线的规模天花板也已被刻画(渐进+突发两阶段退化 [S120])。
- 最佳证据:[S30][S72][S73][S74][S75][S76][S106][S119][S120]。
- 可证伪的一步:跨 3 个数量级模型规模、控制数据漂移强度,拟合"持续学习 scaling law":遗忘率 = f(规模, 重放比例, 漂移)。假说"存在规模阈值使得 5% 重放下遗忘趋近于零"可直接检验,并将裁决 [S30] 与 [S76] 的矛盾。
P6. 经验→能力的自动蒸馏——智能体如何把经历变成本领?
- 为什么根本:当前智能体的"学习"停留在文本/代码记忆(Voyager [S79]、Reflexion [S80]),基座权重不成长;"经验时代" [S20] 要求跨过这一步。缺失的是从情景记忆自动提炼程序性能力并安全写入权重的机制——即 CLS 的完整机器实现。
- 最佳证据:技能库智能体的能力累积 [S79];蒸馏式固化的原型 [S57];知识编辑的规模天花板 [S77][S78]。
- 可证伪的一步:在长程环境(如跨越数百任务的 Minecraft 或机器人课程)中对比"冻结基座+技能库"与"技能库+周期性把技能蒸馏入权重"的两个智能体。假说:蒸馏版在移除技能库后仍保留大部分能力,且新技能学习速度随累积加快(与 P1 指标对接);若蒸馏总是破坏多于沉淀,则说明权重内固化在当前架构下不可行。
P7. 表示的干扰几何——能否事先预测"这次更新会毁掉什么"?
- 为什么根本:遗忘的微观机制(哪层、哪些方向、与任务相似度什么关系)已有描绘 [S29][S30],但没有通用的前瞻性理论:给定当前模型与新数据,预测将被破坏的旧能力。有了它,持续学习可以从"事后补救"变成"事前规避"。
- 最佳证据:理论起点已经存在——NTK 重叠矩阵在(近似)线性区定量刻画任务间干扰 [S107],配套有 OGD 的泛化保证 [S108] 与线性回归中遗忘的精确刻画 [S109];表示层面的实证解剖 [S3][S29][S30][S39]。缺的是把这些从线性/受控设定推进到真实特征学习区与 LLM 尺度。
- 可证伪的一步:检验假说"新旧任务在 NTK 特征空间/表示空间的重叠度([S107] 的量或其变体),可在训练前预测微调后的遗忘量(相关系数显著高于参数距离基线)"。在受控任务族与真实 LLM 微调两个层面各做一次;成立则直接派生出"干扰感知的数据调度"算法。
P8. 评测本身——开放式终身学习的诚实基准
- 为什么根本:P1–P7 的每一步都需要不被玩坏的测量工具。现有基准的失真已被反复证明 [S16][S17],预算对齐后大量增益消失 [S124];无任务边界 [S19]、单遍在线数据 [S122]、计算受限 [S55][S124]、含学习加速度指标的公共基准仍然稀缺。
- 最佳证据:[S16][S17][S19][S55][S122][S124];Dohare 的 Continual ImageNet 与漂移回归提供了可塑性侧的模板 [S23]。
- 可证伪的一步:建立一个满足上述约束的公开长流基准,同时报告 ACC/BWT/FWT/学习加速度/计算与内存账单,然后检验假说"现有方法在标准基准上的排名与在该基准上的排名显著不同"。若排名大幅翻转(如 GDumb 现象再现),即证明领域此前的进展度量存在系统性失真。
最有希望的方向(作者综合排序,均为【推测】级判断,理由与证据如注)
- 面向 LLM 的互补学习系统:检索式情景记忆(即写即用、零遗忘)+ 周期性离线固化(重放/蒸馏进权重)。理由:两端组件均已单独验证([S64][S74][S82]),缺的只是闭环;它同时回应 P4 与 P6;且与现有 LLM 基础设施兼容,可被工业界立即推进。
- 保持可塑性的优化与架构(持续反向传播家族、逐参数元可塑性、多时间尺度权重状态 [S23][S31][S90]):任何长期运行的系统都绕不开 P2;这是"地基"性质的方向。
- 持续预训练的配方科学与 scaling law(P5):最接近实用、数据点最容易产出、每个结论都直接影响生产系统 [S74]。
- 把学习内置于推理的架构(TTT 层、Titans 式神经记忆 [S67][S68]):若成功,它会消解"训练/推理"的两阶段划分——这正是结论 1 指出的根本缺陷;风险在于尚无终身尺度的证据。
- 几何引导的模块化更新与合并(LoRA+任务算术+对齐合并 [S47][S48][S36]):短中期收益确定,但受 P3 的容量边界约束,更可能是过渡技术而非终局。
一句话收束:灾难性遗忘和可塑性丧失都不是待修的 bug,而是"用单一时间尺度的密集共享参数承载全部知识"这一设计的必然后果。出路不在更聪明的补丁,而在架构层面引入大脑早已采用的分层:多时间尺度的参数、快慢分工的记忆系统、主动的离线固化,以及一个诚实度量"知识复利"的目标函数。
方法论与局限
- 本文以文献综述与论证为主;唯一的自有实验是第三部分末尾的玩具演示(已明确标注为示意性质,不作为证据使用)。初稿文献覆盖至 2025 年;2026-09 的更新补充了一批经逐条核验的公开文献(SOURCES.md 第 F 节),包括持续合并/近端锚定的低秩适配器、NTK 干扰理论、预算对齐评测与模型编辑规模化失败等新证据。持续学习是活跃领域,结论 3、9、12 尤其可能随新证据修订。
- 引用规范:所有文献以 arXiv 编号或 DOI 为准;会议/期刊名称仅在经直接核验(官方论文集或会议页面)后标注,未核验者不标注。
- 排序类内容(第六部分)是作者在证据基础上的综合判断,已统一标注【推测】;读者应将其视为可辩论的立场而非事实。
- 所有参考文献均为公开可得;书目信息经在线核对的条目在 SOURCES.md 末尾注明。若发现引用错误,请以原始文献为准。
- 英文版见 STUDY.en.md,一页摘要见 SUMMARY.zh.md。
参考文献(全部为公开文献)
正文以 [S编号] 引用下列条目。所有条目以 arXiv 编号或 DOI 为准;会议/期刊名称仅在经直接核验后标注。
A. 问题定义与综述
[S1] McCloskey, M. & Cohen, N. J. (1989). Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation, Vol. 24, 109–165. — 灾难性遗忘的首次系统报告。
[S2] Ratcliff, R. (1990). Connectionist models of recognition memory: Constraints imposed by learning and forgetting functions. Psychological Review, 97(2), 285–308. — 早期对连接主义遗忘的定量刻画。
[S3] French, R. M. (1999). Catastrophic forgetting in connectionist networks. Trends in Cognitive Sciences, 3(4), 128–135. — 经典综述;提出分布式表示的重叠是遗忘根源。
[S4] Grossberg, S. (1980). How does a brain build a cognitive code? Psychological Review, 87(1), 1–51. — "稳定性–可塑性两难"(stability–plasticity dilemma)概念来源。
[S5] Carpenter, G. A. & Grossberg, S. (1987). A massively parallel architecture for a self-organizing neural pattern recognition machine. Computer Vision, Graphics, and Image Processing, 37, 54–115. — 自适应共振理论(ART),最早直面稳定性–可塑性的架构。
[S6] Ring, M. B. (1994). Continual Learning in Reinforcement Environments. PhD thesis, University of Texas at Austin. — "continual learning" 一词在强化学习语境中的奠基性论述。
[S7] Thrun, S. & Mitchell, T. M. (1995). Lifelong robot learning. Robotics and Autonomous Systems, 15, 25–46. — 终身学习(lifelong learning)问题的早期系统提法。
[S8] Chen, Z. & Liu, B. (2018). Lifelong Machine Learning (2nd ed.). Morgan & Claypool. — 终身机器学习专著。
[S9] Mitchell, T. et al. (2018). Never-Ending Learning. Communications of the ACM, 61(5), 103–115. — NELL:运行多年的持续学习系统实例。
[S10] Parisi, G. I., Kemker, R., Part, J. L., Kanan, C. & Wermter, S. (2019). Continual lifelong learning with neural networks: A review. Neural Networks, 113, 54–71. — 神经网络持续学习综述。
[S11] Hadsell, R., Rao, D., Rusu, A. A. & Pascanu, R. (2020). Embracing Change: Continual Learning in Deep Neural Networks. Trends in Cognitive Sciences, 24(12), 1028–1040. — DeepMind 视角的持续学习综述。
[S12] van de Ven, G. M. & Tolias, A. S. (2019). Three scenarios for continual learning. arXiv:1904.07734. https://arxiv.org/abs/1904.07734 — 任务增量/域增量/类增量三种场景的标准划分。
[S13] van de Ven, G. M., Tuytelaars, T. & Tolias, A. S. (2022). Three types of incremental learning. Nature Machine Intelligence, 4, 1185–1197. — [S12] 的期刊扩展版;系统比较三种场景下各类方法的成败。
[S14] Wang, L., Zhang, X., Su, H. & Zhu, J. (2024). A Comprehensive Survey of Continual Learning: Theory, Method and Application. IEEE TPAMI. arXiv:2302.00487. https://arxiv.org/abs/2302.00487 — 目前覆盖面最广的持续学习综述之一。
[S15] Lopez-Paz, D. & Ranzato, M. (2017). Gradient Episodic Memory for Continual Learning. NeurIPS 2017. arXiv:1706.08840. https://arxiv.org/abs/1706.08840 — GEM;正式定义了前向/后向迁移(FWT/BWT)指标。
[S16] Farquhar, S. & Gal, Y. (2018). Towards Robust Evaluations of Continual Learning. arXiv:1805.09733. https://arxiv.org/abs/1805.09733 — 对标准评测协议的系统批评。
[S17] Prabhu, A., Torr, P. H. S. & Dokania, P. K. (2020). GDumb: A Simple Approach that Questions Our Progress in Continual Learning. ECCV 2020, LNCS 12347, 524–540. — 贪心存样本+从头重训的朴素基线胜过大量复杂方法,对领域进展提出质疑。
[S18] Knoblauch, J., Husain, H. & Diethe, T. (2020). Optimal Continual Learning has Perfect Memory and is NP-hard. ICML 2020, PMLR 119, 5327–5337. arXiv:2006.05188. https://arxiv.org/abs/2006.05188 — 理论结果:最优持续学习一般需要完美记忆且为 NP 难。
[S19] Aljundi, R., Kelchtermans, K. & Tuytelaars, T. (2019). Task-Free Continual Learning. CVPR 2019. arXiv:1812.03596. https://arxiv.org/abs/1812.03596 — 无任务边界的持续学习设定。
[S20] Silver, D. & Sutton, R. S. (2025). Welcome to the Era of Experience. Preprint of a chapter in "Designing an Intelligence" (MIT Press). https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf — 主张智能体应栖居于终身经验流并从中持续学习。
[S21] Sutton, R. S. (2019). The Bitter Lesson. 公开博客文章. http://www.incompleteideas.net/IncIdeas/BitterLesson.html — 通用方法+算力胜过人工先验的著名论断。
[S22] Kudithipudi, D. et al. (2022). Biological underpinnings for lifelong learning machines. Nature Machine Intelligence, 4, 196–210. — 生物终身学习机制面向机器的系统盘点。
B. 可塑性丧失与遗忘机制
[S23] Dohare, S., Hernandez-Garcia, J. F., Lan, Q., Rahman, P., Mahmood, A. R. & Sutton, R. S. (2024). Loss of plasticity in deep continual learning. Nature, 632, 768–774. DOI: 10.1038/s41586-024-07711-7. https://www.nature.com/articles/s41586-024-07711-7 — 标准深度学习在持续设定下逐渐丧失可塑性;提出持续反向传播(continual backprop)。
[S24] Goodfellow, I. J., Mirza, M., Xiao, D., Courville, A. & Bengio, Y. (2013). An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks. arXiv:1312.6211. https://arxiv.org/abs/1312.6211 — 深度学习时代对灾难性遗忘的早期实证研究。
[S25] Ash, J. T. & Adams, R. P. (2020). On Warm-Starting Neural Network Training. NeurIPS 2020. arXiv:1910.08475. https://arxiv.org/abs/1910.08475 — 温启动损害泛化;提出 shrink-and-perturb。
[S26] Nikishin, E., Schwarzer, M., D'Oro, P., Bacon, P.-L. & Courville, A. (2022). The Primacy Bias in Deep Reinforcement Learning. ICML 2022. arXiv:2205.07802. https://arxiv.org/abs/2205.07802 — 深度 RL 中的"首因偏差"与周期性重置。
[S27] Sokar, G., Agarwal, R., Castro, P. S. & Evci, U. (2023). The Dormant Neuron Phenomenon in Deep Reinforcement Learning. ICML 2023. arXiv:2302.12902. https://arxiv.org/abs/2302.12902 — 休眠神经元随训练累积,削弱表达能力。
[S28] Lyle, C., Zheng, Z., Nikishin, E., Avila Pires, B., Pascanu, R. & Dabney, W. (2023). Understanding Plasticity in Neural Networks. ICML 2023. arXiv:2303.01486. https://arxiv.org/abs/2303.01486 — 可塑性丧失的机理分析(曲率、参数增长等)。
[S29] Ramasesh, V. V., Dyer, E. & Raghu, M. (2021). Anatomy of Catastrophic Forgetting: Hidden Representations and Task Semantics. ICLR 2021. arXiv:2007.07400. https://arxiv.org/abs/2007.07400 — 遗忘主要由深层表示的漂移驱动。
[S30] Ramasesh, V. V., Lewkowycz, A. & Dyer, E. (2022). Effect of scale on catastrophic forgetting in neural networks. ICLR 2022. https://openreview.net/forum?id=GhVS8_yPeEa — 模型规模越大、预训练越充分,遗忘越轻。
[S31] Kumar, S., Marklund, H. & Van Roy, B. (2023). Maintaining Plasticity in Continual Learning via Regenerative Regularization. arXiv:2308.11958. https://arxiv.org/abs/2308.11958 — L2 Init:向初始参数正则化以保持可塑性。
C. 损失几何与"就近学习"
[S32] Garipov, T., Izmailov, P., Podoprikhin, D., Vetrov, D. & Wilson, A. G. (2018). Loss Surfaces, Mode Connectivity, and Fast Ensembling of DNNs. NeurIPS 2018. arXiv:1802.10026. https://arxiv.org/abs/1802.10026 — 独立训练的极小点由低损失曲线相连(模式连通性)。
[S33] Draxler, F., Veschgini, K., Salmhofer, M. & Hamprecht, F. A. (2018). Essentially No Barriers in Neural Network Energy Landscape. ICML 2018. arXiv:1803.00885. https://arxiv.org/abs/1803.00885 — 与 [S32] 同期独立发现:极小点之间基本无能量壁垒。
[S34] Frankle, J., Dziugaite, G. K., Roy, D. M. & Carbin, M. (2020). Linear Mode Connectivity and the Lottery Ticket Hypothesis. ICML 2020. arXiv:1912.05671. https://arxiv.org/abs/1912.05671 — 线性模式连通性(LMC)与训练早期的"稳定化"。
[S35] Entezari, R., Sedghi, H., Saukh, O. & Neyshabur, B. (2022). The Role of Permutation Invariance in Linear Mode Connectivity of Neural Networks. ICLR 2022. arXiv:2110.06296. https://arxiv.org/abs/2110.06296 — 猜想:模除置换对称后,SGD 解基本落在同一线性连通盆地。
[S36] Ainsworth, S. K., Hayase, J. & Srinivasa, S. (2023). Git Re-Basin: Merging Models modulo Permutation Symmetries. ICLR 2023. arXiv:2209.04836. https://arxiv.org/abs/2209.04836 — 通过置换对齐合并独立训练的模型。
[S37] Jacot, A., Gabriel, F. & Hongler, C. (2018). Neural Tangent Kernel: Convergence and Generalization in Neural Networks. NeurIPS 2018. arXiv:1806.07572. https://arxiv.org/abs/1806.07572 — NTK:无限宽极限下网络训练近似线性化。
[S38] Chizat, L., Oyallon, E. & Bach, F. (2019). On Lazy Training in Differentiable Programming. NeurIPS 2019. arXiv:1812.07956. https://arxiv.org/abs/1812.07956 — "惰性训练"机制及其与特征学习的对立。
[S39] Mirzadeh, S. I., Farajtabar, M., Pascanu, R. & Ghasemzadeh, H. (2020). Understanding the Role of Training Regimes in Continual Learning. NeurIPS 2020. arXiv:2006.06958. https://arxiv.org/abs/2006.06958 — 平坦极小点与遗忘的关系;训练制度(学习率、批大小)影响遗忘。
[S40] Mirzadeh, S. I., Farajtabar, M., Gorur, D., Pascanu, R. & Ghasemzadeh, H. (2021). Linear Mode Connectivity in Multitask and Continual Learning. ICLR 2021. arXiv:2010.04495. https://arxiv.org/abs/2010.04495 — 同初始化下,多任务解与持续学习解线性连通;提出 MC-SGD。
[S41] Kirkpatrick, J. et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS, 114(13), 3521–3526. DOI: 10.1073/pnas.1611835114. arXiv:1612.00796 — EWC:以 Fisher 信息加权的二次惩罚保护旧任务重要参数。
[S42] Zenke, F., Poole, B. & Ganguli, S. (2017). Continual Learning Through Synaptic Intelligence. ICML 2017. arXiv:1703.04200. https://arxiv.org/abs/1703.04200 — SI:在线累积参数重要性。
[S43] Aljundi, R., Babiloni, F., Elhoseiny, M., Rohrbach, M. & Tuytelaars, T. (2018). Memory Aware Synapses: Learning what (not) to forget. ECCV 2018. arXiv:1711.09601. https://arxiv.org/abs/1711.09601 — MAS:无监督估计参数重要性。
[S44] Farajtabar, M., Azizan, N., Mott, A. & Li, A. (2020). Orthogonal Gradient Descent for Continual Learning. AISTATS 2020. arXiv:1910.07104. https://arxiv.org/abs/1910.07104 — OGD:把新任务梯度投影到旧任务梯度的正交补。
[S45] Zeng, G., Chen, Y., Cui, B. & Yu, S. (2019). Continual learning of context-dependent processing in neural networks. Nature Machine Intelligence, 1, 364–372. — OWM:正交权重修改+情境依赖处理模块。
[S46] Saha, G., Garg, I. & Roy, K. (2021). Gradient Projection Memory for Continual Learning. ICLR 2021. arXiv:2103.09762. https://arxiv.org/abs/2103.09762 — GPM:在旧任务核心梯度子空间的正交方向学习。
[S47] Hu, E. J. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685. https://arxiv.org/abs/2106.09685 — 低秩增量更新:冻结主干、只学小的低秩修正。
[S48] Ilharco, G. et al. (2023). Editing Models with Task Arithmetic. ICLR 2023. arXiv:2212.04089. https://arxiv.org/abs/2212.04089 — 任务向量可加减:权重空间中的知识算术。
[S49] Wortsman, M. et al. (2022). Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time. ICML 2022. arXiv:2203.05482. https://arxiv.org/abs/2203.05482 — 同一预训练模型的多个微调解可以直接平均。
[S50] Wortsman, M. et al. (2022). Robust fine-tuning of zero-shot models. CVPR 2022. arXiv:2109.01903. https://arxiv.org/abs/2109.01903 — WiSE-FT:微调权重与原权重线性插值兼得新旧性能。
D. 系统路线:重放、双系统、记忆、LLM 与智能体
[S51] Robins, A. (1995). Catastrophic forgetting, rehearsal and pseudorehearsal. Connection Science, 7(2), 123–146. — 重放与伪重放(用自生成样本复习)的奠基工作。
[S52] Rebuffi, S.-A., Kolesnikov, A., Sperl, G. & Lampert, C. H. (2017). iCaRL: Incremental Classifier and Representation Learning. CVPR 2017. arXiv:1611.07725. https://arxiv.org/abs/1611.07725 — 类增量学习的代表性重放方法。
[S53] Shin, H., Lee, J. K., Kim, J. & Kim, J. (2017). Continual Learning with Deep Generative Replay. NeurIPS 2017. arXiv:1705.08690. https://arxiv.org/abs/1705.08690 — 生成式重放:用生成模型合成旧数据。
[S54] Chaudhry, A., Ranzato, M., Rohrbach, M. & Elhoseiny, M. (2019). Efficient Lifelong Learning with A-GEM. ICLR 2019. arXiv:1812.00420. https://arxiv.org/abs/1812.00420 — GEM 的高效近似。
[S55] Buzzega, P., Boschini, M., Porrello, A., Abati, D. & Calderara, S. (2020). Dark Experience for General Continual Learning: a Strong, Simple Baseline. NeurIPS 2020. arXiv:2004.07211. https://arxiv.org/abs/2004.07211 — DER:重放 logits 的强基线。
[S56] Rusu, A. A. et al. (2016). Progressive Neural Networks. arXiv:1606.04671. https://arxiv.org/abs/1606.04671 — 每个任务新增一列网络,结构上杜绝遗忘。
[S57] Schwarz, J. et al. (2018). Progress & Compress: A scalable framework for continual learning. ICML 2018. arXiv:1805.06370. https://arxiv.org/abs/1805.06370 — 快速学习列+知识蒸馏固化到慢速列。
[S58] Mallya, A. & Lazebnik, S. (2018). PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning. CVPR 2018. arXiv:1711.05769. https://arxiv.org/abs/1711.05769 — 剪枝腾挪容量、按任务分配子网络。
[S59] Serra, J., Suris, D., Miron, M. & Karatzoglou, A. (2018). Overcoming Catastrophic Forgetting with Hard Attention to the Task. ICML 2018. arXiv:1801.01423. https://arxiv.org/abs/1801.01423 — HAT:学习任务级硬注意力掩码。
[S60] Masse, N. Y., Grant, G. D. & Freedman, D. J. (2018). Alleviating catastrophic forgetting using context-dependent gating and synaptic stabilization. PNAS, 115(44), E10467–E10475. DOI: 10.1073/pnas.1803839115. arXiv:1802.01569 — XdG:稀疏情境门控+突触稳固,在数百个任务上保持高性能。
[S61] McClelland, J. L., McNaughton, B. L. & O'Reilly, R. C. (1995). Why there are complementary learning systems in the hippocampus and neocortex. Psychological Review, 102(3), 419–457. — 互补学习系统(CLS)理论。
[S62] Kumaran, D., Hassabis, D. & McClelland, J. L. (2016). What Learning Systems do Intelligent Agents Need? Complementary Learning Systems Theory Updated. Trends in Cognitive Sciences, 20(7), 512–534. — CLS 理论的更新版,面向智能体设计。
[S63] Graves, A. et al. (2016). Hybrid computing using a neural network with dynamic external memory. Nature, 538, 471–476. — 可微神经计算机(DNC):可读写外部记忆。
[S64] Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401. https://arxiv.org/abs/2005.11401 — RAG:检索增强生成。
[S65] Khandelwal, U., Levy, O., Jurafsky, D., Zettlemoyer, L. & Lewis, M. (2020). Generalization through Memorization: Nearest Neighbor Language Models. ICLR 2020. arXiv:1911.00172. https://arxiv.org/abs/1911.00172 — kNN-LM:显式记忆库改进语言模型。
[S66] Sun, Y., Wang, X., Liu, Z., Miller, J., Efros, A. A. & Hardt, M. (2020). Test-Time Training with Self-Supervision for Generalization under Distribution Shifts. ICML 2020. arXiv:1909.13231. https://arxiv.org/abs/1909.13231 — 测试时训练(TTT)。
[S67] Sun, Y. et al. (2024). Learning to (Learn at Test Time): RNNs with Expressive Hidden States. arXiv:2407.04620. https://arxiv.org/abs/2407.04620 — TTT 层:把隐状态本身变成一个在推理中被训练的模型。
[S68] Behrouz, A., Zhong, P. & Mirrokni, V. (2024). Titans: Learning to Memorize at Test Time. arXiv:2501.00663. https://arxiv.org/abs/2501.00663 — 神经长期记忆模块在推理时按"惊讶度"做梯度写入,带自适应遗忘。
[S69] Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020. arXiv:2005.14165. https://arxiv.org/abs/2005.14165 — GPT-3;上下文内学习(ICL)现象的确立。
[S70] von Oswald, J. et al. (2023). Transformers Learn In-Context by Gradient Descent. ICML 2023. arXiv:2212.07677. https://arxiv.org/abs/2212.07677 — ICL 可实现为前向传播中的隐式梯度下降。
[S71] Akyürek, E., Schuurmans, D., Andreas, J., Ma, T. & Zhou, D. (2023). What learning algorithm is in-context learning? Investigations with linear models. ICLR 2023. arXiv:2211.15661. https://arxiv.org/abs/2211.15661 — ICL 在线性模型上隐式实现标准学习算法。
[S72] Gururangan, S. et al. (2020). Don't Stop Pretraining: Adapt Language Models to Domains and Tasks. ACL 2020. arXiv:2004.10964. https://arxiv.org/abs/2004.10964 — 领域/任务自适应持续预训练(DAPT/TAPT)。
[S73] Ke, Z., Shao, Y., Lin, H., Konishi, T., Kim, G. & Liu, B. (2023). Continual Pre-training of Language Models. ICLR 2023. arXiv:2302.03241. https://arxiv.org/abs/2302.03241 — 语言模型持续预训练的软掩码方法。
[S74] Ibrahim, A., Thérien, B., Gupta, K. et al. (2024). Simple and Scalable Strategies to Continually Pre-train Large Language Models. arXiv:2403.08763. https://arxiv.org/abs/2403.08763 — 学习率再升温+小比例重放即可接近重新训练的效果。
[S75] Scialom, T., Chakrabarty, T. & Muresan, S. (2022). Fine-tuned Language Models are Continual Learners. EMNLP 2022. arXiv:2205.12393. https://arxiv.org/abs/2205.12393 — 指令微调模型在少量重放下的持续学习能力。
[S76] Luo, Y., Yang, Z., Meng, F., Li, Y., Zhou, J. & Zhang, Y. (2023). An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning. arXiv:2308.08747. https://arxiv.org/abs/2308.08747 — 1B–7B 级 LLM 持续微调中的遗忘实证。
[S77] Meng, K., Bau, D., Andonian, A. & Belinkov, Y. (2022). Locating and Editing Factual Associations in GPT. NeurIPS 2022. arXiv:2202.05262. https://arxiv.org/abs/2202.05262 — ROME:定位并编辑事实关联。
[S78] Meng, K., Sen Sharma, A., Andonian, A., Belinkov, Y. & Bau, D. (2023). Mass-Editing Memory in a Transformer. ICLR 2023. arXiv:2210.07229. https://arxiv.org/abs/2210.07229 — MEMIT:批量知识编辑及其规模极限。
[S79] Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291. https://arxiv.org/abs/2305.16291 — 不改权重、以代码技能库积累能力的开放世界智能体。
[S80] Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K. & Yao, S. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366. https://arxiv.org/abs/2303.11366 — 用语言化自我反思(存于情景记忆)代替权重更新。
[S81] Hinton, G. E., Dayan, P., Frey, B. J. & Neal, R. M. (1995). The "wake-sleep" algorithm for unsupervised neural networks. Science, 268, 1158–1161. — 醒–睡两阶段学习算法。
[S82] Tadros, T., Krishnan, G. P., Ramyaa, R. & Bazhenov, M. (2022). Sleep-like unsupervised replay reduces catastrophic forgetting in artificial neural networks. Nature Communications, 13, 7742. DOI: 10.1038/s41467-022-34938-7 — 睡眠样自发重放(局部 Hebbian 规则+噪声输入)恢复被遗忘的旧任务。
E. 神经科学
[S83] Yang, G., Pan, F. & Gan, W.-B. (2009). Stably maintained dendritic spines are associated with lifelong memories. Nature, 462, 920–924. — 树突棘可稳定保持一生,承载长期记忆。
[S84] Yang, G. et al. (2014). Sleep promotes branch-specific formation of dendritic spines after learning. Science, 344, 1173–1178. — 睡眠促进学习后分支特异的新棘形成。
[S85] Cichon, J. & Gan, W.-B. (2015). Branch-specific dendritic Ca²⁺ spikes cause persistent synaptic plasticity. Nature, 520, 180–185. — 不同任务的可塑性被分配到不同树突分支,减少干扰。
[S86] Wilson, M. A. & McNaughton, B. L. (1994). Reactivation of hippocampal ensemble memories during sleep. Science, 265, 676–679. — 海马在睡眠中重放清醒期的神经活动序列。
[S87] McGaugh, J. L. (2000). Memory—a Century of Consolidation. Science, 287, 248–251. — 记忆固化研究百年综述。
[S88] Tononi, G. & Cirelli, C. (2014). Sleep and the Price of Plasticity. Neuron, 81(1), 12–34. — 突触稳态假说(SHY):睡眠期间全局突触降标。
[S89] Fusi, S., Drew, P. J. & Abbott, L. F. (2005). Cascade models of synaptically stored memories. Neuron, 45(4), 599–611. — 多状态级联突触:用内部隐状态权衡记忆强度与寿命。
[S90] Benna, M. K. & Fusi, S. (2016). Computational principles of synaptic memory consolidation. Nature Neuroscience, 19, 1697–1706. — 多时间尺度变量链的突触模型,遗忘呈幂律衰减。
[S91] Abraham, W. C. & Bear, M. F. (1996). Metaplasticity: the plasticity of synaptic plasticity. Trends in Neurosciences, 19(4), 126–130. — 元可塑性:突触改变自身可塑性的能力。
[S92] Olshausen, B. A. & Field, D. J. (1996). Emergence of simple-cell receptive field properties by learning a sparse code for natural images. Nature, 381, 607–609. — 稀疏编码的奠基工作。
[S93] Eriksson, P. S. et al. (1998). Neurogenesis in the adult human hippocampus. Nature Medicine, 4, 1313–1317. — 成人海马神经发生的经典证据。
[S94] Sorrells, S. F. et al. (2018). Human hippocampal neurogenesis drops sharply in children to undetectable levels in adults. Nature, 555, 377–381. DOI: 10.1038/nature25975 — 成人海马神经发生未检出(与 [S95] 直接冲突)。
[S95] Boldrini, M. et al. (2018). Human Hippocampal Neurogenesis Persists throughout Aging. Cell Stem Cell, 22, 589–599. DOI: 10.1016/j.stem.2018.03.015 — 成人海马神经发生持续到 79 岁(与 [S94] 直接冲突)。
[S96] Flesch, T., Balaguer, J., Dekker, R., Nili, H. & Summerfield, C. (2018). Comparing continual task learning in minds and machines. PNAS, 115(44), E10313–E10322. — 人类在分块(blocked)训练下学得更好,与标准神经网络相反。
[S97] Hassabis, D., Kumaran, D., Summerfield, C. & Botvinick, M. (2017). Neuroscience-Inspired Artificial Intelligence. Neuron, 95, 245–258. — 神经科学启发 AI 的路线图。
[S98] Richards, B. A. et al. (2019). A deep learning framework for neuroscience. Nature Neuroscience, 22, 1761–1770. — 用深度学习三要素(目标、结构、规则)组织神经科学。
[S99] Aston-Jones, G. & Cohen, J. D. (2005). An integrative theory of locus coeruleus-norepinephrine function: adaptive gain and optimal performance. Annual Review of Neuroscience, 28, 403–450. — 去甲肾上腺素系统对学习/探索增益的调控。
F. 补充文献(2026-09 更新)
F.1 正则化与"就近"方法
[S100] Li, Z. & Hoiem, D. (2016). Learning without Forgetting. arXiv:1606.09282. https://arxiv.org/abs/1606.09282 — LwF:蒸馏式函数空间正则,让新模型在新数据上模仿旧模型的输出。
[S101] Li, X., Grandvalet, Y. & Davoine, F. (2018). Explicit Inductive Bias for Transfer Learning with Convolutional Networks. arXiv:1802.01483. https://arxiv.org/abs/1802.01483 — L2-SP:向预训练起点(而非原点)做 L2 正则,是"拴在旧参数附近"最直接的经典形式。
[S102] Rolnick, D., Ahuja, A., Schwarz, J., Lillicrap, T. P. & Wayne, G. (2018). Experience Replay for Continual Learning. arXiv:1811.11682. https://arxiv.org/abs/1811.11682 — 强化学习设定下经验重放的系统研究。
[S103] van de Ven, G. M., Siegelmann, H. T. & Tolias, A. S. (2020). Brain-inspired replay for continual learning with artificial neural networks. Nature Communications, 11. DOI: 10.1038/s41467-020-17866-2 — 类脑生成式重放:重放内部表示而非原始像素,类增量场景下大幅改进。
F.2 几何与理论
[S104] Wang, Z. et al. (2021). Learning to Prompt for Continual Learning (L2P). arXiv:2112.08654. https://arxiv.org/abs/2112.08654 — 冻结预训练主干,只学一组可检索的提示向量。
[S105] Wang, Z. et al. (2022). DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning. arXiv:2204.04799. https://arxiv.org/abs/2204.04799 — 无重放的双提示持续学习。
[S106] Mirzadeh, S. I. et al. (2021). Wide Neural Networks Forget Less Catastrophically. arXiv:2110.11526. https://arxiv.org/abs/2110.11526 — 网络越宽遗忘越少;系统研究宽度/深度对遗忘的影响。
[S107] Doan, T. et al. (2020). A Theoretical Analysis of Catastrophic Forgetting through the NTK Overlap Matrix. arXiv:2010.04003. https://arxiv.org/abs/2010.04003 — 用 NTK 重叠矩阵定量刻画任务间干扰与遗忘。
[S108] Bennani, M. A., Doan, T. & Sugiyama, M. (2020). Generalisation Guarantees for Continual Learning with Orthogonal Gradient Descent. arXiv:2006.11942. https://arxiv.org/abs/2006.11942 — NTK 区内 OGD 的泛化理论保证。
[S109] Evron, I. et al. (2022). How catastrophic can catastrophic forgetting be in linear regression? arXiv:2205.09588. https://arxiv.org/abs/2205.09588 — 线性回归中遗忘的精确理论刻画。
[S110] Fort, S. & Jastrzebski, S. (2019). Large Scale Structure of Neural Network Loss Landscapes. arXiv:1906.04724. https://arxiv.org/abs/1906.04724 — 高维损失地形的大尺度结构模型。
[S111] Li, C., Farkhoor, H., Liu, R. & Yosinski, J. (2018). Measuring the Intrinsic Dimension of Objective Landscapes. arXiv:1804.08838. https://arxiv.org/abs/1804.08838 — 许多任务的"内在维度"远低于参数总数。
[S112] Lubana, E. S. et al. (2022). Mechanistic Mode Connectivity. arXiv:2211.08422. https://arxiv.org/abs/2211.08422 — 损失连通的两个解可能采用完全不同的内部机制;损失接近≠机制接近。
F.3 LLM 时代的持续学习
[S113] Biderman, D. et al. (2024). LoRA Learns Less and Forgets Less. arXiv:2405.09673. https://arxiv.org/abs/2405.09673 — 大规模实证:低秩更新学到的更少、忘掉的也更少——"就近学习"权衡在 LLM 尺度上的直接证据。
[S114] Wang, X. et al. (2023). Orthogonal Subspace Learning for Language Model Continual Learning (O-LoRA). arXiv:2310.14152. https://arxiv.org/abs/2310.14152 — 在相互正交的低秩子空间中顺序学习任务。
[S115] Yadav, P. et al. (2023). TIES-Merging: Resolving Interference When Merging Models. arXiv:2306.01708. https://arxiv.org/abs/2306.01708 — 定位并消解模型合并中的参数干扰(符号冲突、冗余)。
[S116] Matena, M. & Raffel, C. (2021). Merging Models with Fisher-Weighted Averaging. arXiv:2111.09832. https://arxiv.org/abs/2111.09832 — 以 Fisher 信息加权的模型合并。
[S117] Yoo, H. et al. (2025). Continual Low-Rank Adapters for LLM-based Generative Recommender Systems (PESO). ICLR 2026(会议页面已核验)。arXiv:2510.25093. https://arxiv.org/abs/2510.25093 — 单个持续演化的 LoRA,以近端项锚定其最近的冻结状态;并明确论证在推荐场景中过时知识应当被遗忘。
[S118] Qiao, F. & Mahdavi, M. (2025). Merge before Forget: A Single LoRA Continual Learning via Continual Merging (SLAO). ICLR 2026(论文集页面已核验)。arXiv:2512.23017. https://arxiv.org/abs/2512.23017 — 正交初始化+时间感知缩放,把任务更新持续合并进单个 LoRA,内存不随任务数增长。
[S119] Gupta, K. et al. (2023). Continual Pre-Training of Large Language Models: How to (re)warm your model? arXiv:2308.04014. https://arxiv.org/abs/2308.04014 — 学习率重新升温对持续预训练的关键作用。
[S120] Gupta, A., Rao, A. & Anumanchipalli, G. (2024). Model Editing at Scale leads to Gradual and Catastrophic Forgetting. arXiv:2401.07453. https://arxiv.org/abs/2401.07453 — 连续编辑呈两阶段退化:先渐进遗忘,后被单次"致瘫编辑"突然击溃。
[S121] Mitchell, E. et al. (2021). Fast Model Editing at Scale (MEND). arXiv:2110.11309. https://arxiv.org/abs/2110.11309 — 超网络式快速模型编辑。
[S122] Mai, Z. et al. (2021). Online Continual Learning in Image Classification: An Empirical Survey. arXiv:2101.10423. https://arxiv.org/abs/2101.10423 — 在线(单遍、无边界)持续学习的实证综述。
[S123] De Lange, M. et al. (2019). A continual learning survey: Defying forgetting in classification tasks. arXiv:1909.08383. https://arxiv.org/abs/1909.08383 — 分类任务持续学习的系统综述。
[S124] Prabhu, A. et al. (2023). Computationally Budgeted Continual Learning: What Does Matter? arXiv:2303.11165. https://arxiv.org/abs/2303.11165 — 固定算力预算下重新评估:许多已发表的增益在预算对齐比较中消失,简单方法常胜出。
[S125] Wu, T. et al. (2024). Continual Learning for Large Language Models: A Survey. arXiv:2402.01364. https://arxiv.org/abs/2402.01364 — LLM 持续学习综述。
[S126] Shi, H. et al. (2024). Continual Learning of Large Language Models: A Comprehensive Survey. arXiv:2404.16789. https://arxiv.org/abs/2404.16789 — LLM 持续学习综述(另一组)。
F.4 相关但间接
[S127] Li, Jinhao et al. (2026). Signal-Adaptive Trust Regions for Gradient-Free Optimization of Recurrent Spiking Neural Networks. arXiv:2601.21572(公开预印本). https://arxiv.org/abs/2601.21572 — 强化学习/优化方向的工作,与持续学习仅间接相关:体现"把每步更新限制在分布空间的一个信赖域内"的一般原则。本文仅按预印本引用。
核实说明:标注 DOI 或 arXiv 号的条目均可直接访问;[S17][S18][S20][S23][S31][S40][S60][S68][S82][S94][S95] 的书目信息在成文时经在线逐条核对。S23 的 arXiv 预印本版本为 arXiv:2306.13812(预印本标题 "Maintaining Plasticity in Deep Continual Learning",发表版标题不同)。F 节(S100–S127)条目的标题/作者/年份经 arXiv 摘要页或 Crossref 核验;其中会议名称仅在 S103与 [S117][S118](ICLR 2026 官方页面)处经直接核验后标注,其余条目不标注会议名称,以 arXiv 编号为准。若发现任何条目有误,请以原文为准并告知我们更正。