Continual Learning — Public Research Brief

终身学习的机器:持续学习的根本问题与最有希望的方向

独立撰写的公开综述,全部基于公开发表的文献;不隶属于任何机构或个人,亦未获其背书。最后更新:2026-09-26。英文版见上方切换。

一份面向公众的研究综述 · 结论先行,论证与数据在后,全部文献见 SOURCES.md

写给所有读者的开场白:今天的 AI 学东西更像一次性铸造,而不是持续成长——先用海量资料"教"一遍,然后定型投入使用。此后若再教它新东西,新知识往往会覆盖旧知识,因为它的全部本领都写在同一批共享的内部数值上,为学新而调整这些数值,就难免抹掉旧的。人恰恰相反:我们一辈子不断学习,旧本领大多保得住,而且学得越多、再学新东西越快。如果这个差距被解决,AI 将不再是需要定期从头重造的产品,而更像一位随经验成长的同事——共事越久,越懂你的世界。这份报告解释:为什么现在做不到,难点到底在哪,哪些研究路线最有希望。

证据标签说明:本文对每个关键论断标注证据强度。

本文只使用公开发表的文献(期刊、会议、arXiv 预印本、公开报告),正文中以 [S编号] 引用,完整书目见 SOURCES.md。初稿文献检索截至 2025 年;2026-09 补充纳入一批经逐条核验的公开文献(SOURCES.md 第 F 节,S100–S127),会议名称仅在直接核验后标注。

术语约定:每个专业术语在首次出现处均附有通俗解释(括号内)。若中途翻阅遇到陌生词,可回到其首次出现处查看定义。


第〇部分:结论先行

出发的问题是:一个真正强大的 AI 应当像人一样,终其一生持续学习。今天没有任何系统做到这一点。要做到,必须解决哪些根本问题?哪些方向最有希望?

十二条核心结论:

  1. 今天的深度学习在结构上是"两阶段"的——先训练、后冻结使用——这与终身学习的要求直接冲突。这不是工程细节,而是根本缺陷。(深度网络:由大量可调数值层层堆叠而成的学习系统;这些可调数值叫参数或权重,模型的全部知识就存在其中。)一旦让标准深度网络持续学习(不停用、边用边学,而不是一次性训练),它会同时暴露两种失败:忘掉旧的(灾难性遗忘)和学不动新的(可塑性丧失;可塑性=还能被新经验改变、学会新东西的能力)。两者都有扎实的实验证据。【已确立】[S1][S23]
  2. 灾难性遗忘自 1989 年就已知,至今没有通用解。 它的机制是清楚的:分布式表示(每条知识分散写在许多共享数值上,而不是各占一格)意味着新旧知识共用参数,学新任务时的梯度更新(训练中对参数的逐步微调)会覆写旧任务依赖的权重。三类缓解手段——正则化(给参数改动加"惩罚",不许离旧状态太远)、重放(留一小份旧数据,学新时混进去复习)、结构隔离(给新任务划拨独立的网络部件)——各有代价,没有一种在无任务边界、数据只过一遍、存储受限的真实设定下全面成立。【已确立】[S1][S3][S13]
  3. 可塑性丧失是近年才被充分确认的"另一半"问题,且更为致命。 Dohare 等在 Nature(2024)证明:标准深度学习方法在持续学习设定下会逐渐丧失学习能力,最终不如浅层网络;仅靠梯度下降(沿"错误减少最快"的方向反复微调参数的标准训练算法)不够,需要持续注入随机性(如持续反向传播:持续随机重置一小部分不再起作用的神经元,让网络保有"新鲜细胞")才能无限期保持可塑性。【已确立,但"随机性是否必需"这一强论断有待更多独立检验→有争议的部分见正文】[S23]
  4. 理论上,"不用记忆、只靠巧妙的参数更新"的完美持续学习基本无望。 Knoblauch 等(ICML 2020)证明最优持续学习一般需要完美记忆且为 NP 难(计算复杂度理论中公认无法高效求解的一类问题);这解释了为什么重放/记忆类方法在实证中系统性地强于纯正则化方法。任何认真的终身学习方案都必须包含某种形式的记忆。【已确立(定理本身);对实践的约束力属合理推断】[S18]
  5. 损失几何给了"就近学习"一个真实但有限的机会窗口。(损失:衡量模型犯错程度的分数,训练就是把它压低;"损失几何"研究参数空间里这个分数的地形。)过参数化(参数远多于"刚好够用")网络的好解不是孤点,而是连成一片的低损失区域(模式连通性);从同一预训练模型(先在海量通用数据上训练出的底座)出发微调(用新数据接着训练)得到的多个解甚至由直线相连,可以直接加权平均合并(model soups、任务算术)。这解释了为什么 EWC、LoRA、正交投影、模型合并这类"待在旧解附近学新"的方法效果不错——尤其在强预训练模型之上。【已确立】[S32][S33][S34][S40][S48][S49]
  6. 但"就近学习"有原则性上限:约束会累积耗尽容量,而真正的新知识要求特征改变,不能永远线性化。 正交投影类方法(只沿不影响旧任务的方向更新参数)的可用方向随任务数递减;EWC 依赖的 Fisher 估计(对"哪些参数对旧任务重要"的数学估计)在长序列上失真;类增量场景(最难的设定:不告诉模型现在是哪个任务)下纯正则化方法系统性失败;惰性(NTK)区的学习(参数几乎不动、模型近似线性的训练状态)恰恰放弃了深度学习最有价值的特征学习(网络自己发明新的内部概念)。"就近学习"是强预训练模型上的短中期策略,不是终身学习的完整答案。【已确立(各失效点)+ 综合判断】[S13][S37][S38][S46]
  7. 大脑的答案不是单一机制,而是一套多时间尺度的系统架构:互补学习系统(海马快学、皮层慢固化)、睡眠重放、突触内部的多时间尺度状态、稀疏编码与神经调质门控。(海马:大脑中快速记录具体事件的区域;新皮层:缓慢提炼规律的区域;突触:神经元之间强度可调的连接,相当于大脑的"权重";固化:把易失的新记忆转成持久记忆的过程;稀疏编码:任一时刻只让少数神经元活跃;神经调质:多巴胺等化学信号,控制"何时该学、学多快"。)其中最可迁移的洞见是:记忆必须分层,固化必须是主动过程,"学多快"本身要被调控。【已确立(生物机制);"可迁移"属有依据的推断】[S61][S86][S88][S89][S90]
  8. 当前实证上最能打的工程路线是"记忆系统 + 重放 + 慢速固化"的组合,而不是任何单一算法。 重放是持续学习基准(标准化测试集)上最稳健的方法族;检索增强(RAG)(模型回答前先到外部资料库查资料,而不是全凭记在参数里的知识)把事实性知识外置,绕开了权重更新;LLM(大语言模型)持续预训练用"学习率(每次参数调整的步幅)再升温 + 小比例旧数据重放"已能接近重训效果。【已确立(各单项);组合优先级为作者判断】[S13][S64][S74]
  9. 上下文内学习(ICL)是一种真实但短暂的持续学习,它提示了一条架构级出路:把"学习"变成推理的一部分。(上下文内学习:不改任何参数,只把示例放进对话窗口,模型就能现学现用;推理:模型被使用、生成输出的阶段,区别于训练阶段。)研究表明 Transformer 计算一次输出的过程(前向传播)可以隐式地执行梯度下降——等于在"脑内"临时学习;测试时训练(TTT 层、Titans)把这一点显式化,让模型在使用中持续更新一个快速记忆模块。这是当前最有想象空间的架构方向之一,但尚未在真正的终身尺度上验证。【已确立(机制研究)/【推测】(作为终身学习路线)】[S67][S68][S69][S70]
  10. 领域的标准框架部分问错了问题。 主流基准把持续学习定义为"在受限条件下逼近多任务联合训练(把所有任务数据攒在一起同时训练——被当作理想上限)"——目标是不掉分。但终身学习的真正目标是知识积累与复利:学得越多,学新东西越快(前向迁移:旧知识帮到新学习),旧知识还能被新经验改善(后向迁移)。几乎没有基准直接度量"学习加速度";一个朴素基线(最简单的对照方法。GDumb:只存样本、考前重训)能击败大批复杂方法,说明现有评测没有测到真正的能力。【已确立(GDumb 等证据)+ 观点(框架批评)】[S15][S16][S17]
  11. 神经发生的教训:连生物学自己都还在争论。(神经发生:大脑长出新的神经元。)成人海马是否终身产生新神经元,2018 年两篇顶刊结论直接相反(Sorrells: 检不出;Boldrini: 持续到 79 岁)。对 AI 的启示是方向性的(注入新鲜可塑性单元有价值——这恰是持续反向传播所做的),而非可以照抄的蓝图。【有争议(生物事实)】[S23][S94][S95]
  12. 最有希望的方向排序(作者综合判断,理由见第六部分):① 面向 LLM 的互补学习系统(检索式情景记忆〔对具体经历的记忆,区别于对规律的记忆〕+ 周期性固化入权重);② 保持可塑性的优化器与架构(持续反向传播家族);③ 规模化持续预训练的"配方科学";④ 把学习内置于推理的架构(TTT/快速权重);⑤ 几何引导的模型合并与低秩更新(冻结模型主体,只训练一小块附加参数,LoRA 即此类)。真正的瓶颈不在任何单点技术,而在缺少一个诚实的、开放式的终身学习评测与理论目标函数。【推测(排序本身)】

第一部分:问题定义——持续学习到底在问什么

1.1 两难的原型:稳定性 vs 可塑性

一个学习系统面对源源不断的新经验,有两种对称的死法:太"稳定",新东西学不进去;太"可塑",新东西把旧东西冲掉。Grossberg 在 1980 年就把这命名为稳定性–可塑性两难(stability–plasticity dilemma)[S4],并在 ART 架构中第一次尝试正面解决 [S5]。这不是深度学习特有的毛病,而是任何用共享资源存储知识的系统的普遍约束。

深度网络把这个两难表现得极端:McCloskey 与 Cohen(1989)发现,顺序训练的连接主义网络(神经网络的早期叫法)学习第二个任务时会灾难性地摧毁第一个任务的性能 [S1],Ratcliff(1990)做了系统定量刻画 [S2]。French(1999)指出根源:分布式表示的威力恰恰来自参数共享与重叠,而重叠就是干扰的来源——遗忘不是 bug,是分布式表示这枚硬币的反面 [S3]。【已确立】

1.2 标准形式化及其度量

现代文献通常这样设定:任务序列 T₁, T₂, …, Tₖ 依次到来,学习器每次只能看当前任务的数据,目标是在全部见过的任务上都表现好。Lopez-Paz 与 Ranzato(2017)给出了沿用至今的三个指标 [S15]:

van de Ven 等进一步把场景分为三类 [S12][S13]:任务增量(测试时告诉你是哪个任务)、域增量(任务不变、数据分布变)、类增量(要在所有见过的类别中做判别,且不告诉你任务身份)。这个区分极其重要,因为方法的成败强烈依赖场景:正则化类方法(EWC 等)在任务增量下尚可,在类增量下系统性失败;类增量基本只有重放和结构方法能撑住 [S13]。【已确立】

1.3 这个框架问对问题了吗?——我们的论点

部分问对,部分问错。 以下三点批评均有公开证据支撑:

第一,现行基准度量的是"不退步",不是"会积累"。 标准指标以"多任务联合训练"为隐含天花板:一个把所有数据攒起来一起训的模型就是最优解,持续学习被定义为在"不能攒数据"的约束下逼近它。但终身学习的原始动机(Ring 1994 [S6]; Thrun & Mitchell 1995 [S7])是复利式的知识积累:学得越多,学新东西越快、越好——第 1000 个任务的学习曲线应当远陡于第 1 个。这对应 FWT,而 FWT 在绝大多数论文里是被顺带一提的次要指标,且鲜有工作展示随任务数增长的学习加速。一个只会"不忘"而不会"越学越快"的系统,不是人们想要的终身学习者。【观点,但指标现状可查证】[S15]

第二,朴素基线的胜利暴露了评测的失真。 Prabhu 等(2020)的 GDumb 什么持续学习技巧都不用:贪心地往一个小缓冲区里存样本,测试前用缓冲区从头重训一个模型——就这样击败了当时大批专门设计的方法 [S17]。Farquhar 与 Gal(2018)更早就指出,常用协议(多次遍历数据、测试时已知任务身份、只用两三个任务的短序列)使评测偏向根本不解决真问题的方法 [S16]。后续在固定算力预算下的重新评估进一步发现:许多已发表方法的增益在预算对齐比较中消失,简单方法(重放+合理分配算力)常常胜出 [S124]。如果基准能被"不学习"的方法打穿、增益经不起预算对齐,说明基准没有测到目标能力。【已确立】

第三,真实的终身学习没有任务边界,而"任务"这个概念本身可能是错误抽象。 现实经验流是连续、非平稳、无标注切分的。Task-free 设定(Aljundi 等 2019 [S19])、在线持续学习(单遍数据流;实证综述见 Mai 等 [S122])和 general continual learning(Buzzega 等 2020 [S55])朝正确方向走了一步,但仍是少数派。Silver 与 Sutton(2025)的"经验时代"论述把要求提得更高:智能体应栖居于终身经验流,目标、记忆与学习贯穿整个流,而不是被切成一次次短会话 [S20]。按这个标准,今天几乎全部持续学习文献研究的是真问题的一个玩具投影。【观点;引文立场为公开发表】

同时要为标准框架说句公道话:玩具投影不等于无用。灾难性遗忘和可塑性丧失在最干净的小设定里就已出现,机制研究(第二、三部分)正是靠这些受控设定取得的。批评的对象是把基准分数当成终身学习进展本身,而不是受控实验方法论。

1.4 一个理论锚点:没有免费的记忆

Knoblauch 等(ICML 2020)从集合论角度证明:能在最坏情况下避免灾难性遗忘的最优持续学习器,一般需要解 NP 难问题,并且需要完美记忆(至少保留每个"等价类"的一个样本)[S18]。两个推论:

  1. 指望某种巧妙的参数更新规则在不存储任何过去信息的前提下通用地解决遗忘,理论上就不成立;
  2. 这解释了实证格局:重放/记忆类方法系统性强于纯正则化方法 [S13][S17]。

因此,问题从"要不要记忆"变成"记什么、以什么形式记(原始样本/生成模型/权重/外部库)、何时固化、何时丢弃"。这是本文第四、六部分的主线。【已确立(定理);推论为有依据的解读】

还有一个目标层面的细节值得单独指出:"零遗忘"未必是正确目标。 在目标本身随时间变化的场景里,遗忘过时的知识可能恰恰是对的——例如推荐系统中,用户兴趣漂移后,过时的偏好不仅无用还有害,PESO 在该场景中明确以此为设计出发点 [S117]。这提示应区分干扰(新学习无意间破坏仍然有效的旧知识,坏)与修订(有意覆盖已失效的旧知识,好)——现有指标几乎都把两者混在同一个"遗忘"数字里。【已确立(该文的公开论证);"干扰/修订之分应进入指标"为作者观点】


第二部分:两种失败——灾难性遗忘与可塑性丧失

2.1 灾难性遗忘的机制

深度学习时代的系统实证从 Goodfellow 等(2013)开始 [S24]。机制层面目前最清晰的图景:

2.2 可塑性丧失:另一半问题

灾难性遗忘讲的是"忘旧",可塑性丧失讲的是"学不动新"。这个问题长期被忽视,因为标准范式只训练一次。证据链近年迅速齐全:

值得单独标注的是其强推论——"基于梯度下降的方法不够,持续深度学习需要非梯度的随机成分" [S23]。这是一个全称命题,而现有证据是存在性的(所试过的确定性方法都失败了)。L2 Init(向初始参数而非原点正则化 [S31])等确定性方法在较温和的非平稳性下也能维持可塑性,说明边界还没画清。我们标注:现象【已确立】,机制解释(曲率丢失、秩坍缩、死单元 [S27][S28])【已确立但不完整】,"随机性必需"【有争议】。

2.3 两种失败是同一枚硬币

把两者放回 Grossberg 的两难 [S4]:遗忘=稳定性不足,可塑性丧失=系统为求稳定(权重增大、表示固化)付出的代价在时间上的累积。任何只解决一半的方法都会在另一半上付账:冻结参数保护旧知识→加速可塑性耗尽;随机重置单元恢复可塑性→局部破坏旧知识。终身学习的核心不是消灭其中一个,而是找到能同时在两条轴上长期维持的机制——这正是大脑用多时间尺度架构解决的问题(第五部分)。【综合判断】


第三部分:几何视角——在参数空间里"就近学习"能走多远

3.1 低损失区域比想象中大得多

过参数化网络的一个反直觉事实:好解不是孤岛,而是连成一片的大陆。

对持续学习最直接的结果来自 Mirzadeh 等(2021):同初始化条件下,多任务联合训练的解与持续学习的解线性连通——也就是说,不忘旧任务的好解就躺在持续学习轨迹的"隔壁",遗忘的本质是优化器没有被约束住、走出了那条线性走廊 [S40]。【已确立】

两个补充刻画让这幅"低损失大陆"图景更完整:高维损失地形的大尺度结构分析表明低损失区域呈楔形大面积延展 [S110];而"内在维度"实验表明许多任务实际只需要在一个远低于参数总数的子空间里就能解出 [S111]——解空间的富余正是"附近就有好解"的容量基础。【已确立(各实验);两者与持续学习的连接为综合解读】

3.2 惰性训练:为什么"隔壁"常常够用

NTK 理论(Jacot 等 2018 [S37])与惰性训练分析(Chizat 等 2019 [S38])表明:足够宽的网络在训练中参数移动极小,函数变化近似于在初始点的线性化模型中进行。宽网络+强预训练把模型推向"局部线性、局部可解"的状态:新任务往往只需在旧解附近的一个线性子空间里就能解出。这为整个"就近学习"家族提供了统一的理论直觉。【已确立(理论);对实际预训练模型的适用度是近似】

在这一框架内,遗忘本身已经有了可计算的理论刻画:Doan 等(2020)用 NTK 重叠矩阵——新旧任务在核特征空间中的重叠程度——定量预测任务间干扰 [S107];Bennani 等(2020)给出了 NTK 区内正交梯度下降(OGD)的泛化保证 [S108];Evron 等(2022)在线性回归中精确刻画了顺序学习最坏情况下的遗忘量 [S109]。这条理论线索的含义:至少在(近似)线性区,"哪些任务组合会互相破坏"原则上是可以事先算出来的——这直接连到第六部分的 P7。【已确立(各定理/结果,均在线性或 NTK 假设下)】

3.3 "就近学习"方法家族的全景

按"如何定义'附近'"分类:

  1. 软约束(各向异性弹簧):最朴素的形式是 L2-SP——直接向出发点(预训练参数)做 L2 正则,迁移学习文献早已确立其有效性 [S101];EWC 把这根"弹簧"改为按 Fisher 信息加权的各向异性版本,重要参数拴得紧、次要参数拴得松 [S41];SI 在线累积重要性 [S42];MAS 用无监督(不需要标注答案)的敏感度估计 [S43]。
  2. 函数空间的"就近":LwF 不约束参数,而是约束行为——用蒸馏让新模型在新数据上继续模仿旧模型的输出 [S100]。参数距离与函数距离并不等价(见 3.4),所以这是一个实质不同的"附近"定义。
  3. 硬约束(正交子空间):OGD 把新梯度投影到旧任务梯度的正交补 [S44];OWM 用正交投影算子并在 Nature Machine Intelligence 上展示了上百任务的顺序学习 [S45];GPM 显式维护旧任务的核心梯度子空间 [S46];O-LoRA 把同一思想搬到 LLM 的低秩适配器上,让各任务的 LoRA 子空间相互正交 [S114]。
  4. 低维增量:LoRA 冻结主干、只训低秩修正 [S47]——"附近"被参数化为一个低秩流形;天然支持"每个新领域一个适配器"。大规模实证直接确认了这笔交易的两面:LoRA 学得更少、忘得也更少(Biderman 等 2024 [S113])——限制更新自由度同时买到了保持与代价。
  5. 权重空间算术:任务向量(微调解减预训练解)可以相加获得多任务能力、相减实现遗忘 [S48];同一起点的多个微调解可直接平均(model soups [S49])或按 Fisher 信息加权合并 [S116];TIES 进一步定位并消解合并时的参数干扰(符号冲突、冗余)[S115];微调解与原解插值可兼得新旧性能(WiSE-FT [S50])。这些只在共享预训练起点(同一线性盆地)时成立。
  6. 持续化的合并与锚定(最新进展):上述合并多是"一次性"的;新一代工作把它变成随时间滚动的过程——SLAO 用正交初始化+时间感知缩放,把每个新任务的更新持续合并进单个 LoRA,内存不随任务数增长(ICLR 2026 [S118]);PESO 维护一个持续演化的 LoRA,用近端项把当前适配器锚定在其最近的冻结状态附近,并明确论证在其推荐场景中过时知识应当被覆盖(ICLR 2026 [S117])。
  7. 反向的"就近":L2 Init 把参数拴向初始化点而不是旧解——目的不是防遗忘而是保可塑性 [S31]。同一几何工具,两个方向的用法,恰好对应两难的两端。

顺带一提,"限制每步更新的幅度"这个原则比持续学习更普遍:强化学习中的信赖域方法就是同一思想,近期一篇关于循环脉冲网络无梯度优化的公开预印本(arXiv:2601.21572 [S127])用按信号能量自适应缩放的信赖域来稳定训练——它是强化学习/优化方向的工作,与持续学习仅间接相关,此处仅作原则相通的旁注。

3.4 它在哪里断裂

【已确立】的失效点:

结论:几何解释了"就近学习"为什么在强预训练模型上惊人地好用(低损失大陆宽阔、局部近似线性),也解释了它为什么必然不够(大陆再大也有海岸线;线性化学不出新特征)。它是终身学习的重要构件——尤其是"围绕一个强基座做可合并的模块化更新"这条工程路线——但不是完整答案。【综合判断,各支撑点已确立】

📦 附:我们的玩具实验(仅作示意)

为直观感受本部分的几条论断,我们(通过一个配套的可复现实验仓库)跑了一个刻意做小的对照实验。它是示意性质的演示,不是与上述文献同等地位的证据:数据集极小、随机种子很少、不做统计显著性声明,以下只报告定性方向。


第四部分:系统路线——重放、双系统、外部记忆与 LLM 时代

4.1 重放:最不优雅、最有效

重放(rehearsal)存一小部分旧数据混入新训练;思想可追溯到 Robins(1995),他同时提出了不存真数据、用网络自己生成"伪样本"复习的伪重放 [S51]。现代谱系:iCaRL(类增量+样本管理)[S52]、GEM/A-GEM(用旧样本梯度约束更新方向)[S15][S54]、强化学习设定下的经验重放 [S102]、DER(重放 logits——模型输出的原始打分,比只重放"正确答案"携带更多信息;一个极强的简单基线)[S55]、生成式重放(训练生成模型合成旧数据)[S53]、类脑生成式重放(重放内部表示而非原始像素,类增量下大幅改进)[S103]。

实证格局非常一致:在类增量等困难场景中,重放类方法是最稳健的方法族 [S13][S14]。这不是巧合——Knoblauch 的定理说记忆是必需的 [S18],重放就是记忆的最朴素形态。生成式重放理论上摆脱了存储原始数据的负担,但把问题转嫁给了"生成模型自己也要持续学习"的递归难题,在复杂分布上尚未真正成立。【已确立(格局);生成式重放的评价为综合判断】

4.2 互补学习系统:大脑给出的架构答案

McClelland、McNaughton 与 O'Reilly(1995)的经典理论 [S61]:大脑用两个学习系统解决两难——海马以稀疏表示快速记住具体情景;新皮层以重叠分布式表示缓慢学习统计结构;海马在离线期(睡眠/静息)反复向皮层重放,让皮层以不干扰旧知识的交错方式吸收新经验。Kumaran 等(2016)的更新版明确指出这对 AI 智能体设计的直接含义:快慢双系统 + 交错重放 + 情景记忆支持一次性学习 [S62]。【已确立(理论地位与神经证据,见第五部分)】

工程对应物早已存在,只是常不被这样称呼:

4.3 把知识放在权重外面:外部记忆与检索

另一条思路:既然往权重里写新知识这么危险,那就别写。

限度同样清楚:检索解决陈述性知识(事实、文档)极好,但程序性能力(技能、推理模式、品味)不在可检索的颗粒度上;检索库无限增长的管理、以及"检索到了但用不好"的整合问题,都指向仍需某种固化机制把高频使用的记忆压缩进权重。【已确立(方法有效性);限度分析为综合判断】

4.4 上下文内学习:每次前向传播都是一次小型持续学习

GPT-3 确立了 ICL 现象:不更新任何权重,只在上下文中给示例,模型就能"学会"新任务 [S69]。机制研究表明这不只是查表:Transformer 的前向传播可以隐式实现梯度下降 [S70],在受控线性设定下 ICL 隐式执行标准学习算法 [S71]。

这给终身学习提供了一个重要视角:上下文就是一块零遗忘、即写即用、但会随会话蒸发的快速记忆——功能上惊人地像海马的角色。它的三个天花板:容量(上下文窗口)、持久性(会话结束即消失)、成本(注意力的平方开销)。测试时训练路线正是要把这块"蒸发性记忆"变成持久机制:TTT(2020)在测试时用自监督损失(自监督:不需要人工标注,从数据自身构造练习题)更新模型 [S66];TTT 层(2024)把循环网络的内部状态本身做成一个在推理中被梯度更新的小模型 [S67];Titans 加上"惊讶度驱动写入+自适应遗忘"的神经长期记忆模块,扩展到 200 万 token(token:模型处理文本的基本单位,约为一个词或词的一部分)以上的上下文 [S68]。【已确立(各结果);"这是通往终身学习的架构雏形"【推测】】

4.5 LLM 的持续预训练与微调:目前最接近实用的战场

4.6 从经验中学习的智能体

Voyager 在 Minecraft 中展示了一种回避权重更新的终身学习:把学到的行为沉淀为代码技能库,复用与组合技能持续变强 [S79];Reflexion 把失败经验写成语言化反思存入情景记忆 [S80]。这类"经验→文本/代码→检索"的循环是目前 LLM 智能体积累能力的主流方式。它的天花板与 4.3 相同:能力沉淀在权重之外,基座本身不成长。Silver 与 Sutton 的"经验时代"论点 [S20] 正是主张跨过这道坎:让智能体从终身经验流中直接学习(含权重更新),这把本文讨论的全部难题(遗忘、可塑性、固化)重新推回台前。【已确立(系统演示);路线判断为公开发表的立场+作者认同】


第五部分:大脑如何做到不遗忘——以及哪些机制可迁移

生物学习系统运行数十年而不灾难性遗忘,是"终身学习可行"的唯一存在性证明。机制盘点(总览见 Kudithipudi 等 2022 [S22]):

5.1 突触层:记忆写在多时间尺度里

5.2 系统层:固化是主动的离线过程

5.3 编码层:稀疏、分离与门控

5.4 调控层:何时学、学多快,本身是被控制的信号

去甲肾上腺素/多巴胺等神经调质按"惊讶度、新颖性、奖励"门控可塑性(Aston-Jones & Cohen 2005 [S99])。机器侧的对应物正在出现:Titans 按"惊讶度"决定写入记忆的强度 [S68];各类重要性加权 [S41][S42][S43] 是其静态近似。把"学习率"从超参数升格为由系统自身估计的、逐参数逐时刻的控制信号,是被生物学强烈暗示、而 ML 尚未系统化的方向。【推断/推测】

5.5 神经发生:一个诚实的警示

成人海马神经发生曾被视为"注入新可塑性单元"的漂亮机制(Eriksson 等 1998 [S93])。但 2018 年,Sorrells 等(Nature)在成人样本中检不出新生神经元 [S94],Boldrini 等(Cell Stem Cell)却报告其持续到 79 岁 [S95]——方法学争论(死后延迟、标志物降解、立体计数)至今未完全了结。【有争议】

两点教训:(1)引用"大脑如何如何"作为 AI 方案依据时必须核对生物学证据的当前状态;(2)有趣的是,无论生物事实如何,"持续注入新鲜的、未定型的单元"在机器侧已被独立证明有效——这正是持续反向传播 [S23] 与休眠神经元重置 [S27] 所做的事。工程不需要等生物学吵完。

5.6 人脑也不是无懈可击的对照组

人类同样遗忘,也同样有顺序效应——但方向相反:Flesch 等(2018)发现人类在分块(先学完 A 再学 B)训练下比交错训练学得更好,而标准神经网络恰恰相反 [S96]。这说明大脑并非"抗遗忘的神经网络",而是带着强先验、门控与固化机制的不同类型的系统。神经科学对 AI 的正确用法是提取计算原则(多时间尺度、离线固化、稀疏门控、调质控制),而不是复制零件(Hassabis 等 2017 [S97]; Richards 等 2019 [S98])。【已确立(实验);方法论立场为公开发表的观点】


第六部分:开放的根本问题(按重要性排序)与最有希望的方向

以下 8 个问题按"对实现终身学习 AI 的瓶颈程度"排序(排序本身是作者判断【推测】,每条的证据基础单独标注)。每条含:为什么根本、当前最佳证据、一个具体可证伪的研究步骤。


P1. 终身学习的目标函数是什么?——理论空白

P2. 可塑性丧失的充要条件——随机性是否必需?

P3. "就近学习"的容量边界——一个盆地能装下多少知识?

P4. 记忆的分工与固化策略——什么进权重、什么进外部库、何时转移?

P5. 规模化持续预训练的科学——遗忘的 scaling law

P6. 经验→能力的自动蒸馏——智能体如何把经历变成本领?

P7. 表示的干扰几何——能否事先预测"这次更新会毁掉什么"?

P8. 评测本身——开放式终身学习的诚实基准


最有希望的方向(作者综合排序,均为【推测】级判断,理由与证据如注)

  1. 面向 LLM 的互补学习系统:检索式情景记忆(即写即用、零遗忘)+ 周期性离线固化(重放/蒸馏进权重)。理由:两端组件均已单独验证([S64][S74][S82]),缺的只是闭环;它同时回应 P4 与 P6;且与现有 LLM 基础设施兼容,可被工业界立即推进。
  2. 保持可塑性的优化与架构(持续反向传播家族、逐参数元可塑性、多时间尺度权重状态 [S23][S31][S90]):任何长期运行的系统都绕不开 P2;这是"地基"性质的方向。
  3. 持续预训练的配方科学与 scaling law(P5):最接近实用、数据点最容易产出、每个结论都直接影响生产系统 [S74]。
  4. 把学习内置于推理的架构(TTT 层、Titans 式神经记忆 [S67][S68]):若成功,它会消解"训练/推理"的两阶段划分——这正是结论 1 指出的根本缺陷;风险在于尚无终身尺度的证据。
  5. 几何引导的模块化更新与合并(LoRA+任务算术+对齐合并 [S47][S48][S36]):短中期收益确定,但受 P3 的容量边界约束,更可能是过渡技术而非终局。

一句话收束:灾难性遗忘和可塑性丧失都不是待修的 bug,而是"用单一时间尺度的密集共享参数承载全部知识"这一设计的必然后果。出路不在更聪明的补丁,而在架构层面引入大脑早已采用的分层:多时间尺度的参数、快慢分工的记忆系统、主动的离线固化,以及一个诚实度量"知识复利"的目标函数。


方法论与局限

参考文献(全部为公开文献)

正文以 [S编号] 引用下列条目。所有条目以 arXiv 编号或 DOI 为准;会议/期刊名称仅在经直接核验后标注。

A. 问题定义与综述

[S1] McCloskey, M. & Cohen, N. J. (1989). Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation, Vol. 24, 109–165. — 灾难性遗忘的首次系统报告。

[S2] Ratcliff, R. (1990). Connectionist models of recognition memory: Constraints imposed by learning and forgetting functions. Psychological Review, 97(2), 285–308. — 早期对连接主义遗忘的定量刻画。

[S3] French, R. M. (1999). Catastrophic forgetting in connectionist networks. Trends in Cognitive Sciences, 3(4), 128–135. — 经典综述;提出分布式表示的重叠是遗忘根源。

[S4] Grossberg, S. (1980). How does a brain build a cognitive code? Psychological Review, 87(1), 1–51. — "稳定性–可塑性两难"(stability–plasticity dilemma)概念来源。

[S5] Carpenter, G. A. & Grossberg, S. (1987). A massively parallel architecture for a self-organizing neural pattern recognition machine. Computer Vision, Graphics, and Image Processing, 37, 54–115. — 自适应共振理论(ART),最早直面稳定性–可塑性的架构。

[S6] Ring, M. B. (1994). Continual Learning in Reinforcement Environments. PhD thesis, University of Texas at Austin. — "continual learning" 一词在强化学习语境中的奠基性论述。

[S7] Thrun, S. & Mitchell, T. M. (1995). Lifelong robot learning. Robotics and Autonomous Systems, 15, 25–46. — 终身学习(lifelong learning)问题的早期系统提法。

[S8] Chen, Z. & Liu, B. (2018). Lifelong Machine Learning (2nd ed.). Morgan & Claypool. — 终身机器学习专著。

[S9] Mitchell, T. et al. (2018). Never-Ending Learning. Communications of the ACM, 61(5), 103–115. — NELL:运行多年的持续学习系统实例。

[S10] Parisi, G. I., Kemker, R., Part, J. L., Kanan, C. & Wermter, S. (2019). Continual lifelong learning with neural networks: A review. Neural Networks, 113, 54–71. — 神经网络持续学习综述。

[S11] Hadsell, R., Rao, D., Rusu, A. A. & Pascanu, R. (2020). Embracing Change: Continual Learning in Deep Neural Networks. Trends in Cognitive Sciences, 24(12), 1028–1040. — DeepMind 视角的持续学习综述。

[S12] van de Ven, G. M. & Tolias, A. S. (2019). Three scenarios for continual learning. arXiv:1904.07734. https://arxiv.org/abs/1904.07734 — 任务增量/域增量/类增量三种场景的标准划分。

[S13] van de Ven, G. M., Tuytelaars, T. & Tolias, A. S. (2022). Three types of incremental learning. Nature Machine Intelligence, 4, 1185–1197. — [S12] 的期刊扩展版;系统比较三种场景下各类方法的成败。

[S14] Wang, L., Zhang, X., Su, H. & Zhu, J. (2024). A Comprehensive Survey of Continual Learning: Theory, Method and Application. IEEE TPAMI. arXiv:2302.00487. https://arxiv.org/abs/2302.00487 — 目前覆盖面最广的持续学习综述之一。

[S15] Lopez-Paz, D. & Ranzato, M. (2017). Gradient Episodic Memory for Continual Learning. NeurIPS 2017. arXiv:1706.08840. https://arxiv.org/abs/1706.08840 — GEM;正式定义了前向/后向迁移(FWT/BWT)指标。

[S16] Farquhar, S. & Gal, Y. (2018). Towards Robust Evaluations of Continual Learning. arXiv:1805.09733. https://arxiv.org/abs/1805.09733 — 对标准评测协议的系统批评。

[S17] Prabhu, A., Torr, P. H. S. & Dokania, P. K. (2020). GDumb: A Simple Approach that Questions Our Progress in Continual Learning. ECCV 2020, LNCS 12347, 524–540. — 贪心存样本+从头重训的朴素基线胜过大量复杂方法,对领域进展提出质疑。

[S18] Knoblauch, J., Husain, H. & Diethe, T. (2020). Optimal Continual Learning has Perfect Memory and is NP-hard. ICML 2020, PMLR 119, 5327–5337. arXiv:2006.05188. https://arxiv.org/abs/2006.05188 — 理论结果:最优持续学习一般需要完美记忆且为 NP 难。

[S19] Aljundi, R., Kelchtermans, K. & Tuytelaars, T. (2019). Task-Free Continual Learning. CVPR 2019. arXiv:1812.03596. https://arxiv.org/abs/1812.03596 — 无任务边界的持续学习设定。

[S20] Silver, D. & Sutton, R. S. (2025). Welcome to the Era of Experience. Preprint of a chapter in "Designing an Intelligence" (MIT Press). https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf — 主张智能体应栖居于终身经验流并从中持续学习。

[S21] Sutton, R. S. (2019). The Bitter Lesson. 公开博客文章. http://www.incompleteideas.net/IncIdeas/BitterLesson.html — 通用方法+算力胜过人工先验的著名论断。

[S22] Kudithipudi, D. et al. (2022). Biological underpinnings for lifelong learning machines. Nature Machine Intelligence, 4, 196–210. — 生物终身学习机制面向机器的系统盘点。

B. 可塑性丧失与遗忘机制

[S23] Dohare, S., Hernandez-Garcia, J. F., Lan, Q., Rahman, P., Mahmood, A. R. & Sutton, R. S. (2024). Loss of plasticity in deep continual learning. Nature, 632, 768–774. DOI: 10.1038/s41586-024-07711-7. https://www.nature.com/articles/s41586-024-07711-7 — 标准深度学习在持续设定下逐渐丧失可塑性;提出持续反向传播(continual backprop)。

[S24] Goodfellow, I. J., Mirza, M., Xiao, D., Courville, A. & Bengio, Y. (2013). An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks. arXiv:1312.6211. https://arxiv.org/abs/1312.6211 — 深度学习时代对灾难性遗忘的早期实证研究。

[S25] Ash, J. T. & Adams, R. P. (2020). On Warm-Starting Neural Network Training. NeurIPS 2020. arXiv:1910.08475. https://arxiv.org/abs/1910.08475 — 温启动损害泛化;提出 shrink-and-perturb。

[S26] Nikishin, E., Schwarzer, M., D'Oro, P., Bacon, P.-L. & Courville, A. (2022). The Primacy Bias in Deep Reinforcement Learning. ICML 2022. arXiv:2205.07802. https://arxiv.org/abs/2205.07802 — 深度 RL 中的"首因偏差"与周期性重置。

[S27] Sokar, G., Agarwal, R., Castro, P. S. & Evci, U. (2023). The Dormant Neuron Phenomenon in Deep Reinforcement Learning. ICML 2023. arXiv:2302.12902. https://arxiv.org/abs/2302.12902 — 休眠神经元随训练累积,削弱表达能力。

[S28] Lyle, C., Zheng, Z., Nikishin, E., Avila Pires, B., Pascanu, R. & Dabney, W. (2023). Understanding Plasticity in Neural Networks. ICML 2023. arXiv:2303.01486. https://arxiv.org/abs/2303.01486 — 可塑性丧失的机理分析(曲率、参数增长等)。

[S29] Ramasesh, V. V., Dyer, E. & Raghu, M. (2021). Anatomy of Catastrophic Forgetting: Hidden Representations and Task Semantics. ICLR 2021. arXiv:2007.07400. https://arxiv.org/abs/2007.07400 — 遗忘主要由深层表示的漂移驱动。

[S30] Ramasesh, V. V., Lewkowycz, A. & Dyer, E. (2022). Effect of scale on catastrophic forgetting in neural networks. ICLR 2022. https://openreview.net/forum?id=GhVS8_yPeEa — 模型规模越大、预训练越充分,遗忘越轻。

[S31] Kumar, S., Marklund, H. & Van Roy, B. (2023). Maintaining Plasticity in Continual Learning via Regenerative Regularization. arXiv:2308.11958. https://arxiv.org/abs/2308.11958 — L2 Init:向初始参数正则化以保持可塑性。

C. 损失几何与"就近学习"

[S32] Garipov, T., Izmailov, P., Podoprikhin, D., Vetrov, D. & Wilson, A. G. (2018). Loss Surfaces, Mode Connectivity, and Fast Ensembling of DNNs. NeurIPS 2018. arXiv:1802.10026. https://arxiv.org/abs/1802.10026 — 独立训练的极小点由低损失曲线相连(模式连通性)。

[S33] Draxler, F., Veschgini, K., Salmhofer, M. & Hamprecht, F. A. (2018). Essentially No Barriers in Neural Network Energy Landscape. ICML 2018. arXiv:1803.00885. https://arxiv.org/abs/1803.00885 — 与 [S32] 同期独立发现:极小点之间基本无能量壁垒。

[S34] Frankle, J., Dziugaite, G. K., Roy, D. M. & Carbin, M. (2020). Linear Mode Connectivity and the Lottery Ticket Hypothesis. ICML 2020. arXiv:1912.05671. https://arxiv.org/abs/1912.05671 — 线性模式连通性(LMC)与训练早期的"稳定化"。

[S35] Entezari, R., Sedghi, H., Saukh, O. & Neyshabur, B. (2022). The Role of Permutation Invariance in Linear Mode Connectivity of Neural Networks. ICLR 2022. arXiv:2110.06296. https://arxiv.org/abs/2110.06296 — 猜想:模除置换对称后,SGD 解基本落在同一线性连通盆地。

[S36] Ainsworth, S. K., Hayase, J. & Srinivasa, S. (2023). Git Re-Basin: Merging Models modulo Permutation Symmetries. ICLR 2023. arXiv:2209.04836. https://arxiv.org/abs/2209.04836 — 通过置换对齐合并独立训练的模型。

[S37] Jacot, A., Gabriel, F. & Hongler, C. (2018). Neural Tangent Kernel: Convergence and Generalization in Neural Networks. NeurIPS 2018. arXiv:1806.07572. https://arxiv.org/abs/1806.07572 — NTK:无限宽极限下网络训练近似线性化。

[S38] Chizat, L., Oyallon, E. & Bach, F. (2019). On Lazy Training in Differentiable Programming. NeurIPS 2019. arXiv:1812.07956. https://arxiv.org/abs/1812.07956 — "惰性训练"机制及其与特征学习的对立。

[S39] Mirzadeh, S. I., Farajtabar, M., Pascanu, R. & Ghasemzadeh, H. (2020). Understanding the Role of Training Regimes in Continual Learning. NeurIPS 2020. arXiv:2006.06958. https://arxiv.org/abs/2006.06958 — 平坦极小点与遗忘的关系;训练制度(学习率、批大小)影响遗忘。

[S40] Mirzadeh, S. I., Farajtabar, M., Gorur, D., Pascanu, R. & Ghasemzadeh, H. (2021). Linear Mode Connectivity in Multitask and Continual Learning. ICLR 2021. arXiv:2010.04495. https://arxiv.org/abs/2010.04495 — 同初始化下,多任务解与持续学习解线性连通;提出 MC-SGD。

[S41] Kirkpatrick, J. et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS, 114(13), 3521–3526. DOI: 10.1073/pnas.1611835114. arXiv:1612.00796 — EWC:以 Fisher 信息加权的二次惩罚保护旧任务重要参数。

[S42] Zenke, F., Poole, B. & Ganguli, S. (2017). Continual Learning Through Synaptic Intelligence. ICML 2017. arXiv:1703.04200. https://arxiv.org/abs/1703.04200 — SI:在线累积参数重要性。

[S43] Aljundi, R., Babiloni, F., Elhoseiny, M., Rohrbach, M. & Tuytelaars, T. (2018). Memory Aware Synapses: Learning what (not) to forget. ECCV 2018. arXiv:1711.09601. https://arxiv.org/abs/1711.09601 — MAS:无监督估计参数重要性。

[S44] Farajtabar, M., Azizan, N., Mott, A. & Li, A. (2020). Orthogonal Gradient Descent for Continual Learning. AISTATS 2020. arXiv:1910.07104. https://arxiv.org/abs/1910.07104 — OGD:把新任务梯度投影到旧任务梯度的正交补。

[S45] Zeng, G., Chen, Y., Cui, B. & Yu, S. (2019). Continual learning of context-dependent processing in neural networks. Nature Machine Intelligence, 1, 364–372. — OWM:正交权重修改+情境依赖处理模块。

[S46] Saha, G., Garg, I. & Roy, K. (2021). Gradient Projection Memory for Continual Learning. ICLR 2021. arXiv:2103.09762. https://arxiv.org/abs/2103.09762 — GPM:在旧任务核心梯度子空间的正交方向学习。

[S47] Hu, E. J. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685. https://arxiv.org/abs/2106.09685 — 低秩增量更新:冻结主干、只学小的低秩修正。

[S48] Ilharco, G. et al. (2023). Editing Models with Task Arithmetic. ICLR 2023. arXiv:2212.04089. https://arxiv.org/abs/2212.04089 — 任务向量可加减:权重空间中的知识算术。

[S49] Wortsman, M. et al. (2022). Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time. ICML 2022. arXiv:2203.05482. https://arxiv.org/abs/2203.05482 — 同一预训练模型的多个微调解可以直接平均。

[S50] Wortsman, M. et al. (2022). Robust fine-tuning of zero-shot models. CVPR 2022. arXiv:2109.01903. https://arxiv.org/abs/2109.01903 — WiSE-FT:微调权重与原权重线性插值兼得新旧性能。

D. 系统路线:重放、双系统、记忆、LLM 与智能体

[S51] Robins, A. (1995). Catastrophic forgetting, rehearsal and pseudorehearsal. Connection Science, 7(2), 123–146. — 重放与伪重放(用自生成样本复习)的奠基工作。

[S52] Rebuffi, S.-A., Kolesnikov, A., Sperl, G. & Lampert, C. H. (2017). iCaRL: Incremental Classifier and Representation Learning. CVPR 2017. arXiv:1611.07725. https://arxiv.org/abs/1611.07725 — 类增量学习的代表性重放方法。

[S53] Shin, H., Lee, J. K., Kim, J. & Kim, J. (2017). Continual Learning with Deep Generative Replay. NeurIPS 2017. arXiv:1705.08690. https://arxiv.org/abs/1705.08690 — 生成式重放:用生成模型合成旧数据。

[S54] Chaudhry, A., Ranzato, M., Rohrbach, M. & Elhoseiny, M. (2019). Efficient Lifelong Learning with A-GEM. ICLR 2019. arXiv:1812.00420. https://arxiv.org/abs/1812.00420 — GEM 的高效近似。

[S55] Buzzega, P., Boschini, M., Porrello, A., Abati, D. & Calderara, S. (2020). Dark Experience for General Continual Learning: a Strong, Simple Baseline. NeurIPS 2020. arXiv:2004.07211. https://arxiv.org/abs/2004.07211 — DER:重放 logits 的强基线。

[S56] Rusu, A. A. et al. (2016). Progressive Neural Networks. arXiv:1606.04671. https://arxiv.org/abs/1606.04671 — 每个任务新增一列网络,结构上杜绝遗忘。

[S57] Schwarz, J. et al. (2018). Progress & Compress: A scalable framework for continual learning. ICML 2018. arXiv:1805.06370. https://arxiv.org/abs/1805.06370 — 快速学习列+知识蒸馏固化到慢速列。

[S58] Mallya, A. & Lazebnik, S. (2018). PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning. CVPR 2018. arXiv:1711.05769. https://arxiv.org/abs/1711.05769 — 剪枝腾挪容量、按任务分配子网络。

[S59] Serra, J., Suris, D., Miron, M. & Karatzoglou, A. (2018). Overcoming Catastrophic Forgetting with Hard Attention to the Task. ICML 2018. arXiv:1801.01423. https://arxiv.org/abs/1801.01423 — HAT:学习任务级硬注意力掩码。

[S60] Masse, N. Y., Grant, G. D. & Freedman, D. J. (2018). Alleviating catastrophic forgetting using context-dependent gating and synaptic stabilization. PNAS, 115(44), E10467–E10475. DOI: 10.1073/pnas.1803839115. arXiv:1802.01569 — XdG:稀疏情境门控+突触稳固,在数百个任务上保持高性能。

[S61] McClelland, J. L., McNaughton, B. L. & O'Reilly, R. C. (1995). Why there are complementary learning systems in the hippocampus and neocortex. Psychological Review, 102(3), 419–457. — 互补学习系统(CLS)理论。

[S62] Kumaran, D., Hassabis, D. & McClelland, J. L. (2016). What Learning Systems do Intelligent Agents Need? Complementary Learning Systems Theory Updated. Trends in Cognitive Sciences, 20(7), 512–534. — CLS 理论的更新版,面向智能体设计。

[S63] Graves, A. et al. (2016). Hybrid computing using a neural network with dynamic external memory. Nature, 538, 471–476. — 可微神经计算机(DNC):可读写外部记忆。

[S64] Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401. https://arxiv.org/abs/2005.11401 — RAG:检索增强生成。

[S65] Khandelwal, U., Levy, O., Jurafsky, D., Zettlemoyer, L. & Lewis, M. (2020). Generalization through Memorization: Nearest Neighbor Language Models. ICLR 2020. arXiv:1911.00172. https://arxiv.org/abs/1911.00172 — kNN-LM:显式记忆库改进语言模型。

[S66] Sun, Y., Wang, X., Liu, Z., Miller, J., Efros, A. A. & Hardt, M. (2020). Test-Time Training with Self-Supervision for Generalization under Distribution Shifts. ICML 2020. arXiv:1909.13231. https://arxiv.org/abs/1909.13231 — 测试时训练(TTT)。

[S67] Sun, Y. et al. (2024). Learning to (Learn at Test Time): RNNs with Expressive Hidden States. arXiv:2407.04620. https://arxiv.org/abs/2407.04620 — TTT 层:把隐状态本身变成一个在推理中被训练的模型。

[S68] Behrouz, A., Zhong, P. & Mirrokni, V. (2024). Titans: Learning to Memorize at Test Time. arXiv:2501.00663. https://arxiv.org/abs/2501.00663 — 神经长期记忆模块在推理时按"惊讶度"做梯度写入,带自适应遗忘。

[S69] Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020. arXiv:2005.14165. https://arxiv.org/abs/2005.14165 — GPT-3;上下文内学习(ICL)现象的确立。

[S70] von Oswald, J. et al. (2023). Transformers Learn In-Context by Gradient Descent. ICML 2023. arXiv:2212.07677. https://arxiv.org/abs/2212.07677 — ICL 可实现为前向传播中的隐式梯度下降。

[S71] Akyürek, E., Schuurmans, D., Andreas, J., Ma, T. & Zhou, D. (2023). What learning algorithm is in-context learning? Investigations with linear models. ICLR 2023. arXiv:2211.15661. https://arxiv.org/abs/2211.15661 — ICL 在线性模型上隐式实现标准学习算法。

[S72] Gururangan, S. et al. (2020). Don't Stop Pretraining: Adapt Language Models to Domains and Tasks. ACL 2020. arXiv:2004.10964. https://arxiv.org/abs/2004.10964 — 领域/任务自适应持续预训练(DAPT/TAPT)。

[S73] Ke, Z., Shao, Y., Lin, H., Konishi, T., Kim, G. & Liu, B. (2023). Continual Pre-training of Language Models. ICLR 2023. arXiv:2302.03241. https://arxiv.org/abs/2302.03241 — 语言模型持续预训练的软掩码方法。

[S74] Ibrahim, A., Thérien, B., Gupta, K. et al. (2024). Simple and Scalable Strategies to Continually Pre-train Large Language Models. arXiv:2403.08763. https://arxiv.org/abs/2403.08763 — 学习率再升温+小比例重放即可接近重新训练的效果。

[S75] Scialom, T., Chakrabarty, T. & Muresan, S. (2022). Fine-tuned Language Models are Continual Learners. EMNLP 2022. arXiv:2205.12393. https://arxiv.org/abs/2205.12393 — 指令微调模型在少量重放下的持续学习能力。

[S76] Luo, Y., Yang, Z., Meng, F., Li, Y., Zhou, J. & Zhang, Y. (2023). An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning. arXiv:2308.08747. https://arxiv.org/abs/2308.08747 — 1B–7B 级 LLM 持续微调中的遗忘实证。

[S77] Meng, K., Bau, D., Andonian, A. & Belinkov, Y. (2022). Locating and Editing Factual Associations in GPT. NeurIPS 2022. arXiv:2202.05262. https://arxiv.org/abs/2202.05262 — ROME:定位并编辑事实关联。

[S78] Meng, K., Sen Sharma, A., Andonian, A., Belinkov, Y. & Bau, D. (2023). Mass-Editing Memory in a Transformer. ICLR 2023. arXiv:2210.07229. https://arxiv.org/abs/2210.07229 — MEMIT:批量知识编辑及其规模极限。

[S79] Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291. https://arxiv.org/abs/2305.16291 — 不改权重、以代码技能库积累能力的开放世界智能体。

[S80] Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K. & Yao, S. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366. https://arxiv.org/abs/2303.11366 — 用语言化自我反思(存于情景记忆)代替权重更新。

[S81] Hinton, G. E., Dayan, P., Frey, B. J. & Neal, R. M. (1995). The "wake-sleep" algorithm for unsupervised neural networks. Science, 268, 1158–1161. — 醒–睡两阶段学习算法。

[S82] Tadros, T., Krishnan, G. P., Ramyaa, R. & Bazhenov, M. (2022). Sleep-like unsupervised replay reduces catastrophic forgetting in artificial neural networks. Nature Communications, 13, 7742. DOI: 10.1038/s41467-022-34938-7 — 睡眠样自发重放(局部 Hebbian 规则+噪声输入)恢复被遗忘的旧任务。

E. 神经科学

[S83] Yang, G., Pan, F. & Gan, W.-B. (2009). Stably maintained dendritic spines are associated with lifelong memories. Nature, 462, 920–924. — 树突棘可稳定保持一生,承载长期记忆。

[S84] Yang, G. et al. (2014). Sleep promotes branch-specific formation of dendritic spines after learning. Science, 344, 1173–1178. — 睡眠促进学习后分支特异的新棘形成。

[S85] Cichon, J. & Gan, W.-B. (2015). Branch-specific dendritic Ca²⁺ spikes cause persistent synaptic plasticity. Nature, 520, 180–185. — 不同任务的可塑性被分配到不同树突分支,减少干扰。

[S86] Wilson, M. A. & McNaughton, B. L. (1994). Reactivation of hippocampal ensemble memories during sleep. Science, 265, 676–679. — 海马在睡眠中重放清醒期的神经活动序列。

[S87] McGaugh, J. L. (2000). Memory—a Century of Consolidation. Science, 287, 248–251. — 记忆固化研究百年综述。

[S88] Tononi, G. & Cirelli, C. (2014). Sleep and the Price of Plasticity. Neuron, 81(1), 12–34. — 突触稳态假说(SHY):睡眠期间全局突触降标。

[S89] Fusi, S., Drew, P. J. & Abbott, L. F. (2005). Cascade models of synaptically stored memories. Neuron, 45(4), 599–611. — 多状态级联突触:用内部隐状态权衡记忆强度与寿命。

[S90] Benna, M. K. & Fusi, S. (2016). Computational principles of synaptic memory consolidation. Nature Neuroscience, 19, 1697–1706. — 多时间尺度变量链的突触模型,遗忘呈幂律衰减。

[S91] Abraham, W. C. & Bear, M. F. (1996). Metaplasticity: the plasticity of synaptic plasticity. Trends in Neurosciences, 19(4), 126–130. — 元可塑性:突触改变自身可塑性的能力。

[S92] Olshausen, B. A. & Field, D. J. (1996). Emergence of simple-cell receptive field properties by learning a sparse code for natural images. Nature, 381, 607–609. — 稀疏编码的奠基工作。

[S93] Eriksson, P. S. et al. (1998). Neurogenesis in the adult human hippocampus. Nature Medicine, 4, 1313–1317. — 成人海马神经发生的经典证据。

[S94] Sorrells, S. F. et al. (2018). Human hippocampal neurogenesis drops sharply in children to undetectable levels in adults. Nature, 555, 377–381. DOI: 10.1038/nature25975 — 成人海马神经发生未检出(与 [S95] 直接冲突)。

[S95] Boldrini, M. et al. (2018). Human Hippocampal Neurogenesis Persists throughout Aging. Cell Stem Cell, 22, 589–599. DOI: 10.1016/j.stem.2018.03.015 — 成人海马神经发生持续到 79 岁(与 [S94] 直接冲突)。

[S96] Flesch, T., Balaguer, J., Dekker, R., Nili, H. & Summerfield, C. (2018). Comparing continual task learning in minds and machines. PNAS, 115(44), E10313–E10322. — 人类在分块(blocked)训练下学得更好,与标准神经网络相反。

[S97] Hassabis, D., Kumaran, D., Summerfield, C. & Botvinick, M. (2017). Neuroscience-Inspired Artificial Intelligence. Neuron, 95, 245–258. — 神经科学启发 AI 的路线图。

[S98] Richards, B. A. et al. (2019). A deep learning framework for neuroscience. Nature Neuroscience, 22, 1761–1770. — 用深度学习三要素(目标、结构、规则)组织神经科学。

[S99] Aston-Jones, G. & Cohen, J. D. (2005). An integrative theory of locus coeruleus-norepinephrine function: adaptive gain and optimal performance. Annual Review of Neuroscience, 28, 403–450. — 去甲肾上腺素系统对学习/探索增益的调控。

F. 补充文献(2026-09 更新)

F.1 正则化与"就近"方法

[S100] Li, Z. & Hoiem, D. (2016). Learning without Forgetting. arXiv:1606.09282. https://arxiv.org/abs/1606.09282 — LwF:蒸馏式函数空间正则,让新模型在新数据上模仿旧模型的输出。

[S101] Li, X., Grandvalet, Y. & Davoine, F. (2018). Explicit Inductive Bias for Transfer Learning with Convolutional Networks. arXiv:1802.01483. https://arxiv.org/abs/1802.01483 — L2-SP:向预训练起点(而非原点)做 L2 正则,是"拴在旧参数附近"最直接的经典形式。

[S102] Rolnick, D., Ahuja, A., Schwarz, J., Lillicrap, T. P. & Wayne, G. (2018). Experience Replay for Continual Learning. arXiv:1811.11682. https://arxiv.org/abs/1811.11682 — 强化学习设定下经验重放的系统研究。

[S103] van de Ven, G. M., Siegelmann, H. T. & Tolias, A. S. (2020). Brain-inspired replay for continual learning with artificial neural networks. Nature Communications, 11. DOI: 10.1038/s41467-020-17866-2 — 类脑生成式重放:重放内部表示而非原始像素,类增量场景下大幅改进。

F.2 几何与理论

[S104] Wang, Z. et al. (2021). Learning to Prompt for Continual Learning (L2P). arXiv:2112.08654. https://arxiv.org/abs/2112.08654 — 冻结预训练主干,只学一组可检索的提示向量。

[S105] Wang, Z. et al. (2022). DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning. arXiv:2204.04799. https://arxiv.org/abs/2204.04799 — 无重放的双提示持续学习。

[S106] Mirzadeh, S. I. et al. (2021). Wide Neural Networks Forget Less Catastrophically. arXiv:2110.11526. https://arxiv.org/abs/2110.11526 — 网络越宽遗忘越少;系统研究宽度/深度对遗忘的影响。

[S107] Doan, T. et al. (2020). A Theoretical Analysis of Catastrophic Forgetting through the NTK Overlap Matrix. arXiv:2010.04003. https://arxiv.org/abs/2010.04003 — 用 NTK 重叠矩阵定量刻画任务间干扰与遗忘。

[S108] Bennani, M. A., Doan, T. & Sugiyama, M. (2020). Generalisation Guarantees for Continual Learning with Orthogonal Gradient Descent. arXiv:2006.11942. https://arxiv.org/abs/2006.11942 — NTK 区内 OGD 的泛化理论保证。

[S109] Evron, I. et al. (2022). How catastrophic can catastrophic forgetting be in linear regression? arXiv:2205.09588. https://arxiv.org/abs/2205.09588 — 线性回归中遗忘的精确理论刻画。

[S110] Fort, S. & Jastrzebski, S. (2019). Large Scale Structure of Neural Network Loss Landscapes. arXiv:1906.04724. https://arxiv.org/abs/1906.04724 — 高维损失地形的大尺度结构模型。

[S111] Li, C., Farkhoor, H., Liu, R. & Yosinski, J. (2018). Measuring the Intrinsic Dimension of Objective Landscapes. arXiv:1804.08838. https://arxiv.org/abs/1804.08838 — 许多任务的"内在维度"远低于参数总数。

[S112] Lubana, E. S. et al. (2022). Mechanistic Mode Connectivity. arXiv:2211.08422. https://arxiv.org/abs/2211.08422 — 损失连通的两个解可能采用完全不同的内部机制;损失接近≠机制接近。

F.3 LLM 时代的持续学习

[S113] Biderman, D. et al. (2024). LoRA Learns Less and Forgets Less. arXiv:2405.09673. https://arxiv.org/abs/2405.09673 — 大规模实证:低秩更新学到的更少、忘掉的也更少——"就近学习"权衡在 LLM 尺度上的直接证据。

[S114] Wang, X. et al. (2023). Orthogonal Subspace Learning for Language Model Continual Learning (O-LoRA). arXiv:2310.14152. https://arxiv.org/abs/2310.14152 — 在相互正交的低秩子空间中顺序学习任务。

[S115] Yadav, P. et al. (2023). TIES-Merging: Resolving Interference When Merging Models. arXiv:2306.01708. https://arxiv.org/abs/2306.01708 — 定位并消解模型合并中的参数干扰(符号冲突、冗余)。

[S116] Matena, M. & Raffel, C. (2021). Merging Models with Fisher-Weighted Averaging. arXiv:2111.09832. https://arxiv.org/abs/2111.09832 — 以 Fisher 信息加权的模型合并。

[S117] Yoo, H. et al. (2025). Continual Low-Rank Adapters for LLM-based Generative Recommender Systems (PESO). ICLR 2026(会议页面已核验)。arXiv:2510.25093. https://arxiv.org/abs/2510.25093 — 单个持续演化的 LoRA,以近端项锚定其最近的冻结状态;并明确论证在推荐场景中过时知识应当被遗忘。

[S118] Qiao, F. & Mahdavi, M. (2025). Merge before Forget: A Single LoRA Continual Learning via Continual Merging (SLAO). ICLR 2026(论文集页面已核验)。arXiv:2512.23017. https://arxiv.org/abs/2512.23017 — 正交初始化+时间感知缩放,把任务更新持续合并进单个 LoRA,内存不随任务数增长。

[S119] Gupta, K. et al. (2023). Continual Pre-Training of Large Language Models: How to (re)warm your model? arXiv:2308.04014. https://arxiv.org/abs/2308.04014 — 学习率重新升温对持续预训练的关键作用。

[S120] Gupta, A., Rao, A. & Anumanchipalli, G. (2024). Model Editing at Scale leads to Gradual and Catastrophic Forgetting. arXiv:2401.07453. https://arxiv.org/abs/2401.07453 — 连续编辑呈两阶段退化:先渐进遗忘,后被单次"致瘫编辑"突然击溃。

[S121] Mitchell, E. et al. (2021). Fast Model Editing at Scale (MEND). arXiv:2110.11309. https://arxiv.org/abs/2110.11309 — 超网络式快速模型编辑。

[S122] Mai, Z. et al. (2021). Online Continual Learning in Image Classification: An Empirical Survey. arXiv:2101.10423. https://arxiv.org/abs/2101.10423 — 在线(单遍、无边界)持续学习的实证综述。

[S123] De Lange, M. et al. (2019). A continual learning survey: Defying forgetting in classification tasks. arXiv:1909.08383. https://arxiv.org/abs/1909.08383 — 分类任务持续学习的系统综述。

[S124] Prabhu, A. et al. (2023). Computationally Budgeted Continual Learning: What Does Matter? arXiv:2303.11165. https://arxiv.org/abs/2303.11165 — 固定算力预算下重新评估:许多已发表的增益在预算对齐比较中消失,简单方法常胜出。

[S125] Wu, T. et al. (2024). Continual Learning for Large Language Models: A Survey. arXiv:2402.01364. https://arxiv.org/abs/2402.01364 — LLM 持续学习综述。

[S126] Shi, H. et al. (2024). Continual Learning of Large Language Models: A Comprehensive Survey. arXiv:2404.16789. https://arxiv.org/abs/2404.16789 — LLM 持续学习综述(另一组)。

F.4 相关但间接

[S127] Li, Jinhao et al. (2026). Signal-Adaptive Trust Regions for Gradient-Free Optimization of Recurrent Spiking Neural Networks. arXiv:2601.21572(公开预印本). https://arxiv.org/abs/2601.21572 — 强化学习/优化方向的工作,与持续学习仅间接相关:体现"把每步更新限制在分布空间的一个信赖域内"的一般原则。本文仅按预印本引用。

核实说明:标注 DOI 或 arXiv 号的条目均可直接访问;[S17][S18][S20][S23][S31][S40][S60][S68][S82][S94][S95] 的书目信息在成文时经在线逐条核对。S23 的 arXiv 预印本版本为 arXiv:2306.13812(预印本标题 "Maintaining Plasticity in Deep Continual Learning",发表版标题不同)。F 节(S100–S127)条目的标题/作者/年份经 arXiv 摘要页或 Crossref 核验;其中会议名称仅在 S103与 [S117][S118](ICLR 2026 官方页面)处经直接核验后标注,其余条目不标注会议名称,以 arXiv 编号为准。若发现任何条目有误,请以原文为准并告知我们更正。