news 2026/10/3 12:52:13

LLM长时程记忆:单一机制不够,组合持续学习让100任务不遗忘

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LLM长时程记忆:单一机制不够,组合持续学习让100任务不遗忘

Continual Learning Mechanisms Compose for Long-Horizon Memorization

作者:Zheyuan Zhang, Alvin Zhang, Daniel Khashabi, Tianmin Shu
核心发表机构:论文源码未明确标注或暂未可靠识别
论文链接:arXiv:2609.06986v1
发布于:arXiv 预印本(cs.LG)

|—😐—😐—😐—😐
| SymbolQA | +0.3 |+5.7|+9.5|+5.9|
| LLMQA |+5.8|+5.0|+18.5|+14.9|
| RealQA |+6.3|+3.7|+19.3|+20.5|

Replay 与 merged LoRA 在每个数据集上都是两个最大的主效应。Replay 提升保留 9.5 到 19.3 百分点;merged LoRA 提升 5.9 到 20.5 百分点。

二路交互如下:

数据集SI×SDSI×RSI×MSD×RSD×MR×M
SymbolQA-0.3+0.7-3.0-0.2+0.6+3.6
LLMQA+1.6+2.9-0.1-3.5+1.7+9.4
RealQA+1.3+0.1+0.2-10.3+1.7+11.7

关键发现是:R×M 交互在所有三个数据集上均为正且显著。SI×M 的负交互仅在 SymbolQA 上显著(-3.0)。SD×R 在 LLMQA(-3.5)和 RealQA(-10.3)上负且显著,说明当 replay 已经存在时,SD 的平均收益更小。SI 在两个自然语言数据集上有正主效应,但在 SymbolQA 上没有可检测的主效应。

三路与四路交互如下:

数据集SI×SD×RSI×SD×MSI×R×MSD×R×M四路
SymbolQA+0.1-1.8-0.8-1.3+0.2
LLMQA-1.3-0.1+0.2-2.6-0.2
RealQA-1.9+0.5-0.6-4.9-0.6

超加性方面,在无 SI 或 SD 的配置中,replay 与 merged LoRA 的 standalone gains 之和仅为 SymbolQA 3.9 点、LLMQA 7.7 点、RealQA 13.9 点;二者组合相比 naive fine-tuning 的改善为 SymbolQA 15.6 点、LLMQA 31.0 点、RealQA 46.9 点。因此组合增益远超二者独立贡献之和,表现出强超加性。论文还解释 SI 与 merged LoRA 的负交互:merged LoRA 在每个任务后替换 LoRA 因子;SI 会携带与先前因子相关的重要性值和参考;这些值因此被施加到新初始化的坐标上,而这些坐标的功能角色已经改变。SymbolQA 上的负交互与这种不匹配一致;自然语言数据集上该负交互缺失,表明这是一种结构性风险,而非普遍经验惩罚。可能解释是,SymbolQA 中的任意映射提供更少可跨任务复用的结构,使得对新工作空间的错位约束代价更高。总体结论是:Replay 与 merged LoRA 构成强组合的共同核心;SI 与 SD 可提供额外增益,但其价值取决于数据集和其他活动机制。

五、相关工作 / Related Work

灾难性遗忘最早在连接主义神经网络中被记录,至今仍是持续学习核心问题。增量学习按推理时是否有任务标识、预测空间是否变化,可分为 task-incremental、domain-incremental、class-incremental。本文设置属于 domain-incremental:全程使用相同 question-answer 接口和词汇,评估不提供 task identifier,测试一个模型能否保留所有关联而无需把每个输入路由到任务特定预测器。

持续学习方法大致可分为几类。权重正则化限制对旧任务重要参数的改变,代表工作包括 EWC、online EWC、SI、MAS 等。函数正则化保持旧模型输出或表征,例如 Learning without Forgetting。回放方法存储样本回放或生成样本,例如 iCaRL、Experience Replay、Deep Generative Replay、LAMOL。参数隔离为不同任务分配不同容量,例如 Progressive Networks、PackNet。本文的 data、function、weight anchors 分别实例化前三类 preservation signals;low-rank allocation rules 决定连续任务更新是重用还是分离低秩容量。

已有工作也组合过持续学习机制,但没有系统研究本文考虑的更广泛 mechanism compositions。Dark Experience Replay 联合使用存储样本及其早期 logits;Momentum Knowledge Distillation 在在线持续学习方法上加入教师约束。Buzzega 等虽显示“回放 + 知识蒸馏”混合效果好,但没有系统研究更广的机制组合空间。本文以两条设计维度系统化组合并做析因量化,使用 generated replay 而非 stored examples,并在 controlled compositions 中评估 data、function、weight anchors 与不同 low-rank allocation rules 的组合。

语言模型持续学习方面,先前工作研究连续语言建模、任务学习、指令微调、持续微调、指令微调基准以及跨多样语言任务的遗忘。持续预训练关注新语料、领域或时间段到来时适配语言模型。这些研究主要测量 language modeling、迁移或下游任务性能。本文通过评估同一 question-answer items 在 many later tasks 前后是否被记住,隔离 associative retention。现有公开持续语言学习基准主要衡量迁移或异构下游任务/语料变化下的表现,例如 CITB、TRACE、TemporalWiki;顺序模型编辑基准研究的是定向编辑而非逐任务 SFT,例如 GRACE、Aging with GRACE 等。因此本文自建三个 100 任务数据集以隔离 long-horizon memorization 问题。

与 Deep Generative Replay 和 LAMOL 相比,本文 data anchor 使用前一个模型的冻结副本,从一个任务无关的 replay token 生成完整伪序列;每任务前生成 300 条序列,丢弃空输出;每个当前 minibatch 配对一个 replay minibatch;冻结模型提供 replay 序列的 soft next-token targets,仅用于学当前任务。与 Learning without Forgetting 相比,本文 function anchor 用前一个模型定义参考分布,对当前任务数据做 self-distillation;数据锚的软目标用于生成的重放序列,函数锚仅用于当前任务数据。与 EWC、online EWC、SI 相比,本文权重锚一般形式为二次惩罚;EWC 对每个先前任务分别使用对角 Fisher 信息;Online EWC 用 running Fisher 和以最新参数为中心的单一惩罚;SI 用相同对角二次形式,但重要性来自优化路径上的累积贡献。

与 LoRA 系列工作相比,LoRA 冻结预训练权重,注入可训练的低秩分解矩阵;ReLoRA 在预训练中反复将低秩更新合并进模型并重新初始化低秩矩阵;O-LoRA 为每个任务分配新的更新子空间,并在训练中抑制与先前子空间重叠;OSRM 使用任务特征选择更新子空间,以减少合并独立训练任务模型时的干扰;CoLoR、InfLoRA 等也研究任务特定低秩容量。本文把 low-rank allocation rule 与 preservation objective 分离,比较 shared LoRA、merged LoRA、O-LoRA、sequential OSRM adaptation。Merged LoRA 把 ReLoRA 的 merge and reinitialization 模式适配到连续学习:每个任务后把 LoRA 更新合并进稠密权重,并初始化新 LoRA 矩阵和新优化器。O-LoRA 与 sequential OSRM 的状态随任务数增长;本文主要方法保持状态大小恒定。

与顺序模型编辑和 AgentOdyssey 等工作的区别在于,这些工作关注连续编辑存储、重复编辑对早期编辑和其他能力的损害,或测试时连续学习 agent 的世界知识与情景记忆。本文关注 100 个顺序 query-answer 任务的记忆保留与机制组合,评估的是同一 query 的 recall,而非定向编辑的成功率或 agent 在游戏中的表现。

六、局限性与展望 / Limitations & Future Work

第一,论文评估的是记忆而非泛化。评估测试的是训练中见过的查询的召回;模型可能保留对应关联,但对改写后的查询回答错误。结果不建立对新查询表述的泛化能力。SymbolQA 明确训练和评估使用相同 association,因此测量 retention 而非泛化。

第二,通用能力保持仍是开放挑战。更强的记忆不确保保持通用能力。论文在 GSM8K、MATH、MGSM、MMLU-Redux 上评估,所有方法在 100 任务后仍在这些基准上损失大量准确率。尽管 O-LoRA 在 LLMQA 和 RealQA 训练后比 merged LoRA 保留显著更多通用能力,但最终保留仅小增益。在学新关联的同时保持这些能力仍是未来工作。

第三,旧记忆最终仍会丢失。所有记忆曲线随 memory age 继续下降。组合延迟遗忘、改变遗忘的时间尺度,但不能阻止旧记忆最终衰退。最佳方法的平均最终保留率为 34.9%,远非完全保留。如何进一步延长记忆寿命、甚至实现长期不遗忘,仍是未解决问题。

第四,权重锚在坐标重置后的语义问题值得注意。SI 和 online EWC 每个参数只存一个重要性权重,无法表示坐标变换后的非对角交互。当低秩分配规则重置 LoRA 工作区时,实现保留 SI/EWC 参考和重要性张量,并匹配到新矩阵的相同行列,但不调整这些存储值。因此,施加到新 LoRA 矩阵上的惩罚可能与施加到 dense model 上的效果不同。若要在坐标变换后保持二次惩罚的原始意义,需要同时变换参考值和重要性矩阵;对于一般非线性映射,完整保持通常需要非对角重要性矩阵,而 SI/EWC 的单坐标重要性无法完整表示这些交互。这解释了为什么 SI 与 merged LoRA 在某些数据集上出现负交互,也提示未来可以研究坐标兼容的权重锚或更丰富的参数重要性表示。

第五,数据集与评估方面也有局限。LLMQA 的 novelty 未外部验证:生成 prompt 要求虚构实体和事实,但 pipeline 不验证它们是否不存在于外部来源,因此论文不声称每个 LLMQA item 在训练前对 base model 经验未知。RealQA 的 per-model contamination filter 细节在给定源码片段中省略,不能进一步推断。SymbolQA 测量 retention 而非泛化。未来可以研究更自然的持续记忆任务、更严格的污染控制、以及对改写查询的泛化。

第六,状态大小与计算成本存在权衡。Shared LoRA 与 merged LoRA 的 adapter 状态不随已完成任务数增长;O-LoRA 在t tt个已完成任务后存t P r tP_rtPr​个累积标量,sequential OSRM 存 merged LoRA state 加上每个已完成任务和每个 target 的一个d i n , j d_{\mathrm{in},j}din,j​维 feature vector,保留 feature state 大小为O ( t ∑ j ∈ J d i n , j ) O(t\sum_{j\in\mathcal{J}}d_{\mathrm{in},j})O(t∑j∈J​din,j​)。Online EWC 需要为每个选中序列做一次反向传播;SI 不需要额外数据遍历。未来可以研究在固定状态预算下更有效的组合,或研究状态增长是否值得其成本。论文还禁用了若干选项,例如 query-conditioned replay、replay cross-entropy、trainable replay-token embedding、reverse KL、Jensen-Shannon divergence、vocabulary truncation、O-LoRA gradient projection、O-LoRA factor-norm paths,因此这些选项不被视为独立方法,其潜在作用仍有待探索。

七、总结 / Conclusion

论文形式化了 long-horizon continual memorization,并把设计空间组织为 data、function、weight anchors 与 low-rank allocation rules 两个维度。它引入三个 100 任务 query-answer 数据集,自然性递增;提出 task-level successive halving 获得机制组合的早期证据;使用因子设计测量个体与交互效应。实验表明,没有任何单一机制在 100 任务后能很好地保留知识。最佳方法组合全部三个 anchors + merged LoRA,是唯一在所有数据集中排名 top 3 的因子组合,把平均最终保留从 naive fine-tuning 的 1.2% 提升到 34.9%,约 28 倍。因子分析识别 data anchor 与 merged LoRA 为最大改进来源,并显示二者在每个数据集上均有超加性交互。结论是:有效长时程连续记忆依赖于找到互补机制的正确组合。尽管组合显著延迟遗忘并延长记忆半衰期,旧记忆最终仍会丢失,通用能力保持也仍是开放挑战。

原文摘要:Language models may need to internalize information that arrives over time and retain it through many subsequent updates. To study this challenge, we introduce long-horizon memorization, a setting in which a model learns 100 query-answer tasks through continual supervised fine-tuning without retaining earlier training examples or receiving task identifiers at inference. Sequential updates cause catastrophic forgetting, and no single continual learning mechanism we evaluate maintains strong retention at this horizon. We hypothesize that mechanisms addressing complementary sources of forgetting will be more effective when composed. We organize these compositions along two design dimensions. Data, function, and weight anchors specify what prior information each update should preserve, while low-rank allocation rules determine where successive updates are retained. To test this hypothesis systematically, we construct three distinct 100-task memorization datasets. We introduce task-level successive halving to search the combinatorial design space and use a factorial experiment to measure individual and interaction effects. Our best method combines all three anchors with merged LoRA, ranks among the top 3 methods in all datasets, and raises average final retention from 1.2% under naive sequential fine-tuning to 34.9%, a 28-fold improvement. The data anchor and merged LoRA provide the largest average gains and interact super-additively on all three datasets. Together, these results show that composing complementary mechanisms substantially improves long-horizon memorization beyond what any individual mechanism achieves.

PDF链接:https://arxiv.org/pdf/2609.06986v1

部分平台可能图片显示异常,请以我的博客内容为准

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 12:49:53

高仕星番茄红素适合哪些备孕期男性

高仕星番茄红素适合哪些备孕期男性,结合国家保健食品相关规范与男性生殖营养的研究结论,目前有明确营养调理需求的四类备孕期成年男性,补充合规高活性的天然番茄红素可以获得针对性的身体状态改善收益,不存在通用的适配所有男性的…

作者头像 李华
网站建设 2026/10/3 12:49:45

用霍尔传感器自娱自乐

猪咪闲来无事,创作"无中生有"阵。一边是一台可以播放声音的主机,一边是zero w绑着霍尔传感器。本来以为还要MQTT结果发现局域网里有更简单粗暴的实现方式,甚好。zero端代码:from gpiozero import DigitalInputDevice fr…

作者头像 李华
网站建设 2026/10/3 12:49:36

MySQL 中什么是条件注释

很多同学写 SQL 的时候,都熟悉 #、--、/* */ 这几种普通注释。普通注释的特点很简单:数据库解析时直接忽略里面的内容,不会执行。 但 MySQL 里有一类特殊注释,在 MySQL 环境下注释内部的 SQL 会被执行;其他数据库&…

作者头像 李华
网站建设 2026/10/3 12:47:27

PHP项目复盘:foreach 引用残留造成的诡异数据错乱

写PHP业务久的人,基本都碰到过一类完全无解的问题:数组循环处理完之后,后续操作数据莫名被篡改,代码看着干干净净,没有赋值、没有覆盖,结果就是不对。 这类问题特别喜欢出现在列表处理、批量改状态、数据组…

作者头像 李华