说好2026主打持续学习continual learning,开局拉满
深度之眼官方账号
2026年02月05日 11:02
收录于文集
共377篇
论文写作

2026刚开年,谷歌DeepMind就爆出震撼预言,表示今年将会成为「持续学习」之年。与此同时,MIT联合ETH Zurich提出SDFT方法,通过让模型"自我蒸馏"实现真正的持续学习,在学习新任务的同时保持旧有能力的零遗忘。

联系之前Sutton老爷子的观点,说持续学习是LLM下个研究热点没人反对了吧。不过目前关于这方向的研究是有点千篇一律,就是transfer、回放数据、模型蒸馏这些。如果能在模型的范式上有所创新,效果上不仅能记住历史知识,在新任务上也能实现更优秀的性能,想必更有应用价值,比如上述MIT成果。

本文整理了14篇持续学习前沿论文,附代码,旨在帮助各位更直观地理解当前持续学习的研究思路与技术落地路径,建议有论文需求的同学拿一份学习,有助于快速找准思路。

扫码添加小享,回复“持续25”  

免费获取全部论文+开源代码

SELF-DISTILLATION ENABLES CONTINUAL LEARNING

方法:论文提出自蒸馏微调(SDFT)方法,让模型同时作为结合专家演示的教师与仅用任务输入的学生,通过在线策略蒸馏生成训练信号,在持续学习新技能时有效保留原有知识,减少灾难性遗忘。

创新点:

  • 让同一模型兼具教师与学生角色,教师结合专家演示、学生仅用任务输入,无需额外模型或显式奖励。

  • 采用在线策略蒸馏生成训练信号,实现新技能学习与旧知识保留的同步推进。

  • 无需推理数据中的中间轨迹,简化训练流程的同时缓解持续学习中的灾难性遗忘。

Exploiting Task Relationships in Continual Learning via Transferability-Aware Task Embeddings

方法:论文提出基于迁移性感知的 H - 嵌入引导超网络框架,通过信息论中的 H - 分数提取任务间迁移性并转化为低维嵌入,结合超网络生成任务适配权重,同时融入正则化与引导损失,在持续学习中实现正向与反向迁移,减少灾难性遗忘。

创新点:

  • 提出H-嵌入,基于信息论H-分数在线提取任务间迁移性,经AHP归一化转化为低维嵌入,精准捕捉任务内在关联。

  • 构建H-嵌入引导的超网络框架,以嵌入为条件生成任务适配权重,结合三重损失实现端到端训练。

  • 支持插件式应用,可灵活生成全模型或LoRA等轻量化参数,兼容现有持续学习策略与预训练模型,适配不同任务场景。

扫码添加小享,回复“持续25”  

免费获取全部论文+开源代码

LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization

方法:论文提出动态知识路由持续学习框架,通过动态路由机制选择性复用历史任务的共享知识、隔离任务特异性知识,同时结合知识蒸馏与参数正则化,在持续学习新任务时高效迁移有用知识、抑制灾难性遗忘。

创新点:

  • 设计动态知识路由机制,可自适应区分并选择性复用历史任务共享知识、隔离特异性知识,实现精准知识迁移。

  • 融合知识蒸馏与参数正则化双重策略,在学习新任务时有效保留既有能力,缓解灾难性遗忘。

  • 框架无需预先知晓任务边界与数量,适配增量式任务场景,具备较强的灵活性与实用性。

From RAGtoMemory: Non-Parametric Continual Learning for Large Language Models

方法:论文提出基于元学习的持续提示调优方法,通过元训练学习通用提示生成范式,在持续学习新任务时动态适配提示以挖掘任务关联,结合提示蒸馏与正则化策略,实现知识高效迁移并抑制灾难性遗忘。

创新点:

  • 采用元学习范式训练通用提示生成能力,为持续学习新任务提供可迁移的提示基础。

  • 动态适配提示挖掘任务间关联,搭配提示蒸馏策略,实现知识高效复用与传递。

  • 融入针对性正则化机制,在适配新任务的同时抑制提示漂移,缓解灾难性遗忘。

扫码添加小享,回复“持续25”  

免费获取全部论文+开源代码