在模型微调过程中,灾难性遗忘是常见挑战。请系统阐述其成因,并给出多种可行的缓解策略,包括但不限于数据重放、正则化约束、参数隔离与多任务学习等方法,并说明各自适用场景与潜在代价。
考察说明
考查对微调中灾难性遗忘问题的理解深度及工程应对能力。
回答思路
- 【回答框架 1】灾难性遗忘指模型学习新任务时覆盖旧知识,本质是参数更新导致旧分布表征漂移。缓解思路分三类:数据层面、参数层面、架构层面。
- 【回答框架 2】数据层面常用经验重放,即混合旧任务样本或生成伪样本参与训练,简单有效但需存储或生成成本;也可用课程学习或领域自适应。
- 【回答框架 3】参数层面可用正则化约束,如EWC对重要参数施加二次惩罚,或SI、LwF等知识蒸馏方法,保留旧任务输出分布;弹性权重巩固适合任务序列明确场景。
- 【回答框架 4】架构层面采用参数隔离,如Adapter、LoRA等增量模块,冻结原参数只训练新模块,或使用动态扩展网络、记忆网络,避免干扰旧知识,但增加模型复杂度。
- 【回答框架 5】多任务联合训练或持续学习框架(如Progressive Neural Networks)也能缓解,需权衡存储、计算与性能。实际工程常组合多种策略,并监控旧任务指标。
- 【关键点 1】EWC通过Fisher信息矩阵识别重要参数并施加惩罚,是经典正则化方法。
- 【关键点 2】LoRA等参数高效微调只更新低秩矩阵,天然减少对原参数的覆盖。
- 【关键点 3】经验重放需平衡新旧样本比例,避免新任务过拟合。
- 【关键点 4】知识蒸馏(LwF)用旧模型输出作为软标签,保留旧任务分布。
- 【关键点 5】无绝对防止,需根据任务相似度、数据量选择策略并验证。
- 【易错点 1】不能只依赖单一方法,需组合使用并评估旧任务性能。
- 【易错点 2】重放样本过多可能降低新任务学习效率,需动态调整。
- 【易错点 3】参数隔离方法可能限制模型容量,影响新任务表现。