请解释参数高效微调(PEFT)的基本思想,并给出 3 种常见的实现方法。
考察说明
考查对参数高效微调核心思想的理解及典型方法的掌握。
回答思路
- 【回答框架 1】参数高效微调(PEFT)的核心思路是只更新少量额外参数或部分参数,冻结大部分预训练模型参数,以降低计算和存储成本,同时保持或接近全量微调的性能。
- 【回答框架 2】典型方法一:Adapter,在 Transformer 层中插入小型瓶颈结构,训练时仅更新这些适配器参数。
- 【回答框架 3】典型方法二:Prefix-Tuning,在输入序列前添加可学习的连续前缀向量,只优化这些前缀参数。
- 【回答框架 4】典型方法三:LoRA,通过低秩分解矩阵近似权重更新量,训练时只更新低秩矩阵,推理时可合并回原权重。
- 【回答框架 5】这些方法均显著减少可训练参数量,适用于资源受限或需要多任务适配的场景。
- 【关键点 1】PEFT 冻结大部分预训练参数,仅训练少量额外参数。
- 【关键点 2】Adapter 在层内插入瓶颈模块。
- 【关键点 3】Prefix-Tuning 优化输入前缀向量。
- 【关键点 4】LoRA 使用低秩分解更新权重。
- 【关键点 5】PEFT 降低显存和存储需求,性能接近全量微调。
- 【易错点 1】不能认为 PEFT 一定优于全量微调,性能可能略低。
- 【易错点 2】不同 PEFT 方法适用场景不同,需根据任务选择。
- 【易错点 3】LoRA 的秩大小影响效果,需调参。