在参数高效微调(PEFT)的背景下,它是通过哪些具体机制来降低训练过程中的计算资源消耗的?
考察说明
考查对PEFT核心思想及其降低计算成本机制的理解。
回答思路
- 【回答框架 1】PEFT(参数高效微调)的核心是只更新少量新增或选中的参数,而冻结预训练模型的大部分参数。这样反向传播时只需计算这些少数参数的梯度,显著减少了梯度和优化器状态的内存占用,从而降低计算成本。
- 【回答框架 2】常见方法包括Adapter、LoRA和Prefix Tuning。Adapter在Transformer层中插入小型瓶颈模块,训练时只更新这些模块;LoRA通过低秩分解模拟权重更新,只训练低秩矩阵;Prefix Tuning在输入序列前添加可学习的虚拟token,只优化这些前缀。
- 【回答框架 3】由于可训练参数数量大幅减少,显存需求降低,可以使用更大的批大小或更长的序列,同时训练速度通常更快。但需要注意,不同PEFT方法的性能与任务相关,且可能存在额外推理开销,如Adapter增加层数,LoRA可将训练后的低秩矩阵合并回原权重而不增加推理成本。
- 【关键点 1】PEFT通过冻结大部分预训练参数,仅训练少量新增或选中的参数来降低计算成本。
- 【关键点 2】LoRA使用低秩分解,训练后可将权重合并,避免推理延迟。
- 【关键点 3】Adapter增加网络层数,可能带来额外推理开销。
- 【关键点 4】PEFT减少显存占用,支持更大批大小或更长序列。
- 【易错点 1】PEFT并非在所有任务上都能达到全参数微调的效果,存在性能下降的可能。
- 【易错点 2】训练成本降低不等于推理成本一定降低,需区分训练与推理的计算开销。