在大模型微调实践中,通常采用哪些优化器?请列举几种常见的优化器并说明它们各自的特点。
考察说明
考查对微调场景下常用优化器及其适用性的理解。
回答思路
- 【回答框架 1】微调中常用优化器包括 SGD、Adam、AdamW、LAMB 等。SGD 简单稳定但收敛慢,适合小规模数据或作为基线。
- 【回答框架 2】Adam 自适应学习率,对超参数不敏感,收敛快,但可能引入权重衰减偏差。AdamW 将权重衰减与梯度更新解耦,提升泛化性能,是目前微调首选。
- 【回答框架 3】LAMB 针对大批量训练设计,能在大 batch size 下保持收敛速度,适合预训练或超大规模微调。此外还有 Adafactor 等低内存优化器。
- 【回答框架 4】选择优化器需结合任务规模、显存限制和收敛需求,通常默认 AdamW,并根据验证集表现调整学习率、权重衰减等超参数。
- 【关键点 1】AdamW 是微调中最常用的优化器,解决了 Adam 权重衰减不一致问题。
- 【关键点 2】SGD 适合简单任务或微调基线,收敛稳定但较慢。
- 【关键点 3】LAMB 在大批量训练中表现优异,能减少训练时间。
- 【易错点 1】混淆 Adam 与 AdamW 的权重衰减处理方式,导致模型泛化下降。
- 【易错点 2】忽略学习率等超参数对微调效果的影响,直接使用默认配置。