人工智能面试题更新 2026-08-05

在大模型微调实践中,通常采用哪些优化器?请列举几种常见的优化器并说明它们各自的特点。

人工智能技术原理技术选型

考察说明

考查对微调场景下常用优化器及其适用性的理解。

回答思路

  1. 【回答框架 1】微调中常用优化器包括 SGD、Adam、AdamW、LAMB 等。SGD 简单稳定但收敛慢,适合小规模数据或作为基线。
  2. 【回答框架 2】Adam 自适应学习率,对超参数不敏感,收敛快,但可能引入权重衰减偏差。AdamW 将权重衰减与梯度更新解耦,提升泛化性能,是目前微调首选。
  3. 【回答框架 3】LAMB 针对大批量训练设计,能在大 batch size 下保持收敛速度,适合预训练或超大规模微调。此外还有 Adafactor 等低内存优化器。
  4. 【回答框架 4】选择优化器需结合任务规模、显存限制和收敛需求,通常默认 AdamW,并根据验证集表现调整学习率、权重衰减等超参数。
  5. 【关键点 1】AdamW 是微调中最常用的优化器,解决了 Adam 权重衰减不一致问题。
  6. 【关键点 2】SGD 适合简单任务或微调基线,收敛稳定但较慢。
  7. 【关键点 3】LAMB 在大批量训练中表现优异,能减少训练时间。
  8. 【易错点 1】混淆 Adam 与 AdamW 的权重衰减处理方式,导致模型泛化下降。
  9. 【易错点 2】忽略学习率等超参数对微调效果的影响,直接使用默认配置。