请比较 Adam 和 SGD 的优缺点,解释为什么 Adam 在训练初期往往比 SGD 收敛更快,并讨论如果调大 SGD 的学习率,其收敛速度是否可能超过 Adam?
考察说明
考察对优化算法原理、学习率敏感性和收敛行为的深入理解
回答思路
- 准确阐述 Adam 的自适应学习率、动量机制及其优缺点
- 给出 Adam 初期收敛快的原理,涉及一阶和二阶矩估计
- 分析调大 SGD 学习率的影响,讨论可能的不稳定和发散风险
- 说明调大后可能达到类似速度,但通常伴随收敛不稳定,需要权衡
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。