解释动量梯度下降算法的原理,并给出其更新公式及关键特点。
考察说明
考查对动量优化算法的理解,包括其动机、机制和数学表达。
回答思路
- 【回答框架 1】动量梯度下降是一种改进的梯度下降优化算法,通过在更新参数时累积历史梯度的指数衰减平均,以加速收敛并抑制振荡。其核心思想是模拟物理中的动量概念,使更新方向不仅依赖当前梯度,还受之前更新方向的影响。
- 【回答框架 2】在标准梯度下降中,参数更新为 θ = θ - η∇L(θ),而动量法引入速度变量 v,更新规则为 v = βv - η∇L(θ),θ = θ + v。其中 β 通常取 0.9 左右,η 是学习率。这样可以在梯度方向变化不大时加速,在梯度方向变化剧烈时减少震荡。
- 【回答框架 3】动量法适用于梯度噪声较大或存在局部极小值的情况,能帮助跳出局部极小值并加快收敛。但需要调整超参数 β 和 η,β 过大可能导致发散,过小则效果不明显。
- 【关键点 1】动量法通过累积历史梯度来加速收敛,减少震荡。
- 【关键点 2】更新规则为 v = βv - η∇L(θ),θ = θ + v。
- 【关键点 3】β 通常取 0.9,需要根据问题调整。
- 【易错点 1】动量法不能保证全局最优,可能陷入局部极小值。
- 【易错点 2】β 过大可能导致更新方向过度依赖于历史梯度,产生发散风险。