在逻辑回归模型中,为何选择交叉熵作为损失函数,而放弃平方损失函数?
考察说明
考察对逻辑回归损失函数选择原因及梯度优化特性的理解。
回答思路
- 【回答框架 1】交叉熵损失源自极大似然估计,逻辑回归输出为概率分布,交叉熵度量预测分布与真实分布的差异,数学形式与模型结合紧密。
- 【回答框架 2】平方损失对逻辑回归输出概率求梯度时,包含 sigmoid 导数项,在预测极端值时梯度接近零,导致参数更新缓慢。
- 【回答框架 3】交叉熵损失的梯度简化,误差项为预测值减真实值,梯度传递高效,有利于优化收敛。
- 【回答框架 4】从概率角度,交叉熵对应伯努利分布的负对数似然,具有概率解释性,而平方损失假设高斯分布,与二分类模型不匹配。
- 【关键点 1】交叉熵损失与极大似然估计等价,具有概率意义。
- 【关键点 2】平方损失在逻辑回归中会遭遇梯度消失,收敛慢。
- 【关键点 3】交叉熵损失梯度简洁,无饱和区,优化效率高。
- 【易错点 1】误以为平方损失绝对不可用,实际会影响收敛。
- 【易错点 2】混淆交叉熵与 KL 散度,二者虽有联系但不同。
- 【易错点 3】忽略 sigmoid 导数的最大值 0.25,导致梯度缩小。