在朴素贝叶斯分类器中,当训练数据中某个特征在某一类别下从未出现时,计算后验概率会得到零值,这种现象被称为什么问题?请解释其产生原因,并提出至少两种常用的平滑处理方法,说明各自的原理和适用场景。
考察说明
考查对朴素贝叶斯中零概率问题的理解及常用平滑技术的掌握。
回答思路
- 【回答框架 1】零概率问题是指在估计条件概率时,若某特征在训练集某类别下未出现,则计算的后验概率为零,导致整个概率为零,影响分类结果。其根源是训练数据稀疏,最大似然估计不够可靠。
- 【回答框架 2】常用方法是拉普拉斯平滑,对每个特征计数加1,分母加类别数,避免零概率。适用于样本量较小或特征维度不高的情况。
- 【回答框架 3】另一种方法是Lidstone平滑,即加α(0<α<1)的小数,更灵活,适合特征分布较均匀的场景。
- 【回答框架 4】对连续特征可假设高斯分布,通过概率密度估计避免离散化的零概率。
- 【回答框架 5】加性平滑简单有效,但在特征极稀疏时可能引入偏差,需结合先验或交叉验证调整参数。
- 【关键点 1】零概率由训练数据稀疏导致,使后验概率为0。
- 【关键点 2】拉普拉斯平滑加1可消除零概率,但可能过度平滑。
- 【关键点 3】Lidstone平滑用α控制平滑强度。
- 【关键点 4】连续特征宜用密度估计而非离散计数。
- 【关键点 5】平滑参数的调整需依赖验证集或实际效果。
- 【易错点 1】不能只依赖平滑,应结合特征选择或减少冗余。
- 【易错点 2】对所有特征统一平滑可能破坏分布特性。
- 【易错点 3】平滑不能解决根本的数据不足问题。