在数据挖掘任务里,当类别样本数量差异悬殊时,通常采用哪些策略来缓解数据不平衡带来的影响?请列举并说明几种主流处理手段。
考察说明
考查候选人对数据不平衡问题的理解深度及常用处理方法的掌握程度。
回答思路
- 【回答框架 1】数据不平衡指分类任务中各类别样本数量差异大,导致模型偏向多数类、少数类召回率低。核心思路是调整数据分布、调整算法或调整评价指标。
- 【回答框架 2】数据层面:欠采样随机删除多数类样本,易丢失信息;过采样如SMOTE在少数类样本间插值生成新样本,但可能引入噪声;可结合两者或使用ENN等清洗方法。
- 【回答框架 3】算法层面:使用代价敏感学习,为少数类误分类赋予更高惩罚权重;或采用集成方法如EasyEnsemble、BalanceCascade,通过多次采样训练多个分类器。
- 【回答框架 4】评价指标:准确率在失衡下失真,应关注精确率、召回率、F1值、AUC或PR曲线,必要时使用分层交叉验证保证少数类在验证集中有代表。
- 【回答框架 5】实际中需结合业务目标权衡:若少数类更重要(如欺诈检测),优先提升召回率;同时注意过采样可能过拟合,欠采样可能欠拟合,需验证集评估。
- 【关键点 1】数据不平衡的根源是类别分布偏差,模型偏向多数类。
- 【关键点 2】常用方法分数据层(重采样)、算法层(代价敏感、集成)和评价层(F1、AUC)。
- 【关键点 3】SMOTE通过插值生成少数类样本,但需注意噪声和过拟合。
- 【关键点 4】代价敏感学习通过调整误分类权重直接优化少数类。
- 【关键点 5】评价指标应使用F1、AUC等,而非仅准确率。
- 【易错点 1】过采样可能导致模型过拟合少数类噪声,需结合交叉验证。
- 【易错点 2】欠采样可能丢失多数类重要信息,导致欠拟合。
- 【易错点 3】仅调整阈值而不改变训练分布,效果有限,需结合其他方法。