数据岗位面试题更新 2026-08-05

在机器学习建模中,当类别样本数量差异显著时,通常称数据为不平衡的。请说明处理不平衡数据集的核心思路,并列举常用的处理方法。

数据业务理解技术原理方案权衡

考察说明

考查对类别不平衡问题的理解及常用处理策略的掌握程度。

回答思路

  1. 【回答框架 1】不平衡数据集指分类任务中各类别样本数量差异悬殊,导致模型偏向多数类,少数类召回率低。核心思路是调整数据分布、调整模型或调整评价指标,使模型更关注少数类。
  2. 【回答框架 2】数据层面常用方法:随机欠采样减少多数类样本,但可能丢失重要信息;随机过采样复制少数类样本,易过拟合;SMOTE等合成方法在少数类样本间插值生成新样本,缓解过拟合,但可能引入噪声。
  3. 【回答框架 3】算法层面可调整类权重,如scikit-learn中class_weight参数,对少数类赋予更高惩罚,使损失函数更关注少数类;也可使用集成方法如EasyEnsemble、BalanceCascade,结合欠采样与集成学习提升少数类识别。
  4. 【回答框架 4】评价指标应使用精确率、召回率、F1-score、AUC等,而非准确率,因为准确率在极端不平衡下会虚高。
  5. 【回答框架 5】实际应用中需结合业务场景,若少数类代价高(如欺诈检测),应优先提升召回率,并考虑代价敏感学习。
  6. 【关键点 1】不平衡数据导致模型偏向多数类,少数类性能差。
  7. 【关键点 2】常用方法包括欠采样、过采样、SMOTE、类权重调整和集成方法。
  8. 【关键点 3】评价指标应选F1-score、AUC等,而非准确率。
  9. 【关键点 4】需结合业务场景选择优化目标,如欺诈检测优先召回率。
  10. 【易错点 1】随机过采样易导致过拟合,SMOTE可能生成噪声样本。
  11. 【易错点 2】欠采样可能丢失多数类重要信息,导致欠拟合。
  12. 【易错点 3】仅用准确率评估不平衡模型会得出误导性结论。