在文本分类任务里,当不同类别的样本数量差异较大时,你会采用哪些策略来缓解类别不平衡带来的影响?
考察说明
考查候选人对文本分类中类别不平衡问题的理解及常用处理手段。
回答思路
- 【回答框架 1】类别不平衡指各训练类别样本数差异悬殊,导致模型偏向多数类、少数类召回率低。常见处理分数据、算法、评价三个层面。
- 【回答框架 2】数据层面:对多数类欠采样(如随机删除、NearMiss)或对少数类过采样(如SMOTE合成新样本),也可结合两者;文本场景可对少数类做同义词替换、回译等增强。
- 【回答框架 3】算法层面:使用代价敏感学习,为少数类分配更高误分类代价;或采用集成方法如EasyEnsemble、BalanceCascade;也可调整损失函数权重,如focal loss聚焦难分样本。
- 【回答框架 4】评价层面:不能只用准确率,应关注精确率、召回率、F1值,尤其是少数类的F1,以及AUC、PR曲线;必要时采用分层交叉验证保证类别分布一致。
- 【回答框架 5】实际方案需结合数据规模与业务目标:若少数类极其稀少,可考虑收集更多数据或使用预训练模型微调;最终以验证集指标和业务效果为准。
- 【关键点 1】欠采样、过采样(含SMOTE)和文本增强是数据层常用手段。
- 【关键点 2】代价敏感学习与focal loss从算法层缓解不平衡。
- 【关键点 3】评价指标应侧重少数类的F1、AUC或PR曲线,而非准确率。
- 【关键点 4】类别不平衡严重时,可结合集成方法或预训练模型微调。
- 【关键点 5】最终方案需通过实验对比,以业务目标为导向选择。
- 【易错点 1】过采样可能引入噪声或过拟合,需配合交叉验证。
- 【易错点 2】仅调整数据分布而不改评价指标,可能仍无法真实反映少数类效果。
- 【易错点 3】欠采样可能丢失多数类重要信息,导致整体性能下降。