数据岗位面试题更新 2026-08-05

在数据挖掘流程里,特征选择扮演什么角色?请列举并简要说明几种常见的特征选择实现方式。

数据技术原理方案权衡

考察说明

考查对特征选择概念及其常用方法的掌握程度。

回答思路

  1. 【回答框架 1】特征选择是从原始特征集合中挑选出对模型预测贡献最大、冗余度最低的子集的过程,目标是降低维度、减少过拟合、提升训练效率与模型可解释性。
  2. 【回答框架 2】常用方法分为三类:过滤式(Filter)基于统计指标如方差、相关系数、卡方检验、互信息对每个特征独立评分,不依赖具体模型,计算快但忽略特征间组合效果。
  3. 【回答框架 3】包裹式(Wrapper)如递归特征消除(RFE)以模型性能为准则反复训练并删除弱特征,效果较好但计算开销大,容易过拟合。
  4. 【回答框架 4】嵌入式(Embedded)如L1正则化(Lasso)、决策树与随机森林的特征重要性、XGBoost的增益重要性,将特征选择融入模型训练过程,兼顾效率与效果。
  5. 【回答框架 5】实际使用中需根据数据规模、模型类型与业务需求综合选择,并注意特征共线性、重要性不稳定等问题。
  6. 【关键点 1】特征选择旨在降低维度、缓解过拟合并提高模型可解释性。
  7. 【关键点 2】主要方法为过滤式、包裹式和嵌入式三类。
  8. 【关键点 3】过滤式依赖统计指标,包裹式以模型性能评估特征子集,嵌入式在训练中自动选择。
  9. 【易错点 1】过滤式可能忽略特征组合的联合作用。
  10. 【易错点 2】包裹式计算量大且易过拟合。
  11. 【易错点 3】嵌入式特征重要性可能受特征共线性影响而失真。