数据岗位面试题更新 2026-08-05

在机器学习项目中,我们通常需要理解哪些特征对模型影响最大。请列举并解释几种常用的特征重要性评估方法,并讨论它们的原理、适用场景及各自的优缺点。

数据技术原理方案权衡

考察说明

考查对特征选择与解释性方法的知识广度及其适用边界的理解。

回答思路

  1. 【回答框架 1】特征重要性评估方法可分为模型无关与模型相关两大类。模型无关方法如置换重要性(Permutation Importance)通过打乱某特征取值并观察模型性能下降程度来衡量其重要度;其优点是适用于任意模型,缺点是对特征间相关性敏感,相关特征可能稀释彼此重要性。
  2. 【回答框架 2】基于树模型的方法如随机森林的特征重要性有两种:基于不纯度减少(如Gini重要性)和基于精度减少(如置换重要性)。不纯度重要性计算简单,但存在对高基数特征偏置的问题;精度重要性通过OOB样本或验证集评估,相对更可靠。
  3. 【回答框架 3】线性模型中的系数(如线性回归的权重、逻辑回归的系数)可视为特征重要性,但需要特征标准化后系数才可比;绝对值大表示影响大,但需注意多重共线性会影响系数稳定性。
  4. 【回答框架 4】SHAP(SHapley Additive exPlanations)基于合作博弈论的Shapley值,为每个特征分配一个贡献值,能解释单个预测,其一致性优于其他方法,但计算成本较高,尤其对复杂模型或大数据集。
  5. 【回答框架 5】LIME(Local Interpretable Model-agnostic Explanations)通过局部近似可解释模型来解释单个预测,关注局部重要性,适合解释黑盒模型的局部行为,但稳定性相对较差,且近似的忠实度需注意。
  6. 【关键点 1】特征重要性方法分为模型无关(置换、SHAP、LIME)与模型相关(树模型不纯度、线性系数)。
  7. 【关键点 2】线性模型系数需标准化后比较,且受多重共线性影响。
  8. 【关键点 3】树模型的不纯度重要性偏置高基数特征,可结合置换重要性。
  9. 【关键点 4】SHAP提供一致性与全局解释,但计算开销大。
  10. 【关键点 5】LIME适合局部解释,但注意局部近似的局限性。
  11. 【易错点 1】置换重要性对特征相关性敏感,相关特征重要性可能被分摊导致低估。
  12. 【易错点 2】不纯度重要性偏好高基数特征,可能导致误导。
  13. 【易错点 3】SHAP计算成本高,大数据集下可能不适用。