数据岗位面试题更新 2026-08-05

在数据科学的实际工作中,处理缺失值的常见策略有哪些?请列举并简要说明各种方法的适用场景。

数据业务理解技术原理方案权衡

考察说明

考察对数据预处理中缺失值处理方法的掌握程度及实际应用能力。

回答思路

  1. 【回答框架 1】缺失值处理是数据清洗的重要环节。常见方法包括删除法、填补法和模型预测法。删除法又分为直接删除行和删除列,适用于缺失值比例较小的情况,如缺失率低于5%且为随机缺失。
  2. 【回答框架 2】填补法包括均值/中位数/众数填补、前向/后向填充、插值法等。均值填补简单但会降低方差,中位数对异常值鲁棒。前向填充适用于时间序列。插值法如线性插值适合连续变量。
  3. 【回答框架 3】模型预测法如使用回归、KNN或随机森林预测缺失值,利用其他特征信息,但计算成本高,可能引入偏差。
  4. 【回答框架 4】高级方法还包括多重插补(MICE),通过多次填补并合并结果,考虑不确定性。选择方法需结合数据缺失机制(完全随机缺失、随机缺失、非随机缺失)和业务场景。
  5. 【回答框架 5】处理完成后需验证填补效果,如比较填补前后的分布,并记录处理过程以便后续分析。
  6. 【关键点 1】删除法适合缺失率低且随机缺失的情况。
  7. 【关键点 2】均值填补简单但会低估方差,中位数对异常值更稳健。
  8. 【关键点 3】模型预测法利用特征信息但计算成本高,多重插补考虑不确定性。
  9. 【关键点 4】时间序列数据可考虑前向填充或插值。
  10. 【关键点 5】选择方法需基于数据缺失机制和业务需求。
  11. 【易错点 1】不应简单删除大量缺失数据,可能导致样本偏差。
  12. 【易错点 2】均值填补会扭曲数据分布,对后续建模有负面影响。
  13. 【易错点 3】忽视缺失机制,错误使用处理方法。