进行数据分析时,面对数据集里的缺失值,你通常会采取哪些处理办法?
考察说明
考查对数据清洗中缺失值处理方法的掌握程度。
回答思路
- 【回答框架 1】缺失值处理的核心是识别缺失模式,再根据业务场景和数据特征选择删除、填充或建模预测。删除分为直接删除含缺失的样本或特征,适用于缺失比例低且随机缺失的情况,但会损失数据量。
- 【回答框架 2】填充法用均值、中位数、众数或常数填补,适用于数值型变量且缺失随机;也可用上下条数据填充或插值法。更优的是用回归、KNN或随机森林等模型预测缺失值,适合缺失机制复杂或缺失比例较高时。
- 【回答框架 3】对缺失比例极高的特征可直接删除;对关键变量可引入缺失指示列作为新特征,保留缺失信息。时间序列数据常用前向填充或后向填充,但需注意趋势和季节因素。
- 【回答框架 4】处理前应做缺失值可视化或统计,判断是随机缺失、完全随机缺失还是非随机缺失,因为非随机缺失时简单填充可能带来偏差。
- 【回答框架 5】最终选择要以业务理解为基础,可通过对比不同方法在验证集上的表现来评估,避免盲目使用单一方法。
- 【关键点 1】缺失值处理前需先分析缺失机制和比例。
- 【关键点 2】常用方法包括删除、统计填充、插值、模型预测和缺失指示列。
- 【关键点 3】非随机缺失时简单填充可能引入偏差,需谨慎。
- 【关键点 4】时间序列数据填充需考虑趋势与周期性,不可一概而论。
- 【易错点 1】用全局均值填充会忽略变量间关系,在缺失非随机时导致估计偏差。
- 【易错点 2】将缺失直接填0可能扭曲分布,影响后续建模和统计推断。
- 【易错点 3】对高缺失率特征强行填充而不删除,可能引入大量噪声。