在数据挖掘流程里,针对数据集中出现的缺失值,有哪些常用的处理方法?
考察说明
考查对数据预处理中缺失值处理方法的掌握程度。
回答思路
- 【回答框架 1】缺失值处理的核心目标是减少数据偏差并保留有效信息,常用策略可分为删除、填充和建模预测三类。删除法包括直接删除含缺失值的记录或特征,适用于缺失比例极低且随机缺失的情况。
- 【回答框架 2】填充法是常见做法,按数据类型与场景选择:均值、中位数或众数填充适合数值型,前向或后向填充适合时间序列,常量填充可标记缺失。填充可保持样本量,但可能引入偏差。
- 【回答框架 3】建模法利用完整数据训练模型预测缺失值,例如回归、KNN、多重插补等。多重插补可反映不确定性,适合缺失机制复杂的场景,但计算成本较高。
- 【回答框架 4】选择方法需结合缺失机制(完全随机缺失、随机缺失、非随机缺失)与分析目标,必要时对比不同方式对模型结果的影响,并评估缺失比例。
- 【关键点 1】缺失值处理主要分为删除、填充和基于模型预测三大类。
- 【关键点 2】填充法通常使用均值、中位数、众数或常数值,但可能引入偏差。
- 【关键点 3】多重插补适用于复杂缺失场景,能体现不确定性。
- 【关键点 4】处理方案应依据缺失机制和数据分布选择并验证效果。
- 【易错点 1】忽略缺失机制,盲目删除或填充可能造成严重偏差。
- 【易错点 2】对所有特征统一使用相同填充策略,忽略数据类型的差异。
- 【易错点 3】认为填充后会提升模型准确率,未评估引入噪声的风险。