在数据挖掘领域,通常包含哪些核心任务?并且请列举一些典型的应用场景来说明这些任务的实际价值。
考察说明
考查对数据挖掘核心任务分类及其现实应用场景的理解。
回答思路
- 【回答框架 1】数据挖掘的主要任务可分为描述性和预测性两大类。描述性任务包括聚类、关联规则分析、异常检测和汇总,目的是发现数据中的常规模式;预测性任务包括分类、回归和时序预测,目标是用历史数据预测未知结果。
- 【回答框架 2】聚类是将数据按相似度分成若干组,常用于客户细分、图像分割;关联规则挖掘用于发现项之间的共现关系,典型如购物篮分析识别商品组合;异常检测寻找偏离常规的样本,应用于欺诈检测和设备故障预警。
- 【回答框架 3】分类任务根据已标注样本学习规则,对新样本归类,常见应用包括垃圾邮件过滤、信用风险评估;回归用于预测连续值,如房价、销售预测;时序预测针对时间序列,用于需求预测和股价趋势分析。
- 【回答框架 4】在实际应用中,一个场景往往组合多种任务。例如推荐系统既用聚类做用户群划分,也用分类预测偏好;风控体系同时用异常检测识别欺诈,用回归评估违约率。
- 【回答框架 5】这些任务的核心目标是提炼数据中的知识,为决策提供依据。选择任务需结合业务问题和数据特征,理解各任务的前提和评估指标。
- 【关键点 1】数据挖掘任务分为描述性和预测性,描述性包括聚类、关联、异常检测,预测性包括分类、回归、时序预测。
- 【关键点 2】聚类用于无监督分组,关联分析发现共现规则,典型如购物篮分析。
- 【关键点 3】分类和回归是监督学习,分别处理离散和连续预测,常见于风控和预测场景。
- 【关键点 4】实际场景常组合多种任务,需要根据业务目标和数据形态选择合适技术。
- 【易错点 1】容易混淆分类和聚类:分类有标记数据,聚类无标记,误将聚类当作分类会忽略标签信息。
- 【易错点 2】关联规则中的支持度和置信度并非因果,高置信度不意味着强关联,需结合提升度等指标。
- 【易错点 3】预测模型需注意过拟合和数据泄漏,不能只追求训练精度而忽视泛化能力。