数据岗位面试题更新 2026-08-05

请解释数据分析中关联规则挖掘的定义,并列举常见的关联规则挖掘算法。

数据技术原理

考察说明

考查对关联规则挖掘概念及主流算法的掌握程度。

回答思路

  1. 【回答框架 1】关联规则挖掘用于发现数据集中项集之间的有趣关联或相关关系,典型形式为形如A→B的蕴含式,支持度和置信度是衡量规则强度的核心指标,支持度表示A和B同时出现的概率,置信度表示在A出现条件下B出现的条件概率。
  2. 【回答框架 2】常用算法中,Apriori算法通过候选集生成和向下闭包性质(频繁项集的所有非空子集也必为频繁项集)逐层迭代挖掘频繁项集,适合稀疏数据集但需多次扫描数据库;FP-Growth算法通过构建频繁模式树(FP-tree)压缩数据并采用分治策略避免候选集生成,效率更高。
  3. 【回答框架 3】此外还有Eclat算法使用垂直数据格式和交集运算计算支持度,以及适用于序列数据的GSP、PrefixSpan等算法,处理数值属性可用量化关联规则。
  4. 【回答框架 4】实际应用时需结合支持度、置信度、提升度等指标筛选有意义规则,并注意处理大量候选项集带来的性能问题和规则冗余。
  5. 【关键点 1】关联规则挖掘目标是发现项集间的强关联关系。
  6. 【关键点 2】Apriori算法利用先验性质减少候选集,多次扫描数据库。
  7. 【关键点 3】FP-Growth算法无需生成候选集,构造FP-tree更高效。
  8. 【关键点 4】常用指标包含支持度、置信度和提升度。
  9. 【关键点 5】算法选择取决于数据规模和类型,序列数据用序列模式算法。
  10. 【易错点 1】高置信度规则不一定有实际价值,需结合提升度评估。
  11. 【易错点 2】支持度和置信度阈值设置不当会漏掉或产生大量无意义规则。
  12. 【易错点 3】FP-Growth在稀疏数据上可能因树深度过大而影响效率。