数据岗位面试题更新 2026-08-05

请解释数据挖掘领域中的关联规则概念,并描述 Apriori 算法发现关联规则的具体流程。

数据技术原理

考察说明

考查对关联规则基本概念及经典 Apriori 算法的理解与表述能力。

回答思路

  1. 【回答框架 1】关联规则用于发现数据项集间的蕴含关系,形式为 X→Y,表示包含 X 的事务也倾向于包含 Y,衡量指标有支持度(X∪Y 出现的概率)和置信度(X 出现时 Y 出现的条件概率)。
  2. 【回答框架 2】Apriori 算法核心是逐层搜索,先找出所有满足最小支持度的频繁项集,再基于频繁项集生成满足最小置信度的关联规则。
  3. 【回答框架 3】频繁项集发现采用先验性质:频繁项集的所有非空子集必为频繁项集,因此可剪枝减少候选集数量。具体步骤包括扫描数据库统计 1-项集支持度、连接生成候选 k+1-项集、剪枝剔除含非频繁子集的项集、重复扫描直至无新频繁项集。
  4. 【回答框架 4】生成规则时,对每个频繁项集 l,产出所有非空子集 s,若 s 在 l 中的置信度≥最小置信度则形成规则 s→(l-s)。
  5. 【回答框架 5】算法瓶颈在于多次扫描数据库和候选项集数量可能巨大,可结合哈希、事务压缩或采样等优化。
  6. 【关键点 1】关联规则由支持度和置信度共同度量,支持度反映规则普遍性,置信度反映可靠性。
  7. 【关键点 2】Apriori 利用频繁项集向下封闭性进行剪枝,减少候选集。
  8. 【关键点 3】核心流程:扫描找频繁 1-项集,连接生成候选,剪枝,迭代直至不再产生新频繁项集。
  9. 【关键点 4】规则生成时需满足最小置信度,且通常关注强规则(同时满足最小支持度和最小置信度)。
  10. 【易错点 1】不要将置信度等同为因果性,高置信度不意味着因果关系。
  11. 【易错点 2】需区分支持度与置信度计算,避免混淆项集概率和条件概率。
  12. 【易错点 3】Apriori 可能产生大量候选集,实际应用中需考虑效率问题。