人工智能面试题更新 2026-08-05

CART 算法在进行特征选择时采用基尼系数而非信息熵,其背后的原因是什么?请结合两者的计算方式和应用场景加以说明。

人工智能技术原理

考察说明

考查对 CART 与 ID3/C4.5 在特征选择准则上差异的理解,以及对基尼系数和信息熵在计算复杂度和适用场景上的认识。

回答思路

  1. 【回答框架 1】基尼系数和信息熵都用于度量数据集的不纯度,但计算方式不同。信息熵为 -p log p 求和,涉及对数运算;基尼系数为 1 - Σp^2,仅含平方运算,计算开销更小,更适合 CART 这类二叉树结构的递归划分,尤其在大样本下能显著降低训练时间。
  2. 【回答框架 2】CART 是二叉树,节点分裂只分为两个子节点。基尼系数在二分类时的最小值和信息熵具有一致性,都能较好反映不纯度下降,且基尼系数对某些分裂的增益变化更敏感,计算效率更高,因此 CART 默认采用基尼系数作为特征选择准则。
  3. 【回答框架 3】信息熵的增益率(C4.5 使用)会偏向取值多的特征,而基尼系数对特征取值数量相对不敏感,更适合 CART 的二分策略,避免因特征取值过多带来的偏差。同时,基尼系数在连续特征的切分点搜索中,计算复杂度低于熵,使得每次分裂的候选点评估更快。
  4. 【回答框架 4】两者的最终树结构在多数情况下差异不大,但基尼系数更倾向于选择能够快速降低不纯度的特征,而信息熵在理论上基于信息论,有更强的解释性。实际中 CART 选择基尼系数是平衡了计算效率与分类效果的工程决策,而非理论优劣的绝对判断。
  5. 【关键点 1】基尼系数计算仅涉及平方运算,信息熵含对数,前者计算更简单,适合大数据量训练。
  6. 【关键点 2】CART 是二叉树,基尼系数与二分裂自然匹配,且对特征取值数量不敏感。
  7. 【关键点 3】两种准则在实践中的树性能差异通常不大,但基尼系数效率更高,因此 CART 采用基尼系数。
  8. 【易错点 1】不要误认为基尼系数一定比信息熵效果更好,两者只是在特定场景下的效率和偏向不同。
  9. 【易错点 2】信息熵不是只用于多分类,二分类也能用,CART 不用熵主要是考虑工程效率。