数据岗位面试题更新 2026-08-05

在数据挖掘场景下,决策树算法是如何用于分类任务的,请说明其基本原理与主要步骤。

数据技术原理

考察说明

考查对决策树分类算法的原理与流程的理解。

回答思路

  1. 【回答框架 1】决策树是一种基于树结构的监督学习算法,通过递归划分特征空间实现分类。核心是选择最优特征进行分裂,使子节点数据尽可能属于同一类别,衡量指标有信息增益、增益率和基尼指数。
  2. 【回答框架 2】构建过程包括特征选择、决策树生成和剪枝。特征选择决定分裂顺序;生成时从根节点开始递归,直至满足停止条件(如样本数过少或纯度足够);剪枝用于防止过拟合,分为预剪枝和后剪枝。
  3. 【回答框架 3】分类时从根节点开始,根据样本的特征值沿路径向下,直至到达叶节点,叶节点对应的多数类别即为预测结果。决策树可处理数值型和类别型特征,且可解释性好。
  4. 【回答框架 4】常见算法包括ID3(基于信息增益)、C4.5(基于增益率)和CART(基于基尼指数),不同算法在特征选择和处理连续值上有差异。
  5. 【关键点 1】决策树通过递归划分特征空间实现分类。
  6. 【关键点 2】特征选择依据信息增益、增益率或基尼指数。
  7. 【关键点 3】剪枝是防止过拟合的关键步骤。
  8. 【关键点 4】预测过程是从根节点到叶节点的路径匹配。
  9. 【易错点 1】信息增益偏向取值多的特征,可用增益率或基尼指数缓解。
  10. 【易错点 2】不剪枝容易过拟合,但剪枝过度可能导致欠拟合。
  11. 【易错点 3】决策树对噪声敏感,样本量小时可能不稳定。