请比较随机森林与单棵决策树的差异,并解释随机森林在多数场景下性能更优的原因。
考察说明
考查对集成学习方法与基学习器差异的理解,以及随机森林提升泛化能力的机制。
回答思路
- 【回答框架 1】随机森林是集成学习中的Bagging方法,构建多棵决策树并综合结果;单棵决策树是单一模型。决策树易过拟合,对数据噪声敏感,而随机森林通过样本扰动和特征扰动降低方差。
- 【回答框架 2】随机森林每棵树使用有放回抽样(bootstrap)生成训练集,约37%样本未参与训练,可作为袋外数据评估模型。特征扰动指每次分裂随机选取部分特征,减少树间相关性,增强多样性。
- 【回答框架 3】性能更好的原因:集成多棵树的预测,降低单棵树过拟合风险,方差减少;对异常值和噪声更鲁棒;特征扰动提升泛化能力;可并行训练,效率高。
- 【回答框架 4】适用场景:高维数据、非线性关系、特征重要性分析。但可解释性差,训练成本高,对线性数据可能不如逻辑回归。
- 【关键点 1】随机森林是Bagging集成,决策树是基学习器。
- 【关键点 2】随机森林通过bootstrap采样和特征随机选择降低方差。
- 【关键点 3】单棵决策树易过拟合,随机森林通过平均/投票减少过拟合。
- 【关键点 4】随机森林可处理高维特征,给出特征重要性。
- 【易错点 1】随机森林不能完全消除偏差,若基学习器偏差高,集成后仍高偏差。
- 【易错点 2】特征扰动可能降低单棵树精度,但整体泛化提升。
- 【易错点 3】随机森林在噪声大时可能过拟合,需调参控制。