人工智能面试题更新 2026-08-05

在随机森林中,为什么每棵决策树不是基于全部样本进行训练?请解释其背后的原因和机制。

人工智能技术原理

考察说明

考察对随机森林算法中样本扰动机制及其对集成性能影响的理解。

回答思路

  1. 【回答框架 1】随机森林是Bagging的扩展,其核心思想是通过样本扰动和特征扰动降低基学习器之间的相关性,从而提升集成的泛化能力。如果所有树都用全量样本训练,每棵树的结构会高度相似,集成结果接近单一决策树,无法获得融合多个模型带来的方差减小和泛化性能提升。
  2. 【回答框架 2】对样本进行有放回抽样(bootstrap抽样)可以构建出多样化的训练子集,每棵树只基于一个子集学习,使得各树之间的相关性降低。根据偏差-方差分解,集成学习主要靠减小方差来提升性能,而降低基学习器之间的相关性是减小集成方差的关键。
  3. 【回答框架 3】样本扰动带来的随机性还能使每棵树对数据中的噪声和异常值有不同程度的敏感性,整体上增强了对噪声的鲁棒性。同时,抽样过程中未被选中的样本(大约36.8%)可以用作袋外样本,用于评估模型性能和特征重要性,无需额外的验证集。
  4. 【关键点 1】全样本训练会导致树之间高度相关,集成效果退化,接近单棵树。
  5. 【关键点 2】Bootstrap抽样产生数据子集,降低树间相关性,是方差减小的关键。
  6. 【关键点 3】袋外样本可免费用于模型评估和特征重要性计算。
  7. 【易错点 1】不要混淆Bootstrap抽样与无放回抽样;随机森林使用有放回抽样。
  8. 【易错点 2】不能认为袋外样本比例恰好是36.8%,实际因样本量有波动。
  9. 【易错点 3】样本扰动只是随机森林的随机性来源之一,特征扰动同样重要,两者不可偏废。