人工智能面试题更新 2026-08-05

在机器学习特征工程中,GBDT 模型对于高维稀疏特征的处理效果如何?请分析其适用性。

人工智能技术原理方案权衡XGBoost

考察说明

考查对 GBDT 在特定特征分布下表现的理解。

回答思路

  1. 【回答框架 1】GBDT 基于决策树,通过特征分裂处理数据,对稀疏特征不敏感,但高维稀疏可能导致树结构复杂,增加过拟合风险。
  2. 【回答框架 2】高维稀疏特征常见于文本或分类变量,GBDT 能自动处理缺失值,但分裂时可能偏向取值多的特征,需注意特征选择。
  3. 【回答框架 3】相比线性模型,GBDT 对特征缩放不敏感,但高维下计算开销大,训练效率低,需考虑降维或特征筛选。
  4. 【回答框架 4】实际应用中,可结合特征哈希或嵌入方法降低维度,或使用 XGBoost 等优化实现,但本质仍受维度影响。
  5. 【关键点 1】GBDT 可处理稀疏特征,但高维下易过拟合且效率下降。
  6. 【关键点 2】特征分裂偏向取值多的特征,需正则化或特征筛选。
  7. 【关键点 3】高维场景下,线性模型或因子分解机可能更高效。
  8. 【易错点 1】误认为 GBDT 天然适合高维稀疏,忽略计算和过拟合问题。
  9. 【易错点 2】忽视特征重要性排序,导致模型解释性差。
  10. 【易错点 3】未考虑稀疏特征中的零值占比,影响分裂质量。