数据岗位面试题更新 2026-08-05

在机器学习项目中,你会采用哪些方法来衡量一个模型的好坏?请列举并解释几种常用的性能评估指标。

数据业务理解技术原理方案权衡

考察说明

考查对机器学习模型评估方法论和常用指标的理解与应用能力。

回答思路

  1. 【回答框架 1】模型评估的核心是衡量模型泛化能力,即对未见数据的预测表现,而非仅对训练数据的拟合。评估通常分为两部分:选择合适的评估协议(如留出法、交叉验证)和选择合适的评估指标。
  2. 【回答框架 2】对于分类问题,常用指标包括准确率、精确率、召回率、F1值、ROC曲线下面积AUC等。准确率是整体正确比例,但类别不平衡时不可靠;精确率衡量预测为正类中的正确率,召回率衡量真实正类被找出的比例,F1是两者的调和平均。AUC不受分类阈值影响,反映模型排序能力。
  3. 【回答框架 3】对于回归问题,常用指标有均方误差MSE、均方根误差RMSE和平均绝对误差MAE。MSE对异常值敏感,RMSE单位与原变量一致,MAE更稳健。选择时需考虑业务对误差的容忍程度。
  4. 【回答框架 4】评估还应关注偏差-方差权衡,高偏差对应欠拟合,高方差对应过拟合。通过交叉验证可以更稳定地估计模型性能,同时要避免数据泄露——特征信息泄漏到训练集导致评估结果偏乐观。
  5. 【回答框架 5】最终指标选择应与业务目标对齐,例如在医疗诊断中更关注召回率,在垃圾邮件过滤中更关注精确率。没有单一指标适用所有场景,应综合多个指标并考虑实际成本。
  6. 【关键点 1】准确率在类别不平衡时不充分,应结合精确率、召回率或AUC。
  7. 【关键点 2】F1值是精确率和召回率的调和平均,适用于平衡两者的场景。
  8. 【关键点 3】回归任务常用MSE、RMSE、MAE,MSE对异常值敏感。
  9. 【关键点 4】交叉验证比单一留出法更稳定地估计泛化性能。
  10. 【关键点 5】评估指标需与业务目标对齐,如医疗场景重召回率。
  11. 【易错点 1】仅用准确率评估不平衡数据集,会得出误导性结论。
  12. 【易错点 2】忽视数据泄露,导致评估结果过于乐观。
  13. 【易错点 3】将AUC与业务概率校准混为一谈,AUC只关注排序质量。