在目标检测任务中,如何对模型的预测输出进行性能评估?请说明常用的评估指标及其计算方式。
考察说明
考查候选人对目标检测模型评估指标的定义、计算逻辑及适用场景的掌握程度。
回答思路
- 【回答框架 1】目标检测评估的核心是衡量预测框与真实框的匹配程度,常用指标包括IoU、mAP、Precision、Recall等。IoU计算预测框与真实框的交并比,通常设定阈值如0.5或0.5:0.95来判断是否为正样本。
- 【回答框架 2】mAP是平均精度的均值,先绘制每个类别的PR曲线,计算曲线下面积得到AP,再对所有类别取平均。COCO数据集使用0.5:0.95的IoU阈值范围,而VOC常用0.5。
- 【回答框架 3】Precision衡量预测为正样本中真正的比例,Recall衡量真实正样本中被正确检出的比例。F1分数是两者的调和平均,适用于类别不平衡场景。
- 【回答框架 4】评估流程包括:先进行非极大值抑制去除重复框,然后按置信度降序排列,依次计算累积TP和FP,进而得到PR曲线。
- 【回答框架 5】此外,还有针对小目标或特定尺度的评估指标,如AP_small、AP_medium、AP_large,以及推理速度指标FPS,需根据应用场景选择侧重。
- 【关键点 1】IoU阈值决定正负样本判定,例如0.5或0.5:0.95。
- 【关键点 2】mAP是目标检测最广泛使用的综合指标。
- 【关键点 3】PR曲线和AP计算需按置信度排序并累积统计。
- 【关键点 4】Recall和Precision需联合评估,避免单一指标偏差。
- 【关键点 5】评估还需考虑模型运行效率如FPS。
- 【易错点 1】不能仅依赖mAP,忽略Precision和Recall的具体平衡。
- 【易错点 2】IoU阈值不同导致结果差异大,需明确设定。
- 【易错点 3】小目标检测时mAP可能掩盖性能问题,应关注分尺度指标。