人工智能面试题更新 2026-08-05

请阐述 Mask R-CNN 的核心工作机制,并说明该网络是如何将图像分割任务与目标检测任务整合在同一个模型中的?

人工智能技术原理

考察说明

考查对 Mask R-CNN 架构原理及其多任务学习能力的理解。

回答思路

  1. 【回答框架 1】Mask R-CNN 是在 Faster R-CNN 基础上的扩展,通过增加一个与现有目标检测分支并行的掩码预测分支,实现像素级实例分割。其核心思路是在 Faster R-CNN 的检测流程中,为每个感兴趣区域(RoI)不仅输出类别和边界框,还输出一个二值掩码。
  2. 【回答框架 2】网络由骨干网络(如 ResNet-FPN)提取多尺度特征,RPN 生成候选区域,RoIAlign 层解决 RoI 池化中的空间量化误差,保证像素级对齐。随后,检测分支和掩码分支并行:检测分支负责分类和回归,掩码分支对每个 RoI 预测一个 K×m×m 的掩码,K 为类别数。
  3. 【回答框架 3】关键创新之一是使用 RoIAlign 替代 RoI Pooling,采用双线性插值避免取整操作,使得掩码预测更精确。另一个关键设计是掩码分支采用 FCN 结构,逐像素预测,并使用 per-pixel sigmoid 和逐类竞争,确保掩码与类别解耦,提升实例分割效果。
  4. 【回答框架 4】训练时采用多任务损失,包括分类损失、边界框回归损失和掩码的交叉熵损失。推理时,先检测出目标框,再为每个框生成对应的掩码,从而结合了目标检测和图像分割,实现实例级别的分割。
  5. 【关键点 1】Mask R-CNN 在 Faster R-CNN 基础上增加掩码分支,实现实例分割。
  6. 【关键点 2】RoIAlign 通过双线性插值解决 RoI Pooling 的像素级错位问题。
  7. 【关键点 3】掩码分支采用 FCN,每类独立预测,与分类解耦。
  8. 【关键点 4】多任务训练损失包括分类、回归和掩码损失。
  9. 【易错点 1】不能将掩码分支理解为语义分割,而是针对每个检测目标的实例分割。
  10. 【易错点 2】RoIAlign 与 RoI Pooling 的核心区别在于避免两次量化,而非单纯增加采样点。
  11. 【易错点 3】掩码预测的类别无关性是有意设计,若混淆类别信息会导致性能下降。