请梳理 YOLO 系列从 v1 到后续版本的主要演进脉络,并分别指出每个版本重点优化的技术环节是哪些?
考察说明
考察对 YOLO 系列各版本核心改进点的系统掌握,以及对其演进逻辑的理解。
回答思路
- 【回答框架 1】YOLO 系列是单阶段目标检测的代表,核心思想是将检测视为回归问题,在单个卷积网络中直接预测边界框和类别概率,核心优势是速度极快。
- 【回答框架 2】YOLOv1 将图像划分网格,每个网格负责预测固定数量的边界框和类别概率,但存在定位不精准、对密集小目标效果差的问题。
- 【回答框架 3】YOLOv2 引入批归一化、高分辨率分类器、锚框机制和直接位置预测,并采用多尺度训练,显著提升召回率和定位精度。
- 【回答框架 4】YOLOv3 采用多尺度特征图进行预测,并使用更深的 Darknet-53 主干网络,通过特征金字塔网络结构增强对小目标的检测能力。
- 【回答框架 5】YOLOv4 和 v5 在工程上做了大量优化,包括 CSPDarknet 主干、SPP 模块、PANet 特征融合、Mish 激活函数等,在速度和精度上取得良好平衡,并提供了更灵活的部署方案。
- 【关键点 1】YOLO 系列是单阶段检测器,将检测视为回归问题,速度快。
- 【关键点 2】YOLOv2 引入锚框和批归一化,改善定位与召回。
- 【关键点 3】YOLOv3 使用多尺度特征图,增强小目标检测。
- 【关键点 4】YOLOv4 和 v5 综合多种技巧,提升精度与部署效率。
- 【关键点 5】演进主线是速度与精度的平衡,以及工程易用性。
- 【易错点 1】不能将 YOLOv2 改进简单归结为只加锚框,还包含位置预测、多尺度训练等多项改动。
- 【易错点 2】YOLOv3 的多尺度并非简单融合,而是通过特征金字塔实现不同层级特征。
- 【易错点 3】YOLOv4 与 v5 版本众多,具体改进细节需结合具体实现,不能一概而论。