请介绍 Vision Transformer(ViT)的核心原理,并说明它与传统 CNN 在图像分类任务上的主要区别。
考察说明
考察对 ViT 架构原理的掌握及其与 CNN 的对比理解
回答思路
- 准确描述 ViT 将图像切块、线性投影并加入位置编码的过程
- 说明 Transformer 编码器中的自注意力机制在处理图像特征时的作用
- 清晰对比 ViT 与 CNN 在归纳偏置、感受野和计算复杂度上的差异
- 能提及 ViT 对大规模数据集的依赖以及数据增强或蒸馏等缓解手段
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。