互联网/IT行业面试题更新 2026-08-05

请介绍 Vision Transformer(ViT)的核心原理,并说明它与传统 CNN 在图像分类任务上的主要区别。

联想人工智能互联网/IT技术原理技术选型

考察说明

考察对 ViT 架构原理的掌握及其与 CNN 的对比理解

回答思路

  1. 准确描述 ViT 将图像切块、线性投影并加入位置编码的过程
  2. 说明 Transformer 编码器中的自注意力机制在处理图像特征时的作用
  3. 清晰对比 ViT 与 CNN 在归纳偏置、感受野和计算复杂度上的差异
  4. 能提及 ViT 对大规模数据集的依赖以及数据增强或蒸馏等缓解手段
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。