电子/半导体行业面试题更新 2026-08-05

ViT在输入encoder之前对图像做了什么?

中科曙光人工智能电子/半导体技术原理Transformer

考察说明

考察对Vision Transformer输入预处理流程的理解

回答思路

  1. 说明图像被切分为固定大小的patch
  2. 说明每个patch被展平并经过线性投影得到patch embedding
  3. 说明添加位置编码以保留空间位置信息
  4. 说明加入可学习的class token用于分类任务
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。