ViT需要Transformer的encoder和decoder吗?
考察说明
考察对ViT架构中Transformer组件的理解,特别是编码器与解码器的角色差异
回答思路
- 明确指出ViT仅使用Transformer的encoder部分,不使用decoder
- 解释ViT将图像切块并线性投影为token,类似NLP中的词嵌入
- 说明decoder在生成任务中的作用,而ViT主要用于分类/特征提取,不需要解码生成序列
- 如能提及ViT的encoder堆叠层及自注意力机制更佳
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。