多模态大模型中的ViT,解释其原理以及它是如何训练的?
考察说明
考察对Vision Transformer(ViT)架构原理及其训练流程的理解
回答思路
- 清晰解释ViT将图像分割为patch并线性嵌入、添加位置编码、送入Transformer编码器的流程
- 说明CLS token的作用及分类或下游任务的使用方式
- 能描述预训练阶段(如大规模图像数据集上的监督或自监督)与下游微调的流程
- 能联系多模态场景,说明ViT作为视觉编码器与文本模态对齐的方式
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。