互联网/IT行业面试题更新 2026-08-05

多模态大模型的Vision Encoder一般使用ViT的第几层输出?

美团人工智能互联网/IT技术原理技术选型

考察说明

考察对多模态模型中视觉编码器具体实现细节的掌握

回答思路

  1. 能明确指出常用做法是使用ViT的倒数第二层(如第23层)输出
  2. 解释为何不用最后一层(如CLS token或与文本对齐不足)
  3. 说明不同模型(如LLaVA、Qwen-VL)可能采用不同层,需根据训练经验选择
  4. 提及层输出对语义对齐和细粒度特征的影响